← Все статьи

Firecrawl otevřel pdf-inspektor: PDF v Markdown v milisekundách, bez OCR

Firecrawl otevřel pdf-inspektor: PDF v Markdown v milisekundách, bez OCR

Firecrawl, startup od Y Combinator, který vyrábí nástroje pro extrakci dat z webových stránek, otevřel zdroje pdf-inspector: knihovnu Rust, která v milisekundách určí, zda je text před vámi PDF nebo sken, a přemění textové dokumenty na čistý Markdown bez OCR. Podle odhadů týmu je asi 54 % PDF ve skutečných problémech založeno na textu a prostě nemá smysl je procházet pomalým a drahým OCR.

Pokud jste někdy krmili neuronovou síť PDF – smlouvu, zprávu, knihu – znáte ten pocit: soubor se zdánlivě otevře, ale text z něj se nezkopíruje nebo se zkopíruje na kaši. Klasické analyzátory se buď dusí tabulkami, nebo každou stránku procházejí OCR, čímž plýtvají vteřinami a penězi. pdf-inspector zasáhne přesně tuto bolest: nejprve se rychle podívá, o jaký druh souboru se jedná, a připojí OCR pouze v případě, že se jedná o skutečný sken.

Nejprve klasifikace, pak extrakce

V jednom průchodu knihovna přiřadí PDF jednomu ze čtyř typů – TextBased, Scanned, ImageBased nebo Mixed – a poskytuje spolehlivost od 0 do 1 plus trasu stránky: která se má číst jako text, která se má odeslat do OCR. Klasifikace trvá 10–50 milisekund. Dále u textových stránek je extrakce se souřadnicemi, fonty a pořadím čtení a výstupem je Markdown s nadpisy, seznamy, tabulkami a odkazy.

Čísla, která jsou působivá

Na opendataloader-bench z 200 PDF pdf-inspektor rozebral celý případ za 0,47 sekundy. Pro srovnání: pymupdf4llm - 17 sekund, markitdown - 16 sekund. Zároveň je nejvyšší v kvalitě: celkové skóre je 0,875 oproti 0,735 pro pymupdf4llm a 0,589 pro markitdown. Mnohem lépe rozpoznává tabulky – 0,814 oproti 0,401 a 0,273.

Co ještě umí?

Vícesloupcové rozvržení novin, text zprava doleva, CID fonty, detekce poškozeného kódování. Samostatně - selektivní OCR: pokud jsou jednotlivé naskenované stránky zaseknuté v PDF, můžete je spustit pouze prostřednictvím OCR, lokálně, prostřednictvím PP-OCRv6 Small, a ne celý dokument.

Kde je háček?

Upřímně: pro skutečné skeny a fotografie dokumentů je OCR stále potřeba a zde není pdf-inspektor kouzelný - prostě neutrácí OCR za něco, co ho nepotřebuje. Fungovat mohou i komplexní rozvržení, kde se vzorce a rozvržení mísí s textem. A toto je knihovna, ne hotová služba: abyste ji mohli používat, musíte napsat malý kód.

Glowing lines and table folding from a paper document into a hologram

Existují vazby pro Python, Node.js a WASM založený na prohlížeči - stejný analyzátor Rust funguje přímo v prohlížeči bez serveru. Úložiště na GitHubu již získalo téměř 17 tisíc hvězdiček. Pokud často nosíte PDF v neuronové síti, stojí za to se na to podívat.