Firecrawl open-sources pdf-inspector: PDF do Markdown v milisekundách, žádné OCR
Firecrawl, startup Y Combinator známý svými nástroji pro škrábání webu, má open-source pdf-inspector – knihovnu Rust, která během milisekund zjistí, zda je PDF textový nebo skenovaný, a přemění textové dokumenty na čistý Markdown bez jakéhokoli OCR. Podle odhadů týmu je přibližně 54 % souborů PDF ve skutečné zátěži založeno na textu, takže jejich provozování pomalým a drahým OCR je zbytečné.
Pokud jste někdy vložili PDF do modelu – smlouvy, zprávy, knihy – znáte ten pocit: soubor se otevře dobře, ale text se nezkopíruje nebo se zkopíruje jako smetí. Klasické analyzátory se buď dusí tabulkami, nebo protlačují každou stránku přes OCR, pálí vteřiny a peníze. pdf-inspector přesně zasáhne tento problém: rychle zkontroluje, co je soubor, a po OCR sáhne pouze tehdy, když se skutečně jedná o sken.
Nejprve klasifikujte, poté extrahujte
V jediném průchodu knihovna roztřídí PDF do jednoho ze čtyř typů — TextBased, Scanned, ImageBased nebo Mixed — a vrátí skóre spolehlivosti od 0 do 1 plus trasu na stránku: které stránky číst jako text, které odeslat do OCR. Klasifikace trvá 10–50 milisekund. U textových stránek pak extrahuje souřadnicemi, fonty a pořadím čtení a výstupem Markdown s nadpisy, seznamy, tabulkami a odkazy.
Čísla, která vynikají
Na opendataloader-bench korpusu 200 PDF zpracoval pdf-inspector celou sadu za 0,47 sekundy. Pro srovnání: pymupdf4llm trvalo 17 sekund, markitdown 16 sekund. A stále dosáhl nejvyššího skóre v kvalitě – 0,875 celkově oproti 0,735 pro pymupdf4llm a 0,589 pro markitdown. Tabulky jsou tam, kde to opravdu táhne dopředu: 0,814 versus 0,401 a 0,273.
Co jiného to dělá
Vícesloupcové rozvržení novin, text zprava doleva, CID fonty, detekce přerušeného kódování. A selektivní OCR: pokud je v PDF smícháno několik naskenovaných stránek, můžete místo celého dokumentu spustit OCR lokálně pouze pomocí PP-OCRv6 Small.
Kde to nedosahuje
Upřímně: skutečné skeny a fotografie dokumentů stále potřebují OCR a pdf-inspector tam není žádná magie – prostě neplýtvá OCR u souborů, které to nepotřebují. Složitá rozvržení, kde se vzorce a sazba mísí s textem, to také mohou podrazit. A je to knihovna, ne hotová služba: budete muset napsat trochu kódu, abyste ji mohli používat.

Existují vazby pro Python, Node.js a prohlížeč WebAssembly – stejný analyzátor Rust běží přímo v prohlížeči bez serveru. Repo GitHub již překonalo 17 000 hvězdiček. Pokud modelkám pravidelně dodáváte PDF, stojí za to se na to podívat.