Firecrawl open-sources pdf-inspector: PDF do Markdown za milisekúnd, žiadne OCR
Firecrawl, startup Y Combinator známy svojimi nástrojmi na zoškrabovanie webu, má open-source pdf-inspector – knižnicu Rust, ktorá v priebehu milisekúnd zistí, či je PDF textový alebo skenovaný, a premení textové dokumenty na čistý Markdown bez akéhokoľvek OCR. Podľa odhadov tímu je približne 54 % súborov PDF v reálnych úlohách založených na texte, takže ich spúšťanie cez pomalé a drahé OCR je zbytočné.
Ak ste niekedy vložili PDF do modelu – zmluvy, správy, knihy – poznáte ten pocit: súbor sa otvorí v poriadku, ale text sa neskopíruje alebo sa skopíruje ako odpad. Klasické analyzátory sa buď dusia stolmi, alebo pretláčajú každú stránku cez OCR, čím pália sekundy a peniaze. pdf-inspector zasiahne presne ten bod bolesti: rýchlo skontroluje, čo je súbor, a po OCR siahne len vtedy, keď ide o skutočný sken.
Najprv klasifikujte, potom extrahujte
Knižnica jediným prechodom roztriedi PDF do jedného zo štyroch typov — TextBased, Scanned, ImageBased alebo Mixed — a vráti skóre spoľahlivosti od 0 do 1 plus trasu na stránku: ktoré stránky sa majú čítať ako text, ktoré sa majú poslať do OCR. Klasifikácia trvá 10–50 milisekúnd. Pre textové stránky potom extrahuje súradnice, fonty a poradie čítania a vypíše Markdown s nadpismi, zoznamami, tabuľkami a odkazmi.
Čísla, ktoré vynikajú
Na korpuse opendataloader-bench 200 PDF spracoval pdf-inspector celú sadu za 0,47 sekundy. Pre porovnanie: pymupdf4llm trvalo 17 sekúnd, markitdown 16 sekúnd. A stále dosiahol najvyššie skóre v kvalite – 0,875 celkovo oproti 0,735 pre pymupdf4llm a 0,589 pre markitdown. V tabuľkách to skutočne ťahá dopredu: 0,814 oproti 0,401 a 0,273.
Čo ešte robí
Rozloženie novín s viacerými stĺpcami, text písaný sprava doľava, CID fonty, detekcia nefunkčného kódovania. A selektívne OCR: ak má PDF zmiešaných niekoľko naskenovaných strán, namiesto celého dokumentu môžete pomocou OCR lokálne spustiť iba tie, ktoré sú pomocou OCR spustené pomocou PP-OCRv6 Small.
Kde to nedosahuje
Úprimne povedané: skutočné skeny a fotografie dokumentov stále potrebujú OCR a pdf-inspector tam nie je čarovný – jednoducho neplytvá OCR na súbory, ktoré ho nepotrebujú. Zložité rozloženia, kde sú vzorce a sadzba zmiešané s textom, to môžu tiež podraziť. A je to knižnica, nie hotová služba: na jej používanie budete musieť napísať trochu kódu.

Existujú väzby pre Python, Node.js a prehliadač WebAssembly – rovnaký analyzátor Rust beží priamo v prehliadači bez servera. Repozitár GitHub už prekonal 17 000 hviezdičiek. Ak modelkám pravidelne dodávate súbory PDF, oplatí sa to pozrieť.