Firecrawl otvoril pdf-inspector: PDF v Markdown za milisekúnd, bez OCR
Firecrawl, startup od Y Combinator, ktorý vyrába nástroje na extrahovanie údajov z webových stránok, otvoril zdroje pdf-inspectora: knižnicu Rust, ktorá v milisekundách určí, či je text pred vami PDF alebo sken, a premení textové dokumenty na čistý Markdown bez OCR. Podľa odhadov tímu je približne 54 % skutočných problémov PDF založených na texte a jednoducho nemá zmysel spúšťať ich cez pomalé a drahé OCR.
Ak ste niekedy kŕmili neurónovú sieť PDF – zmluvu, správu, knihu – poznáte tento pocit: súbor sa zdá byť otvorený, ale text z neho nie je skopírovaný alebo je skopírovaný ako kaša. Klasické analyzátory sa buď dusia v stoloch, alebo prechádzajú každú stránku cez OCR, čím strácajú sekundy a peniaze. pdf-inspector zasiahne presne túto bolesť: najprv sa rýchlo pozrie na to, o aký druh súboru ide, a pripojí OCR iba vtedy, ak ide o skutočný sken.
Najprv klasifikácia, potom extrakcia
V jednom prechode knižnica priradí PDF k jednému zo štyroch typov – TextBased, Scanned, ImageBased alebo Mixed – a poskytuje spoľahlivosť od 0 do 1 plus trasu stránky: ktorá sa má čítať ako text, ktorá sa má odoslať do OCR. Klasifikácia trvá 10–50 milisekúnd. Ďalej pre textové stránky je tu extrakcia so súradnicami, typmi písma a poradím čítania a výstupom je Markdown s nadpismi, zoznamami, tabuľkami a odkazmi.
Čísla, ktoré sú pôsobivé
Na opendataloader-bench z 200 PDF pdf-inšpektor rozobral celý prípad za 0,47 sekundy. Pre porovnanie: pymupdf4llm - 17 sekúnd, markitdown - 16 sekúnd. Zároveň je najvyššia v kvalite: celkové skóre je 0,875 oproti 0,735 pre pymupdf4llm a 0,589 pre markitdown. Oveľa lepšie rozpoznáva tabuľky – 0,814 oproti 0,401 a 0,273.
Čo ešte dokáže?
Viacstĺpcové rozloženie novín, text sprava doľava, CID fonty, detekcia poškodeného kódovania. Samostatne – selektívne OCR: ak sa jednotlivé naskenované strany zaseknú v PDF, môžete ich spustiť iba cez OCR, lokálne cez PP-OCRv6 Small, a nie celý dokument.
Kde je háčik?
Úprimne povedané: pre skutočné skeny a fotografie dokumentov je OCR stále potrebné a tu nie je pdf-inšpektor kúzlo - jednoducho nemíňa OCR na niečo, čo ho nepotrebuje. Fungovať môžu aj zložité rozloženia, kde sa vzorce a rozloženie miešajú s textom. A toto je knižnica, nie hotová služba: aby ste ju mohli používať, musíte napísať malý kód.

Existujú väzby pre Python, Node.js a WASM založený na prehliadači - rovnaký analyzátor Rust funguje priamo v prehliadači bez servera. Úložisko na GitHub získalo už takmer 17 tisíc hviezdičiek. Ak často prenášate PDF v neurónovej sieti, stojí za to si ho pozrieť.