← Összes cikk

Firecrawl megnyitotta a pdf-ellenőrzőt: PDF Markdown-ban ezredmásodpercben, OCR nélkül

Firecrawl megnyitotta a pdf-ellenőrzőt: PDF Markdown-ban ezredmásodpercben, OCR nélkül

A Firecrawl, az Y Combinator egyik startupja, amely eszközöket készít adatok kinyerésére a webhelyekről, megnyitotta a pdf-inspector forrásait: egy Rust könyvtárat, amely ezredmásodpercek alatt meghatározza, hogy az Ön előtt lévő szöveg PDF-e vagy szkennelés, és a szöveges dokumentumokat tiszta Markdown-vé alakítja OCR nélkül. A csapat becslései szerint a valódi problémákkal kapcsolatos PDF-ek körülbelül 54%-a szövegalapú, és egyszerűen nincs értelme a lassú és költséges OCR-en keresztül futtatni őket.

Ha valaha is betáplált egy neurális hálózati PDF-et - szerződést, jelentést, könyvet -, akkor ismeri ezt az érzést: a fájl megnyílik, de a szöveget nem másolják át, vagy másolják. A klasszikus elemzők vagy megfulladnak az asztaloktól, vagy minden oldalt átfuttatnak az OCR-en, másodperceket és pénzt pazarolva. A pdf-inspector pontosan ezt a fájdalmat éri el: először is gyorsan megnézi, hogy milyen fájlról van szó, és csak akkor kapcsolja be az OCR-t, ha valódi szkennelésről van szó.

Először osztályozás, majd kivonás

Egy lépésben a könyvtár a PDF-et a négy típus egyikéhez rendeli – TextBased, Scanned, Image Based vagy Mixed –, és 0-tól 1-ig terjedő biztonságot ad, valamint egy oldalútvonalat: melyiket olvassa el szövegként, melyiket küldje el OCR-nek. Az osztályozás 10-50 milliszekundumot vesz igénybe. Ezután a szöveges oldalak esetében a kivonás koordinátákkal, betűtípusokkal és olvasási sorrenddel történik, a kimenet pedig a Markdown címsorokkal, listákkal, táblázatokkal és hivatkozásokkal.

Lenyűgöző számok

Az opendataloader-padon 200 PDF-ből pdf-inspector 0,47 másodperc alatt szétszedte a teljes házat. Összehasonlításképpen: pymupdf4llm - 17 másodperc, markitdown - 16 másodperc. Minőségben ugyanakkor a legmagasabb: az összpontszám 0,875, szemben a pymupdf4llm 0,735 és a markitdown 0,589 ponttal. Sokkal jobban felismeri a táblázatokat – 0,814 versus 0,401 és 0,273.

Mi mást tehet?

Többoszlopos újságelrendezések, jobbról balra haladó szöveg, CID betűtípusok, hibás kódolás észlelése. Külön - szelektív OCR: ha az egyes beolvasott oldalak beragadtak a PDF-be, csak azokat futtathatja az OCR-en keresztül, helyileg, a PP-OCRv6 Small segítségével, és nem a teljes dokumentumot.

Hol a fogás?

Őszintén szólva: a dokumentumok valódi szkenneléséhez és fényképezéséhez továbbra is szükség van OCR-re, és itt a pdf-ellenőr nem varázslat - egyszerűen nem költ OCR-re valamire, aminek nincs szüksége rá. Az összetett elrendezések is működhetnek, ahol a képletek és az elrendezés szöveggel keverednek. Ez pedig egy könyvtár, nem egy kész szolgáltatás: használatához egy kis kódot kell írni.

Glowing lines and table folding from a paper document into a hologram

Vannak kötések a Python, a Node.js és a böngésző alapú WASM számára – ugyanaz a Rust elemző működik közvetlenül a böngészőben szerver nélkül. A GitHubon található adattár már csaknem 17 ezer csillagot szerzett. Ha gyakran hordozol PDF fájlt neurális hálózatban, érdemes megnézni.