← Alle artikler

Firecrawl åpnet pdf-inspektør: PDF i Markdown i millisekunder, uten OCR

Firecrawl åpnet pdf-inspektør: PDF i Markdown i millisekunder, uten OCR

Firecrawl, en oppstart fra Y Combinator som lager verktøy for å trekke ut data fra nettsider, har åpnet kildene til pdf-inspector: et Rust-bibliotek som på millisekunder bestemmer om teksten foran deg er PDF eller en skanning, og gjør tekstdokumenter til ren Markdown uten OCR i det hele tatt. I følge teamets estimater er omtrent 54 % av PDF i reelle problemer tekstbasert, og det er rett og slett ingen vits i å kjøre dem gjennom den langsomme og dyre OCR.

Hvis du noen gang har matet et nevralt nettverk PDF - en kontrakt, en rapport, en bok - kjenner du denne følelsen: filen ser ut til å åpne seg, men teksten fra den er ikke kopiert eller kopiert i grøt. Klassiske parsere kveler enten på tabeller eller kjører hver side gjennom OCR, og kaster bort sekunder og penger. pdf-inspector treffer akkurat denne smerten: først ser den raskt på hva slags fil det er, og kobler OCR bare hvis det er en ekte skanning.

Først klassifisering, deretter utvinning

I ett pass tildeler biblioteket PDF til en av fire typer - tekstbasert, skannet, bildebasert eller blandet - og gir en trygghet fra 0 til 1 pluss en siderute: hvilken som skal leses som tekst, som skal sendes til OCR. Klassifisering tar 10–50 millisekunder. Deretter, for tekstsider, er det uttrekk med koordinater, fonter og leserekkefølge, og utgangen er Markdown med overskrifter, lister, tabeller og lenker.

Tall som er imponerende

På opendataloader-benken av 200 PDF pdf-inspektør demonterte hele saken på 0,47 sekunder. Til sammenligning: pymupdf4llm - 17 sekunder, markitdown - 16 sekunder. Samtidig er den høyest i kvalitet: den totale poengsummen er 0,875 mot 0,735 for pymupdf4llm og 0,589 for markitdown. Den gjenkjenner tabeller mye bedre - 0,814 mot 0,401 og 0,273.

Hva annet kan han gjøre?

Avisoppsett med flere spalter, tekst fra høyre til venstre, CID-fonter, gjenkjenning av ødelagt koding. Separat - selektiv OCR: hvis individuelle skannede sider sitter fast i PDF, kan du bare kjøre dem gjennom OCR, lokalt, gjennom PP-OCRv6 Small, og ikke hele dokumentet.

Hvor er fangsten?

Ærlig talt: for ekte skanninger og fotografier av dokumenter er OCR fortsatt nødvendig, og her er ikke pdf-inspektøren magi - den bruker bare ikke OCR på noe som ikke trenger det. Komplekse layouter, der formler og layout blandes med tekst, kan også fungere. Og dette er et bibliotek, ikke en ferdiglaget tjeneste: for å bruke det, må du skrive litt kode.

Glowing lines and table folding from a paper document into a hologram

Det er bindinger for Python, Node.js og nettleserbasert WASM – den samme Rust-parseren fungerer direkte i nettleseren uten server. Depotet på GitHub har allerede fått nesten 17 tusen stjerner. Hvis du ofte har PDF i et nevralt nettverk, er det verdt en titt.