← Все статьи

Firecrawl open source pdf-inspektør: PDF til Markdown på millisekunder, ingen OCR

Firecrawl open source pdf-inspektør: PDF til Markdown på millisekunder, ingen OCR

Firecrawl, Y Combinator-opstarten kendt for sine web-scraping-værktøjer, har open source pdf-inspector - et Rust-bibliotek, der på millisekunder finder ud af, om en PDF er tekstbaseret eller en scanning, og forvandler tekstbaserede dokumenter til ren Markdown uden nogen OCR. Ifølge teamets estimat er omkring 54 % af PDF'er i reelle arbejdsbelastninger tekstbaserede, så det er meningsløst at køre dem gennem langsom, dyr OCR.

Hvis du nogensinde har ført en PDF til en model - en kontrakt, en rapport, en bog - kender du følelsen: filen åbner fint, men teksten kopieres ikke, eller den kopieres som skrald. Klassiske parsere kvæler enten borde eller skubber hver side gennem OCR, brænder sekunder og penge. pdf-inspector rammer præcis det smertepunkt: den tjekker hurtigt, hvad filen er, og når først efter OCR, når det virkelig er en scanning.

Klassificer først, udtræk derefter

I en enkelt omgang sorterer biblioteket en PDF i en af ​​fire typer - Tekstbaseret, Scannet, Billedbaseret eller Blandet - og returnerer en konfidensscore fra 0 til 1 plus en rute pr. side: hvilke sider der skal læses som tekst, hvilke der skal sendes til OCR. Klassificering tager 10-50 millisekunder. For tekstsider udtrækker den derefter med koordinater, skrifttyper og læserækkefølge og udsender Markdown med overskrifter, lister, tabeller og links.

Tal der skiller sig ud

På opendataloader-bench-korpuset på 200 PDF'er behandlede pdf-inspector hele sættet på 0,47 sekunder. Til sammenligning: pymupdf4llm tog 17 sekunder, markitdown 16 sekunder. Og det scorede stadig højest på kvalitet - 0,875 samlet versus 0,735 for pymupdf4llm og 0,589 for markitdown. Tabellerne er, hvor det virkelig trækker frem: 0,814 mod 0,401 og 0,273.

Hvad gør den ellers

Avislayouts med flere spalter, tekst fra højre mod venstre, CID-skrifttyper, detektering af brudt kodning. Og selektiv OCR: Hvis en PDF har nogle få scannede sider blandet, kan du kun køre dem gennem OCR lokalt via PP-OCRv6 Small, i stedet for hele dokumentet.

Hvor det kommer til kort

Helt ærligt: ​​rigtige scanninger og fotos af dokumenter har stadig brug for OCR, og pdf-inspector er ikke magi der - den spilder bare ikke OCR på filer, der ikke har brug for det. Komplekse layouts, hvor formler og sætning blandes med tekst, kan også udløse det. Og det er et bibliotek, ikke en færdiglavet tjeneste: du skal skrive en smule kode for at bruge den.

Glowing lines and table folding from a paper document into a hologram

Der er bindinger til Python, Node.js og browser WebAssembly - den samme Rust-parser kører lige i browseren uden server. GitHub-repoen har allerede passeret 17.000 stjerner. Hvis du regelmæssigt feeder PDF-filer til modeller, er det et kig værd.