Firecrawl åpen kildekode pdf-inspektør: PDF til Markdown i millisekunder, ingen OCR
Firecrawl, Y Combinator-oppstarten kjent for sine nettskrapingsverktøy, har pdf-inspektør med åpen kildekode – et Rust-bibliotek som i millisekunder finner ut om en PDF er tekstbasert eller en skanning, og gjør tekstbaserte dokumenter til ren Markdown uten OCR. Etter teamets estimat er rundt 54 % av PDF-filer i reelle arbeidsmengder tekstbaserte, så det er meningsløst å kjøre dem gjennom langsom, kostbar OCR.
Hvis du noen gang har matet en PDF-fil til en modell – en kontrakt, en rapport, en bok – kjenner du følelsen: filen åpnes fint, men teksten kopieres ikke, eller den kopieres som søppel. Klassiske parsere enten kveles på tabeller eller skyver hver side gjennom OCR, brenner sekunder og penger. pdf-inspector treffer akkurat det smertepunktet: den sjekker raskt hva filen er, og når bare OCR når det virkelig er en skanning.
Klassifiser først, trekk ut andre
I en enkelt omgang sorterer biblioteket en PDF i en av fire typer - Tekstbasert, Skannet, Bildebasert eller Blandet - og returnerer en konfidenspoengsum fra 0 til 1 pluss en rute per side: hvilke sider som skal leses som tekst, hvilke som skal sendes til OCR. Klassifisering tar 10–50 millisekunder. For tekstsider trekkes den ut med koordinater, fonter og leserekkefølge, og gir ut Markdown med overskrifter, lister, tabeller og lenker.
Tall som skiller seg ut
På opendataloader-bench-korpuset på 200 PDF-er behandlet pdf-inspector hele settet på 0,47 sekunder. Til sammenligning: pymupdf4llm tok 17 sekunder, markitdown 16 sekunder. Og den scoret fortsatt høyest på kvalitet - 0,875 totalt mot 0,735 for pymupdf4llm og 0,589 for markitdown. Tabeller er der det virkelig trekker frem: 0,814 mot 0,401 og 0,273.
Hva annet gjør den
Avisoppsett med flere spalter, tekst fra høyre til venstre, CID-fonter, gjenkjenning av ødelagt koding. Og selektiv OCR: hvis en PDF har noen få skannede sider blandet inn, kan du bare kjøre de gjennom OCR lokalt via PP-OCRv6 Small, i stedet for hele dokumentet.
Der det kommer til kort
Ærlig talt: ekte skanninger og bilder av dokumenter trenger fortsatt OCR, og pdf-inspektør er ikke magi der – den kaster bare ikke bort OCR på filer som ikke trenger det. Komplekse oppsett der formler og skriftsett blandes med tekst kan også snuble det. Og det er et bibliotek, ikke en ferdiglaget tjeneste: du må skrive litt kode for å bruke den.

Det er bindinger for Python, Node.js og nettleser WebAssembly - den samme Rust-parseren kjører rett i nettleseren uten server. GitHub-repoen har allerede passert 17 000 stjerner. Hvis du regelmessig mater PDF-filer til modeller, er det verdt en titt.