Firecrawl åbnede pdf-inspektør: PDF i Markdown på millisekunder uden OCR
Firecrawl, en startup fra Y Combinator, der laver værktøjer til at udtrække data fra websteder, har åbnet kilderne til pdf-inspector: et Rust-bibliotek, der på millisekunder afgør, om teksten foran dig er PDF eller en scanning, og gør tekstdokumenter til ren Markdown uden OCR overhovedet. Ifølge holdets estimater er omkring 54 % af PDF i reelle problemer tekstbaserede, og det nytter simpelthen ikke at køre dem gennem den langsomme og dyre OCR.
Hvis du nogensinde har fodret et neuralt netværk PDF - en kontrakt, en rapport, en bog - kender du denne følelse: filen ser ud til at åbne sig, men teksten fra den er ikke kopieret eller kopieret i grød. Klassiske parsere enten kvæler i tabeller eller kører hver side gennem OCR, hvilket spilder sekunder og penge. pdf-inspector rammer præcis denne smerte: For det første ser den hurtigt på, hvilken slags fil det er, og forbinder kun OCR, hvis det er en rigtig scanning.
Først klassificering, derefter ekstraktion
I én omgang tildeler biblioteket PDF til en af fire typer - TextBased, Scanned, ImageBased eller Mixed - og giver en sikkerhed fra 0 til 1 plus en siderute: hvilken der skal læses som tekst, som skal sendes til OCR. Klassificering tager 10-50 millisekunder. Dernæst for tekstsider er der udtræk med koordinater, skrifttyper og læserækkefølge, og outputtet er Markdown med overskrifter, lister, tabeller og links.
Tal, der er imponerende
På opendataloader-bænken ud af 200 PDF pdf-inspektør adskilte hele sagen på 0,47 sekunder. Til sammenligning: pymupdf4llm - 17 sekunder, markitdown - 16 sekunder. Samtidig er det den højeste i kvalitet: den samlede score er 0,875 mod 0,735 for pymupdf4llm og 0,589 for markitdown. Den genkender tabeller meget bedre - 0,814 versus 0,401 og 0,273.
Hvad kan han ellers gøre?
Avislayout med flere spalter, tekst fra højre mod venstre, CID-skrifttyper, detektering af brudt kodning. Separat - selektiv OCR: Hvis individuelle scannede sider sidder fast i PDF, kan du kun køre dem gennem OCR, lokalt, gennem PP-OCRv6 Small, og ikke hele dokumentet.
Hvor er fangsten?
Helt ærligt: til rigtige scanninger og fotografier af dokumenter er der stadig brug for OCR, og her er pdf-inspektøren ikke magi - den bruger bare ikke OCR på noget, der ikke har brug for det. Komplekse layouts, hvor formler og layout blandes med tekst, kan også fungere. Og dette er et bibliotek, ikke en færdiglavet tjeneste: For at bruge det, skal du skrive lidt kode.

Der er bindinger til Python, Node.js og browserbaseret WASM – den samme Rust-parser fungerer direkte i browseren uden server. Depotet på GitHub har allerede fået næsten 17 tusind stjerner. Hvis du ofte bærer PDF i et neuralt netværk, er det et kig værd.