← Alle artikelen

Firecrawl geopende pdf-inspecteur: PDF in Markdown in milliseconden, zonder OCR

Firecrawl geopende pdf-inspecteur: PDF in Markdown in milliseconden, zonder OCR

Firecrawl, een startup van Y Combinator die tools maakt voor het extraheren van gegevens uit websites, heeft de bronnen van pdf-inspector geopend: een Rust-bibliotheek die in milliseconden bepaalt of de tekst die voor je ligt PDF of een scan is, en tekstdocumenten omzet in pure Markdown zonder OCR. Volgens de schattingen van het team is ongeveer 54% van PDF in echte problemen tekstgebaseerd, en heeft het eenvoudigweg geen zin om ze door de langzame en dure OCR te halen.

Als je ooit een neuraal netwerk PDF hebt gevoed - een contract, een rapport, een boek - ken je dit gevoel: het bestand lijkt te openen, maar de tekst ervan wordt niet gekopieerd of wordt in pap gekopieerd. Klassieke parsers stikken in tabellen of doorlopen elke pagina door OCR, waardoor seconden en geld worden verspild. pdf-inspector raakt precies dit probleem: eerst kijkt het snel wat voor soort bestand het is, en maakt alleen verbinding met OCR als het een echte scan is.

Eerst classificatie, dan extractie

In één keer wijst de bibliotheek PDF toe aan een van de vier typen - TextBased, Scanned, ImageBased of Mixed - en geeft een betrouwbaarheid van 0 tot 1 plus een paginaroute: welke moet worden gelezen als tekst, welke moet worden verzonden naar OCR. Classificatie duurt 10-50 milliseconden. Vervolgens vindt er voor tekstpagina's extractie plaats met coördinaten, lettertypen en leesvolgorde, en de uitvoer is Markdown met koppen, lijsten, tabellen en links.

Cijfers die indrukwekkend zijn

Op de opendataloader-bench van 200 PDF demonteerde pdf-inspecteur de hele behuizing in 0,47 seconden. Ter vergelijking: pymupdf4llm - 17 seconden, markitdown - 16 seconden. Tegelijkertijd is het de hoogste kwaliteit: de totaalscore is 0,875 versus 0,735 voor pymupdf4llm en 0,589 voor markitdown. Het herkent tabellen veel beter: 0,814 versus 0,401 en 0,273.

Wat kan hij nog meer doen?

Krantenindelingen met meerdere kolommen, tekst van rechts naar links, CID-lettertypen, detectie van defecte codering. Afzonderlijk - selectief OCR: als individuele gescande pagina's vastzitten in PDF, kunt u ze alleen via OCR lokaal doornemen, via PP-OCRv6 Small, en niet door het hele document.

Waar is de vangst?

Eerlijk gezegd: voor echte scans en foto's van documenten is OCR nog steeds nodig, en hier is de pdf-inspecteur geen magie - hij geeft gewoon geen OCR uit aan iets dat het niet nodig heeft. Complexe lay-outs, waarbij formules en lay-out worden gemengd met tekst, kunnen ook werken. En dit is een bibliotheek, geen kant-en-klare service: om hem te gebruiken, moet je een beetje code schrijven.

Gloeiende lijnen en tafelvouwen van een papieren document naar een hologram

Er zijn bindingen voor Python, Node.js en browsergebaseerde WASM - dezelfde Rust-parser werkt rechtstreeks in de browser zonder server. De repository op GitHub heeft al bijna 17 duizend sterren gekregen. Als je PDF vaak in een neuraal netwerk bij je hebt, is het de moeite van het bekijken waard.