← Alla artiklar

Firecrawl öppnad pdf-inspektör: PDF på Markdown i millisekunder, utan OCR

Firecrawl öppnad pdf-inspektör: PDF på Markdown i millisekunder, utan OCR

Firecrawl, en start från Y Combinator som gör verktyg för att extrahera data från webbplatser, har öppnat källorna till pdf-inspector: ett Rust-bibliotek som på millisekunder avgör om texten framför dig är PDF eller en skanning, och förvandlar textdokument till rena Markdown3 utan Markdown alls. Enligt teamets uppskattningar är cirka 54 % av PDF i verkliga problem textbaserade, och det är helt enkelt ingen idé att köra dem genom de långsamma och dyra OCR.

Om du någonsin har matat ett neuralt nätverk PDF - ett kontrakt, en rapport, en bok - känner du till den här känslan: filen verkar öppnas, men texten från den är inte kopierad eller är kopierad i gröt. Klassiska analyserare kväver antingen tabeller eller kör varje sida genom OCR och slösar bort sekunder och pengar. pdf-inspector träffar exakt denna smärta: först tittar den snabbt på vilken typ av fil det är och ansluter OCR endast om det är en riktig skanning.

Först klassificering, sedan extraktion

I ett pass tilldelar biblioteket PDF till en av fyra typer - TextBased, Scanned, ImageBased eller Mixed - och ger ett förtroende från 0 till 1 plus en sidväg: vilken som ska läsas som text, vilken som ska skickas till OCR. Klassificeringen tar 10–50 millisekunder. Därefter, för textsidor, finns det extraktion med koordinater, typsnitt och läsordning, och utdata är Markdown med rubriker, listor, tabeller och länkar.

Siffror som är imponerande

På opendataloader-bänken av 200 PDF plockade pdf-inspektör isär hela fallet på 0,47 sekunder. Som jämförelse: pymupdf4llm - 17 sekunder, markitdown - 16 sekunder. Samtidigt är det högst i kvalitet: totalpoängen är 0,875 mot 0,735 för pymupdf4llm och 0,589 för markitdown. Den känner igen tabeller mycket bättre - 0,814 jämfört med 0,401 och 0,273.

Vad mer kan han göra?

Tidningslayouter med flera kolumner, text från höger till vänster, CID-teckensnitt, upptäckt av trasig kodning. Separat - selektiv OCR: om enskilda skannade sidor har fastnat i PDF, kan du bara köra dem genom OCR, lokalt, genom PP-OCRv6 Small, och inte hela dokumentet.

Var är haken?

Ärligt talat: för riktiga skanningar och fotografier av dokument behövs fortfarande OCR, och här är pdf-inspektören inte magisk - den spenderar bara inte OCR på något som inte behöver det. Komplexa layouter, där formler och layout blandas med text, kan också fungera. Och det här är ett bibliotek, inte en färdig tjänst: för att använda den måste du skriva lite kod.

Glödande linjer och bordsvikning från ett pappersdokument till ett hologram

Det finns bindningar för Python, Node.js och webbläsarbaserad WASM – samma Rust-parser fungerar direkt i webbläsaren utan server. Lagret på GitHub har redan fått nästan 17 tusen stjärnor. Om du ofta bär PDF i ett neuralt nätverk är det värt att titta på.