Firecrawl avasi pdf-tarkastajan: PDF Markdownissa millisekunneissa, ilman tekstintunnistusta
Firecrawl, Y Combinatorin käynnistys, joka valmistaa työkaluja tiedon poimimiseen verkkosivuilta, on avannut pdf-tarkastajan lähteet: Rust-kirjaston, joka millisekunneissa määrittää, onko edessäsi oleva teksti PDF vai skannaus, ja muuttaa tekstidokumentit puhtaiksi Markdowniksi ilman OCR:ää. Ryhmän arvioiden mukaan noin 54 % PDF:stä todellisissa ongelmissa on tekstipohjaisia, eikä niitä ole yksinkertaisesti mitään järkeä ajaa niitä hitaiden ja kalliiden OCR:n läpi.
Jos olet joskus syöttänyt hermoverkkoon PDF-tiedostoa - sopimusta, raporttia, kirjaa - tiedät tämän tunteen: tiedosto näyttää avautuvan, mutta tekstiä siitä ei kopioida tai se kopioidaan puuroon. Klassiset jäsentimet joko tukahduttavat taulukoita tai suorittavat jokaisen sivun OCR:n läpi tuhlaten sekunteja ja rahaa. pdf-inspector osuu juuri tähän tuskaan: ensin se tarkistaa nopeasti, millainen tiedosto se on, ja yhdistää OCR:n vain, jos se on oikea skannaus.
Ensin luokittelu, sitten purkaminen
Kirjasto määrittää yhdellä kertaa PDF-tiedoston johonkin neljästä tyypistä - TextBased, Scanned, ImageBased tai Mixed - ja antaa varmuuden 0-1 sekä sivureitin: mikä luetaan tekstinä ja mikä lähetetään tekstintunnistusohjelmaan. Luokittelu kestää 10–50 millisekuntia. Seuraavaksi tekstisivuille poimitaan koordinaatit, fontit ja lukujärjestys, ja tulos on Markdown otsikoineen, luetteloineen, taulukoineen ja linkeineen.
Vaikuttavia lukuja
Opendataloader-penkillä 200 PDF:stä pdf-inspector purki koko kotelon 0,47 sekunnissa. Vertailun vuoksi: pymupdf4llm - 17 sekuntia, markitdown - 16 sekuntia. Samalla se on laadultaan korkein: kokonaispistemäärä on 0,875 vs. pymupdf4llm 0,735 ja markitdown 0,589. Se tunnistaa taulukot paljon paremmin - 0,814 vs. 0,401 ja 0,273.
Mitä muuta hän voi tehdä?
Monisarakkeiset sanomalehtiasettelut, oikealta vasemmalle kulkeva teksti, CID-fontit, rikkinäisen koodauksen tunnistus. Erikseen - valikoiva OCR: jos yksittäiset skannatut sivut ovat juuttuneet PDF-tiedostoon, voit suorittaa vain ne OCR:n kautta paikallisesti, PP-OCRv6 Smallin kautta, et koko asiakirjaa.
Missä saalis?
Rehellisesti sanottuna: oikeita skannauksia ja asiakirjojen valokuvia varten tarvitaan edelleen OCR, ja tässä pdf-tarkistaja ei ole taikuutta - se ei vain kuluta OCR:ää johonkin, joka ei sitä tarvitse. Myös monimutkaiset asettelut, joissa kaavat ja asettelu sekoitetaan tekstiin, voivat toimia. Ja tämä on kirjasto, ei valmis palvelu: käyttääksesi sitä, sinun on kirjoitettava pieni koodi.

Pythonille, Node.js:lle ja selainpohjaiselle WASM:lle on sidoksia – sama Rust-jäsennin toimii suoraan selaimessa ilman palvelinta. GitHubin arkisto on saanut jo lähes 17 tuhatta tähteä. Jos käytät PDF-tiedostoja usein neuroverkossa, se kannattaa katsoa.