← Kaikki artikkelit

Firecrawl avasi pdf-tarkastajan: PDF Markdownissa millisekunneissa, ilman tekstintunnistusta

Firecrawl avasi pdf-tarkastajan: PDF Markdownissa millisekunneissa, ilman tekstintunnistusta

Firecrawl, Y Combinatorin käynnistys, joka valmistaa työkaluja tiedon poimimiseen verkkosivuilta, on avannut pdf-tarkastajan lähteet: Rust-kirjaston, joka millisekunneissa määrittää, onko edessäsi oleva teksti PDF vai skannaus, ja muuttaa tekstidokumentit puhtaiksi Markdowniksi ilman OCR:ää. Ryhmän arvioiden mukaan noin 54 % PDF:stä todellisissa ongelmissa on tekstipohjaisia, eikä niitä ole yksinkertaisesti mitään järkeä ajaa niitä hitaiden ja kalliiden OCR:n läpi.

Jos olet joskus syöttänyt hermoverkkoon PDF-tiedostoa - sopimusta, raporttia, kirjaa - tiedät tämän tunteen: tiedosto näyttää avautuvan, mutta tekstiä siitä ei kopioida tai se kopioidaan puuroon. Klassiset jäsentimet joko tukahduttavat taulukoita tai suorittavat jokaisen sivun OCR:n läpi tuhlaten sekunteja ja rahaa. pdf-inspector osuu juuri tähän tuskaan: ensin se tarkistaa nopeasti, millainen tiedosto se on, ja yhdistää OCR:n vain, jos se on oikea skannaus.

Ensin luokittelu, sitten purkaminen

Kirjasto määrittää yhdellä kertaa PDF-tiedoston johonkin neljästä tyypistä - TextBased, Scanned, ImageBased tai Mixed - ja antaa varmuuden 0-1 sekä sivureitin: mikä luetaan tekstinä ja mikä lähetetään tekstintunnistusohjelmaan. Luokittelu kestää 10–50 millisekuntia. Seuraavaksi tekstisivuille poimitaan koordinaatit, fontit ja lukujärjestys, ja tulos on Markdown otsikoineen, luetteloineen, taulukoineen ja linkeineen.

Vaikuttavia lukuja

Opendataloader-penkillä 200 PDF:stä pdf-inspector purki koko kotelon 0,47 sekunnissa. Vertailun vuoksi: pymupdf4llm - 17 sekuntia, markitdown - 16 sekuntia. Samalla se on laadultaan korkein: kokonaispistemäärä on 0,875 vs. pymupdf4llm 0,735 ja markitdown 0,589. Se tunnistaa taulukot paljon paremmin - 0,814 vs. 0,401 ja 0,273.

Mitä muuta hän voi tehdä?

Monisarakkeiset sanomalehtiasettelut, oikealta vasemmalle kulkeva teksti, CID-fontit, rikkinäisen koodauksen tunnistus. Erikseen - valikoiva OCR: jos yksittäiset skannatut sivut ovat juuttuneet PDF-tiedostoon, voit suorittaa vain ne OCR:n kautta paikallisesti, PP-OCRv6 Smallin kautta, et koko asiakirjaa.

Missä saalis?

Rehellisesti sanottuna: oikeita skannauksia ja asiakirjojen valokuvia varten tarvitaan edelleen OCR, ja tässä pdf-tarkistaja ei ole taikuutta - se ei vain kuluta OCR:ää johonkin, joka ei sitä tarvitse. Myös monimutkaiset asettelut, joissa kaavat ja asettelu sekoitetaan tekstiin, voivat toimia. Ja tämä on kirjasto, ei valmis palvelu: käyttääksesi sitä, sinun on kirjoitettava pieni koodi.

Glowing lines and table folding from a paper document into a hologram

Pythonille, Node.js:lle ja selainpohjaiselle WASM:lle on sidoksia – sama Rust-jäsennin toimii suoraan selaimessa ilman palvelinta. GitHubin arkisto on saanut jo lähes 17 tuhatta tähteä. Jos käytät PDF-tiedostoja usein neuroverkossa, se kannattaa katsoa.