← Все статьи

Firecrawl pdf-inspector deschis: PDF în Markdown în milisecunde, fără OCR

Firecrawl pdf-inspector deschis: PDF în Markdown în milisecunde, fără OCR

Firecrawl, un startup de la Y Combinator care face instrumente pentru extragerea datelor de pe site-uri web, a deschis sursele pdf-inspector: o bibliotecă Rust care determină în milisecunde dacă textul din fața ta este PDF sau o scanare și transformă documentele text în Markdown pur, fără OCR. Conform estimărilor echipei, aproximativ 54% din PDF din problemele reale sunt bazate pe text și pur și simplu nu are rost să le rulezi prin OCR lentă și costisitoare.

Dacă ați alimentat vreodată o rețea neuronală PDF - un contract, un raport, o carte - cunoașteți acest sentiment: fișierul pare să se deschidă, dar textul din acesta nu este copiat sau este copiat în terci. Analizatoarele clasice fie se sufocă cu tabele, fie rulează fiecare pagină prin OCR, irosind secunde și bani. pdf-inspector lovește exact această durere: mai întâi, se uită rapid la ce fel de fișier este și conectează OCR numai dacă este o scanare reală.

Mai întâi clasificarea, apoi extragerea

Într-o singură trecere, biblioteca atribuie PDF unuia dintre cele patru tipuri - bazat pe text, scanat, pe bază de imagini sau mixt - și oferă o încredere de la 0 la 1 plus o rută a paginii: pe care să o citești ca text, pe care să o trimiți la OCR. Clasificarea durează 10-50 de milisecunde. În continuare, pentru paginile de text, există extragerea cu coordonate, fonturi și ordine de citire, iar rezultatul este Markdown cu titluri, liste, tabele și link-uri.

Cifre care sunt impresionante

Pe opendataloader-bench din 200 PDF pdf-inspector a dezasamblat întregul caz în 0,47 secunde. Pentru comparație: pymupdf4llm - 17 secunde, markitdown - 16 secunde. În același timp, este cea mai înaltă calitate: scorul general este 0,875 față de 0,735 pentru pymupdf4llm și 0,589 pentru markitdown. Recunoaște tabelele mult mai bine - 0,814 față de 0,401 și 0,273.

Ce altceva poate face?

Aspecte de ziare cu mai multe coloane, text de la dreapta la stânga, fonturi CID, detectarea codării întrerupte. Separat - selectiv OCR: dacă paginile scanate individuale sunt blocate în PDF, le puteți rula doar prin OCR, local, prin PP-OCRv6 Small, și nu întregul document.

Unde-i captura?

Sincer: pentru scanări reale și fotografii ale documentelor, este încă nevoie de OCR, iar aici inspectorul pdf nu este magic - pur și simplu nu cheltuiește OCR pe ceva care nu are nevoie de el. Aspectele complexe, în care formulele și aspectul sunt amestecate cu text, pot funcționa și ele. Și aceasta este o bibliotecă, nu un serviciu gata făcut: pentru a o folosi, trebuie să scrieți un mic cod.

Liniile strălucitoare și plierea mesei dintr-un document de hârtie într-o hologramă

Există legături pentru Python, Node.js și WASM bazat pe browser - același parser Rust funcționează direct în browser fără un server. Depozitul de pe GitHub a câștigat deja aproape 17 mii de stele. Dacă purtați adesea PDF într-o rețea neuronală, merită o privire.