← Tutti gli articoli

Firecrawl aperto ispettore pdf: PDF in Markdown in millisecondi, senza OCR

Firecrawl ispettore pdf aperto: PDF in Markdown in millisecondi, senza OCR

Firecrawl, una startup di Y Combinator che crea strumenti per estrarre dati da siti web, ha aperto i sorgenti di pdf-inspector: una libreria Rust che in millisecondi determina se il testo di fronte a te è PDF o una scansione, e trasforma i documenti di testo in puro Markdown senza OCR. Secondo le stime del team, circa il 54% dei PDF problemi reali sono basati su testo, e semplicemente non ha senso sottoporli al lento e costoso OCR.

Se hai mai alimentato una rete neurale PDF - un contratto, un rapporto, un libro - conosci questa sensazione: il file sembra aprirsi, ma il testo da esso non viene copiato o viene copiato in porridge. I parser classici si soffocano con le tabelle o eseguono ogni pagina fino a OCR, sprecando secondi e denaro. pdf-inspector colpisce esattamente questo problema: in primo luogo, controlla rapidamente che tipo di file è e si connette OCR solo se si tratta di una scansione reale.

Prima classificazione, poi estrazione

In un passaggio, la libreria assegna PDF a uno dei quattro tipi: TextBased, Scanned, ImageBased o Mixed - e fornisce una confidenza da 0 a 1 più un percorso di pagina: quale leggere come testo, quale inviare a OCR. La classificazione richiede 10–50 millisecondi. Successivamente, per le pagine di testo, c'è l'estrazione con coordinate, caratteri e ordine di lettura, e l'output è Markdown con intestazioni, elenchi, tabelle e collegamenti.

Numeri che impressionano

Sul banco opendataloader su 200 PDF pdf-inspector ha smontato l'intero caso in 0,47 secondi. Per confronto: pymupdf4llm - 17 secondi, markitdown - 16 secondi. Allo stesso tempo, è il più alto in termini di qualità: il punteggio complessivo è 0,875 contro 0,735 per pymupdf4llm e 0,589 per markitdown. Riconosce le tabelle molto meglio: 0,814 contro 0,401 e 0,273.

Cos'altro può fare?

Layout di giornale a più colonne, testo da destra a sinistra, caratteri CID, rilevamento della codifica errata. Separatamente - selettivo OCR: se le singole pagine scansionate sono bloccate in PDF, puoi eseguirle solo tramite OCR, localmente, tramite PP-OCRv6 Small e non l'intero documento.

Dov'è il problema?

Onestamente: per scansioni e fotografie reali di documenti, è ancora necessario OCR, e qui l'ispettore pdf non è magico: semplicemente non spende OCR per qualcosa che non ne ha bisogno. Possono funzionare anche layout complessi, in cui formule e layout sono mescolati con testo. E questa è una libreria, non un servizio già pronto: per usarla bisogna scrivere un po' di codice.

Linee luminose e tavolo che si piega da un documento cartaceo a un ologramma

Esistono collegamenti per Python, Node.js e WASM basato su browser: lo stesso parser Rust funziona direttamente nel browser senza un server. Il repository su GitHub ha già guadagnato quasi 17mila stelle. Se porti spesso PDF in una rete neurale, vale la pena dargli un'occhiata.