← Все статьи

Firecrawl membuka pdf-inspektor: PDF dalam Markdown dalam milisaat, tanpa OCR

Firecrawl membuka pdf-inspektor: PDF dalam Markdown dalam milisaat, tanpa OCR

Firecrawl, permulaan daripada Y Combinator yang membuat alat untuk mengekstrak data daripada tapak web, telah membuka sumber pdf-inspector: perpustakaan Rust yang dalam milisaat menentukan sama ada teks di hadapan anda ialah PDF atau imbasan dan menukarkan dokumen teks kepada Turun Tulen tanpa OCR sama sekali. Menurut anggaran pasukan, kira-kira 54% daripada PDF dalam masalah sebenar adalah berasaskan teks, dan tidak ada gunanya menjalankannya melalui OCR yang perlahan dan mahal.

Jika anda pernah memberi PDF rangkaian saraf - kontrak, laporan, buku - anda tahu perasaan ini: fail kelihatan terbuka, tetapi teks daripadanya tidak disalin atau disalin dalam bubur. Penghurai klasik sama ada tercekik pada jadual atau menjalankan setiap halaman melalui OCR, membazirkan saat dan wang. pdf-inspector menyentuh kesakitan ini: pertama, ia dengan cepat melihat jenis fail itu, dan menyambungkan OCR hanya jika ia adalah imbasan sebenar.

Pengelasan pertama, kemudian pengekstrakan

Dalam satu laluan, pustaka memperuntukkan PDF kepada salah satu daripada empat jenis - TextBased, Scanned, ImageBased atau Mixed - dan memberikan keyakinan daripada 0 hingga 1 ditambah laluan halaman: yang dibaca sebagai teks, yang dihantar ke OCR. Pengelasan mengambil masa 10–50 milisaat. Seterusnya, untuk halaman teks, terdapat pengekstrakan dengan koordinat, fon dan susunan bacaan, dan output ialah Markdown dengan tajuk, senarai, jadual dan pautan.

Nombor yang mengagumkan

Pada bangku opendataloader daripada 200 PDF pdf-inspektor membongkar keseluruhan kes dalam 0.47 saat. Sebagai perbandingan: pymupdf4llm - 17 saat, markitdown - 16 saat. Pada masa yang sama, ia adalah kualiti tertinggi: skor keseluruhan ialah 0.875 berbanding 0.735 untuk pymupdf4llm dan 0.589 untuk penurunan harga. Ia mengenali jadual dengan lebih baik - 0.814 berbanding 0.401 dan 0.273.

Apa lagi yang dia boleh buat?

Reka letak akhbar berbilang lajur, teks kanan ke kiri, fon CID, pengesanan pengekodan rosak. Secara berasingan - OCR terpilih: jika halaman yang diimbas individu tersekat dalam PDF, anda hanya boleh menjalankannya melalui OCR, secara setempat, melalui PP-OCRv6 Small, dan bukan keseluruhan dokumen.

mana tangkapannya?

Sejujurnya: untuk imbasan sebenar dan gambar dokumen, OCR masih diperlukan, dan di sini pemeriksa pdf bukanlah sihir - ia hanya tidak membelanjakan OCR pada sesuatu yang tidak memerlukannya. Reka letak yang kompleks, di mana formula dan reka letak bercampur dengan teks, juga boleh berfungsi. Dan ini adalah perpustakaan, bukan perkhidmatan sedia: untuk menggunakannya, anda perlu menulis sedikit kod.

Glowing lines and table folding from a paper document into a hologram

Terdapat pengikatan untuk Python, Node.js dan WASM berasaskan pelayar - penghurai Rust yang sama berfungsi secara langsung dalam penyemak imbas tanpa pelayan. Repositori di GitHub telah memperoleh hampir 17 ribu bintang. Jika anda sering membawa PDF dalam rangkaian saraf, ia patut dilihat.