← Все статьи

Firecrawl membuka pdf-inspector: PDF dalam Markdown dalam milidetik, tanpa OCR

Firecrawl membuka pdf-inspector: PDF dalam Markdown dalam milidetik, tanpa OCR

Firecrawl, startup dari Y Combinator yang membuat alat untuk mengekstrak data dari situs web, telah membuka sumber pdf-inspector: perpustakaan Rust yang dalam milidetik menentukan apakah teks di depan Anda adalah PDF atau pindaian, dan mengubah dokumen teks menjadi Markdown murni tanpa OCR sama sekali. Menurut perkiraan tim, sekitar 54% PDF dalam masalah nyata berbasis teks, dan tidak ada gunanya menjalankannya melalui OCR yang lambat dan mahal.

Jika Anda pernah memasukkan PDF jaringan saraf - kontrak, laporan, buku - Anda pasti tahu perasaan ini: file sepertinya terbuka, tetapi teks darinya tidak disalin atau disalin dalam bubur. Parser klasik akan tersedak tabel atau menjalankan setiap halaman melalui OCR, membuang-buang waktu dan uang. pdf-inspector mengatasi masalah ini dengan tepat: pertama, ia dengan cepat melihat jenis file apa itu, dan menghubungkan OCR hanya jika itu adalah pemindaian sebenarnya.

Klasifikasi pertama, lalu ekstraksi

Dalam sekali jalan, perpustakaan menetapkan PDF ke salah satu dari empat jenis - Berbasis Teks, Dipindai, Berbasis Gambar, atau Campuran - dan memberikan keyakinan dari 0 hingga 1 ditambah rute halaman: mana yang dibaca sebagai teks, mana yang dikirim ke OCR. Klasifikasi membutuhkan waktu 10–50 milidetik. Selanjutnya untuk halaman teks dilakukan ekstraksi dengan koordinat, font dan urutan bacaan, dan keluarannya adalah Markdown dengan judul, daftar, tabel dan link.

Angka yang mengesankan

Di bangku opendataloader dari 200 PDF pdf-inspektur membongkar seluruh kasus dalam 0,47 detik. Sebagai perbandingan: pymupdf4llm - 17 detik, penurunan harga - 16 detik. Pada saat yang sama, kualitasnya adalah yang tertinggi: skor keseluruhannya adalah 0,875 versus 0,735 untuk pymupdf4llm dan 0,589 untuk penurunan harga. Ia mengenali tabel jauh lebih baik - 0,814 versus 0,401 dan 0,273.

Apa lagi yang bisa dia lakukan?

Tata letak surat kabar multi-kolom, teks kanan ke kiri, font CID, deteksi pengkodean rusak. Secara terpisah - OCR selektif: jika setiap halaman yang dipindai terjebak dalam PDF, Anda hanya dapat menjalankannya melalui OCR, secara lokal, melalui PP-OCRv6 Kecil, dan bukan seluruh dokumen.

Di mana hasil tangkapannya?

Jujur saja: untuk scan dan foto dokumen yang sebenarnya, OCR masih diperlukan, dan di sini pdf-inspector bukanlah sihir - ia tidak menghabiskan OCR untuk sesuatu yang tidak membutuhkannya. Tata letak yang rumit, dimana rumus dan tata letak dicampur dengan teks, juga dapat berfungsi. Dan ini adalah perpustakaan, bukan layanan siap pakai: untuk menggunakannya, Anda harus menulis sedikit kode.

Glowing lines and table folding from a paper document into a hologram

Ada binding untuk Python, Node.js, dan WASM berbasis browser - parser Rust yang sama bekerja langsung di browser tanpa server. Repositori di GitHub telah memperoleh hampir 17 ribu bintang. Jika Anda sering membawa PDF di jaringan saraf, ada baiknya untuk dilihat.