← Все статьи

Inspektur pdf sumber terbuka Firecrawl: PDF ke Penurunan Harga dalam milidetik, tanpa OCR

Inspektur pdf sumber terbuka Firecrawl: PDF ke Penurunan Harga dalam milidetik, tanpa OCR

Firecrawl, startup Y Combinator yang terkenal dengan alat pengikis webnya, memiliki pdf-inspector bersumber terbuka — pustaka Rust yang dapat mengetahui dalam hitungan milidetik apakah PDF berbasis teks atau pindaian, dan mengubah dokumen berbasis teks menjadi Markdown bersih tanpa OCR apa pun. Berdasarkan perkiraan tim, sekitar 54% PDF dalam beban kerja nyata berbasis teks, jadi menjalankannya melalui OCR yang lambat dan mahal tidak ada gunanya.

Jika Anda pernah memasukkan PDF ke suatu model - kontrak, laporan, buku - Anda pasti tahu perasaannya: file terbuka dengan baik, tetapi teksnya tidak dapat disalin, atau disalin sebagai sampah. Parser klasik akan menghambat tabel atau mendorong setiap halaman melalui OCR, menghabiskan waktu dan uang. pdf-inspector tepat sasaran: ia dengan cepat memeriksa file apa, dan hanya meraih OCR jika itu benar-benar pemindaian.

Klasifikasi dulu, ekstrak kedua

Dalam sekali akses, perpustakaan mengurutkan PDF ke dalam salah satu dari empat jenis — Berbasis Teks, Dipindai, Berbasis Gambar, atau Campuran — dan mengembalikan skor keyakinan dari 0 hingga 1 ditambah rute per halaman: halaman mana yang dibaca sebagai teks, halaman mana yang dikirim ke OCR. Klasifikasi membutuhkan waktu 10–50 milidetik. Untuk halaman teks kemudian diekstraksi dengan koordinat, font, dan urutan pembacaan, dan menghasilkan Penurunan harga dengan judul, daftar, tabel, dan tautan.

Angka yang menonjol

Pada korpus opendataloader-bench yang berisi 200 PDF, pdf-inspector memproses seluruh rangkaian dalam 0,47 detik. Sebagai perbandingan: pymupdf4llm membutuhkan waktu 17 detik, penurunan harga 16 detik. Dan skor kualitasnya masih tertinggi — 0,875 secara keseluruhan versus 0,735 untuk pymupdf4llm dan 0,589 untuk penurunan harga. Tabel menunjukkan keunggulannya: 0,814 versus 0,401 dan 0,273.

Apa lagi fungsinya

Tata letak surat kabar multi-kolom, teks kanan ke kiri, font CID, deteksi pengkodean rusak. Dan OCR selektif: jika PDF memiliki beberapa halaman pindaian yang tercampur, Anda hanya dapat menjalankannya melalui OCR secara lokal melalui PP-OCRv6 Small, bukan seluruh dokumen.

Dimana kekurangannya

Sejujurnya: pemindaian dan foto dokumen yang sebenarnya masih memerlukan OCR, dan pdf-inspector bukanlah hal yang ajaib — ia tidak menyia-nyiakan OCR pada file yang tidak memerlukannya. Tata letak yang rumit di mana rumus dan pengaturan huruf dicampur dengan teks juga dapat membuat kesalahan. Dan ini adalah perpustakaan, bukan layanan siap pakai: Anda perlu menulis sedikit kode untuk menggunakannya.

Glowing lines and table folding from a paper document into a hologram

Ada binding untuk Python, Node.js, dan browser WebAssembly — parser Rust yang sama berjalan langsung di browser tanpa server. Repo GitHub telah melampaui 17.000 bintang. Jika Anda secara teratur memasukkan PDF ke model, ini layak untuk dilihat.