← सभी लेख

Firecrawl ने पीडीएफ-इंस्पेक्टर खोला: PDF में Markdown मिलीसेकंड में, OCR के बिना

Firecrawl पीडीएफ-इंस्पेक्टर खोला गया: PDF में Markdown मिलीसेकेंड में, बिना OCR के

Firecrawl, वाई कॉम्बिनेटर का एक स्टार्टअप जो वेबसाइटों से डेटा निकालने के लिए टूल बनाता है, ने पीडीएफ-इंस्पेक्टर के स्रोत खोले हैं: एक रस्ट लाइब्रेरी जो मिलीसेकंड में निर्धारित करती है कि आपके सामने का टेक्स्ट PDF है या स्कैन, और टेक्स्ट दस्तावेज़ों को बिना OCR के शुद्ध Markdown में बदल देता है। टीम के अनुमान के अनुसार, वास्तविक समस्याओं में PDF में से लगभग 54% पाठ-आधारित हैं, और उन्हें धीमी और महंगी OCR के माध्यम से चलाने का कोई मतलब नहीं है।

यदि आपने कभी एक तंत्रिका नेटवर्क PDF - एक अनुबंध, एक रिपोर्ट, एक पुस्तक - को खिलाया है, तो आप इस भावना को जानते हैं: फ़ाइल खुलती प्रतीत होती है, लेकिन उसमें से पाठ की प्रतिलिपि नहीं बनाई जाती है या दलिया में कॉपी की जाती है। क्लासिक पार्सर या तो टेबलों पर अटक जाते हैं या सेकंड और पैसे बर्बाद करते हुए प्रत्येक पेज को OCR तक चलाते हैं। पीडीएफ-इंस्पेक्टर वास्तव में इस दर्द को झेलता है: सबसे पहले, यह तुरंत देखता है कि यह किस प्रकार की फ़ाइल है, और OCR को केवल तभी कनेक्ट करता है जब यह वास्तविक स्कैन हो।

पहले वर्गीकरण, फिर निष्कर्षण

एक पास में, लाइब्रेरी चार प्रकारों में से एक को PDF असाइन करती है - टेक्स्टबेस्ड, स्कैन्ड, इमेजबेस्ड या मिक्स्ड - और 0 से 1 प्लस एक पेज रूट तक का विश्वास देती है: किसे टेक्स्ट के रूप में पढ़ना है, किसे OCR पर भेजना है। वर्गीकरण में 10-50 मिलीसेकंड लगते हैं। इसके बाद, पाठ पृष्ठों के लिए, निर्देशांक, फ़ॉन्ट और पढ़ने के क्रम के साथ निष्कर्षण होता है, और शीर्षकों, सूचियों, तालिकाओं और लिंक के साथ आउटपुट Markdown होता है।

संख्याएँ जो प्रभावशाली हैं

200 PDF में से opendataloader-बेंच पर पीडीएफ-इंस्पेक्टर ने 0.47 सेकंड में पूरे मामले को अलग कर दिया। तुलना के लिए: pymupdf4llm - 17 सेकंड, मार्किटडाउन - 16 सेकंड। साथ ही, यह गुणवत्ता में उच्चतम है: समग्र स्कोर pymupdf4llm के लिए 0.875 बनाम 0.735 और मार्किटडाउन के लिए 0.589 है। यह तालिकाओं को बेहतर ढंग से पहचानता है - 0.814 बनाम 0.401 और 0.273।

वह और क्या कर सकता है?

मल्टी-कॉलम अखबार लेआउट, दाएं से बाएं पाठ, सीआईडी ​​फ़ॉन्ट, टूटी एन्कोडिंग का पता लगाना। अलग से - चयनात्मक OCR: यदि अलग-अलग स्कैन किए गए पृष्ठ PDF में अटके हुए हैं, तो आप उन्हें केवल OCR के माध्यम से, स्थानीय रूप से, पीपी-OCRv6 छोटे के माध्यम से चला सकते हैं, और संपूर्ण दस्तावेज़ नहीं।

पकड़ कहाँ है?

ईमानदारी से: दस्तावेज़ों के वास्तविक स्कैन और तस्वीरों के लिए, OCR की अभी भी आवश्यकता है, और यहां पीडीएफ-इंस्पेक्टर जादू नहीं है - यह किसी ऐसी चीज़ पर OCR खर्च नहीं करता है जिसे इसकी आवश्यकता नहीं है। जटिल लेआउट, जहां सूत्र और लेआउट पाठ के साथ मिश्रित होते हैं, भी काम कर सकते हैं। और यह एक लाइब्रेरी है, कोई रेडीमेड सेवा नहीं: इसका उपयोग करने के लिए आपको थोड़ा कोड लिखना होगा।

कागज़ के दस्तावेज़ से चमकती रेखाएँ और टेबल को होलोग्राम में मोड़ना

Python, Node.js और ब्राउज़र-आधारित WASM के लिए बाइंडिंग हैं - वही रस्ट पार्सर बिना सर्वर के सीधे ब्राउज़र में काम करता है। GitHub पर रिपॉजिटरी पहले ही लगभग 17 हजार स्टार प्राप्त कर चुकी है। यदि आप अक्सर तंत्रिका नेटवर्क में PDF रखते हैं, तो यह देखने लायक है।