← सभी लेख

फायरक्रॉल ओपन-सोर्स पीडीएफ-इंस्पेक्टर: पीडीएफ से मार्कडाउन मिलीसेकंड में, कोई ओसीआर नहीं

फायरक्रॉल ओपन-सोर्स पीडीएफ-इंस्पेक्टर: पीडीएफ से मार्कडाउन मिलीसेकंड में, कोई ओसीआर नहीं

फायरक्रॉल, वाई कॉम्बिनेटर स्टार्टअप जो अपने वेब-स्क्रैपिंग टूल के लिए जाना जाता है, के पास ओपन-सोर्स पीडीएफ-इंस्पेक्टर है - एक रस्ट लाइब्रेरी जो मिलीसेकंड में पता लगाती है कि पीडीएफ टेक्स्ट-आधारित है या स्कैन, और टेक्स्ट-आधारित दस्तावेज़ों को बिना किसी ओसीआर के स्वच्छ मार्कडाउन में बदल देता है। टीम के अनुमान के अनुसार, वास्तविक कार्यभार में लगभग 54% पीडीएफ टेक्स्ट-आधारित हैं, इसलिए उन्हें धीमी, महंगी ओसीआर के माध्यम से चलाना व्यर्थ है।

यदि आपने कभी किसी मॉडल को पीडीएफ खिलाया है - एक अनुबंध, एक रिपोर्ट, एक पुस्तक - तो आप इस भावना को जानते हैं: फ़ाइल ठीक से खुलती है, लेकिन पाठ कॉपी नहीं होगा, या यह कचरे के रूप में कॉपी हो जाता है। क्लासिक पार्सर या तो टेबलों पर अटक जाते हैं या प्रत्येक पृष्ठ को ओसीआर के माध्यम से धकेल देते हैं, जिससे सेकंड और पैसा खर्च होता है। पीडीएफ-इंस्पेक्टर ठीक उसी समस्या बिंदु पर पहुंचता है: यह तुरंत जांचता है कि फ़ाइल क्या है, और केवल ओसीआर तक पहुंचता है जब यह वास्तव में स्कैन होता है।

पहले वर्गीकृत करें, दूसरे को निकालें

एक ही पास में लाइब्रेरी पीडीएफ को चार प्रकारों में से एक में क्रमबद्ध करती है - टेक्स्टबेस्ड, स्कैन्ड, इमेजबेस्ड, या मिक्स्ड - और 0 से 1 प्लस प्रति-पेज रूट तक एक कॉन्फिडेंस स्कोर लौटाती है: कौन से पेज को टेक्स्ट के रूप में पढ़ना है, कौन सा ओसीआर को भेजना है। वर्गीकरण में 10-50 मिलीसेकंड लगते हैं। पाठ पृष्ठों के लिए यह निर्देशांक, फ़ॉन्ट और पढ़ने के क्रम के साथ निकालता है, और शीर्षकों, सूचियों, तालिकाओं और लिंक के साथ मार्कडाउन को आउटपुट करता है।

संख्याएँ जो उभर कर सामने आती हैं

200 पीडीएफ के ओपनडेटालोडर-बेंच कॉर्पस पर, पीडीएफ-इंस्पेक्टर ने पूरे सेट को 0.47 सेकंड में संसाधित किया। तुलना के लिए: pymupdf4llm को 17 सेकंड लगे, मार्किटडाउन को 16 सेकंड। और इसने अभी भी गुणवत्ता पर उच्चतम स्कोर किया है - कुल मिलाकर 0.875 बनाम pymupdf4llm के लिए 0.735 और मार्किटडाउन के लिए 0.589। तालिकाएँ वह हैं जहाँ यह वास्तव में आगे बढ़ती है: 0.814 बनाम 0.401 और 0.273।

यह और क्या करता है

मल्टी-कॉलम अखबार लेआउट, दाएं से बाएं पाठ, सीआईडी ​​फ़ॉन्ट, टूटी-एन्कोडिंग का पता लगाना। और चयनात्मक ओसीआर: यदि किसी पीडीएफ में कुछ स्कैन किए गए पृष्ठ मिश्रित हैं, तो आप पूरे दस्तावेज़ के बजाय केवल उन्हें पीपी-ओसीआरवी6 स्मॉल के माध्यम से स्थानीय स्तर पर ओसीआर के माध्यम से चला सकते हैं।

जहां यह कम पड़ जाता है

ईमानदारी से: वास्तविक स्कैन और दस्तावेज़ों की तस्वीरों को अभी भी ओसीआर की आवश्यकता है, और पीडीएफ-इंस्पेक्टर वहां जादू नहीं है - यह उन फ़ाइलों पर ओसीआर बर्बाद नहीं करता है जिन्हें इसकी आवश्यकता नहीं है। जटिल लेआउट जहां सूत्र और टाइपसेटिंग को पाठ के साथ मिलाया जाता है, वह भी इसे ख़राब कर सकता है। और यह एक लाइब्रेरी है, कोई रेडीमेड सेवा नहीं: इसका उपयोग करने के लिए आपको थोड़ा सा कोड लिखना होगा।

Светящиеся строки и таблица, складывающиеся из бумажного документа в голограмму

Python, Node.js और ब्राउज़र WebAssembly के लिए बाइंडिंग हैं - वही रस्ट पार्सर सीधे ब्राउज़र में बिना सर्वर के चलता है। GitHub रेपो पहले ही 17,000 सितारों को पार कर चुका है। यदि आप नियमित रूप से मॉडलों को पीडीएफ़ खिलाते हैं, तो यह देखने लायक है।