→ כל המאמרים

Inspector PDF ל-Firecrawl בקוד פתוח: PDF ל-Markdown באלפיות שניות, ללא OCR

Inspector PDF ל-Firecrawl בקוד פתוח: PDF ל-Markdown באלפיות שניות, ללא OCR

ל-Firecrawl, הסטארט-אפ של Y Combinator הידוע בכלי גירוד האינטרנט שלו, יש PDF-inspector במקור פתוח - ספריית Rust שמגלה באלפיות שניות אם PDF מבוסס על טקסט או סריקה, והופכת מסמכים מבוססי טקסט ל-Markdown נקי ללא כל OCR. לפי הערכת הצוות, כ-54% מקובצי PDF בעומסי עבודה אמיתיים הם מבוססי טקסט, כך שהפעלתם באמצעות OCR איטי ויקר היא חסרת טעם.

אם אי פעם הזנת PDF לדגם - חוזה, דוח, ספר - אתה מכיר את התחושה: הקובץ נפתח בסדר, אבל הטקסט לא יועתק, או שהוא מועתק כזבל. מנתחים קלאסיים או נחנקים בטבלאות או דוחפים כל עמוד דרך OCR, שורפים שניות וכסף. pdf-inspector פוגע בדיוק בנקודת הכאב הזו: הוא בודק במהירות מהו הקובץ, ומגיע ל-OCR רק כאשר מדובר בסריקה אמיתית.

סיווג ראשון, חלץ שני

במעבר בודד הספרייה ממיינת PDF לאחד מארבעה סוגים - מבוסס טקסט, סרוק, מבוסס תמונה או מעורב - ומחזירה ציון ביטחון מ-0 ל-1 בתוספת מסלול לכל עמוד: אילו דפים לקרוא כטקסט, אילו עמודים לשלוח ל-OCR. הסיווג לוקח 10-50 מילישניות. עבור דפי טקסט הוא מחלץ עם קואורדינטות, גופנים וסדר קריאה, ומוציא Markdown עם כותרות, רשימות, טבלאות וקישורים.

מספרים בולטים

בקורפוס ה-opendataloader-bench של 200 קובצי PDF, PDF-inspector עיבד את כל הסט ב-0.47 שניות. לשם השוואה: pymupdf4llm לקח 17 שניות, markitdown 16 שניות. והוא עדיין קיבל את הציון הגבוה ביותר באיכות - 0.875 בסך הכל לעומת 0.735 עבור pymupdf4llm ו-0.589 עבור markitdown. הטבלאות הן המקום שבו היא באמת מושכת קדימה: 0.814 לעומת 0.401 ו-0.273.

מה זה עוד עושה

פריסות עיתונים מרובות עמודות, טקסט מימין לשמאל, גופני CID, זיהוי קידוד שבור. ו-OCR סלקטיבי: אם קובץ PDF כולל כמה דפים סרוקים מעורבבים, אתה יכול להריץ רק את אלה דרך OCR באופן מקומי באמצעות PP-OCRv6 Small, במקום המסמך כולו.

איפה זה נופל

בכנות: סריקות אמיתיות ותמונות של מסמכים עדיין זקוקות ל-OCR, ו-pdf-inspector אינו קסם שם - הוא פשוט לא מבזבז OCR על קבצים שאינם זקוקים לו. פריסות מורכבות שבהן נוסחאות וקביעת כתיבה מעורבבים עם טקסט יכולות גם להכשיל אותו. וזו ספרייה, לא שירות מוכן: תצטרך לכתוב מעט קוד כדי להשתמש בו.

Светящиеся строки и таблица, складывающиеся из бумажного документа в голограмму

יש כריכות עבור Python, Node.js ו-WebAssembly של הדפדפן - אותו מנתח Rust פועל ישירות בדפדפן ללא שרת. הריפו של GitHub כבר עבר 17,000 כוכבים. אם אתה מזין בקביעות קובצי PDF לדגמים, שווה להסתכל.