→ כל המאמרים

Firecrawl פותח PDF-inspector: PDF בMarkdown במילישניות, ללא OCR

Firecrawl פותח PDF-inspector: PDF בMarkdown במילישניות, ללא OCR

Firecrawl, סטארט-אפ מ-Y Combinator שמייצר כלים לחילוץ נתונים מאתרים, פתח את המקורות של pdf-inspector: ספריית Rust שבמילישניות קובעת אם הטקסט שלפניכם הוא PDF או סריקה, והופכת מסמכי טקסט ל-Markdown טהורים בכלל ללא Markdown. על פי הערכות הצוות, כ-54% מהבעיות האמיתיות של PDF הם מבוססי טקסט, ופשוט אין טעם להריץ אותם ב-OCR האיטי והיקר.

אם אי פעם האכלת רשת עצבית PDF - חוזה, דוח, ספר - אתה מכיר את התחושה הזו: נראה שהקובץ נפתח, אבל הטקסט ממנו לא מועתק או מועתק בדיסה. מנתחים קלאסיים או נחנקים בטבלאות או מריצים כל עמוד ב-OCR, מבזבזים שניות וכסף. pdf-inspector פוגע בדיוק בכאב הזה: ראשית, הוא מסתכל במהירות באיזה סוג קובץ מדובר, ומחבר את OCR רק אם מדובר בסריקה אמיתית.

קודם סיווג, אחר כך מיצוי

במעבר אחד, הספרייה מקצה PDF לאחד מארבעה סוגים - TextBased, Scanned, ImageBased או Mixed - ונותנת ביטחון מ-0 ל-1 פלוס מסלול עמוד: מה לקרוא כטקסט, מה לשלוח אל OCR. הסיווג לוקח 10-50 מילישניות. לאחר מכן, עבור דפי טקסט, יש חילוץ עם קואורדינטות, גופנים וסדר קריאה, והפלט הוא Markdown עם כותרות, רשימות, טבלאות וקישורים.

מספרים מרשימים

על ספסל ה-opendataloader מתוך 200 PDF מפקח pdf פירק את כל המארז תוך 0.47 שניות. לשם השוואה: pymupdf4llm - 17 שניות, markitdown - 16 שניות. יחד עם זאת, הוא הגבוה ביותר באיכות: הציון הכולל הוא 0.875 לעומת 0.735 עבור pymupdf4llm ו-0.589 עבור markitdown. הוא מזהה טבלאות הרבה יותר טוב - 0.814 לעומת 0.401 ו-0.273.

מה עוד הוא יכול לעשות?

פריסות עיתונים מרובות עמודות, טקסט מימין לשמאל, גופני CID, זיהוי קידוד שבור. בנפרד - סלקטיבי OCR: אם עמודים סרוקים בודדים תקועים ב- PDF, אתה יכול להריץ רק אותם דרך OCR, באופן מקומי, דרך PP-OCRv6 Small, ולא את כל המסמך.

איפה המלכוד?

בכנות: עבור סריקות אמיתיות ותצלומים של מסמכים, עדיין יש צורך ב-OCR, וכאן מפקח ה-PDF הוא לא קסם - הוא פשוט לא מוציא OCR על משהו שלא צריך אותו. גם פריסות מורכבות, שבהן נוסחאות ופריסה מעורבבים עם טקסט, יכולות לעבוד. וזו ספרייה, לא שירות מוכן: כדי להשתמש בה, צריך לכתוב קוד קטן.

קווים זוהרים וקיפול שולחן ממסמך נייר להולוגרמה

יש bindings עבור Python, Node.js ו-WASM מבוסס דפדפן – אותו מנתח Rust עובד ישירות בדפדפן ללא שרת. המאגר ב-GitHub כבר צבר כמעט 17 אלף כוכבים. אם אתה נושא לעתים קרובות PDF ברשת עצבית, שווה להסתכל.