→ אלע ארטיקלען

Firecrawl געעפנט פּדף-ינספּעקטאָר: PDF אין Markdown אין מיליסעקאַנדז, אָן OCR

Firecrawl געעפנט פּדף-ינספּעקטאָר: PDF אין Markdown אין מיליסעקאַנדז, אָן OCR

Firecrawl, אַ סטאַרטאַפּ פון Y Combinator וואָס מאכט מכשירים פֿאַר עקסטראַקט דאַטן פון וועבסיטעס, האט געעפנט די קוואלן פון PDF-ינספּעקטאָר: אַ רוסט ביבליאָטעק וואָס אין מיליסעקאַנדז באַשטימען צי דער טעקסט אין פראָנט פון איר איז PDF אָדער אַ יבערקוקן, און טורנס טעקסט דאָקומענטן אין ריין Markdown אָן Markdown אין אַלע. לויט די עסטאַמאַץ פון די מאַנשאַפֿט, וועגן 54% פון PDF אין פאַקטיש פּראָבלעמס זענען טעקסט-באזירט, און עס איז פשוט קיין פונט צו לויפן זיי דורך די פּאַמעלעך און טייַער OCR.

אויב איר האָט אלץ געפֿיטערט אַ נעוראַל נעץ PDF - אַ קאָנטראַקט, אַ באַריכט, אַ בוך - איר וויסן דעם געפיל: די טעקע סימז צו עפענען, אָבער דער טעקסט פון עס איז נישט קאַפּיד אָדער איז קאַפּיד אין קאַשע. קלאַסיש פּאַרסערס אָדער דערשטיקן די טישן אָדער לויפן יעדער בלאַט דורך OCR, וויסט סעקונדעס און געלט. pdf-inspector איז פּונקט דעם ווייטיק: ערשטער, עס קוקט געשווינד אין וואָס מין פון טעקע עס איז, און קאַנעקץ OCR בלויז אויב עס איז אַ פאַקטיש יבערקוקן.

ערשטער קלאַסאַפאַקיישאַן, דעמאָלט יקסטראַקשאַן

אין איין פאָרן, די ביבליאָטעק אַסיינז PDF צו איינער פון פיר טייפּס - טעקסטבאַסעד, סקאַנד, בילדבאַסעד אָדער געמישט - און גיט אַ צוטרוי פון 0 צו 1 פּלוס אַ בלאַט מאַרשרוט: וואָס צו לייענען ווי טעקסט, וואָס צו שיקן צו OCR. קלאַסאַפאַקיישאַן נעמט 10-50 מיליסעקאַנדז. דערנאָך, פֿאַר טעקסט בלעטער, עס איז יקסטראַקשאַן מיט קאָואָרדאַנאַץ, פאַנץ און לייענען סדר, און דער רעזולטאַט איז Markdown מיט כעדינגז, רשימות, טישן און לינקס.

נומערן וואָס זענען ימפּרעסיוו

אויף די אָפּענעדאַטאַלאָודער-באַנק פון 200 PDF פּדף-ינספּעקטאָר דיסאַסעמבאַלד די גאנצע פאַל אין 0.47 סעקונדעס. פֿאַר פאַרגלייַך: pymupdf4llm - 17 סעקונדעס, מאַרקיטדאָוון - 16 סעקונדעס. אין דער זעלביקער צייט, עס איז די העכסטן אין קוואַליטעט: די קוילעלדיק כעזשבן איז 0.875 קעגן 0.735 פֿאַר pymupdf4llm און 0.589 פֿאַר מאַרקיטדאָוון. עס אנערקענט טישן פיל בעסער - 0.814 קעגן 0.401 און 0.273.

וואָס אַנדערש קען ער טאָן?

צייטונג לייאַוץ מיט מולטי זייַל, טעקסט פון רעכט צו לינקס, CID פאַנץ, דיטעקשאַן פון צעבראכן קאָדירונג. סעפּעראַטלי - סעלעקטיוו OCR: אויב יחיד סקאַנד בלעטער זענען סטאַק אין PDF, איר קענען לויפן בלויז זיי דורך OCR, לאָוקאַלי, דורך PP-OCRv6 קליין, און נישט די גאנצע דאָקומענט.

װוּ איז דער כאַפּ?

האָנעסטלי: פֿאַר פאַקטיש סקאַנז און פאָוטאַגראַפס פון דאָקומענטן, OCR איז נאָך דארף, און דאָ דער פּדף-ינספּעקטאָר איז נישט מאַגיש - עס נאָר טוט נישט פאַרברענגען OCR אויף עפּעס וואָס טוט נישט דאַרפֿן עס. קאָמפּלעקס לייאַוץ, ווו פאָרמולאַס און אויסלייג זענען געמישט מיט טעקסט, קענען אויך אַרבעטן. און דאָס איז אַ ביבליאָטעק, נישט אַ פאַרטיק דינסט: צו נוצן עס, איר מוזן שרייַבן אַ ביסל קאָד.

גלאָוינג שורות און טיש פאָלדינג פון אַ פּאַפּיר דאָקומענט אין אַ כאַלאַגראַם

עס זענען ביינדינגז פֿאַר Python, Node.js און בלעטערער-באזירט WASM - דער זעלביקער רוסט פּאַרסער אַרבעט גלייך אין דעם בלעטערער אָן אַ סערווער. די ריפּאַזאַטאָרי אויף GitHub האט שוין פארדינט כּמעט 17 טויזנט שטערן. אויב איר אָפט פירן PDF אין אַ נעוראַל נעץ, עס איז ווערט אַ קוק.