→ אלע ארטיקלען

Firecrawl עפֿענען קוואלן פּדף-ינספּעקטאָר: פּדף צו מאַרקדאַון אין מיליסעקאַנדז, קיין אָקר

Firecrawl עפֿענען קוואלן פּדף-ינספּעקטאָר: פּדף צו מאַרקדאַון אין מיליסעקאַנדז, קיין אָקר

Firecrawl, די Y Combinator סטאַרטאַפּ באַוווסט פֿאַר זיין וועב-סקרייפּינג מכשירים, האט אָפֿן-סאָורסעד פּדף-ינספּעקטאָר - אַ רוסט ביבליאָטעק וואָס פיגיערז אין מיליסעקאַנדז צי אַ פּדף איז טעקסט-באזירט אָדער אַ יבערקוקן, און טורנס טעקסט-באזירט דאָקומענטן אין ריין מאַרקדאַון אָן קיין OCR. לויט די מאַנשאַפֿט ס אָפּשאַצונג, אַרום 54% פון פּדף אין פאַקטיש ווערקלאָודז זענען טעקסט-באזירט, אַזוי פליסנדיק זיי דורך פּאַמעלעך, טייַער OCR איז ומזיסט.

אויב איר האָט אלץ געפֿיטערט אַ פּדף צו אַ מאָדעל - אַ קאָנטראַקט, אַ באַריכט, אַ בוך - איר וויסן די געפיל: די טעקע עפֿנט זיך גוט, אָבער דער טעקסט וועט נישט נאָכמאַכן, אָדער עס קאפיעס ווי מיסט. קלאַסיש פּאַרסערז אָדער דערשטיקן טישן אָדער שטופּן יעדער בלאַט דורך OCR, ברענען סעקונדעס און געלט. pdf-ינספּעקטאָר ריטשאַז פּונקט אַז ווייטיק פונט: עס געשווינד טשעקס וואָס די טעקע איז, און נאָר ריטשאַז פֿאַר OCR ווען עס איז טאַקע אַ יבערקוקן.

קלאַסיפיצירן ערשטער, עקסטראַקט רגע

אין אַ איין פאָרן, די ביבליאָטעק סאָרטירט אַ פּדף אין איינער פון פיר טייפּס - טעקסטבאַסעד, סקאַנד, בילדבאַסעד אָדער געמישט - און קערט אַ בטחון כעזשבן פון 0 צו 1 פּלוס אַ פּער בלאַט מאַרשרוט: וואָס בלעטער צו לייענען ווי טעקסט, וואָס צו שיקן צו OCR. קלאַסאַפאַקיישאַן נעמט 10-50 מיליסעקאַנדז. פֿאַר טעקסט בלעטער, עס עקסטראַקט מיט קאָואָרדאַנאַץ, פאַנץ און לייענען סדר, און אַוטפּוץ מאַרקדאָוון מיט כעדינגז, רשימות, טישן און לינקס.

נומערן וואָס שטיין אויס

אויף די אָפּענעדאַטאַלאָודער-באַנק קאָרפּוס פון 200 פּדף, פּדף-ינספּעקטאָר פּראַסעסט די גאנצע גאַנג אין 0.47 סעקונדעס. פֿאַר פאַרגלייַך: pymupdf4llm גענומען 17 סעקונדעס, מאַרקיט אַראָפּ 16 סעקונדעס. און עס נאָך סקאָרד די העכסטן פֿאַר קוואַליטעט - 0.875 קוילעלדיק קעגן 0.735 פֿאַר pymupdf4llm און 0.589 פֿאַר מאַרקיטדאַון. טאַבלעס זענען ווו עס טאַקע פּולז פאָרויס: 0.814 קעגן 0.401 און 0.273.

וואָס אַנדערש עס טוט

צייטונג לייאַוץ מיט מולטי זייַל, טעקסט פון רעכט צו לינקס, CID פאַנץ, דיטעקשאַן פון צעבראכן קאָדירונג. און סעלעקטיוו OCR: אויב אַ פּדף האט אַ ביסל סקאַנד בלעטער געמישט אין, איר קענען לויפן בלויז די דורך OCR לאָוקאַלי דורך PP-OCRv6 Small, אַנשטאָט פון די גאנצע דאָקומענט.

וואו עס פאלט קורץ

האָנעסטלי: פאַקטיש סקאַנז און פאָטאָס פון דאָקומענטן נאָך דאַרפֿן OCR, און פּדף-ינספּעקטאָר איז נישט מאַגיש דאָרט - עס נאָר טוט נישט וויסט OCR אויף טעקעס וואָס טאָן ניט דאַרפֿן עס. קאָמפּלעקס לייאַוץ ווו פאָרמולאַס און טייפּסעטינג זענען געמישט מיט טעקסט קענען אויך ויסשליסן עס. און עס איז אַ ביבליאָטעק, נישט אַ פאַרטיק דינסט: איר וועט דאַרפֿן צו שרייַבן אַ ביסל קאָד צו נוצן עס.

Светящиеся строки и таблица, складывающиеся из бумажного документа в голограмму

עס זענען ביינדינגז פֿאַר Python, Node.js און בלעטערער וועבאַססעמבלי - דער זעלביקער רוסט פּאַרסער לויפט רעכט אין דעם בלעטערער אָן קיין סערווער. די GitHub רעפּאָ האט שוין דורכגעגאנגען 17,000 שטערן. אויב איר קעסיידער קאָרמען פּדפס צו מאָדעלס, עס איז ווערט אַ קוק.