Firecrawl geöffneter PDF-Inspektor: PDF in Markdown in Millisekunden, ohne OCR
Firecrawl, ein Startup von Y Combinator, das Tools zum Extrahieren von Daten aus Websites herstellt, hat die Quellen von pdf-inspector geöffnet: eine Rust-Bibliothek, die in Millisekunden bestimmt, ob der Text vor Ihnen PDF oder ein Scan ist, und Textdokumente in reines Markdown ohne OCR umwandelt. Schätzungen des Teams zufolge sind etwa 54 % der PDF in echten Problemen textbasiert, und es macht einfach keinen Sinn, sie durch das langsame und teure OCR laufen zu lassen.
Wenn Sie jemals ein neuronales Netzwerk PDF gefüttert haben – einen Vertrag, einen Bericht, ein Buch –, kennen Sie dieses Gefühl: Die Datei scheint sich zu öffnen, aber der Text daraus wird nicht kopiert oder wird in Brei kopiert. Klassische Parser ersticken entweder an Tabellen oder lassen jede Seite durch OCR laufen, was Sekunden und Geld verschwendet. pdf-inspector trifft genau dieses Problem: Zunächst prüft er schnell, um welche Art von Datei es sich handelt, und verbindet OCR nur, wenn es sich um einen echten Scan handelt.
Erst Klassifizierung, dann Extraktion
In einem Durchgang weist die Bibliothek PDF einem von vier Typen zu – textbasiert, gescannt, bildbasiert oder gemischt – und gibt eine Konfidenz von 0 bis 1 sowie eine Seitenroute an: welche als Text gelesen werden soll und welche an OCR gesendet werden soll. Die Klassifizierung dauert 10–50 Millisekunden. Als nächstes erfolgt für Textseiten eine Extraktion mit Koordinaten, Schriftarten und Lesereihenfolge, und die Ausgabe ist Markdown mit Überschriften, Listen, Tabellen und Links.
Zahlen, die beeindruckend sind
Auf der OpenDataLoader-Bench von 200 PDF zerlegte der PDF-Inspektor das gesamte Gehäuse in 0,47 Sekunden. Zum Vergleich: pymupdf4llm – 17 Sekunden, Markitdown – 16 Sekunden. Gleichzeitig weist es die höchste Qualität auf: Die Gesamtpunktzahl beträgt 0,875 gegenüber 0,735 für pymupdf4llm und 0,589 für Markitdown. Es erkennt Tabellen viel besser – 0,814 gegenüber 0,401 und 0,273.
Was kann er sonst noch tun?
Mehrspaltige Zeitungslayouts, Text von rechts nach links, CID-Schriftarten, Erkennung defekter Codierungen. Getrennt – selektiv OCR: Wenn einzelne gescannte Seiten in PDF hängen bleiben, können Sie nur diese über OCR, lokal, über PP-OCRv6 Small und nicht das gesamte Dokument ausführen.
Wo ist der Haken?
Ehrlich gesagt: Für echte Scans und Fotos von Dokumenten werden immer noch OCR benötigt, und hier ist der PDF-Inspektor keine Zauberei – er gibt einfach keine OCR für etwas aus, das ihn nicht braucht. Komplexe Layouts, bei denen Formeln und Layout mit Text gemischt werden, können ebenfalls funktionieren. Und dies ist eine Bibliothek, kein vorgefertigter Dienst: Um sie zu verwenden, müssen Sie ein wenig Code schreiben.

Es gibt Bindungen für Python, Node.js und browserbasiertes WASM – derselbe Rust-Parser funktioniert direkt im Browser ohne Server. Das Repository auf GitHub hat bereits fast 17.000 Sterne gewonnen. Wenn Sie PDF häufig in einem neuronalen Netzwerk tragen, ist es einen Blick wert.