← Todos los artículos

Firecrawl open-sources pdf-inspector: PDF a Markdown en milisegundos, sin OCR

Firecrawl open-sources pdf-inspector: PDF a Markdown en milisegundos, sin OCR

Firecrawl, la startup Y Combinator conocida por sus herramientas de web scraping, tiene un pdf-inspector de código abierto, una biblioteca Rust que determina en milisegundos si un PDF está basado en texto o es un escaneo, y convierte documentos basados ​​en texto en Markdown limpio sin ningún OCR. Según la estimación del equipo, alrededor del 54% de los archivos PDF en cargas de trabajo reales están basados ​​en texto, por lo que no tiene sentido ejecutarlos mediante OCR, lento y costoso.

Si alguna vez ha enviado un PDF a un modelo (un contrato, un informe, un libro), conoce la sensación: el archivo se abre bien, pero el texto no se copia o se copia como basura. Los analizadores clásicos se ahogan con las tablas o pasan cada página por OCR, quemando segundos y dinero. pdf-inspector llega exactamente a ese punto débil: comprueba rápidamente cuál es el archivo y sólo utiliza el OCR cuando se trata realmente de un escaneo.

Clasificar primero, extraer segundo

En una sola pasada, la biblioteca clasifica un PDF en uno de cuatro tipos (basado en texto, escaneado, basado en imágenes o mixto) y devuelve una puntuación de confianza de 0 a 1 más una ruta por página: qué páginas leer como texto y cuáles enviar a OCR. La clasificación tarda entre 10 y 50 milisegundos. Para las páginas de texto, luego extrae coordenadas, fuentes y orden de lectura, y genera Markdown con encabezados, listas, tablas y enlaces.

Números que destacan

En el corpus de opendataloader-bench de 200 archivos PDF, pdf-inspector procesó el conjunto completo en 0,47 segundos. A modo de comparación: pymupdf4llm tardó 17 segundos, markitdown 16 segundos. Y aun así obtuvo la puntuación más alta en calidad: 0,875 en general frente a 0,735 de pymupdf4llm y 0,589 de markitdown. Las tablas son donde realmente avanza: 0,814 frente a 0,401 y 0,273.

¿Qué más hace?

Diseños de periódicos de varias columnas, texto de derecha a izquierda, fuentes CID, detección de codificación rota. Y OCR selectivo: si un PDF tiene algunas páginas escaneadas mezcladas, puede ejecutar solo aquellas a través de OCR localmente a través de PP-OCRv6 Small, en lugar de todo el documento.

Donde se queda corto

Honestamente: los escaneos y fotografías reales de documentos aún necesitan OCR, y pdf-inspector no es mágico en ese sentido, simplemente no desperdicia OCR en archivos que no lo necesitan. Los diseños complejos donde las fórmulas y la composición tipográfica se mezclan con el texto también pueden causar problemas. Y es una biblioteca, no un servicio listo para usar: necesitarás escribir un poco de código para usarlo.

Светящиеся строки и таблица, складывающиеся из бумажного документа в голограмму

Hay enlaces para Python, Node.js y el navegador WebAssembly: el mismo analizador Rust se ejecuta directamente en el navegador sin servidor. El repositorio de GitHub ya superó las 17.000 estrellas. Si envía archivos PDF con regularidad a los modelos, vale la pena echarle un vistazo.