Firecrawl abrió pdf-inspector: PDF en Markdown en milisegundos, sin OCR
Firecrawl, una startup de Y Combinator que fabrica herramientas para extraer datos de sitios web, ha abierto las fuentes de pdf-inspector: una biblioteca de Rust que en milisegundos determina si el texto que tienes delante es PDF o un escaneo, y convierte documentos de texto en Markdown puro sin OCR. Según las estimaciones del equipo, alrededor del 54% de los PDF en problemas reales están basados en texto, y simplemente no tiene sentido ejecutarlos en el lento y costoso OCR.
Si alguna vez ha alimentado una red neuronal PDF (un contrato, un informe, un libro), conoce esta sensación: el archivo parece abrirse, pero el texto que contiene no se copia o se copia en papilla. Los analizadores clásicos se ahogan con las tablas o ejecutan cada página hasta OCR, desperdiciando segundos y dinero. pdf-inspector soluciona exactamente este problema: primero, mira rápidamente qué tipo de archivo es y se conecta OCR solo si se trata de un escaneo real.
Primera clasificación, luego extracción.
En una sola pasada, la biblioteca asigna PDF a uno de cuatro tipos (basado en texto, escaneado, basado en imágenes o mixto) y proporciona una confianza de 0 a 1 más una ruta de página: cuál leer como texto y cuál enviar a OCR. La clasificación tarda entre 10 y 50 milisegundos. A continuación, para las páginas de texto, se extrae con coordenadas, fuentes y orden de lectura, y el resultado es Markdown con títulos, listas, tablas y enlaces.
Cifras que impresionan
En opendataloader-bench de 200 PDF pdf-inspector desmontó todo el caso en 0,47 segundos. A modo de comparación: pymupdf4llm - 17 segundos, markitdown - 16 segundos. Al mismo tiempo, es el de mayor calidad: la puntuación general es 0,875 frente a 0,735 de pymupdf4llm y 0,589 de markitdown. Reconoce tablas mucho mejor: 0,814 frente a 0,401 y 0,273.
¿Qué más puede hacer?
Diseños de periódicos de varias columnas, texto de derecha a izquierda, fuentes CID, detección de codificación rota. Por separado - selectivo OCR: si las páginas escaneadas individuales están atascadas en PDF, puede ejecutarlas solo a través de OCR, localmente, a través de PP-OCRv6 Small, y no el documento completo.
¿Dónde está el truco?
Honestamente: para escaneos y fotografías reales de documentos, todavía se necesitan OCR, y aquí el pdf-inspector no es mágico, simplemente no gasta OCR en algo que no lo necesita. También pueden funcionar los diseños complejos, donde las fórmulas y el diseño se mezclan con texto. Y esto es una biblioteca, no un servicio listo para usar: para usarlo, debes escribir un pequeño código.

Hay enlaces para Python, Node.js y WASM basado en navegador: el mismo analizador Rust funciona directamente en el navegador sin un servidor. El repositorio en GitHub ya ha ganado casi 17 mil estrellas. Si sueles llevar PDF en una red neuronal, vale la pena echarle un vistazo.