Firecrawl 开源 pdf-inspector:毫秒级把 PDF 转成 Markdown,无需 OCR

Firecrawl 开源 pdf-inspector:毫秒级把 PDF 转成 Markdown,无需 OCR

Firecrawl 这家以网页数据抓取工具闻名的 Y Combinator 创业公司,开源了 pdf-inspector——一个用 Rust 写的库,能在几毫秒内判断一份 PDF 是文本型还是扫描件,并把文本型文档直接转成干净的 Markdown,完全不用 OCR。按团队估算,实际场景里约 54% 的 PDF 都是文本型,把它们塞进又慢又贵的 OCR 纯属浪费。 如果你曾把 PDF 喂给模型——合同、报告、书——就懂那种感觉:文件明明能打开,文字却复制不出来,或者复制出来是一团乱码。传统解析器要么在表格上卡壳,要么把每一页都过一遍 OCR,白白烧掉时间和钱。pdf-inspector 正好打在这个痛点上:先快速判断文件是什么,只有真遇到扫描件才动用 OCR。 先分类,再提取 这个库一次遍历就把 PDF 归为四类之一—