内置官方 WebAssembly 版解析器,拖 PDF 即出类型判定和 Markdown,浏览器本地完成,无需上传任何数据。
关于本站 - pdf-inspector.wiki 中文官网
pdf-inspector.wiki 是 pdf-inspector 的中文官网与使用指南,一个专门讲"怎么又快又准地把 PDF 变成 Markdown"的站点。
本站是什么
pdf-inspector 是 Firecrawl 开源的 Rust PDF 解析库:毫秒级判断 PDF 是文本型还是扫描型,把文本型 PDF 本地转换成干净、带位置信息的 Markdown。本站围绕它做了三件事:
- 在线解析 Demo——在浏览器里直接拖 PDF 解析,全程本地处理,文件不出设备
- 使用文档——从新手入门到五端 API 参考,把官方 README 的信息整理成中文教程
- 性能基准——把官方公布的 opendataloader-bench 横向对比数据讲清楚,供选型参考
我们的立场
- 不搬运、不改写官方代码——任何 PDF 解析都发生在官方解析器或你本地安装的库中
- 不夸大、不吹嘘——基准数据来自官方仓库,局限性(如网页端不含 OCR)也如实写明
- 尊重开源——pdf-inspector 使用 MIT License,本站内容同样可以自由传播,注明出处即可
关于 Firecrawl
Firecrawl 是面向 AI 场景的数据抓取与解析平台,pdf-inspector 是其混合 OCR 管线的底层解析引擎。它同时也是开源生态的活跃贡献者,pdf-inspector 就是它开源的成果之一。
网站特性
新手入门、API 快速参考、Node / Python / Rust / WebAssembly / CLI 五端详解,全部中文。
opendataloader-bench 五引擎横向对比的完整数据与解读,帮你做选型判断,也坦率列出 pdf-inspector 的局限。
本站是纯静态站点,不设账号、不采集文档内容,详情见隐私政策。