parse pdf online
拖入或点击选择一份 PDF,先看类型判定,再拿 Markdown。
把 PDF 拖到这里,或点击选择文件
解析在浏览器本地完成,文件不会上传到任何服务器
pdf-inspector
大多数在线 PDF 工具会把文件传到服务器再处理,本页不是
解析内核(WebAssembly)随网页下载到你的浏览器,PDF 从头到尾不离开本机。合同、财报、病历等敏感文件也能放心解析。
没有注册登录、没有页数限制、没有每日次数限制,也没有水印。因为解析发生在你自己的设备上,我们没有服务器成本要摊给用户。
文本型 PDF 全流程 200ms 内完成,类型判定约 10–50ms。速度取决于你的设备而不是网络排队,大文件也不怕。
pdf-inspector
一次拖拽,同时拿到「体检报告」和「正文内容」
输出 TextBased(文本型)/ Scanned(扫描型)/ ImageBased(图片型)/ Mixed(混合型)四类判定和置信度分数,扫描件会明确提示需要 OCR,不会给你乱码。
还原标题层级、多栏阅读顺序、列表、表格与链接,输出 GitHub Flavored Markdown——可直接粘贴进笔记软件,也可作为 RAG 语料。
Markdown 预览可一键复制,也可下载为 .md 文件保存;分页标记保留在文中,方便回溯原文位置。
pdf-inspector
从日常办公到 AI 数据工程都用得上
pdf-inspector
关于在线解析的常见疑问。
不会。解析由 WebAssembly 内核在你的浏览器内完成,文件只存在于当前标签页的内存里,关闭页面即释放。本站也没有后端服务器可以接收文件。
没有人为限制。理论上限取决于你的设备内存(浏览器标签页可用 RAM),普通几百页的文档没有问题。
浏览器 Demo 不含 OCR,遇到扫描件会明确提示类型并说明原因。原生版本(Rust / Node.js / Python)内置可选的选择性 OCR,只对需要的页面做 OCR。参见如何判断 PDF 是否为扫描版。
在线 Demo 与开源库共用同一个解析内核。官方 opendataloader-bench 基准中综合评分 0.875 排名第一,表格与阅读顺序得分同样居首,详见性能基准。
可以。现代移动浏览器都支持 WebAssembly,直接访问本页即可使用;只是小屏幕上建议横屏查看 Markdown 结果。
更多方式
npm / PyPI / crates.io 三渠道分发,另有 CLI 可批量处理。
MIT 开源,商用免费。