Skip to content

在线 PDF 解析

拖进来,立刻出结果

基于 @firecrawl/pdf-inspector-wasm 的免费在线解析:自动判定 PDF 类型(文本型 / 扫描型 / 图片型 / 混合型),把文字内容转换为干净的 Markdown。全程在你的浏览器内完成——文件不上传、不存储,关掉页面即销毁。

parse pdf online

在线解析 Demo

拖入或点击选择一份 PDF,先看类型判定,再拿 Markdown。

把 PDF 拖到这里,或点击选择文件

解析在浏览器本地完成,文件不会上传到任何服务器

PDFMarkdown类型检测多栏还原表格中日韩支持

pdf-inspector

为什么选"本地解析"的在线工具

大多数在线 PDF 工具会把文件传到服务器再处理,本页不是

🔒 文件不出设备

解析内核(WebAssembly)随网页下载到你的浏览器,PDF 从头到尾不离开本机。合同、财报、病历等敏感文件也能放心解析。

🆓 免费且无限量

没有注册登录、没有页数限制、没有每日次数限制,也没有水印。因为解析发生在你自己的设备上,我们没有服务器成本要摊给用户。

⚡ 秒级响应

文本型 PDF 全流程 200ms 内完成,类型判定约 10–50ms。速度取决于你的设备而不是网络排队,大文件也不怕。

pdf-inspector

这个工具能做什么

一次拖拽,同时拿到「体检报告」和「正文内容」

类型判定

📄 判断 PDF 能否直接读

输出 TextBased(文本型)/ Scanned(扫描型)/ ImageBased(图片型)/ Mixed(混合型)四类判定和置信度分数,扫描件会明确提示需要 OCR,不会给你乱码。

内容提取

📝 提取文字转 Markdown

还原标题层级、多栏阅读顺序、列表、表格与链接,输出 GitHub Flavored Markdown——可直接粘贴进笔记软件,也可作为 RAG 语料。

隐私保障

🛡️ 零上传架构

打开 DevTools 的 Network 面板可以自行验证:除了解析内核本身,没有任何包含文件内容的请求发出。详见隐私政策

结果导出

💾 复制 / 下载 .md

Markdown 预览可一键复制,也可下载为 .md 文件保存;分页标记保留在文中,方便回溯原文位置。

pdf-inspector

适用场景

从日常办公到 AI 数据工程都用得上

  • 论文与报告摘录:双栏论文按正确阅读顺序转 Markdown,粘进 Obsidian / Notion 不乱序。
  • RAG 知识库预处理:带标题层级和表格的 Markdown 是检索增强生成最理想的切块原料。
  • 敏感文件检查:合同、标书、财务报表不出本机即可提取内容,满足合规要求。
  • 批量前的抽样验证:接入流水线之前,先用在线版确认文件类型和转换质量。

💡 需要批量自动化?CLI 和代码库版本见安装下载页,用法见快速上手教程

pdf-inspector

常见问题

关于在线解析的常见疑问。

我的 PDF 会被上传到服务器吗?

不会。解析由 WebAssembly 内核在你的浏览器内完成,文件只存在于当前标签页的内存里,关闭页面即释放。本站也没有后端服务器可以接收文件。

有页数或文件大小限制吗?

没有人为限制。理论上限取决于你的设备内存(浏览器标签页可用 RAM),普通几百页的文档没有问题。

扫描版 PDF 可以解析吗?

浏览器 Demo 不含 OCR,遇到扫描件会明确提示类型并说明原因。原生版本(Rust / Node.js / Python)内置可选的选择性 OCR,只对需要的页面做 OCR。参见如何判断 PDF 是否为扫描版

解析结果准确吗?

在线 Demo 与开源库共用同一个解析内核。官方 opendataloader-bench 基准中综合评分 0.875 排名第一,表格与阅读顺序得分同样居首,详见性能基准

手机上能用吗?

可以。现代移动浏览器都支持 WebAssembly,直接访问本页即可使用;只是小屏幕上建议横屏查看 Markdown 结果。

更多方式

用得顺手?
把它装进你的项目里。

npm / PyPI / crates.io 三渠道分发,另有 CLI 可批量处理。
MIT 开源,商用免费。