PDF 转 Markdown API
只有一个接口。发送 PDF,返回结构化的 Markdown。表格、标题、列表全部保留, 中文扫描件同样适用。无需注册即可试用。
$ curl -X POST https://pdftomarkdown.dev/v1/convert \
-H "Authorization: Bearer demo_public_key" \
-H "Content-Type: application/json" \
-d '{"input":{"pdf_url":"https://pdftomarkdown.dev/samples/invoice.pdf"}}'{
"complete": true,
"markdown": "# CONTOSO LTD.\n\n# INVOICE\n\nINVOICE: INV-100\nDATE: 11/15/2019\nDUE DATE: 12/15/2019\n\n| SALESPERSON | P.O. NUMBER | REQUISITIONER | SHIPPED VIA | F.O.B. POINT | TERMS |\n| --- | --- | --- | --- | --- | --- |\n| | PO-3333 | | | | |\n\n| QUANTITY | DESCRIPTION | UNIT PRICE | TOTAL |\n| --- | --- | --- | --- |\n| 1 | Test for 23 fields | $100.00 | $100.00 |\n\nTOTAL DUE: $610.00\n\n> Processed by pdfToMarkdown.dev",
"pages": 1,
"request_id": "req_example_invoice"
}为什么适合中文文档
这不是 Tesseract 的封装。转换由视觉语言模型完成——它像人一样"看懂"文档版面。 面向英文设计的 OCR 工具在中文、日文文档上往往表现不佳,而这正是我们的优势所在。 在真实政府报告扫描件上的实测基准(含复现步骤,英文):中文字符错误率 0.00%(Tesseract:0.97%),并完整保留表格结构。
扫描件 / 图片型 PDF
没有文本层的纸质扫描件也能识别中文正文和标题,输出为 Markdown。
复杂表格
简单的矩形表格会转换为转义后的 GFM 管道表格;包含跨行、跨列或嵌套内容的复杂表格会以经过清理的 HTML 保留在 Markdown 中,避免破坏结构。
多栏排版
论文、报告的多栏版式也能按正确的阅读顺序重组文本。
支持的文档类型
发票与收据
研究论文(含数学公式)
合同协议
财务报表
技术手册
扫描文档
在 Python 中使用
一次 HTTP 请求即可。除 requests 外无需安装任何东西。
python
import requests
r = requests.post(
"https://pdftomarkdown.dev/v1/convert",
headers={"Authorization": "Bearer demo_public_key"},
json={"input": {"pdf_url": "https://pdftomarkdown.dev/samples/invoice.pdf"}},
)
print(r.json()["markdown"])不写代码也能用
官方 CLI 一条命令即可转换本地文件、URL 或标准输入。有 Node 18+ 就行,无需安装。
terminal
$ npx pdftomarkdown 文档.pdf > 文档.md想让 Codex、Claude Code 等编程智能体读取 PDF?请看让 Codex 读取 PDF。 更多用法见 CLI 指南(英文)。
价格
两个套餐均免费,无需信用卡。
粘贴到终端即可运行,无需账号。
curl -X POST https://pdftomarkdown.dev/v1/convert \
-H "Authorization: Bearer demo_public_key" \
-H "Content-Type: application/json" \
-d '{"input":{"pdf_url":"https://pdftomarkdown.dev/samples/invoice.pdf"}}'