今天推荐一个文档转 Markdown 的开源工具 doc7,GitHub 上已收获 1.1K Star。它可以把 PDF、Office、扫描件、截图、图表、公式、流程图等任意文档,通过你自己的多模态模型,转换成 AI 可直接检索、引用和推理的 Markdown 格式。

项目简介
doc7 由 magicrew 团队开发,使用 Go 语言编写。核心理念一句话:Any document in. AI-ready Markdown out.

核心亮点
不靠 OCR 栈,靠视觉理解
传统文档处理工具采用"分而治之"的流水线架构:OCR 识别文字、布局分析识别版面、表格模型识别表格……每个环节都会丢失信息,误差层层累积。
doc7 的做法完全不同:把整页文档渲染成图像,交给多模态模型去"看"。模型一次性理解页面上所有元素——文字、表格、公式、图表、图示关系——然后直接重建为结构化 Markdown。不是"看清"每个字,而是"看懂"整页内容。
实测数据说话
项目团队在两份纯图片 PDF 上做了公开 Benchmark,15 项可机器校验的视觉事实,doc7 恢复了全部 15 项。对比数据:
- MarkItDown 0.1.6 + OCR 插件:9/15
- Docling 2.113.0 标准模式:3/15
- MarkItDown 默认模式:0/15(直接输出空文件)
更关键的是,doc7 生成的 Markdown 仅 5,293 字节,而 Docling 输出了 2,571,445 字节——体积大了近 500 倍(因嵌入了 Base64 页面图像)。
不收费、不绑定、不锁死
- 不卖文档额度:不按页、不按图片、不按转换次数收费
- 不绑定模型:可用任何兼容 OpenAI 接口的多模态模型,包括本地部署
- 不锁定服务:无必需的 OCR 技术栈或文档处理服务
- 文档留在本地:配合本地模型部署,内容完全不出你的基础设施
用项目的话来说:"当硬件已经存在时,新增一份文档的边际成本主要只剩电力和运行时间。"
一套流程,所有格式
PDF、Word、PPT、Excel、图片、扫描件——不同格式进入同一个页面理解管线,产出统一的 Markdown。不需要为不同格式维护不同的处理工具。
功能特性
- 多格式支持:支持几乎所有常见文档格式
- 内置 Agent:自带轻量 Agent,运行在配置的本地模型上
- 断点续跑和选择性重跑
- 远程文档处理 + HTTP 服务
- 批量目录处理
- MCP 与 Go SDK

快速上手
第一步:安装 doc7
macOS / Linux:
curl -fsSL https://raw.githubusercontent.com/magicrew/doc7/main/scripts/install.sh | bash
Windows PowerShell:
irm https://raw.githubusercontent.com/magicrew/doc7/main/scripts/install.ps1 | iex
也可以直接从 GitHub Releases 页面下载对应平台的压缩包。
第二步:准备视觉模型
需要兼容 OpenAI 接口的多模态模型:
- 本地模型(推荐):安装 LM Studio 或 Ollama,加载支持视觉的模型(如 qwen3.5-9b、llama3.2-vision 等),启动本地服务。默认地址:http://127.0.0.1:1234/v1
- 远程 API:使用任何兼容 OpenAI 接口的视觉模型服务,配置 API Key
第三步:首次配置
# 查看可用模型
doc7 models --base-url http://localhost:8000/v1
# 保存配置
doc7 setup config \
--base-url http://localhost:8000/v1 \
--model
# 如果需要 API Key
doc7 setup config --api-key-stdin
第四步:检查环境
# 检查本地依赖和模型连通性
doc7 doctor --check-model
# 检查特定文件格式的依赖
doc7 doctor report.docx --check-model
第五步:开始转换
# 最简单的用法
doc7 report.pdf
# 指定输出目录
doc7 read report.pdf -o output-dir
# 处理截图
doc7 screenshot.png
# 批量处理目录
doc7 read ./documents -o ./knowledge
# 从 stdin 管道输入
cat report.pdf | doc7 read - --stdin-name report.pdf --stdout > report.md
总结
使用 doc7 处理后,表格结构完整,条款分段清晰,连页脚的法律声明都能准确识别。如果你手里有一堆格式混乱的文档想喂给 AI,不想花大把时间搭环境、调参数,也不想被按页计费的服务收割,doc7 值得试试。
它代表的方向是:让 AI 像人一样"看懂"文档,而不是像机器一样"识别"文档。
GitHub 项目地址:https://github.com/magicrew/doc7