编程 doc7:5MB的文档理解工具,用多模态模型把PDF/Word/扫描件统一转成Markdown,1.1K Star

2026-09-05 19:06:17

doc7:5MB的文档理解工具,用多模态模型把PDF/Word/扫描件统一转成Markdown,1.1K Star

做RAG的朋友都会有这样的感觉:现在接入模型已经很简单了,真正折腾人的是怎么把一堆乱七八糟的资料喂进去。PDF转Markdown、Word转Markdown、扫描件OCR,论文、报表、流程图混杂在一起格式还不一样,整理这些资料要花几天,而且转完之后也不一定可靠——表格很乱、公式很糊、图片中的文字和关系也容易丢失。

doc7 只解决一个问题:把各种文档直接变成AI可以使用的Markdown。 它在GitHub上目前有1117个Star,二进制仅5MB。

工作原理

假如你有一篇扫描版的论文,里面包含公式、图表以及复杂的排版。以前通常是OCR提取文字、修表格、补公式。现在使用doc7,直接转为Markdown。

它会把PDF的每一页都渲染成图片,然后给多模态模型看,把整页都看完。因此它并不是只把文字抠出来——公式可以转换成LaTeX,图表中的文字、数字以及它们之间的关系也会被一起理解。doc7最有趣的地方是由"提取文字"变为"理解页面"。

统一处理各种格式

PDF、Office、扫描件、截图、图表、邮件、Notebook等都可以走同一条流水线,不需要PDF配一个工具、Word再配一个、扫描件再单独跑OCR。它的思路是把各种不同的格式都统一成页面之后再交给视觉模型处理,最后统一输出为Markdown格式。md、txt、csv等原生文本直接在本地转换,不浪费视觉模型的推理。

效果测试

官方用《Attention Is All You Need》进行了一次测试,一共统计了15个视觉事实。doc7恢复了15项,MarkItDown+OCR共有9项,Docling标准流程只有3项。需要说明的是,这是作者自己做的基准测试,并不是第三方评测,不能仅仅根据这个数据就断言它已经全面超越其他工具。但这个结果至少表明:复杂文档里的信息确实不只是文字,表格、公式、图表、版面关系这些东西如果在解析阶段丢掉,后面的RAG再强也补不回来。

实用细节

本地模型支持

LM Studio、Ollama都可以使用。自己的模型自己跑,文档不需要全部上传到第三方。如果本地机器性能好,批量处理也不用按照页数一直付API费用。对于企业资料、技术文档这种机密信息,用本地模型很合适。

断点续传

几百页文档跑到最后突然失败,做过批处理的人都懂这种痛苦。doc7只对失败的页面进行重新处理,--resume会自动找到上一次中断的地方,--pages可以指定要重新运行的页面。每次转换都会留下manifest,可以用来回头检查。这些功能不算什么"AI黑科技",但真正使用的时候反而最节省时间。

安装方式

macOS和Linux:

curl -fsSL https://raw.githubusercontent.com/magicrew/doc7/main/scripts/install.sh | bash

Windows PowerShell:

irm https://raw.githubusercontent.com/magicrew/doc7/main/scripts/install.ps1 | iex

然后在LM Studio或者Ollama中启动一个支持视觉输入的模型,直接执行:

doc7 convert 论文.pdf

就可以进行转换了。如果正在使用Agent,它还提供了MCP的convert_to_markdown工具,可以直接接入到工作流中。

注意事项

doc7终究还是让LLM在看文档,模型可能会把数字看错,也可能会误解图表之间的关系。公式、合同、财务数据等还需要人工抽查。doc7采用固定温度、精确值校验等方法来减小风险,但降低风险并不等于没有风险,建议做好充分测试,确认能在自己的业务里稳定输出后再用到生产中。

小结

今年大家对RAG后面的东西越来越重视——Embedding、向量数据库、Rerank、Agent,但最前面的"文档理解"反而经常被忽略。表格解析出错、流程图中缺少箭头、论文中的公式变成乱码,后面的RAG做得再漂亮也只是把错误的信息检索得更快。doc7代表的方向是文档解析已经由"提取文字"发展到"让AI理解文档",这个方向挺值得关注。如果你最近在搭建RAG,或者手头正好有一大堆论文、技术文档、企业资料没有人愿意整理,可以试一试。

开源地址:https://github.com/magicrew/doc7

复制全文 生成海报 doc7 文档理解 RAG 多模态 Markdown转换

推荐文章

程序员茄子在线接单