首页 / 开源宝库 / AnyDoc
AnyDoc
// project.info

AnyDoc

AnyDoc 是什么

anydoc 是 Firecrawl 开发并开源的 Rust 文档转换库,目标是把 Word、PowerPoint、Excel、OpenDocument、RTF、EPUB、CSV 和 PDF 等文档转成干净的 GitHub-Flavored Markdown,让普通办公文件直接变成大模型能读的格式。官方称转换在个位数毫秒内完成,无论输入哪种格式,输出都保持一致,并且它正是 Firecrawl Parse 背后的转换引擎。

它同时提供 Node.js、Python 与浏览器(WebAssembly)绑定,发布在 crates.io、npm 与 PyPI 三个渠道,另有 CLI 与 Agent Skill 让智能体直接读文档。浏览器演示页把库以 WebAssembly 运行,文件在本地转换、不会离开用户机器;若不愿自行部署,托管的 Firecrawl Parse API 提供同样转换并加上 OCR 模型处理扫描件。仓库以 MIT 协议开源。

主要功能

01把 Word 文档转成 Markdown
02支持 PowerPoint 与 Excel 转换
03支持 OpenDocument 与 RTF 格式
04支持 EPUB 与 PDF 输入
05输出统一的 GitHub-Flavored Markdown
06官方称转换在个位数毫秒完成
07提供 Node.js 与 Python 绑定
08提供浏览器 WebAssembly 版本
09带 CLI 可一条命令转换文件
10附 Agent Skill 让智能体读文档
11托管 API 支持扫描件 OCR
12MIT 协议开源

如何使用 AnyDoc

1用 npx @firecrawl/anydoc report.docx 直接把文档转成 Markdown 输出到终端
2加 -o 参数把结果写成文件,例如 npx @firecrawl/anydoc slides.pptx -o slides.md
3用 --format 指定无签名的格式,例如从标准输入读取 CSV
4扫描版 PDF 加 --ocr hosted 走 Firecrawl Parse 的 OCR
5需要长期命令可执行 npm install -g @firecrawl/anydoc 全局安装
6在 Node.js 项目里 npm install @firecrawl/anydoc 后用 toMarkdown 接口
7在 Python 项目里 pip install firecrawl-anydoc 后用 anydoc.to_markdown
8想先试效果可打开官方浏览器演示页,文件在本地完成转换

使用示例

在终端执行 npx @firecrawl/anydoc 财报.pdf -o report.md,几毫秒后得到结构化的 Markdown;再把整段 Markdown 喂给大模型做摘要或抽取表格数据,不用再单独解析 PDF。

核心优势

✓速度快:官方称单个办公文档在个位数毫秒内完成转换
✓输出一致:不同输入格式都得到同一种 GitHub-Flavored Markdown
✓绑定齐全:Rust 库之外提供 Node.js、Python 与浏览器 WebAssembly 版本
✓本地可控:浏览器演示在本地转换文件,不上传服务器;也可用官方 CLI 自行处理

与同类工具对比

Pandoc老牌文档格式转换工具,支持格式极多

Pandoc 以通用文档互转为主,重在保排版;anydoc 面向 LLM 输入,输出统一为干净的 GFM Markdown 并强调速度

Marker常见的 PDF 转 Markdown 开源工具

Marker 主要针对 PDF 且依赖较重的模型管线;anydoc 用 Rust 实现,覆盖 Office 文档、EPUB、CSV 等更多格式并给出多语言绑定

FirecrawlFirecrawl 的网页抓取与解析服务,anydoc 是其 Parse 功能的底层引擎

Firecrawl 面向网页抓取与云端 API;anydoc 是可本地运行的库,浏览器版本还能做到文件不出本机

使用方式与技巧

使用方式

  • 命令行 CLI(npx 或全局安装)
  • Node.js 库
  • Python 库
  • 浏览器 WebAssembly
  • 托管 API(Firecrawl Parse)

功能模式

  • 单文件转换(含标准输入)
  • 指定输出文件的批量转换
  • 按内容或指定格式识别输入
  • 扫描件 OCR 转换
  • 只取文档模型并保留内嵌资源

使用技巧

  • CSV 这类无签名格式要显式指定 --format
  • 扫描 PDF 才需要加 --ocr hosted,普通文档不必
  • 先用浏览器演示页验证转换效果再接入代码

进阶玩法

01用 toDocument 接口停在文档模型层,可拿到内嵌资源
02Agent Skill 支持 Claude Code、Codex、Cursor、OpenCode 等兼容客户端
03托管 API 提供与本地库一致的转换并叠加 OCR 模型

客户端下载渠道

⬇GitHub:https://github.com/firecrawl/anydoc ⬇npm:@firecrawl/anydoc ⬇PyPI:firecrawl-anydoc ⬇Crates.io:anydoc ⬇浏览器演示:https://firecrawl.github.io/anydoc/

常见问题

支持哪些输入格式?

Word、PowerPoint、Excel、OpenDocument、RTF、EPUB、CSV 和 PDF。

扫描版 PDF 能处理吗?

库本身读不了扫描页,加 --ocr hosted 由 Firecrawl Parse 的 OCR 模型处理。

文件会上传到服务器吗?

浏览器演示用 WebAssembly 在本地转换,文件不离开本机;走托管 API 时会经过服务端。

开源协议是什么?

MIT 协议。

// more.info

项目信息

AnyDoc:Firecrawl 出品的 Rust 文档转换库,把办公文档变成干净的 LLM 可用 Markdown

将多种文档格式转换为纯净Markdown格式。

开发工具 适合人群:开发者
// 商业项目:在数据 affiliate 字段填入 CPS 推广链接后,按钮自动改跳你的推广链接
← 返回开源宝库

站长熬夜整理 · 开源大礼包

点击一键转存《2329 件副业装备大礼包》,内含分类 Excel 表,找工具不再大海捞针

一键转存《2329 个开源大礼包》
资料整理自公开开源渠道,仅供学习交流使用;如涉及版权问题请联系删除。