anything2explainer:把讲解视频拆成代码,两小时从主题到成片
对于做技术的,做一条科普讲解视频挺费力,不是录个视频或配个音就行。好的科普视频不是主播念 PPT,而是用动态图形把机制画出来。
问题在于:有没有办法像生成模型那样自动化,不用逐帧手工画,又能保证每一帧都精准可控、都是为了讲清楚内容服务?
anything2explainer 是一个 GitHub 上刚发布的项目,把这件事做成了。它不是视频生成模型,也不是数字人工具,而是一条完整的 AI 视频生产流水线:从一个主题开始,经过调研、解说词、分镜、并行构建、质检,两个小时后,一条带配音、字幕、章节进度条的黑底 MG 风格讲解视频就出来了。每一帧都是代码绘制的,可复现、可修改、可追溯。
项目介绍
anything2explainer 是一个 Codex Skill。
它不是独立 CLI 工具,而是专为 AI 编程代理设计的一套“方法 + 工具链”。整个仓库里装的不是一个可执行程序,而是:
- 一份可编译的 Remotion 4 模板工程(React + TypeScript)
- 一套图元与光效库(调色板、字体、动效组件)
- 配音/分镜/渲染/量化质检的脚本工具
- 详尽的风格与动效规范文档
- 多 agent 分工协议与 prompt 模板
- 一条完整的样片作为质量标尺
核心思路是:每一帧画面都是代码。
它能产出什么
输入一个主题(比如“讲一下向量数据库”)或一篇文章,指定时长和语言,anything2explainer 会输出:
视频:1280×720 @ 30fps 的 H.264 MP4,自带:
- TTS 配音(中文 edge-tts 云希男声,英文 kokoro-82m Liam 男声,支持自换)
- 按词边界精确对齐的字幕
- 章节卡片和底部章节进度条
- 顶部 HUD 胶囊和可选流程轨
同时交付的全套过程文件:
- 带来源 URL 的调研文档
- 解说词原文
- 分镜表
- 逐镜头源码
- QC 质检报告
不仅给成片,还给全流程的“作业”文件。
核心亮点
1. 全代码绘制,确定性渲染
anything2explainer 走的是中间路线:用 Remotion 作为渲染引擎,但让 AI agent 自动写组件代码。
好处是双重的:
- 可复现:重新渲染一遍,每一帧都一模一样。因为所有动画都是帧号的纯函数,随机数有种子,文字排版靠计算而不是 DOM 测量。
- 可修改:觉得第 17 个镜头的图表颜色不对?直接改那个镜头对应的
.tsx文件,重渲就行。不用重新跑一遍模型,也不用看模型“这次心情好不好”。
2. 多 agent 并行构建,速度快
这不是一个 AI 在干活,是一群 AI 分工协作。样片《RAG 与知识库》的制作过程:
- 1 个 agent 做调研
- 主会话写解说词和分镜
- 8 个构建 agent 并行写镜头代码(每个 5-7 个镜头)
- 每章 1 个 QC agent 检查质量
- 修复 agent 按组派单
3. 四个人工确认点,不是全自动闷头跑
很多人担心 AI 自动做出来的东西质量不可控,anything2explainer 在流程里设计了四个必须停下来等人确认的节点:
- 时长和语言:写文案之前先问你想做多长、用中文还是英文。这直接决定了后续要写多少镜头、派多少 agent。
- 解说词定稿:配音之前给你看完整文案,确认没问题再往下走。因为一旦配音定稿,每个镜头的帧号就被硬编码了,改一个字全片都要重排,这是最便宜的干预点。
- 配音引擎:默认用 edge-tts(中文)和 kokoro-82m(英文),但如果你有偏好的 TTS 或者自己做的配音,随时可以换。
- 前 30 秒样片:只构建完第一个镜头组就渲 30 秒样片,让你判断风格、字号、语速、节奏合不合适。在这里改成本是 1 个镜头组,整片渲完再改就是全部组。
4. 事实有出处,画面不瞎画
anything2explainer 有一条硬性原则:画面上出现的每个数字、年份、机构、英文术语,都必须能在调研文档里找到来源 URL。
没核实过的事实,不上画面也不进配音。这条规则直接写进了 SKILL.md 的硬性原则里,调研 agent 必须执行。
快速上手
第一步:克隆仓库
git clone https://github.com/Vincentwei1021/anything2explainer.git
第二步:注册 skill(软链接到 AI 代理的 skills 目录)
# 如果你用 Claude Code
ln -s "$PWD/anything2explainer" ~/.claude/skills/anything2explainer
# 如果你用 Codex
ln -s "$PWD/anything2explainer" ~/.codex/skills/anything2explainer
第三步:安装系统依赖
brew install ffmpeg
第四步:创建 Python 虚拟环境并安装依赖
python3 -m venv ~/.venvs/a2e && source ~/.venvs/a2e/bin/activate
# 中文配音必需
pip install 'edge-tts==7.2.8' numpy pillow scipy
# 如果要做英文片,还需要装 kokoro-82m(本地推理,CPU 就能跑)
pip install kokoro soundfile && brew install espeak-ng
使用方式
装好之后,在 Claude Code 或 Codex 里直接说你想做什么就行:
讲一下向量数据库,做成一条讲解视频
或者英文:
Make me an explainer video about vector databases.
skill 会自动触发,然后按 9 个阶段走完流程,在四个确认点停下来问你。
已知限制
anything2explainer 也不是万能的,作者在 README 里坦诚列出了几条限制:
- 只有一种视觉风格:想完全换一套画风,得改风格指南和图元库,工作量不小。
- 不做竖屏:模板和全部安全区规则都按 1280×720 横屏设计,9:16 的短视频不支持。
- 不做真人/实拍为主的片子:如果你要拍 Vlog 或综艺节目,这个工具帮不上忙。
- 解说词定稿后不能改词:因为帧号硬编码在镜头代码里,改一个字全片重对位——所以那两个“解说词定稿”的确认点非常重要。
- 需要 AI 编程代理:它是 Skill 不是独立程序,没有 Claude Code 或 Codex 跑不起来。
写在最后
anything2explainer 这条路线的优势是确定性和可追溯性——每帧都是代码,每个数字都有来源 URL。
代价是它需要 Remotion 技术栈、需要 AI 编程代理、需要你在关键节点做确认。但对于那些真正想“把一件事讲清楚”的内容创作者来说,这种可控性比什么都重要。
现在还不知道这条路线能走多远,但至少有了 anything2explainer 这个起点,“给一个主题,两小时产出一条讲解视频”不再是一句空话。