编程 给一个主题 2 小时出片:anything2explainer 把讲解视频变成可复现的代码

2026-09-12 09:15:05

anything2explainer:把讲解视频拆成代码,两小时从主题到成片

对于做技术的,做一条科普讲解视频挺费力,不是录个视频或配个音就行。好的科普视频不是主播念 PPT,而是用动态图形把机制画出来。

问题在于:有没有办法像生成模型那样自动化,不用逐帧手工画,又能保证每一帧都精准可控、都是为了讲清楚内容服务?

anything2explainer 是一个 GitHub 上刚发布的项目,把这件事做成了。它不是视频生成模型,也不是数字人工具,而是一条完整的 AI 视频生产流水线:从一个主题开始,经过调研、解说词、分镜、并行构建、质检,两个小时后,一条带配音、字幕、章节进度条的黑底 MG 风格讲解视频就出来了。每一帧都是代码绘制的,可复现、可修改、可追溯。

项目介绍

anything2explainer 是一个 Codex Skill

它不是独立 CLI 工具,而是专为 AI 编程代理设计的一套“方法 + 工具链”。整个仓库里装的不是一个可执行程序,而是:

  • 一份可编译的 Remotion 4 模板工程(React + TypeScript)
  • 一套图元与光效库(调色板、字体、动效组件)
  • 配音/分镜/渲染/量化质检的脚本工具
  • 详尽的风格与动效规范文档
  • 多 agent 分工协议与 prompt 模板
  • 一条完整的样片作为质量标尺

核心思路是:每一帧画面都是代码

它能产出什么

输入一个主题(比如“讲一下向量数据库”)或一篇文章,指定时长和语言,anything2explainer 会输出:

视频:1280×720 @ 30fps 的 H.264 MP4,自带:

  • TTS 配音(中文 edge-tts 云希男声,英文 kokoro-82m Liam 男声,支持自换)
  • 按词边界精确对齐的字幕
  • 章节卡片和底部章节进度条
  • 顶部 HUD 胶囊和可选流程轨

同时交付的全套过程文件

  • 带来源 URL 的调研文档
  • 解说词原文
  • 分镜表
  • 逐镜头源码
  • QC 质检报告

不仅给成片,还给全流程的“作业”文件。

核心亮点

1. 全代码绘制,确定性渲染

anything2explainer 走的是中间路线:用 Remotion 作为渲染引擎,但让 AI agent 自动写组件代码。

好处是双重的:

  • 可复现:重新渲染一遍,每一帧都一模一样。因为所有动画都是帧号的纯函数,随机数有种子,文字排版靠计算而不是 DOM 测量。
  • 可修改:觉得第 17 个镜头的图表颜色不对?直接改那个镜头对应的 .tsx 文件,重渲就行。不用重新跑一遍模型,也不用看模型“这次心情好不好”。

2. 多 agent 并行构建,速度快

这不是一个 AI 在干活,是一群 AI 分工协作。样片《RAG 与知识库》的制作过程:

  • 1 个 agent 做调研
  • 主会话写解说词和分镜
  • 8 个构建 agent 并行写镜头代码(每个 5-7 个镜头)
  • 每章 1 个 QC agent 检查质量
  • 修复 agent 按组派单

3. 四个人工确认点,不是全自动闷头跑

很多人担心 AI 自动做出来的东西质量不可控,anything2explainer 在流程里设计了四个必须停下来等人确认的节点:

  1. 时长和语言:写文案之前先问你想做多长、用中文还是英文。这直接决定了后续要写多少镜头、派多少 agent。
  2. 解说词定稿:配音之前给你看完整文案,确认没问题再往下走。因为一旦配音定稿,每个镜头的帧号就被硬编码了,改一个字全片都要重排,这是最便宜的干预点。
  3. 配音引擎:默认用 edge-tts(中文)和 kokoro-82m(英文),但如果你有偏好的 TTS 或者自己做的配音,随时可以换。
  4. 前 30 秒样片:只构建完第一个镜头组就渲 30 秒样片,让你判断风格、字号、语速、节奏合不合适。在这里改成本是 1 个镜头组,整片渲完再改就是全部组。

4. 事实有出处,画面不瞎画

anything2explainer 有一条硬性原则:画面上出现的每个数字、年份、机构、英文术语,都必须能在调研文档里找到来源 URL

没核实过的事实,不上画面也不进配音。这条规则直接写进了 SKILL.md 的硬性原则里,调研 agent 必须执行。

快速上手

第一步:克隆仓库

git clone https://github.com/Vincentwei1021/anything2explainer.git

第二步:注册 skill(软链接到 AI 代理的 skills 目录)

# 如果你用 Claude Code
ln -s "$PWD/anything2explainer" ~/.claude/skills/anything2explainer

# 如果你用 Codex
ln -s "$PWD/anything2explainer" ~/.codex/skills/anything2explainer

第三步:安装系统依赖

brew install ffmpeg

第四步:创建 Python 虚拟环境并安装依赖

python3 -m venv ~/.venvs/a2e && source ~/.venvs/a2e/bin/activate

# 中文配音必需
pip install 'edge-tts==7.2.8' numpy pillow scipy

# 如果要做英文片,还需要装 kokoro-82m(本地推理,CPU 就能跑)
pip install kokoro soundfile && brew install espeak-ng

使用方式

装好之后,在 Claude Code 或 Codex 里直接说你想做什么就行:

讲一下向量数据库,做成一条讲解视频

或者英文:

Make me an explainer video about vector databases.

skill 会自动触发,然后按 9 个阶段走完流程,在四个确认点停下来问你。

已知限制

anything2explainer 也不是万能的,作者在 README 里坦诚列出了几条限制:

  • 只有一种视觉风格:想完全换一套画风,得改风格指南和图元库,工作量不小。
  • 不做竖屏:模板和全部安全区规则都按 1280×720 横屏设计,9:16 的短视频不支持。
  • 不做真人/实拍为主的片子:如果你要拍 Vlog 或综艺节目,这个工具帮不上忙。
  • 解说词定稿后不能改词:因为帧号硬编码在镜头代码里,改一个字全片重对位——所以那两个“解说词定稿”的确认点非常重要。
  • 需要 AI 编程代理:它是 Skill 不是独立程序,没有 Claude Code 或 Codex 跑不起来。

写在最后

anything2explainer 这条路线的优势是确定性和可追溯性——每帧都是代码,每个数字都有来源 URL。

代价是它需要 Remotion 技术栈、需要 AI 编程代理、需要你在关键节点做确认。但对于那些真正想“把一件事讲清楚”的内容创作者来说,这种可控性比什么都重要。

现在还不知道这条路线能走多远,但至少有了 anything2explainer 这个起点,“给一个主题,两小时产出一条讲解视频”不再是一句空话。

GitHubhttps://github.com/Vincentwei1021/anything2explainer

复制全文 生成海报 AI视频 Remotion Codex 开源项目 自动化

推荐文章

程序员茄子在线接单