编程 ViMax:港大开源的多 Agent 视频生成框架,Novel2Video 把长篇小说拍成剧集

2026-09-11 23:55:25

ViMax:港大开源的多 Agent 视频生成框架,Novel2Video 把长篇小说拍成剧集

项目地址:https://github.com/HKUDS/ViMax
论文:https://arxiv.org/abs/2606.07649
协议:MIT


定位:Director / Screenwriter / Producer / Video Generator 四合一

ViMax 来自港大数据智能实验室(HKUDS),把编剧、导演、制片、视频生成四件事揉进一个 agentic 框架:你给一个想法,它自动完成剧本编写、分镜设计、角色创建到最终视频生成的全流程。12344 Star、1860 Fork,MIT 协议,Python 3.12,用 uv 管环境。

README 把当前 AI 视频的三个通病摆得很直白:

  • 只能出短片:多数工具只生成几秒素材;
  • 一致性失控:角色和场景跨帧乱变;
  • 只管画面:缺剧本、音频、叙事结构。

它想解决的是「分钟级甚至小时级、跨场景连续、多分镜」的长视频生产问题——这也是它和单点文生视频工具的根本区别。

四条创作入口

  • Idea2Video:一句概念 → 结构化故事、角色、剧本、分镜、镜头、成片;
  • Script2Video:把明确剧本转成可控的多场景多镜头视频,保留创作意图;
  • Novel2Video:把长篇虚构作品改编成分集视觉叙事,带叙事压缩、角色追踪、场景规划——这是它最特别的能力,专为长篇小说设计;
  • AutoCameo:把参考照片里的人或宠物放进生成故事,保持外观一致。

此外还有 Agent Loop + TUI:在交互式工作区里讨论想法、修订方案、恢复会话、审阅文本产物、控制渲染;以及 Web UI:命名项目管理、上传源文件、查看产物和分镜进度、预览渲染、配置供应商。

它的生产管线会把参考图、首帧、镜头连续性、最终装配端到端协调起来,并并行生成兼容的镜头与媒体资产来加速多镜头生产。

快速开始

环境:Linux、Windows。用 uv 管理依赖(安装见 https://docs.astral.sh/uv/getting-started/installation/)。

git clone https://github.com/HKUDS/ViMax.git
cd ViMax
uv sync

方式一:Agent TUI(终端交互)

cp configs/agent.example.yaml configs/agent.local.yaml

configs/agent.local.yaml 里配置 LLM、图像生成、视频生成三部分:

llm:
model_provider: openai
model:
base_url:
api_key:

image:
model:
base_url:
api_key:

video:
model:
base_url:
api_key:
vimax tui new
vimax tui resume
vimax tui resume

也可以把该文件留空,改用环境变量 VIMAX_LLM_API_KEYVIMAX_IMAGE_API_KEYVIMAX_VIDEO_API_KEY

方式二:Web UI

和 TUI 共用同一套 agent runtime、会话、工具和 configs/agent.local.yaml,需要 Node.js 18+:

cd web
npm install
npm run dev

打开 http://127.0.0.1:4173。服务默认只绑 127.0.0.1,跑在远程机器上就用 SSH 端口转发:

ssh -N -L 4173:127.0.0.1:4173 @

换端口用 VIMAX_WEB_PORT=4174 npm run dev

方式三:直接跑脚本

main_idea2video.py 把想法转成视频,在 configs/idea2video.yaml 里配 chat / image / video 三部分:

chat_model:
init_args:
model: google/gemini-2.5-flash-lite-preview-09-2025
model_provider: openai
api_key:
base_url: https://openrouter.ai/api/v1

image_generator:
class_path: tools.ImageGeneratorNanobananaGoogleAPI
init_args:
api_key:

video_generator:
class_path: tools.VideoGeneratorVeoGoogleAPI
init_args:
api_key:

working_dir: .working_dir/idea2video

然后在脚本里给 idea 和创作要求:

idea = """
If a cat and a dog are best friends, what would happen when they meet a new cat?
"""
user_requirement = """
For children, do not exceed 3 scenes.
"""
style = "Cartoon"

main_script2video.py 则是基于具体剧本来出片,配置放 configs/script2video.yaml。剧本用标准场景格式写,例如 EXT. SCHOOL GYM - DAY 加角色和对白,再给风格与镜头数要求。

版本动态(近期)

  • 2026-07-20 v1.2.0 引入 Web UI:命名项目、Agent Loop 会话、产物与分镜预览、渲染检查点、文件上传、供应商设置、深色模式;
  • 2026-07-17 加入 OpenRouter GPT Image 2 出图与 Seedance 2.0 Fast 视频生成;
  • 2026-06-28 Agent Loop 与 TUI 稳定性更新:更强的 LLM 重试、持久化渲染状态、横屏图像守卫、Script2Video 断点续跑修复;
  • 2026-06-09 发布技术报告;2026-06-07 发布 Novel2Video 工作流;2026-06-01 支持 Google Omni 视频生成器。

适合谁

  • 想研究 agentic 长视频生成框架、看多 Agent 如何编排剧本到成片的人;
  • 手上有长篇小说想改编成分集视觉叙事的创作者;
  • 用 OpenRouter / Google API 生态、能自己配 Key 的开发者。

MIT 协议,是这一批项目里商用约束最宽松的,适合拿来二次开发。代价是它更偏「框架」而非开箱即用的产品,供应商配置、环境、脚本都得自己动手。

推荐文章

程序员茄子在线接单