BigBanana AI Director:关键帧驱动的 AI 漫剧工场,源码停更只发 Docker 镜像
项目地址:https://github.com/shuyu-labs/BigBanana-AI-Director
在线版:https://director.tree456.com/
协议:CC BY-NC-SA 4.0(禁止商业用途)
先说这个仓库当前的形态
BigBanana AI Director 自我定位是「AI 一站式短剧/漫剧平台」,2136 Star、318 Fork。但 README 里有一句必须先说清楚的话:
由于近期出现大量抄袭、搬运不署名,后续版本将仅通过官方 Docker 镜像发布,不再继续公开同步源码。
所以现在这个公开仓库主要是说明文档 + docker-compose.yaml + 历史参考版本。想部署和升级,以官方镜像为准;商业版用户才会拿到完整源码交付。如果你来找源码自己改,这里已经不是了。
核心理念:用关键帧管住镜头
它明确反对「抽卡式生成」,走的是 Script-to-Asset-to-Keyframe 的工业化工作流。其中最核心的设计是关键帧驱动:
- 先画后动:先生成精准的起始帧(Start)和结束帧(End);
- 插值生成:用 Veo 模型在两帧之间生成平滑过渡视频;
- 资产约束:所有画面生成都受「角色定妆照」和「场景概念图」强约束,减少人物变形。
传统 Text-to-Video 的问题就是控制不了具体运镜和起止画面。把它拆成首尾帧 + 插值,等于借用了传统动画制作的控制方式,这是它和「一句话生成」类工具最大的思路差异。
五个 Phase
项目级工作流:项目中心管最近项目、账号、模型配置、全局资产库、整库导入导出;项目概览按「项目 → 季 → 集」组织,支持整篇小说导入并自动拆分多集草稿;制作前先沉淀角色/场景/道具资源和地图、区域、地点、音乐风格等世界观锚点。
Phase 01 叙事规划:输入大纲、小说片段或单集创意,AI 拆出角色、场景、道具、镜头等结构化结果;可设语言、目标时长、视觉风格、模型组合,统一控制全链路。支持 AI 续写与逐项手动编辑,正式批量生成前会先给「全自动生产方案」预审,由你逐镜头决定用「九宫格分镜」还是「首尾帧」链路。
Phase 02 一致性资产:为每个角色生成标准参考图,衣橱系统维护多套造型的一致身份;场景/道具资产化,可复用道具建独立提示词、参考图、形体参考;支持跨项目资产库复用;可一键补齐缺失资产图。
Phase 03 镜头制作:网格化镜头工作台全景管理所有镜头;Start / End Frame 支持生成、上传、继承、编辑;九宫格分镜预览先生成 9 个候选视角,再选整图或裁切单格当首帧;生成时自动读取当前场景图、角色服装参考、道具参考,降低「不连戏」;双视频链路(单图 Image-to-Video 或首尾帧插值)。
Phase 04 成片交付:时间线预览与渲染追踪;CutOS 风格 AI 粗剪(调序、裁剪、滤镜、导出前检查);可导出母版视频、片段压缩包、源素材,便于进 Premiere / Resolve;剧集级备份支持跨设备迁移。
Phase 05 提示词管理:集中检索编辑模板、角色、场景、道具、关键帧、视频提示词;保留编辑历史可版本回滚;结果不稳定时可回到这页定位上游提示词问题。
部署与模型接入
git clone https://github.com/shuyu-labs/BigBanana-AI-Director.git
cd BigBanana-AI-Director
# 首次启动会自动拉取并启动所需官方镜像
docker-compose up -d
# 浏览器打开 http://localhost:3005
docker-compose logs -f
# 更新
docker-compose pull && docker-compose up -d --force-recreate
模型默认通过 AntSK API 统一接入文本、图像、视频。公开版仍需完整模型组合:大语言模型(如 GPT-5.2)、图像模型(如 Nano Banana Pro)、视频模型(如 Sora-2 / Veo-3.1)。项目数据主要保存在本地浏览器环境,适合个人创作和轻量协作,跨设备要自己用导入导出。
README 里有一句坦白值得注意:如果你的核心诉求是「长期必须免费」,并以免费为唯一标准评估,这个项目可能不适合你——作者建议去用千问、元宝、豆包。换句话说,走官方 API 是有成本的。
协议
CC BY-NC-SA 4.0:允许个人学习和非商业用途,允许修改和二次创作(需同协议),禁止商业用途,商用需单独授权。