起点只有三样东西:一条竞品"炮台守桥"买量视频、一张峡谷铁路桥场景图、一张黑胡子角色设定图。终点是一条可以直接投喂投放测试的写实玩法视频。中间没有建模师、没有动画师、没有剪辑,全部由 AI 管线完成。
重点不在任何一个单点工具,在中间那个闭环:每一条修改意见都能在小时级回到画面里,所以 4 轮就把 17 条意见全部消化掉了。


参考图不直接进成片,它们是后面所有 AI 生成的"锚":生成的每一版角色、每一门炮都要跟它们对得上。
先逐帧看竞品,把它的编排抄下来变成一张节拍表:0-2s 瞄准、2s 起三波扫射、4 发重炮(6.2 / 8.0 / 14.65 / 16.45s)、Boss 4s 登场 20.3s 阵亡、21s 清场。然后用 Three.js 写代码把这张表"演"出来——几何块拼的兵、方块炮台,丑,但是每个动作都在正确的时间点上。
为什么先做丑的?因为 AI 视频模型不缺画质,缺的是导演。灰模 previz 就是导演的分镜,它把"怎么演"定死,后面生成只负责"画得真"。
左:竞品原片。右:v1 灰模 previz(720×1280 · 24fps · 25s)。两边节拍逐秒对齐——扫射、重炮、Boss 登场与阵亡都在同一时间点;场景已换成峡谷铁路桥,Boss 已换成黑胡子。
previz 不是发一个视频等意见,而是发一个网页编辑器:打开就能播,能点选任何物件(相机、Boss、炮、军团、火车)、拖关键帧、在任意时间点圈点写评论,一键导出 JSON 发回来。我们按 JSON 修改,发新版链接。四轮下来:
| 轮次 | 代表意见(原话) | 怎么落实 |
|---|---|---|
| 1 | "整体风格不够写实,类似 3A 大作的风格吧" | 接入 unified 统一风格生图 + Tripo 3D 重建,全套资产写实化 |
| 2 | "推进的红色士兵要满山遍野" / "场景也要超写实" | 军团 64→150 人;桥/岩壁/台地/火车全部换 AI 生成模型 |
| 3 | "高架上面没有铁轨" / "人物看起来黑黑的" | 补铁轨桥面;查出模型金属度过高发黑,统一钳制并补光 |
| 4 | "被大炮击中要飞起来" / "重新生成一个小兵趴在上面操作" | 命中者抛物线炸飞;生成"士兵趴在炮上"人炮一体模型 |
17 条意见没有一条需要开会解释——评论挂在具体物件的具体时间点上,歧义天然就小。用户自己拖过的关键帧(Boss 走位、瞄准圈)直接原样进正片。
编辑器最新版:edbb7(工具栏自带「导出MP4」,逐帧渲染出片,改完即出)。
每个资产走同一条流水线:unified 生图(以黑胡子设定图为风格锚,批量生成统一写实风格的概念图)→ Tripo image_to_model(概念图直接重建带贴图的 3D 模型)→ 自动绑骨 + 动作预设(走路 / 倒地 / 射击)→ 热替换进场景。





16 张概念图 → 16 个在最终场景里的 3D 模型。角色、道具、桥、岩壁、火车、连地面贴图都出自这条流水线,所以整个画面是一套风格。
两条出片通道,产物都是 720×1280 / 24fps 的标准 mp4:
左:服务端渲染的 25s 完整版。右:在编辑器里改完炮位后一键导出的 15s 版本——从改意见到拿到新视频,不需要经过任何人。
最后一跳用 seedance-2-omni(any2video),分两段走:先抽灰模成片的关键帧,用生图模型在构图完全不动的前提下洗成一张照片级剧照;再把剧照作为 @图1(唯一画风基准)、灰模成片作为 @视频1(只提供运动和机位)一起喂给 seedance。prompt 里只写两类事——"每一帧都必须是 @图1 的渲染品质"和"严格 1:1 跟随 @视频1 的机位、节奏、事件时序"。
左:喂给 seedance 的灰模成片(@视频1)。右:两段式重渲结果(720×1280 · 24fps · 15s)——机位、UI、炮口节奏、Boss 走位与左边逐帧对应,地面、桥墩、大气透视全部到照片级。中间那张剧照决定了成败:第一版直接喂视频,灰模画风渗进结果;加了剧照锚之后质感才真正换掉。