之前只在 1 个视频(加油站手游 sI4W7c)上测过:给生成 prompt 加一句「只描述这一刻画面里已发生的事,别提前剧透后面镜头」,就把「词跑在画面前」治好了(当时 v1=3/3)。但那是 n=2–3、单一指标、单个 case 的结果。这页把同一改动放到 6 个不同视频、每臂跑 5 次、用两套口径量,看它到底稳不稳。
做法:模型固定 gemini-3.1-pro-preview,温度 1,两臂只差那一段 prompt(v0=线上的,v1=加了 no-lookahead 约束的),desc/视频/其余完全一样——prompt 是唯一变量。
两条结论先写在前面,不美化:
| 视频 | v0 对齐 | v1 对齐 | |
|---|---|---|---|
| z5cXvN | 5/5 | 4/5 | v1 差 |
| qrIwwY | 3/5 | 5/5 | v1 好 |
| bdE1hS | 2/5 | 3/5 | v1 好 |
| rYEP7C | 5/5 | 5/5 | 持平 |
| sI4W7c | 4/5 | 2/5 | v1 差 |
| c12xUC | 3/5 | 3/5 | 持平 |
| 合计 | 22/30 | 22/30 | 打平 |
单转场(可比原研究) · v1 比 v0:好 2 / 持平 2 / 差 2 个视频
| 视频 | v0 对齐 | v1 对齐 | |
|---|---|---|---|
| z5cXvN | 0/5 | 0/5 | 持平 |
| qrIwwY | 0/5 | 1/5 | v1 好 |
| bdE1hS | 5/5 | 4/5 | v1 差 |
| rYEP7C | 1/5 | 3/5 | v1 好 |
| sI4W7c | 0/5 | 1/5 | v1 好 |
| c12xUC | 2/5 | 3/5 | v1 好 |
| 合计 | 8/30 | 12/30 | v1 总体更优 |
全里程碑(更严) · v1 比 v0:好 4 / 持平 1 / 差 1 个视频
单转场口径不是事后凑的——先拿它去量原研究当时那批 sI4W7c 出词(回海洋 vs 上船 ~29s),看能不能复现原结论。结果:这把尺子定位「回海洋」那句的时间和原研究人工标的 return_start 完全吻合(24.0 / 28.0 / 29.5 / 30.0 / 29.5),方向也复现(v0 差、v1 好)。尺子可信,再 blind 套到 6 个视频。
注:v0 rep2 的 28.0s 在 ±1.5s 容差下算 aligned(原研究用硬阈值 29.0 算它超前)。方向一致:v1 仍明显优于 v0。
sI4W7c · v1 · rep1 — 玩家 29s 才回海洋,但脚本 18s 就喊「往回走」
[18.0–29.0] “Drop your cash on the pads to unlock new areas! I need more money for the car wash, so let's head back out.”
「head back out」(回海洋)在 18s 就说了,画面 29s 才回去——超前 11 秒。no-lookahead 约束这一 rep 没拦住。这正是 temp=1 下 v1 不稳的真实样本。
右栏展示样例 rep1 的完整出词。蓝色高亮 = 该句超前;「单转场超前」按可比口径,「里程碑超前」按更严口径。两套口径各自的 5-rep 对齐结果用圆点标在每臂标题(● 对齐 / ○ 超前)。
① 单转场口径(和原研究同一问题):v1 没帮上忙,也没泛化。 总对齐 v0 22/30、v1 22/30,打平。6 个视频里 v1 更好 2、持平 2、更差 2。关键是原研究的 v1=3/3(n=2–3)在 5 reps 下站不住:同一个 sI4W7c,新样本里 v0 4/5、v1 2/5,反而 v0 更稳。也就是说,最初那个干净结论很大程度上是小样本+temp=1 的运气。
② 全里程碑口径(更严,看全片任何超前):v1 有温和但不彻底的改善。 总对齐 v0 8/30 → v1 12/30,v1 更好 4、持平 1、更差 1 个视频。方向是正的,但远没到「每个视频都稳定治好」——而且这套口径比原研究严,绝对数都很低,v0/v1 都漏一堆。
给 haonan 的一句话: no-lookahead 这个改动方向没错(更严口径下确实少一点超前),但它不是一个稳定、可泛化的修复,在可比口径下甚至看不出收益,单测 case 的「3/3」别再当成定论。要上线前建议:扩大样本、或把约束写得更强/配合后处理校验,而不是凭这一版 prompt 直接拍。