Tobatsu · 数字人情绪控制 · 实验三
OmniHuman 的 prompt 压不过音频情绪——欢快的语音念「司机生气了」,脸还是在笑。换 fal-ltx-2-3-a2v 试同一段音频、同一套情绪 prompt:着急那一拍,脸真的皱起来了。
最关键一张图
都是「Oh no, the drivers are getting angry…」这句(音频本身是亢奋语气),都给了「furrowed brows, NO smile, anxious」的 prompt:
LTX-2 的 prompt 杠杆强得多:它能压过音频情绪,让一段欢快语音配出焦虑的脸。OmniHuman 做不到(被音频带跑)。要做「情绪准」的数字人,LTX-2 是更对的模型。
LTX-2 四拍
| 拍 | 想要 | OmniHuman | LTX-2 |
|---|---|---|---|
| 惊喜 | 笑、亮眼 | ✓ | ✓ |
| 专注 | 收敛认真 | ~ | ✓ |
| 着急 | 皱眉、收笑 | ✗ 还在笑 | ✓ 皱眉苦脸 |
| 狂喜 | 欢呼、亢奋 | ✓ | ✓ |
这个模型的脾气
type=any2video / model=fal-ltx-2-3-a2v / input={image_url, audio_url, prompt}。输出 output_data.videos[],1280×768。方向
time_range+emotion_style,相邻同情绪合并成拍,每拍一段音频 + 一句情绪 prompt(agent 生成、纯表演、不提画面),逐拍烧、concat。[worried]),音画一致会更自然。范围:探索 + 验证,全直连 unified 做的对照实验,未碰生产工作流。结论:LTX-2 + 按拍 prompt 是更可行的情绪控制路线。