Tobatsu · 数字人情绪控制 · 实验三

换个模型:LTX-2 的情绪 prompt,听话多了

OmniHuman 的 prompt 压不过音频情绪——欢快的语音念「司机生气了」,脸还是在笑。换 fal-ltx-2-3-a2v 试同一段音频、同一套情绪 prompt:着急那一拍,脸真的皱起来了。

2026-06-26 · fal-ltx-2-3-a2v (any2video) · image+audio+prompt · 上限 20s → 按句切 4 拍 · 直连 unified

最关键一张图

同一段欢快音频,同一句「着急」prompt

都是「Oh no, the drivers are getting angry…」这句(音频本身是亢奋语气),都给了「furrowed brows, NO smile, anxious」的 prompt:

OmniHuman vs LTX 着急对比
上排 = OmniHuman:压不动,时不时还在笑。下排 = LTX-2:全程皱眉、苦脸、紧张——着急立住了。
结论

LTX-2 的 prompt 杠杆强得多:它能压过音频情绪,让一段欢快语音配出焦虑的脸。OmniHuman 做不到(被音频带跑)。要做「情绪准」的数字人,LTX-2 是更对的模型。

OmniHuman · beat3 着急
LTX-2 · beat3 着急

LTX-2 四拍

四种情绪都分得开

LTX 四拍
B0 惊喜 / B1 专注 / B2 着急(皱眉苦脸) / B3 狂喜(大笑挥手)——四拍表情明显不同。
想要OmniHumanLTX-2
惊喜笑、亮眼
专注收敛认真~
着急皱眉、收笑✗ 还在笑✓ 皱眉苦脸
狂喜欢呼、亢奋
LTX-2 · 4 拍 concat 整条(39.8s)

这个模型的脾气

用 LTX-2 的几条硬约束

方向

落地怎么搭

范围:探索 + 验证,全直连 unified 做的对照实验,未碰生产工作流。结论:LTX-2 + 按拍 prompt 是更可行的情绪控制路线。