
#1
voiceover-digital-human-combo · 出图实验 · 第二组
用「保留背景」那版极简提示词,nano 和 gpt2 各连跑 5 次,看每个模型多次出图脸会不会飘、背景稳不稳、有没有翻车。
nano_banana





5 张全部:背景留住(花拱门 + 吊灯 + 大厅)、居中正脸、空手、闭嘴。脸每张都明显是同一个人,只有光线/拱门构图的细微差别。这一组里没出现「换人」。分辨率 2752×1536,最高。
gpt_image (gpt2)




背景同样留住了,拱门更对称、更像棚拍大片(你说更好看的就是这种)。5 次里 4 张出图、1 张超时,三处不稳:#1 把「empty hands」理解成「露出手」,给了个摊手手势;脸每张都轻微美化/磨过(比 nano 略不像本人);速度抖得厉害——#3 直接超时没出图,#5 跑了 223 秒(差点也超时)。分辨率 2048×1152。
怎么选
| 维度 | nano_banana | gpt_image (gpt2) |
|---|---|---|
| 脸像不像本人 | 更忠实,5/5 几乎不飘 | 轻微美化,每张略飘 |
| 构图观感 | 自然、略写实 | 更对称、更大片 |
| 背景保留 | 稳 | 稳 |
| 可靠性 | 5/5 成功 | 4/5(1 超时;其中 1 张手势) |
| 分辨率 | 2752×1536 | 2048×1152 |
| 速度 | ~50s | ~60s,偶发超时 |
建议:要稳和像本人就 nano(适合默认);要更上镜的成片感、且能接受偶发飘脸/重试就 gpt2。gpt2 用的话提示词里把 empty hands 换成 hands relaxed at his sides,能压住那个摊手手势。