背景说明
口播配音能力升级后,实际执行必须指定一个具体音色。音色不再靠“中年磁性男声”这类自然语言描述,而是来自服务商音色列表的选择结果;未来其他技能只要包含口播配音能力,也会复用同一套音色选择逻辑。但 Ignis 的主体验仍是 Agent 对话和多模态输入框,因此需要把音色选择做成轻量入口,而不是把流程改成传统配置表单。
工具约束
包含口播配音能力的工具调用需要明确 voice_id,缺失时不能稳定执行。
前端补位
提供音色展示、搜索、筛选、试听、选择能力,并写回输入框。
交互原则
保留 Agent 对话流,只在关键参数处增强感知和选择,不新增重表单。
一、输入框如何兼容并增强音色选择感知
在现有多模态输入框里增加音色入口、一次性引导和音色 chip 写入,不改变用户继续用自然语言表达需求的方式。
Canvas Chat
入口
音色入口贴近技能入口,表示它是当前技能上下文的参数,不是独立工具。
选择
Popover 内先搜索和筛选,再试听。试听状态不污染输入。
写入
点击某个音色后直接写回输入框;再次选择音色时替换上一枚音色 chip。
选择音色
选择技能
点击后直接插入标签
为口播选择音色
0/4000
0/5
音色入口可见:当前输入框已选需音色技能,且 Session 也有相关历史。
二、快速开始提示词模板优化
快速开始仍然只是输入框下方的填充入口;点击后生成一段可编辑提示词,并默认带入口播配音能力、语种变量和音色 chip。
Ignis 首页输入框
输入您的设计需求
选择语种
0/8000
0/10
快速开始
三、数据来源与对接说明
这里补充前后端和服务商的对接边界,避免原型只停留在 UI 层。
Data Contract Notes
列表来源
ElevenLabs API 或后端聚合接口返回可选音色。
用户选择
前端显示名称,但保留 voice_id 作为实际参数。
排序策略
保留热门、最新、用户最多等排序;先不加最近使用,避免和排序入口冲突。