The TWIML AI Podcast

The TWIML AI Podcast

科技与 AI•
主持人Sam Charrington
•官方网站 ↗

收录单集

1
From Voice Agents to AI Avatars

From Voice Agents to AI Avatars

2026-09-17
·
01:04:29

The TWIML AI Podcast ·Sam Charrington 与 Boson AI 联合创始人 Alex Smola 讨论为什么自然的语音交互是系统工程,而不只是更强的语言模型。Charrington 描述了当前语音界面动辄破功的体验;Smola 用嘈杂酒吧里的演示作答,同时把一部分功劳让给手机端的音频处理。他把打断延迟、音频 token 化、模型规模、流式缓冲和视听一致性都挂到同一个核心设计约束上:一场持续进行的对话必须是负担得起的。Boson 的做法是从价格目标倒推,而不是先把模型做大再说。 Smola 回顾了 Boson 从文本走向音频的路径:语音识别不等于音频理解,而新增模态时最大的风险是把原有的语言能力丢掉。他描述了大规模的音频采集与处理、自持的基础设施、弱监督和模型与标注互相带动的迭代闭环;在他口中,适配是实打实的大量训练,不是轻量微调。随后他解释前台对话如何与后台推理、工具调用共存,上下文窗口和 KV 缓存成本决定了集成方案的选择边界。他宣称的基准优势带着一个实质性限定:对比是在对方关闭思考模式的情况下做的。 后半段话题从任务完成转向人际交互的质量。Smola 主张把等待说出口、区分附和与打断、体面地从中断中恢复、察觉未被说出的需求;他点名 ProactBench 和 IHBench,提醒别把虚构或娱乐性的互动当成正常行为的范本,并为涉及真人的实验守住伦理边界。收尾的讨论厘清了模拟用户训练、个人记忆、面向全体用户的改进和文化适应这几条线。Smola 认为新的交互和显式指导可以教会稀缺的沟通技巧,并把未来两三年的快速进步当作预期,而非既成结论。

栏目文章

(1)
查看全部文章