From Voice Agents to AI Avatars

From Voice Agents to AI Avatars

The TWIML AI Podcast•01:04:29•2026-09-17•原始音频
主持人
Sam Charrington
嘉宾
Alex Smola

核心摘要

Sam Charrington 与 Boson AI 联合创始人 Alex Smola 讨论为什么自然的语音交互是系统工程,而不只是更强的语言模型。Charrington 描述了当前语音界面动辄破功的体验;Smola 用嘈杂酒吧里的演示作答,同时把一部分功劳让给手机端的音频处理。他把打断延迟、音频 token 化、模型规模、流式缓冲和视听一致性都挂到同一个核心设计约束上:一场持续进行的对话必须是负担得起的。Boson 的做法是从价格目标倒推,而不是先把模型做大再说。 Smola 回顾了 Boson 从文本走向音频的路径:语音识别不等于音频理解,而新增模态时最大的风险是把原有的语言能力丢掉。他描述了大规模的音频采集与处理、自持的基础设施、弱监督和模型与标注互相带动的迭代闭环;在他口中,适配是实打实的大量训练,不是轻量微调。随后他解释前台对话如何与后台推理、工具调用共存,上下文窗口和 KV 缓存成本决定了集成方案的选择边界。他宣称的基准优势带着一个实质性限定:对比是在对方关闭思考模式的情况下做的。 后半段话题从任务完成转向人际交互的质量。Smola 主张把等待说出口、区分附和与打断、体面地从中断中恢复、察觉未被说出的需求;他点名 ProactBench 和 IHBench,提醒别把虚构或娱乐性的互动当成正常行为的范本,并为涉及真人的实验守住伦理边界。收尾的讨论厘清了模拟用户训练、个人记忆、面向全体用户的改进和文化适应这几条线。Smola 认为新的交互和显式指导可以教会稀缺的沟通技巧,并把未来两三年的快速进步当作预期,而非既成结论。

章节看点与核心要点

Alex 的嘈杂酒吧例子把一部分功劳归于手机端的音频分离,而不是全部归给模型本身。
Alex 解释说,token 频率会影响保真度、时间粒度,以及交互速度下负担得起的模型规模。
Alex 描述的是先定价的设计策略,而不是把大模型演示当成服务在经济上可行的证据。
Alex 说,音频适配必须保留语言训练和音频与文本的对齐,否则会丢掉推理和语言能力。
Alex 把采集、标注、归一化、转写和存储描述为实打实的工作,不能与模型训练互相替代。
Alex 提出一个由上下文支撑的弱监督反馈回路,同时单独注明:均值化的类比要以误差无偏为前提。
Alex 区分了把公开模型当起点,和其后大量的音频与语言训练这两件事。
Alex 描述了一种把工作派发到后台、同时保住前台对话交互的架构。
对方关闭思考模式这一限定,与 Alex 的性能对比主张不可分割。
Alex 把同时启用 MCP 服务器的数量上限与预填充、KV 缓存大小和推理成本联系起来。
Alex 主张打断、恢复和主动性都应随情境而定,同时仍把任务完成当作硬要求。
Alex 警告说,剧情片和脱口秀可能是糟糕的范本,不能照着学人该如何互动。
Alex 区分了适应某一个人的历史,和跨交互、跨文化的泛化改进。
面对良好社交行为的样本稀缺,Alex 的答案是探索和显式指导,而不是宣称现有数据已经解决了问题。

自然的语音 AI 是系统工程:Alex Smola 谈延迟、token 与可负担性

导语

语音界面一直在进步,也一直在破功——回复前多停的那半拍、被打断时的笨拙、不合时宜的语气。当 Sam Charrington 问 Boson AI 联合创始人兼 CEO Alex Smola 到底怎样才能补上这块短板时,贯穿整场对话的答案不是"更大的模型",而是一整套系统:一份从生物学借来的延迟预算、一门 token 经济学、一条以人类寿命为单位计量的数据流水线,以及一类全新的"智能体该如何在对话中举止"的基准测试。

错觉问题

Smola 把业界争相发布的产品降了一级: "语音只是一块中间垫脚石。" 他说,这一切收敛的终点,是"你将和一个看起来、感觉起来都像人的视听智能体对话"——而他把那个终点放在离"自然"非常远的地方。 Charrington 则补充了用户侧的挫败感:ChatGPT 的高级语音模式一直在变好,却依然令人恼火,因为 "它真的只在完美条件下可用:安静的房间、没有背景噪音、打断时非常小心。"

济州岛的一间嘈杂酒吧

Smola 的反例来自韩国济州岛 KDD 会议期间的一间酒吧,他一时兴起在那里演示了自家系统。 他说,模型"相当好地接住了有人切换到斯洛文尼亚语、另一个人又换到印地语,而酒吧非常吵"的场面。 他随即将功劳分了出去:"不小的一份功劳要记在 iOS 团队头上,他们在手机上做了非常好的降噪和音频分离," 而单支麦克风大概永远不够——麦克风阵列才是已经出货的成熟解法。他的时间表很具体: "我想大概一年之后,音频就会基本做到万无一失," 虚拟人大约一年半后登场,带动画面孔的机器人更慢一些,因为硬件难做。

生物学定的时钟

工程的紧迫感来自一个生物学数字。 Smola 把预算定在"约 150 毫秒"——从"光子打到视网膜,到皮层开始对它做处理"的时间,这个数字稳定到可以当诊断指标用;从耳朵进来还要更短一点。 他说人类在视听感知上大约以六到十赫兹的节奏运作,Boson 于是把模型调到同一个窗口: 中断处理在"大约 150 毫秒上下"完成。

token 速率的两难

更深一层的约束是算术。在当前范式里,音频变成 token,token 过一遍 LLM 式骨干,再变回音频——而 "每秒 token 一多,模型就不能有太多参数", token 速率慢下来,才腾得出预算装更大的模型。 文本在这点上占尽便宜:人类想要的语速合每秒"三到五个 token",而音频动辄十几个——大约每 100 毫秒就要吐一个 token。 虚拟人视频则自带一层补偿: "背景里不会开过赛车", 所以虚拟人的画面大部分时间无聊、可高效压缩。

先定价,再定模型

Boson 从账单出发做设计。 流式传输一场对话,不该占用"一整台 Blackwell 服务器 GPU"——那样当演示很惊艳,当服务没人付得起。 Smola 说,他们的做法是"先定价格,再倒回去", 造客户真正付得起的东西。他给这套设计配的性能主张相当强—— 在基准测试上,"我们比——比如说——GPT、Gemini、还有 Grok 都要好,而成本只是几分之一。所以我们比 OpenAI 的模型好,成本是十分之一" ——而且脚注是他自己补上的: "这些是对方关闭思考模式下的成绩," 因为每次回答前先停一大截去"思考",在对话里感觉并不自然。

给 LLM 教音频,别把老本教丢了

加上一个新模态,可能顺手抹掉它本来依托的智能。Smola 的警世故事是朋友的养女:只对她讲德语,几个月之内就 "把西班牙语的每一个词都忘光了" ——他说,只被按在音频上的语言模型,同样会丢掉推理和语言能力。解法是围绕音频工作维持完整的训练流水线,它产出了 他称之为相当不错的 TTS 模型 Higgs Audio V2(去年发布),今年又加快节奏接连发布 TTS、ASR 和音频理解模型。 Higgs Audio V2 这次发布在 Boson AI 官网上以 Higgs TTS 2 之名留有记录。 在他看来这些类目必须分开: 语音识别是音频进、文本出,分辨不出"recognize speech"到底是"识别语音"还是"毁掉一片好海滩"(wreck a nice beach), 音频理解模型才能真正对音频做推理。这也不是轻量微调: 一个已发布的模型"建立在 Llama 之上",并在模型卡里注明, 但免费原料的逻辑依然成立——"如果有人送你免费的钢材,你不会去建钢厂,你会去造车" —— 而他估算,音频侧的工作量约为语言模型的一半或三分之一,并强调"不是十分之一"。

一亿小时的飞轮

Smola 最先点名的差异化因素是数据: "我们持有的音频在一亿小时这个量级",他折算成"约等于 200 个人类一生。" 靠的不是买标注,而是抓取之后按规模做提取、打标、归一化和转写。 Boson AI 自己的工程文章收窄了这个数字:文中表述为处理 1 亿+原始小时、得到超过 1000 万模型可用小时——因此访谈里的头条数字计的是原始音频,不是可直接训练的数据。 自建数据中心是护城河的一部分—— 放到 NeoCloud 上,"存储账单会把你吃穷" ——而标注厂商的量级差了四个数量级: 有公司报价比一万小时标注,Smola 回答说 Boson 的规模"是它的一万倍"。 让旁人害怕的带噪标签,他们用经典统计学消化—— 他指出,中世纪的脚尺法字面上就是"脚尺和截尾均值估计量的出处" —— 而闭环会自己转起来:素材够多,你就能"造出更好的模型,然后飞轮就转起来了", 其中还包括利用"一期播客只有两个人"这类上下文做语音分离的巧办法。

前台交谈,后台推理

架构跟着经济学走。Boson 没有做单一的巨型端到端模型——快,但用他的话说"笨"——而是跑 "一种更两段式的架构:理解与推理在后台进行",前台由一个更小的模型撑住对话。 开发者拿到的界面很熟悉:提示词写得和指挥普通 LLM"感觉一模一样","只不过我们的模型还会说话"。 在 Higgs Live 演示里,模型"在后台做网页搜索",视结果返回快慢,要么直接回答,要么说一句"嘿,我去找找"。 现成 MCP 服务器能用,但有上限: "能同时启用的服务器数量"目前"还比较有限", 因为一次大规模预填充会留下"一个大得你必须拖着走的 KV 缓存",让每个生成的 token 都更贵。 慢工具只要提前打招呼就能活——"人类对延迟是非常宽容的",只要"被告知有延迟"。 他的例证是苹果的开机进度条,收尾顺滑得可疑:在他的讲法里,说谎的是苹果,"微软的开机进度条才是实话"——一条按上次开机时长掐好时间的假进度条,妙就妙在没解决那个不可能的技术难题,却解决了体验。

为"举止"立基准

量什么,本身就是个研究问题。 Smola 主张,可打断性"必须随场景而定":日语听众那声短短的附和意思是"我收到了",不该让智能体停下;而"我没听懂"必须让它停。 主动性基准已经公开,收录于 arXiv 论文 "ProactBench: Beyond What The User Asked For"。 它的同伴 IHBench 也有 arXiv 论文 "Evaluating Post-Interruption Recovery in Voice Agents with Structured Workflows",覆盖可打断性、响应速度、声音是否与内容相配等指标。 优化目标则和代码生成不同: "在我们的场景里,我们操心的是人类的幸福感。" 任务完成度仍然算数,但"用得开心"是硬要求,不是点缀。他心中失败的样子,是《银河系漫游指南》BBC 剧集里那台欢快的飞船电脑,宣布 "两分钟后坠毁。我们都会死。" 这个故事的寓意在于:"智商和情商是两回事",而语音两者都要。

学会讨人喜欢

社交行为的训练数据是个陷阱。爱情喜剧把尾随拍成浪漫,动作片以握手言和收场,而 Smola 说,"我衷心希望没有人拿《菲尔博士》去训练模型"还当作正常人类行为。 便宜又合乎伦理的练习来自模拟器—— "英伟达在发布一批数字人物和场景这件事上做得很棒", Boson 用它们训练模型应对不配合的、粗声粗气的、存心搞坏系统的用户。另一半是记忆: 一份个人的交互历史,相当于"一个加强版 CRM,只不过现在人人都有一个", 再与跨全体交互的通用改进相平衡—— 甚至细到礼仪层面:"在印度用左手吃饭是绝对犯忌讳的。" 不可复制的是天才: "才华很好,但才华不可重复、不可自动化。" 替代品是体量—— "你可以把每一次交互都看成又一个新实验、一个新的数据点" ——再加上可以直接教的技巧,从管理培训到 "千禧世代三明治":按"表扬、批评、再表扬"的顺序把话说出口。 他的预测给这条弧线收尾:未来大概两三年会是一场"激动人心的革命",而且会推进得很快。

访谈精粹15 组核心对谈

主持人与特邀嘉宾原声对谈精选,支持精准时间戳跳转

QSam Charrington
01:39

语音 AI 能否在嘈杂环境中自然交流,而不只是像我使用 ChatGPT 语音模式时那样依赖理想条件?

AAlex Smola

我们在济州岛一家嘈杂的酒吧演示过系统,现场有人切换到斯洛文尼亚语,也有人换成印地语,模型都处理得相当不错。这说明语音系统不一定只能在安静房间里工作,但功劳不能全算在模型头上:手机上的降噪和音频分离做得很好,iOS 团队贡献了相当一部分效果。我不认为随便拿一支麦克风挥动一下也能得到同样的结果。尤其同时存在多个声源时,单支麦克风恐怕无法彻底解决问题,真正做好降噪需要麦克风阵列。这些硬件能力已经有产品在用,我觉得我们正在取得进展。

QSam Charrington
06:07

语音 AI 面临的挑战中,哪些主要是工程问题,哪些主要是研究问题?

AAlex Smola

研究和工程必须一起做。我们希望打断处理大致落在人类感知所涉及的 150 毫秒量级,但音频还要经过编码成 token、模型处理、再解码成声音的过程。提高 token 频率有助于保真度,却会同时推高预填充和生成成本:每秒 token 越多,能负担的模型规模就越受限;频率降低,才有余地增加参数。每秒 10 个 token 也意味着每个覆盖约 100 毫秒。生理感知、交互设计、表示学习和服务成本,就在这里形成同一个取舍。缓冲有利于流式传输,但又不能妨碍及时打断。视频还带来帧率差异,以及维持一小时画面一致性的要求,不能只会生成短片。虚拟人画面通常大部分背景变化不大,可以利用这一特点提高压缩和实时运行效率;快速动作则会拉高码率。目标是用户负担得起的交互,而不只是大模型带来的漂亮演示。

QSam Charrington
12:50

你们为语音模型选择不同的设计取舍,主要是出于可负担性的考虑吗?

AAlex Smola

我们优先考虑可负担性。模型做大可以更聪明,但持续进行的对话也得在经济上成立。如果一场对话就要独占整块 Blackwell 服务器 GPU,演示或许很好看,客户却可能付不起钱。因此,我们先定价格目标,再倒推在这一成本内能做什么,而不是先追求模型能力、之后才考虑费用。