当前位置: 首页 > news >正文

NVIDIA 发布 Magpie TTS 多语种 Voice Agent 部署指南;DuplexGen 开源面向全双工语音交互的对话数据合成框架丨日报

 

29c0660641d7e5886e2364e5d8cbbd5b

 

 

本期编辑:@三水、@鲍勃

01 有话题的技术

1、NVIDIA 发布 Magpie TTS Multilingual Voice Agent 部署指南:12 语种支持,B200 单流首音延迟 32ms

 

faaa26177f7bf0261e44c08d62b5cfca

 

 

NVIDIA 发布 Magpie TTS Multilingual 的 Voice Agent 部署指南,将此前开放权重的多语种 TTS 模型整理为更完整的服务化接入路径。本次更新重点在模型部署与 Voice Agent 集成,并非 Magpie TTS Multilingual 的首次发布。

 

  • v2607 版本约 364M 参数,支持 12 种语言: 模型名称为 Magpie TTS Multilingual 357M,采用编码器-解码器 Transformer 架构,覆盖英语、汉语、阿拉伯语、韩语和巴西葡萄牙语等 12 种语言。

  • B200 单流首音延迟达到 32ms: 当前版本面向流式 Voice Agent 场景,在 NVIDIA B200 GPU 上单流首音延迟为 32ms。

  • 开放权重并提供完整部署控制: 指南围绕低延迟、多语种和服务化接入展开,将开放权重模型进一步转化为可复现的 Voice Agent 部署流程。

  • 标准模式单次最多生成 20 秒语音: 模型当前仅支持指定的 12 种语言,并出于安全考虑移除了零样本语音克隆功能。

 

https://huggingface.co/nvidia/magpie_tts_multilingual_357m

 

https://huggingface.co/blog/nvidia/magpie-tts-multilingual-voice-agents

 

(@NVIDA)

 

2、DuplexGen 开源场景自适应 Turn-Taking 对话合成框架:用人类偏好校准接管对话轮次、Backchannel 与沉默

 

d1dc9e7568c8cc5b436e690c4e5b4866

 

 

DuplexGen 提出一种面向全双工语音交互的对话数据合成框架,通过少量 slot-level 人类偏好标注校准 LLM 的 Turn-Taking 决策,使生成数据中的对话节奏能够随场景变化,而不是对所有任务使用同一套抢话、回应和等待策略。

 

  • 将 Turn-Taking 拆成 slot-level 决策: 框架先将文本对话改写为口语形式,再识别句中潜在动作位置,并在每个 slot 上选择接管话轮、Backchannel 或继续沉默。

  • 用少量人类偏好标注校准 LLM: DuplexGen 通过 KL-divergence soft-label 微调校准每个 slot 的动作分布,使预测结果更接近特定场景下的人类偏好,而非直接采用 LLM 原始置信度。

  • 覆盖 6 类合作与竞争对话场景: 包括苏格拉底式教学、协作规划、采访、谈判、说服和社交对话;实验中的人类标注显示,合作任务更频繁出现 Backchannel,竞争任务则更倾向主动接管话轮。

  • 训练数据可改变全双工模型的 Turn-Taking 行为: 使用 DuplexGen 数据微调 PersonaPlex 后,其六类场景平均 Turn-Taking Naturalness 人类评分从 3.56 提升至 3.69,Moshi 基线为 3.48;Instruction Following 平均分从 PersonaPlex 的 3.41 提升至 3.55。

  • 已开放数据生成代码、Corpus 与语音版本: 官方代码覆盖文本转口语、slot 识别、Turn-Taking 预测、对话生成及 Chatterbox TTS 渲染流程,同时提供 PersonaPlex 的 LoRA 微调代码,但当前未发布对应微调模型 checkpoint。

 

https://duplexgen.github.io/

 

https://x.com/takyoung_kim/status/2086996559452123622

 

(@takyoung_kim)

 

3、OpenBenchmarks 发布 Voice Agent Latency Benchmark:真实电话测量 TTFAB,覆盖 Telnyx、ElevenLabs 等 5 个平台

 

7e19d98494059febade1d12e9fa3be5b

 

761bb21e919a4c68416cff2a512561ee

 

 

OpenBenchmarks Labs 发布 Voice Agent Latency Benchmark,用真实电话录音测量用户停止说话到 Voice Agent 开始发声之间的等待时间 TTFAB,而非采用平台自身上报的延迟数据。当前榜单覆盖 Telnyx、ElevenLabs、Bland AI、Vapi 和 Retell AI,共汇总 550 通电话、2078 个有效对话轮次。

 

  • TTFAB 直接从双声道通话录音计算: 分析器分别定位用户结束说话的 t1 和智能体开始发声的 t2,以 t2 − t1 计算每轮延迟;双方重叠说话、检测器结果不一致或未收到回复的轮次会被剔除。

  • Telnyx 的 p50 为 1296ms: 当前榜单中 Telnyx 的 TTFAB p50 最低;ElevenLabs 为 1424ms,Bland AI 为 1520ms,Vapi 为 1558ms,Retell AI 为 1740ms。

  • ElevenLabs 的 p95 为 1768ms: 其 p95/p50 为 1.24×,当前五个平台中尾部延迟波动最小;Telnyx p95 为 1856ms,Vapi、Bland AI 和 Retell AI 的 p95 均超过 2 秒。

  • 同步测试使用相同问题集同时拨号:harness.sync_bench 会让多个平台在同一时刻接收相同问题集,以减少平台负载、模型路由和运营商网络随时间变化带来的测试偏差。

  • 测试代码、逐轮数据和录音验证流程已开放: 仓库提供拨号 harness、离线 analyzer、每通电话的逐轮 timing 与 discard 信息,并可通过 verify_run.py 根据公开录音和 SHA256 重新计算榜单结果。

 

https://openbenchmarks.com/voice-agent-latency

 

https://github.com/openbenchmarks-labs/voice-agent-latency

02 有亮点的产品

1、Grok 上线 Voice connector:支持生成个性化播客与每日简报自动化

 

2bb6e9cddfe5208d78fc7603bf26a257

 

 

(@Grok)

 

2、Deepgram - 新语音即将上线预告

 

73095444b5bc55b9c60047b2aef5f73e

 

6f1ae9ef887835bd369b937341ada96d

 

 

(@Deepgram)

 

3、HappyRobot 完成 1.5 亿美元 Series C:估值 12 亿美元,服务 150+ 企业客户

 

0258aed0c865e6a1932fefabbf3bc37f

 

 

HappyRobot 完成 1.5 亿美元 Series C 融资,投后估值达到 12 亿美元。公司从物流货运场景切入企业 Voice Agent 与流程自动化,目前已服务超过 150 家企业客户,并继续扩展电话、邮件和真实业务流程处理能力。

 

  • Series C 融资金额为 1.5 亿美元: 本轮融资后,公司估值达到 12 亿美元。

  • 企业客户超过 150 家: 已披露客户包括 DHL、Uber 等企业。

  • 营收较 Series B 后增长 5 倍: 公司披露自上一轮融资以来,营收实现 5 倍增长。

  • 净收入留存率超过 150%: 现有客户的扩展使用推动收入继续增长。

  • 产品聚焦真实业务流程自动化: HappyRobot 的 Voice Agent 可用于打电话、发送邮件,并参与物流及其他企业流程处理。

 

https://www.happyrobot.ai/blog/happyrobot-seriesc-fundraising-announcement

 

(@HappyRobot )

 

4、AI 助听器公司飞声完成数千万元天使+轮融资:由慧和资产领投,方瑞资本担任财务顾问并跟投

 

3a8a5ee7d58e4fe1ab79c2a1a4d65dfe

 

 

AI 助听器公司飞声完成数千万元天使+轮融资,由慧和资产领投,方瑞资本担任财务顾问并跟投,资金将用于产品研发、算法迭代、医疗器械认证及市场拓展。公司正在推进开放式 AI 助听器 B02,通过端侧声学模型处理环境声音,并针对开放式结构中的啸叫问题进行算法抑制。

 

  • 最高 50dB 增益下进行啸叫控制: 飞声称,其算法会在声音输出前识别可能导致啸叫的共振特征并进行抑制;B02 同时定制更大尺寸动圈单元和耳帽,以兼顾增益、佩戴稳定性和漏音控制。

  • 声学 AI 模型部署在端侧: 助听器需要实时采集环境音,并在十毫秒内区分人声与噪声,再根据用户不同频段的听力损失进行补偿;由于延时要求较高,飞声未采用云端大模型处理这部分声学任务。

  • 通过 App 完成听力测试与增益调节: 用户可先在 App 内完成听力测试,系统再依据测试结果调整不同频段的声音增益,减少对传统线下验配流程的依赖。

  • B02 海外众筹金额已达数百万美元: 文章称,该产品已获得批量订单;飞声同时正在推进欧盟和美国医疗器械认证。

  • H8 底噪为 5dB: 飞声此前推出面向轻度至重度听损人群的 H8,并称其 5dB 底噪低于外资头部品牌高端产品常见的 15–25dB 水平。

 

硬氪首发 | 开放式AI助听器完成数千万元天使轮融资,海外市场已众筹数百万美金

 

(@硬氪)

03 有态度的观点

1、Meta CEO Mark Zuckerberg 发文阐述 Meta 构建超级智能哲学与愿景

 

Meta CEO Mark Zuckerberg 近日发文系统阐述其构建超级智能的哲学:AI 的终点不应该是把更多工作交给机器,而是把更强的能力交到每个人手中。他认为,超级智能最重要的贡献将是「发明」,而不是「自动化」。

 

在 Zuckerberg 描绘的未来里,每个人都会拥有一个持续工作的个人超级智能 Agent。它不仅回答问题,还会理解用户的目标和长期偏好,帮助处理健康、职业、财务、家庭管理和创作等事务,并可以通过眼镜等设备随时参与现实世界。Meta 还计划提供面向数十亿人的免费版本,让超级智能尽可能广泛地分布。

 

这也构成了 Meta 与其他 AI 实验室在路线上的核心分歧。Zuckerberg 认为,如果超级智能主要服务于企业、政府和少数机构,AI 会进一步放大机构与个人之间的权力差距;相比之下,Meta 希望把超级智能做成一种「个人能力放大器」,让普通人也获得过去只有大型组织才能拥有的研究、创造和执行能力。

 

因此,他甚至对当前 AI 行业围绕「对齐」的主流叙事提出质疑:不存在一个能够代表所有人价值观的、唯一正确的超级智能。真正的安全机制,不是把能力集中到少数人手里,而是通过广泛分发超级智能形成新的「权力平衡」。

 

92cd7e70db3e926d40381bcfd6d4d303

 

 

https://www.meta.com/thefutureisforeveryone/

 

(@Mark Zuckerberg)

04 社区黑板报

招聘、项目分享、求助……任何你想和社区分享的信息,请联系我们投稿。(加微信 creators2022,备注「社区黑板报」)

 

1、赛事推荐:AI 社会科学家研究挑战赛:开启AGI时代的社会科学研究之旅

 

由清华大学计算社会科学与国家治理实验室、清华大学电子工程系主办的「AI 社会科学家研究挑战赛」正式启动。赛事基于 AgentSociety² 平台,参赛者可以构建大规模智能体社会,通过 Agent 之间的交互,研究政策治理、数字经济、信息传播、社会演化,以及人类与 AI Agent 共存等问题。

 

这也是一个很值得 Agent 开发者关注的方向:把智能体从“完成任务”进一步推向“模拟社会”——让多 Agent 系统成为研究复杂现实世界的一种实验基础设施。

 

赛事设置 7 大研究方向,总奖金及 LLM API 支持共 18 万元,支持 3–5 人跨学科组队。

 

🗓 9 月 15 日初筛

 

🏆 10 月 25 日现场评审及颁奖(暂定)

 

感兴趣的开发者、研究者,尤其是正在关注 Multi-Agent、Agent Simulation、AI for Science / Social Science 的朋友,可以关注一下。

 

264b9178e6a6cfce9fb1c03eebff700d

 

 

赛事发布|AI 社会科学家研究挑战赛:开启AGI时代的社会科学研究之旅

 

image

 

79e3f83e1a30a6b675f91f4c177875eb

 

 

阅读更多 Voice Agent 学习笔记:了解最懂 AI 语音的头脑都在思考什么

 

写在最后:

 

我们欢迎更多的小伙伴参与 「RTE 开发者日报」 内容的共创,感兴趣的朋友请通过开发者社区或公众号留言联系,记得报暗号「共创」。

 

对于任何反馈(包括但不限于内容上、形式上)我们不胜感激、并有小惊喜回馈,例如你希望从日报中看到哪些内容;自己推荐的信源、项目、话题、活动等;或者列举几个你喜欢看、平时常看的内容渠道;内容排版或呈现形式上有哪些可以改进的地方等。

 

091c21a5524d9821bb89b7c8a2dfd1eb

 

 

作者提示: 个人观点,仅供参考

http://www.jsqmd.com/news/1375710/

相关文章:

  • 2026秦皇岛废旧设备回收公司推荐:秦皇岛耐鑫再生资源回收有限公司(秦皇岛服务中心) - 品牌优推
  • 成都童装店招商源头公司怎么合作?轻库存参考成都昊祎裳童装集合店(成都销售中心) - 品牌优推
  • 咨询石家庄评价高的工序间水性防锈剂源头厂家电话石家庄高新区海怡防腐科技(石家庄销售中心) - 热点品牌推荐
  • 谈河北360度旋转坦克车优质厂商怎么联系河北科达起重机械制造有限公司(河北运营中心) - 热点品牌推荐
  • 2026 年更新:福海比较好的风化岩边坡防护网供应商哪家可靠,这种不起眼的玩意儿,竟能牢牢锁住风化岩边坡,躲过了多少灾?-思顺丝网 - 行业推荐官【认证】
  • 天津高效的企业员工专用定制手机系统科技企业怎么选天津全域(天津营销部) - 热点品牌推荐
  • 即梦去水印靠谱吗?2026软件介绍、使用方法与收费 - 免费软件工具方法教程
  • 酒店全宅定制成本明细?认准固安县辰虹京瑞建材家具中心(固安县销售中心) - 品牌优推
  • 2026年找专业的二手房买卖侵权纠纷律师事务所 李政宇(山东长城长律所) - 品牌优推
  • 四川专业的建筑模壳制造厂有哪些2026年优选重庆钰塑新型建材有限公司(四川联络处) - 热点品牌推荐
  • 苏州口碑好的PFA喷涂厂家推荐哪家,裕锦欣(苏州)金属制品有限公司(苏州销售部) - 热点品牌推荐
  • 福建海鲜牛肉火锅餐饮店有哪些2026海大富自选海鲜火锅(福建销售中心) - 热点品牌推荐
  • 给git配置指定代理
  • 2026 年至今,扎赉特旗正规的金属雕花防火保温装饰板厂家哪家专业,冬天车间温度低到穿大衣?装了这玩意儿的厂房连暖气费都省一半-锦泓盛金属雕花板 - 行业推荐官[官方】--
  • 查许昌丝接管件源头厂家联系电话建议直连实力供应商峰顺贸易(许昌营销部) - 品牌优推
  • 2026年河南马场垫料刨花机厂家联系电话查询与选购指南 - 热点品牌推荐
  • 广东工业级黄原胶厂怎么选 实用采购选型全攻略 - 热点品牌推荐
  • 辽宁专业的GRC构件源头厂家推荐几家2026年优选沈阳科创建筑材料有限公司(辽宁服务中心) - 品牌优推
  • 天津地区2026宝马7系无损改装店科普介绍 - 起跑123
  • 郑州机制净化板批发厂家推荐,2026年优选河南普源新型材料有限公司(郑州销售中心) - 品牌优推
  • 2026年河北高粘度黄原胶定制厂家选购实用参考指南 - 热点品牌推荐
  • 2026年8月靠谱的镀锌管/热镀锌方管 厂家优选 - 海棠依旧大
  • 河北光之翼数字孪生服务商怎么联系?2026年对接光之翼信息(河北办事处)指南 - 热点品牌推荐
  • 东莞专业的优盘挂绳生产厂家怎么选?参考东莞汇彩绳带(东莞运营中心) - 热点品牌推荐
  • 东莞优质的CNC铝件加工生产厂家怎么选认准银辰精密(东莞营销部) - 热点品牌推荐
  • 南平快递打包机器公司/全自动快递打包机公司电话-银铃智能科技 - 行业推荐官[官方】--
  • 2026 年现阶段丹棱靠谱的无机纤维喷涂施工公司哪家好,家里做隔热隔音还能省30%钱?这门手艺藏着普通人不知道的门道-征振保温工程无机纤维喷涂施工 - 行业推荐官[官方】--
  • 2026天津宝马7系无损改装相关门店信息梳理 - 起跑123
  • 海南食品级黄原胶厂哪家强 食品添加剂供应商选型参考 - 热点品牌推荐
  • 成都培训学校消防改造第三方服务机构推荐哪家结合流程选福睿德消防(成都服务中心) - 热点品牌推荐