AI前沿 | 2026年9月19日蚂蚁 Realtime-Venus 全双工音视频 Agent 异步委派 打断式交互首屏导读 · 本教程配套付费专栏《大模型工程师修炼手记》19.9 元AI 编程 · Agent 实战 · 本文同主题系统课程· 《AI时代程序员的自我提升》49.9 元AI 时代成长方法论单篇不过瘾订阅解锁全量源码、实战与答疑文末附资料包领取方式 ↓本期导读9 月 18 日蚂蚁百灵在 Hugging Face 开源Realtime-Venus 全双工音视频交互系统一次性放出两个 9B 模型Realtime-Venus-Omni音视频一体、能看到画面与Realtime-Venus-Audio纯语音Apache-2.0 协议、上下文 40,960 tokens。核心卖点是四个字——「全双工」像真人打电话一样能边听边说、被人打断立刻接住、边回应边并行干活异步委派在专用 Full-Duplex-Bench 上面对背景音干扰仍能保持97%的应答率。这不是又一次「语音版大模型」而是把『通话体验』做成了可本地部署的技术栈。本期拆六件全双工到底解决什么体验、模型架构怎么搭、异步委派为什么是杀手锏、性能数字怎么读、对做语音/多模态产品的启示、一个开放问题。一、事件全双工为什么是语音 AI 的「下一个门槛」过去大多数语音助手是半双工的你说一句它停住等它答一句你不能同时插嘴——一轮最多 1-2 秒的「回合制」交互对「点歌、查天气」够用但对电话客服、医患沟通、车载、陪伴式对话远远不够。真人对话的体验核心是重叠我能打断你、你能改口、我们同时说话也互相听得懂。Realtime-Venus 要做的就是把这套「自然的重叠与打断」变成模型能力而不是靠工程拼接ASR 分段 云端排队。全双工 低延迟、可打断、边听边说这是语音 AI 走向「真人级通话」最难的一道坎。二、十个关键数字指标值含义模型数量2 个Omni 音视频 Audio 纯语音一套架构两个形态参数量9B×2可本地部署的中小规模上下文40,960 tokens长对话不丢记忆StreamingBench70.2流式基准超同类基线MMAU78.0Audio 版多模态理解高水准被打断响应75% 打断后 1 秒内接住打断体验核心背音下应答97%背景声干扰嘈杂环境稳定性异步委派流内以 ✂️ 标记发起并直接返回结果边说边干活开源性Apache-2.0可商用可魔改开放形态模型 推理本地部署端侧/私有化三、架构MiniCPM 一脉的把「多模态 离散语音」塞进 9BRealtime-Venus 的底座很有意思——延续了 MiniCPM-o 一族的架构思路视觉编码器 SigLIP2 音频编码 Whisper-Medium音视频统一进模型。语言主干 Qwen3-8B借用成熟 LLM 的对话与推理能力。离散语音 S3 tokenizer用离散符号表示语音让「说话」和「思考」在一个 token 空间里完成。异步委派asynchronous delegation交互中模型可以在流里吐出一个 ✂️ 标记表示「这里我交给一个并行任务去查/去算」随后把结果作为新数据接回来——这是把『边对话边干活』做进模型架构的尝试。四、性能数字怎么读不刷分专做「对话感」Realtime-Venus 公布的成绩单绕开了传统「问答准确率」主线转而量化对话的流畅度打断75% 的打断请求模型能在 1 秒内接住——不是「被按住不说话」而是「立刻续上新的回应」。嘈杂环境面对背景声/他人插话仍保持 97% 的应答率。全双工基准在专门的 Full-Duplex-Bench 上对「背音覆盖」「目标指令」「持续响应」分维度评测。流式榜单StreamingBench 70.2碾压大多数同规模闭源基线。这些数字说明Realtime-Venus 团队把工程精力放在了「对话的节奏感」上——而节奏感恰恰是语音产品留存率的关键。把它放进 2026 年的「全双工竞速」里看位置字节 SeedRealtime 8 月在豆包全量上线Google Gemini 3.8 Live 9 月 15 日发布xAI 同周部署 Grok Bot 语音蚂蚁 9 月 18 日直接开源——闭源与开源两线并进全双工正在从「发布会词条」变成「产品标配」。五、对做语音 / 多模态产品的三点启示「全双工」是差异化卖点不是锦上添花如果你们产品仍按「半双工回合制」设计用户会觉得「像对着对讲机说话」。把可打断、边说边做内建进产品是 2026 年语音产品的及格线。9B Apache-2.0 意味着私有化部署可行敏感行业医疗、金融的语音交互可以本地闭环不必再为「语音 AI」多付一层云端 API 的钱。异步委派值得抄用户在通话中要查资料、算金额、看日程「边说边干活再说回来」是 Agent 进化的方向——能在一个交互里做两件事的语音助手才配叫 Agent。启示Realtime-Venus 开源的意义是把『全双工对话』从头部闭源 API 拉进了开源可复制的区间。对创业者的含义① 如果你做的是终端产品车机、客服、陪伴硬件今天就能用 9B 模型做出真人感对话的 MVP② 全双工体验的技术栈复杂护城河不在「有没有模型」而在「信号质量、打断策略、异步任务编排」这些工程细节才是团队差异点③ 蚂蚁这一手对内是技术中台、对外是开源生态国产语音 Agent 的工程水位被整体抬高了。六、一个开放问题当语音 AI 学会「边听边说、边说边做」以后人对 AI 的『说话边界』要求会反过来提高——全双工对话里的误打断、抢话、回答延迟比一字一句的识别错误更伤信任。那么问题来了一家语音产品的用户留存到底由『识别准确率』决定还是由『对话的等待感与打断权』决定——这个问题的答案可能决定下一代语音交互产品怎么设计。来源Hugging Face inclusionAI/Realtime-Venus2026-09-18/ 蚂蚁百灵官方2026-09-18/ 量子位 QbitAI2026-09-18。本文为 AI 辅助整理的前沿技术解读事实以官方与权威媒体口径为准不构成任何投资建议。 延伸阅读 · 我的付费专栏觉得这篇文章对你有帮助我把同类主题的系统化内容沉淀成了付费专栏欢迎订阅支持持续输出专栏定价内容大模型工程师修炼手记19.9 元AI 编程 / Agent 深度实战AI时代程序员的自我提升49.9 元AI 时代成长方法论 一杯咖啡的价格换来系统化的知识体系你的订阅是我持续创作的最大动力。本文配套代码 / 资料包欢迎在评论区留言「求代码」我会私信发送完整资源