🧊 前沿科技知识库
全部 / 人工智能(AI)

对话助手与语音(Conversational Assistants & Voice)

2026-09-26 · 人工智能(AI)
最后更新:2026-09-26 | 领域:AI·提示、Agent 与应用 | 说明:信息来源为公开网络资料,详见文末参考来源

概述

对话助手与语音技术栈由四层构成:语音识别(ASR,语音转文本)、语音合成(TTS,文本转语音)、实时语音对话模型(speech-in / speech-out,端到端低延迟交互),以及承载它们的消费级助手生态(如 Siri、Alexa+、Gemini)。2026 年的关键变化是:实时语音 API 开始支持语音直进直出的对话,且主要平台把"对话式 AI"作为一等公民能力对外提供(Use the GPT Realtime API via WebRTC — Microsoft Learn)。

最新进展(2025–2026)

实时语音(Realtime):Azure OpenAI 的 GPT Realtime API 面向语音与音频,属于 GPT-4o 模型家族,支持低延迟的 "speech in, speech out" 对话交互,可通过 WebRTC、SIP 或 WebSocket 传入音频并实时接收音频响应(Use the GPT Realtime API via WebRTC)。不同接入方式的典型延迟不同:WebRTC 面向客户端应用,约 100ms;WebSocket 面向服务端到服务端,约 200ms;SIP 用于电话/呼叫中心集成,延迟视网络而变(Use the GPT Realtime API for speech and audio)。OpenAI 官方介绍了第三代语音系统 GPT-Live:它把"轮次检测器"(turn detector)从音频路径中移除,语音模型为 full-duplex(全双工),可同时听与说,从而让对话更即时自然;当需要更深推理或工具调用时,GPT-Live 可调用 GPT-5.5 等前沿模型而不打断对话流(How we built a realtime system for responsive voice AI in six months)。Google 侧的 Gemini 系列在 2026 年推出 gemini-3.8-live,被定位为大多数低延迟语音 Agent 体验与实时对话的默认选项,官方称其"不会有推理延迟",功能包括交错推理、默认异步函数调用,以及完整会话的客户端上下文更新(Gemini API 版本资讯)。

TTS:据报道,Google 于 2026 年 9 月 23 日推出 Gemini 3.8 Flash TTS 与 Gemini 3.8 Flash-Lite TTS 两款文本转语音模型,前者面向声音与角色设计,支持用自然语言创建定制声音并逐句控制语气、语速、口音等,后者面向大规模音频生成与配音(数智周报)。开源与闭源 TTS 竞争加剧:一份 2026 年榜单以 Elo 给出 ElevenLabs Eleven v3 为 1,177(闭源,作为参照)、Fish Audio S2 Pro 1,125(研究性非商业许可)、StepFun Step Audio EditX 1,102(Apache 2.0)、Mistral Voxtral TTS 1,082 分(Best Open Source Self-Hosted Text-to-Speech Models in 2026)。

ASR:ElevenLabs 推出 Scribe v2 Medical,并在临床音频上把词错误率(WER)相对基础 Scribe v2 模型降低约 35%,用于弥补通用模型在临床工作流上的退化(Scribe v2 Medical is now available to everyone)。开源侧,OpenAI Whisper 仍是参考级开放 ASR 模型,其价值更多体现在许可与可移植性:模型尺寸从 tiny(约 39M 参数、约 1GB 显存)到 large(1.55B 参数),仓库同时提供多种规模(Speech-to-Text Models Compared 2026);一份 2026 年开放 ASR 对比给出 Whisper large-v3 的平均 WER 为 7.44、支持 99 种语言与英译、MIT 许可、速度在对比组中最慢(large-v3-turbo 把解码器减到 4 层),其架构为 encoder-decoder Transformer、128 个 Mel 频带、在 100 万小时标注数据 + 400 万小时伪标注数据上训练(Best Open Speech Recognition (ASR) Models in 2026)。新的多语种基准 GigaSpeechBench 则把 Qwen3-ASR-1.7B、Whisper-large-v3、NVIDIA NeMo Canary 与 Meta OmniASR-LLM-3B 等纳入统一评测(GigaSpeechBench)。

助手生态:Apple 于 2026 年 6 月发布 Siri AI,官方称其为"能力大幅提升、更具对话性"的个人助手(Apple introduces Siri AI),并在 2026 年 9 月宣布其正式发布(Siri AI is here);据媒体报道,新 Siri 支持多轮对话、可基于实时世界知识作答、并直接嵌入 Dynamic Island,配有重新设计的语音引擎与可在初始化时微调的声音设置(Apple Announces 'Siri AI' at WWDC 2026 — MacRumors)。Amazon 的 Alexa+ 持续国际扩张,2026 年 9 月 16 日登陆印度,此前已进入美国、英国、加拿大、墨西哥、意大利、西班牙、德国、奥地利、巴西、法国、澳大利亚等市场,并计划在 2027 年扩展至 10 多个国家(Alexa+ arrives in India)。

核心技术与关键概念

端到端语音模型 vs 级联管线:传统方案为 ASR → LLM → TTS 三级级联,延迟累加;实时语音 API 则直接做语音到语音,缩短首字响应时间、保留韵律与情感线索(Use the GPT Realtime API via WebRTC)。OpenAI 描述的 GPT-Live 采用全双工模型、去除了独立轮次检测器,代表"端到端语音"路线的进一步演进(Continuous voice interaction with GPT-Live)。

关键指标:TTFA(Time To First Audio,首音频时间)与词错误率(WER)是语音栈的两个核心度量;离线场景还看 RT factor(实时倍率)(Best AI Models for Voice and Speech;AI Voice and Speech Leaderboard)。接入层的工程指标还包括端到端延迟:WebRTC 约 100ms、WebSocket 约 200ms(Microsoft Learn)。

语音克隆与情感表达:声音质量与克隆能力是 TTS 差异化的关键,多语言情感深度、跨语言传递说话者情感成为新一代卖点(I Benchmarked the Voice AI Stack in May 2026;ElevenLabs 中文官网)。

对话式 AI 平台:以 ElevenLabs Conversational AI 为代表,把 TTS、ASR、LLM 与编排能力打包,允许通过 UI、API 或 SDK 接入不同前沿模型(如 GPT-5)构建企业级语音 Agent(GPT-5 Available in ElevenLabs Conversational AI)。

语音 Agent 的延迟预算:呼叫中心场景把"用户说完到 AI 开口"的延迟拆解为 STT、分流、检索、LLM 首 token 与 TTS 各环节,并给出一个参考预算:端到端 p95 控制在 2.5 秒以内,其中 STT 约 500ms、分流 200ms、检索 800ms、LLM 首 token 500ms、TTS 250ms,常用优化手段包括并行执行、缓存与流式输出(Contact Center AI Architecture for Voice AI (2026))。由于人类自然对话停顿约 200–300ms,低于 700ms 的响应通常被视为"自然"(Best Voice Agents for Call Centers in 2026 — Retell AI);真实 PSTN 电话链路还会在 AI 处理前额外引入约 200–500ms 的 SIP 路由、运营商跳数、抖动缓冲与编解码转换延迟(Speech latency in voice AI — Parloa)。

消费级助手的架构重建:Amazon 官方称 Alexa+ 建立在全新架构上,由 Amazon Bedrock 上的大语言模型驱动,连接数百个服务与设备,把"理解意图"转化为"执行动作",并可在被打断或用不完整表达时继续对话(Alexa+ launches in Italy);另有官方说明称 Alexa+ 由 Amazon Nova 与 Anthropic 的大语言模型共同驱动(Alexa+ now available to everyone in the US)。Amazon 还表示重建 Alexa 需要一系列技术突破,包括让 LLM 可靠地编排 API 与创造全新的 agentic 能力,且 Alexa+ 已在美国面向所有人开放、对 Prime 会员免费(Getting started with Alexa+)。

代表性项目 / 产品(附官方链接)

关键数据与评测结果

趋势与争议

一是实时语音成为默认交互层:gemini-3.8-live 被官方定位为"大多数低延迟语音 Agent 与实时对话的默认选项"(Gemini API 版本资讯),OpenAI 亦以全双工 GPT-Live 取代轮次检测器(OpenAI),说明语音不再只是附加功能。二是助手生态的模型外包与阵营化:有第三方分析称 Siri 2026 的"大脑"部分依赖 Google Gemini 后端并可与 ChatGPT 交接,Alexa+ 被称由 Claude 驱动,且 Siri 绑定 Apple 硬件、Alexa+ 对 Prime 会员免费(或 $19.99/月)(Siri vs Alexa in 2026;Alexa+ vs Gemini Voice vs Siri 2026)——此类说法来自第三方媒体,官方未逐一确认;Amazon 官方仅确认 Alexa+ 使用 Amazon Nova 与 Anthropic 模型(About Amazon)。三是开源 TTS 的许可分歧:Mistral Voxtral TTS 被一份来源标注为 Apache 2.0、并被称在 68% 盲测中胜过 ElevenLabs(免费语音模型),而另一份榜单标注其许可为 CC BY-NC 4.0(非商业)(Best Open Source Self-Hosted TTS Models in 2026),许可表述不一致需以官方仓库为准。四是硬件与软件解耦的延期争议:有报道称 Apple 的 HomePad 硬件早已完成,延期完全源于需等待新版 Apple Intelligence 驱动的 Siri(Gemini for Home vs. Alexa+ vs. Siri)。五是模型退役节奏:OpenAI 已于 2026 年 2 月 13 日在 ChatGPT 中停用 GPT-4o 等模型(仍可通过 API 使用),提示依赖特定语音模型的系统需关注生命周期(停用 GPT-4o 和其他 ChatGPT 模型)。

参考来源

  1. Use the GPT Realtime API via WebRTC — Microsoft Learn
  2. Use the GPT Realtime API for speech and audio — Microsoft Learn
  3. How we built a realtime system for responsive voice AI in six months (GPT-Live) — OpenAI
  4. Gemini API 版本资讯 — Google AI for Developers
  5. 数智周报(Gemini 3.8 Flash TTS)
  6. Scribe v2 Medical is now available to everyone — ElevenLabs
  7. Apple introduces Siri AI — Apple Newsroom (2026-06)
  8. Siri AI is here — Apple Newsroom (2026-09)
  9. Apple Announces 'Siri AI' at WWDC 2026 — MacRumors
  10. Alexa+ arrives in India — About Amazon
  11. Getting started with Alexa+ — About Amazon
  12. Amazon's Alexa+ launches in Italy — About Amazon
  13. Alexa+ now available to everyone in the US — About Amazon
  14. Best AI Models for Voice and Speech (June 2026)
  15. AI Voice and Speech Leaderboard: TTS and STT Rankings
  16. Best Open Source Self-Hosted Text-to-Speech Models in 2026
  17. TTS Arena: Human Preference Leaderboard
  18. TTS Model Quality Ranking 2026: Speech Arena Results
  19. 7 бесплатных голосовых моделей (Voxtral TTS)
  20. I Benchmarked the Voice AI Stack in May 2026
  21. ElevenLabs 中文官网
  22. GPT-5 Available in ElevenLabs Conversational AI
  23. openai-whisper on PyPI
  24. WhisperKit: On-device Real-time ASR with Billion-Scale Transformers
  25. Benchmarking Large Pretrained Multilingual Models on Québec French Speech Recognition
  26. Siri vs Alexa in 2026 — Elephas
  27. Alexa+ vs Gemini Voice vs Siri 2026
  28. Gemini for Home vs. Alexa+ vs. Siri: The 2026 AI Assistant War
  29. 停用 GPT-4o 和其他 ChatGPT 模型 — OpenAI Help Center
  30. Speech-to-Text Models Compared 2026: Whisper, Deepgram, AssemblyAI, ElevenLabs Scribe
  31. Best Open Speech Recognition (ASR) Models in 2026: WER, Languages, Latency, and License Compared
  32. GigaSpeechBench: A Real-World Multilingual Speech-to-Text Benchmark
  33. Contact Center AI Architecture for Voice AI (2026)
  34. Speech latency in voice AI — Parloa
  35. Best Voice Agents for Call Centers in 2026 — Retell AI
  36. 8 Best Voice AI Agent Companies for Contact Centers (2026) — Retell AI
← 音乐与音频生成扩散与图像生成 →