AI 快讯DeepSeek灰度上线语音对话
产品更新

DeepSeek灰度上线语音对话

2026-09-12T05:04:37.611Z
DeepSeek灰度上线语音对话

DeepSeek正在App端小范围灰度测试AI语音对话,获得测试资格的用户可通过右上角喇叭入口进行实时语音交互,并在设置中选择贝壳、白浪、海星、暗潮四种音色。

DeepSeek开口说话了:灰度测试语音对话,新增四种音色

DeepSeek正在App端灰度测试AI语音对话功能,部分获得测试资格的用户已经可以在右上角看到喇叭按钮,并让AI直接用声音回答问题。与此前仅支持语音转文字输入不同,这次更新补上了语音回复这一环,DeepSeek开始从“会读懂语音”走向“能和人说话”。

目前,这仍是一项小范围测试,不是面向所有用户的正式发布。测试用户可以在设置页面找到“朗读音色”选项,四种内置音色分别是:贝壳、白浪、海星和暗潮。官方暂未公布完整的开放范围、语音模型、延迟、使用限制和正式上线时间。

DeepSeek App右上角喇叭入口与四种朗读音色设置页面示意图

这次更新具体增加了什么

AI语音对话是指用户通过语音提出问题,AI经过识别和推理后,再以连续语音回复的交互方式。它和普通的语音输入并不是一回事:前者只负责把人说的话转成文字,后者还要完成语音合成、播放控制以及连续轮次管理。

从目前披露的信息看,DeepSeek此次更新包含三个可确认的变化。

第一,App首页右上角出现了一个小喇叭入口。获得灰度资格的用户点击后,可以开启语音实时对话交互。这个入口放在主界面而不是隐藏在实验室页面,说明语音功能已经进入真实用户验证阶段,而不只是内部演示。

第二,设置页面新增“朗读音色”选项。用户可以根据偏好切换四种声音,而不是只能使用系统默认音色。音色命名和风格描述如下:

| 音色 | 官方描述 | 更适合的使用场景 | |---|---|---| | 贝壳 | 百变活泼 | 日常问答、轻松聊天、儿童或家庭场景 | | 白浪 | 明朗坚定 | 信息播报、知识讲解、任务确认 | | 海星 | 俏皮甜美 | 休闲对话、陪伴式交流 | | 暗潮 | 低沉浑厚 | 长文朗读、严肃内容、夜间收听 |

第三,DeepSeek新增了AI语音回复能力。此前它已经支持语音转文字输入,用户可以按住或点击语音入口说话,再由系统将语音识别为文本;本次灰度则让回复也变成声音,完整语音对话链路因此基本成形。

需要注意的是,四种音色目前只是风格选择,不等于四个不同人格,也不代表每种声音背后对应一个独立模型。音色主要影响合成语音的声线、语气和听感,回答内容仍取决于DeepSeek所使用的对话模型、上下文和系统策略。

为什么“能说话”对DeepSeek很重要

语音不是聊天App加上的一个装饰按钮,而是AI助手从文字工具转向实时交互产品的关键入口。文字对话要求用户持续看屏幕、阅读和输入;语音对话则允许用户在走路、做家务、开车前后或不方便打字时完成交流。

对DeepSeek而言,语音能力的价值首先在于补齐产品形态。此前主流AI助手已经普遍提供语音输入、语音输出或全双工对话,用户对“直接开口问、听AI回答”的预期已经形成。如果一个模型在文本能力上有竞争力,但仍然只能以文字回应,它在移动端的使用频率和场景覆盖就会受到限制。

其次,语音会改变用户评价AI的方式。文字回答可以慢几秒,用户通常会边看边读;语音回答如果出现明显停顿、抢话、重复或机械重音,体验会立刻变差。语音产品比纯文本产品更容易暴露延迟、识别错误和上下文管理问题。换句话说,DeepSeek现在面对的已经不只是“模型答得对不对”,还包括“它说得像不像一个可用的助手”。

再次,语音能够带来更长的自然交互。很多用户愿意输入一两句文字,却不一定愿意把复杂背景完整打出来;面对语音,他们可能会连续补充信息、修正前一句话,或者用更接近日常交流的方式描述需求。这会让AI获得更丰富的上下文,但也会增加识别歧义、隐私保护和对话打断处理的难度。

四种音色有用,但决定体验的不是名字

音色选择的意义在于让AI更像一个可以长期使用的产品,但四种声音本身并不能证明DeepSeek的语音体验已经达到行业领先水平。真正决定可用性的,主要是以下几项技术指标。

1. 首字节延迟决定“像不像实时对话”

语音交互中的首字节延迟,是用户停止说话到听见AI第一个声音片段之间的时间。延迟越低,用户越容易把它当成实时交流;如果等待时间过长,即使最终回答质量不错,也会让产品像“先录音、再播放”。

目前参考资料没有披露DeepSeek语音功能的平均延迟、P95延迟或不同网络环境下的表现,因此不能把它与其他产品进行量化排名。尤其需要区分端到端延迟和单纯语音合成延迟:端到端延迟还包含语音识别、模型生成、服务排队、音频传输和客户端播放缓冲。

2. 打断能力比音色数量更重要

真正自然的语音对话必须支持打断。用户说“等等”“换个说法”或直接开始新一句话时,AI应及时停止播放并处理新输入;如果用户只能等AI说完再继续,这更接近语音朗读器,而不是对话助手。

现阶段公开信息没有说明DeepSeek是否支持连续打断、自动检测用户停顿,以及在多人环境下如何避免误触发。小范围灰度很可能正是为了验证这些细节:同一套语音链路在安静房间里可用,不代表在地铁、办公室或车内也能稳定工作。

3. 音色自然度需要看长文本和多轮对话

短句演示很容易掩盖问题,真正能拉开差距的是长文本朗读、多轮问答、数字和专有名词发音,以及中英文混合内容。一个声音即使听起来“低沉浑厚”,如果读错人名、产品名或技术术语,实际工作价值仍然有限。

四种音色覆盖了活泼、坚定、俏皮和低沉四种明显风格,选择范围已经足够应付基础场景。但产品是否允许用户调节语速、停顿和情绪强度,目前尚未公布。对开发者和深度用户来说,这些控制能力往往比音色数量更重要。

和主流AI助手相比,DeepSeek还缺一张成绩单

DeepSeek此次更新的优势是补齐了移动端产品的关键短板,且四种音色提供了清晰的差异化入口;它的不足则是公开信息有限,暂时没有性能数据,无法判断语音质量和交互效率处于什么水平。

| 对比维度 | DeepSeek本次灰度测试 | 行业成熟语音助手的常见能力 | 当前判断 | |---|---|---|---| | 语音输入 | 此前已支持 | 普遍支持 | 不再是差异点 | | AI语音回复 | 新增灰度测试 | 普遍支持 | 补齐基础能力 | | 可选音色 | 4种:贝壳、白浪、海星、暗潮 | 通常提供多种声音和风格 | 数量够用,质量待测 | | 实时打断 | 暂无公开细节 | 高质量产品通常支持 | 需要实际体验验证 | | 端到端延迟 | 暂无公开数据 | 通常强调低延迟 | 暂时无法比较 | | 全量开放 | 尚未全量开放 | 正式功能一般面向全部用户 | 仍处于验证阶段 |

这个对比说明,DeepSeek现在最值得关注的不是“新增了四种声音”这条产品宣传点,而是它能否把识别、推理、合成和播放压缩到足够短的等待时间里。如果只能点击后等待较长时间,再听一段无法打断的语音,四种音色的实际价值会明显下降。

对用户来说,现在值得尝试吗

如果你的账号已经出现喇叭入口,值得试用,但不建议把它当作已经成熟的全天候语音助手。测试时可以重点观察四件事:

  • 响应速度:从说完问题到听见第一句话需要等待多久,网络切换后是否明显变慢。
  • 识别准确率:人名、英文缩写、数字、代码术语和方言口音是否容易被识别错。
  • 多轮连贯性:追问、改口和补充条件后,AI能否保持上下文,而不是每次都重新回答。
  • 打断和恢复:AI朗读时能否被自然打断,打断后是否会重复已经说过的内容。

在通勤、整理资料、快速问答和长文听读场景中,语音回复可能比文字更方便;在涉及密码、合同、代码、财务数字和敏感工作内容时,仍然建议优先使用文字并检查原文。语音输出听起来流畅,不代表事实一定正确,尤其不能把“说得像人”误认为“判断更可靠”。

对开发者意味着什么

DeepSeek此次更新暂时是App端产品灰度,并没有公开新的语音模型名称、API端点、价格或开发者接入文档,因此开发者不应据此推断已有文本模型接口会自动获得语音能力。对于需要在产品中集成语音的团队,仍应把语音识别、文本推理、语音合成和会话状态视为独立模块,分别评估延迟、成本、稳定性和数据合规。

更值得观察的是,DeepSeek是否会在后续开放语音能力给开发者,以及是否提供流式音频、打断控制、时间戳、音色参数和多语言支持。如果这些能力开放,DeepSeek的竞争就不再只是模型回答质量的竞争,而会进入智能客服、车载助手、教育陪练和无障碍交互等更具体的产品场景。

但在正式文档、价格和性能数据公布之前,任何关于“行业最低延迟”或“音质领先”的判断都缺少依据。当前可以确认的结论只有一个:DeepSeek正在把语音回复从缺席状态补上,但它距离证明自己是一款成熟的实时语音助手,还有一段需要通过灰度测试完成的路。

OpenAI Hub判断

DeepSeek这次更新的战略意义大于功能新鲜感。四种音色解决的是“AI应该用什么声音说话”,而真正的产品竞争将集中在“它多久开始说、能否听懂、能否被打断,以及连续聊十分钟后是否仍然可靠”。

对普通用户来说,这是一次值得尝试的产品补齐;对深度用户来说,它更像一个信号:DeepSeek正在从以文本模型为中心,转向同时经营移动端助手体验。灰度测试说明功能还没有完成最终验证,暂时不适合下“已经追平所有主流语音助手”的结论。等到全量开放并披露更完整的延迟、音质和隐私说明后,才能判断它究竟是一次跟进,还是一次真正有竞争力的产品升级。

参考来源

  1. IT之家:DeepSeek开口说话了:灰度测试AI语音对话,支持四种音色——提供App喇叭入口、四种音色及灰度测试信息。

注:截至2026年9月12日,公开资料尚未披露该功能的全量上线时间、语音模型名称、端到端延迟、调用价格及开发者接口。

相关推荐

查看全部