阿里发布Qwen-Audio-3.1,语音模型从生成迈向创作

9月23日,在2026云栖大会上,阿里巴巴发布Qwen-Audio-3.1系列语音大模型,语音转写(ASR)、语音合成(TTS)和实时语音交互(Realtime)三类模型全面升级,API服务均已上架千问AI平台。同时,为进一步降低用户使用成本,Qwen-Audio全线语音模型价格均下调,最高降幅达95%。

在语音转写方面,Qwen-Audio-3.1-ASR进一步增强多语种、方言识别与上下文理解能力,并新增原生转写润色能力,可自动去除语气词与重复表达并重组语义,让转写的文字更顺畅、更有逻辑。同时,基于下代架构的音频理解模型Qwen-Audio-3.1-ASR-Next全新发布,它能够理解人物情绪、环境声与机械声,完成声音描述、事件定位、音频问答与推理,让“这段录音中人的情绪怎样”这样的问题能够被理解和准确回答。

在语音合成方面,基于下代音频创作模型Qwen-Audio-3.1-TTS-Next全新亮相。过去,制作一段完整音频通常需要主播、音效师、混音师和剪辑师分工合作,分别制作人物对白、音效和背景声,再进行后期剪辑与合成。新模型采用语言模型与扩散模型协同的统一生成框架,将单一的人声合成扩展为通用音频生成系统,可实现一次生成人声、音效和背景声,大幅提升有声书、影视剧、播客、游戏、广告等专业创作效率。现在,输入一段深夜天台的双人对话脚本,模型既能讲述旁白、表现不同人物的音色与情绪,也能同时生成城市低鸣、晚风和易拉罐碰撞声等音效与环境音,让对话听起来就发生在故事场景里。

在语音实时交互方面,全新升级的Qwen-Audio-3.1-Realtime听得更懂,更会接话,更会共情,甚至可以主动调用Agent工具完成任务。现在,新模型与人的交互完全可以做到同时说和听,这种极强的全双工交互能力让用户可以随时插话、打断,交流体验更接近真人通话。模型还增强了共情能力,当识别到用户语气低落时,不再机械回复“我理解你的感受”,而是放慢语速,以更贴合语境的方式回应。同时,阿里开源了面向实时语音Agent的框架Qwen-Audio-Agent,帮助开发者快速搭建面向不同场景的实时语音Agent,也让用户以更自然、流畅的语音对话调用Agent。

 

点赞

发表评论

邮箱地址不会被公开。 必填项已用*标注