上证报中国证券网讯(记者 杨翔菲)9月23日,在2026云栖大会上,阿里巴巴发布Qwen-Audio-3.1系列语音大模型,语音转写(ASR)、语音合成(TTS)和实时语音交互(Realtime)三类模型全面升级,API服务均已上架千问AI平台。同时,为进一步降低用户使用成本,Qwen-Audio全线语音模型价格均下调,最高降幅达95%。在语音转写方面,Qwen-Audio-3.1-ASR进一步增强多语种、方言识别与上下文理解能力,并新增原生转写润色能力,可自动去除语气词与重复表达并重组语义,让转写的文字更顺畅、更有逻辑。同时,基于下代架构的音频理解模型Qwen-Audio-3.1-ASR-Next全新发布,它能够理解人物情绪、环境声与机械声,完成声音描述、事件定位、音频问答与推理,让“这段录音中人的情绪怎样”这样的问题能够被理解和准确回答。在语音合成方面,基于下代音频创作模型Qwen-Audio-3.1-TTS-Next全新亮相。新模型采用语言模型与扩散模型协同的统一生成框架,将单一的人声合成扩展为通用音频生成系统,可实现一次生成人声、音效和背景声,大幅提升有声书、影视剧、播客、游戏、广告等专业创作效率。在语音实时交互方面,全新升级的Qwen-Audio-3.1-Realtime听得更懂,更会接话,更会共情,甚至可以主动调用Agent工具完成任务。模型还增强了共情能力,当识别到用户语气低落时,不再机械回复“我理解你的感受”,而是放慢语速,以更贴合语境的方式回应。同时,阿里开源了面向实时语音Agent的框架Qwen-Audio-Agent,帮助开发者快速搭建面向不同场景的实时语音Agent,也让用户以更自然、流畅的语音对话调用Agent。

暂无评论