8月5日,腾讯混元正式推出新一代语音识别模型Hy ASR 3.0 preview版本。该模型基于混元3大模型底层语义能力重构,重点优化嘈杂环境、多人交替对话、带口音中文识别效果,解决传统语音转写容易断句、语义错乱的痛点。
新版本支持长音频实时流式转写,可自动区分说话人,输出带角色标记的文本结果,适用于线上会议、直播内容归档、客服录音分析等业务。官方同时开放API接口与私有化部署包,企业可部署在内网完成语音数据处理,保障数据不外泄。
产品同时支持中英混合语句识别,降低多语言混合场景下转写错误率。
专业解读:AI语音不再是独立技术模块,大模型赋能语音成为行业趋势。语音+大模型结合,将拓展智能客服、线下政务窗口、工业语音巡检等落地场景,多模态能力会成为大模型厂商的标配竞争力。