行业资讯

开源黑马 Qwen2-Audio-72B-Instruct 正式开源:中文多模态音频理解全面超越商业闭源,离线语音识别迎来大模型革命

发布时间: 作者:灵声智库团队

【技术前沿速递】8 月 31 日,阿里巴巴通义千问团队正式宣布在 ModelScope 和 Hugging Face 社区完整开源其旗舰级音频大模型 Qwen2-Audio-72B-Instruct。该模型包含 720 亿参数,是目前全球开源社区中规模最大、能力最强的主流开源中文多模态音频基座,同步开放了商业友好的开源协议与配套的端侧推理加速工具链。

在权威评测基准 AIR-Bench 与中文方言语音识别测试集上,Qwen2-Audio-72B-Instruct 在普通话、粤语、四川话、吴语等 20 余种主流方言的识别准确率上全面超越了多款主流闭源商业 API,中文综合字错率(CER)低至 1.7%。更令业界振奋的是,该模型支持 128k 超长音频上下文输入,单次可无间断处理长达 8 小时的连续录音并实时输出结构化纪要与说话人打标,为政企构建自建离线语音识别中台提供了前所未有的强大开源底座。

Qwen2-Audio-72B 开源与离线语音识别大模型架构图

Qwen2-Audio-72B 核心技术演进解析

根据通义千问团队发布的技术架构论文,Qwen2-Audio-72B 的跃升建立在三项核心创新之上:

  1. 双流分级声学特征提取架构:前端集成 8 亿参数的 Whisper-Large 增强编码器提取底层细粒度声学音素,后端连接 72B 稠密语言模型完成深层上下文纠错,实现了“听得清细微杂音、读得懂行业深意”的双重优势。
  2. 支持 128k 超长上下文音频注意力机制:通过引入局部滑动窗口与 RoPE 位置编码扩展,模型能够一次性加载全天会议或庭审笔录,消除长音频切片拼接导致的跨段逻辑割裂。
  3. 针对企业私有化硬件的 INT4/FP8 混合量化支持:开源社区同步贡献了 vLLM 与 TensorRT-LLM 适配加速补丁,将原本需要 8 卡集群运行的 72B 大模型成功压缩至单张消费级 GPU 或国产 NPU 加速卡上稳定跑通,彻底推倒了语音大模型落地的算力门槛。

开发者社区与政企 IT 决策层热议

开源发布后 6 小时内,该模型在 GitHub 与各大技术社区收获了极高的关注度:

  • 开源社区资深自然语言处理专家评价:“Qwen2-Audio-72B 补齐了国内开源社区长期缺乏超大参数量多模态音频模型的短板。1.7% 的中文识别错误率意味着在复杂会议、嘈杂车间等极端场景下,AI 听写的准确度已经达到甚至超越了专业人工速记员的水平。”
  • 某省级政务服务中心信息化负责人指出:“政务 12345 便民热线每天沉淀海量市民诉求录音。此前由于闭源商用模型无法离网私有化,数据出网审计风险极大。现在有了顶级开源大模型底座,我们可以直接在政务内网服务器上部署全套语音识别私有化部署中台,真正做到业务智能化与数据安全兼得。”

行业展望:开源大模型重构语音产业生态

Qwen2-Audio-72B 的开源,标志着中文语音识别产业正在经历一场深刻的范式转移:单一功能的专用小模型正加速被具备通用推理与跨语境理解能力的多模态大模型所取代。

在各行各业加速追求全栈自主可控的大趋势下,依托开源大模型底座进行内网微调与私有化落地,正在成为企业数智化建设的核心共识。

在持续深耕前沿语音算法与私有化工程交付的实践中,灵声智库专注于为政企客户提供基于最新大模型的本地化工程适配与全栈推理加速方案,助力企业构建高效、安全、专属的智能语音基础设施。