科大讯飞发布Spark-Audio-1.0-Preview 全国产语音基座大模型实现从“听清”到“听懂”
  • cici
  • 2026年09月16日 18:07
  • 0

9 月 16 日,科大讯飞发布基于全国产化算力训练的语音基座大模型 Spark-Audio-1.0-Preview,支持文本和语音两个模态的输入以及文本模态的输出,可支持语音转写、多语言翻译、多方言识别、环境音识别、说话人识别、情感分析以及复杂的音频问答等场景任务的实现,使智能语音完成从「听清」到「听懂」的跃升。

Spark-Audio-1.0-Preview 采用 0.65B(Dense 结构)的音频编码器,搭配 30B-A3B(MoE 结构)的大语言模型,使用了 1300 万小时音频以及大量文本数据,基于纯国产算力集群训练完成。在训练数据量仅相当于同尺寸模型 Qwen3.5-omni-Flash 十分之一的情况下,Spark-Audio-1.0-Preview 在各项语音评测任务上效果整体相当、部分超过,尤其在偏真实应用类任务上明显领先;与尺寸更大的闭源语音基座模型效果接近。

Spark-Audio-1.0-Preview 可支持 99 种语言及 202 种方言的识别。在 Fleurs、KeSpeech、LibriSpeech 等中英文、多语言、多方言语音识别评测任务中,Spark-Audio-1.0-Preview 得分高于 Gemini-3.1 Pro;Fleurs-中文测试集中,Spark-Audio-1.0-Preview 取得了 SOTA;面向更实际的应用场景,Spark-Audio-1.0-Preview 在高噪声、小音量等复杂条件下的语音识别评测任务中也有较为明显的领先优势。

同时,Spark-Audio-1.0-Preview 在通用知识、数学与代码等任务上没有出现明显降智,在指令遵循、对话、音频理解等任务上仍有进步追赶空间。

[MD:Title] 公开测试集-音频

[MD:Title] 自建测试集-音频

[MD:Title] 自建测试集-音频-复杂场景

[MD:Title] 公开测试集-文本

据了解,Spark-Audio-1.0-Preview 通过音频编码器预训练,逐步扩展音频编码器的表征能力;再通过预训练和后训练,提升了模型的基础能力、复杂场景泛化性以及多个任务效果,最终在 99 种语言、202 种方言及高噪声、小音量等复杂场景下取得优异成绩。作为业界首个基于全国产算力训练的语音基座大模型,Spark-Audio-1.0-Preview 也证明了在国产算力上完全有能力训练出效果达到业界领先水平的语音基座大模型。

[MD:Title]

Spark-Audio-1.0-Preview 可在实际应用场景任务上带来更好效果,如增强人机交互系统的情绪感知和多轮对话理解能力,保留语气韵律信息、带来更流畅的同传体验,提升医疗电子病历、会议转写与内容审核系统自动区分说话人、提取关键决策点及生成结构化纪要的效果。

目前,Spark-Audio-1.0-Preview 已正式开放体验入口,API 后续将上线讯飞开放平台;基于 Spark-Audio-1.0-Preview 语音基座大模型,科大讯飞还将在近期陆续展开一系列语音相关大模型的发布和升级。

文章纠错

  • 好文点赞
  • 水文反对

此文章为快科技原创文章,快科技网站保留文章图片及文字内容版权,如需转载此文章请注明出处:快科技

观点发布 网站评论、账号管理说明
热门评论
查看全部评论
相关报道

最热文章排行查看排行详情

邮件订阅

评论0 | 点赞0| 分享0 | 收藏0