TII 推出 Falcon-ASR:1.6B 参数阿拉伯语语音识别模型
阿布扎比技术创新研究院(TII)发布 Falcon-ASR,一款 1.6B 参数的语音识别模型,重点覆盖阿联酋方言,同时支持英语、法语、西班牙语和葡萄牙语。在六个阿拉伯语测试集上平均 WER 为 20.92%,优于其参考榜单快照中最佳公开结果 23.17%;内部阿联酋方言评测中 WER 22.73%、CER 10.19%,比次优的 Qwen3-Omni 低 4.07 个百分点。
阿布扎比技术创新研究院(TII)发布 Falcon-ASR,一款 1.6B 参数的语音识别模型,重点覆盖阿联酋方言,同时支持英语、法语、西班牙语和葡萄牙语。在六个阿拉伯语测试集上平均 WER 为 20.92%,优于其参考榜单快照中最佳公开结果 23.17%;内部阿联酋方言评测中 WER 22.73%、CER 10.19%,比次优的 Qwen3-Omni 低 4.07 个百分点。
Google DeepMind 发布两款实时语音对话模型 Gemini 3.8 Live 和 Gemini 3.8 Live Extended Thinking,前者面向规模化与成本效率,后者面向高复杂度任务与多步推理。
推荐理由:官方给出两款语音模型的基准成绩与开放渠道,可据此判断实时语音智能体的能力水位与接入方式。
Google DeepMind 发布 Gemini 3.5 Transcribe,称其为目前最精确的语音转文字模型,可将原始音频直接转为准确、经过润色和格式化的文本。
推荐理由:官方给出 WER、延迟与多语言等量化指标,并说明两套 API 的接入方式,便于开发者评估语音链路选型。
NVIDIA 发布 Magpie TTS Multilingual,一个 364M 参数的开源权重语音合成模型,支持英语、西班牙语、法语、德语、意大利语、越南语、普通话、印地语、日语以及新增的现代标准阿拉伯语、韩语和巴西葡萄牙语共 12 种语言,每种语言含男女声。
推荐理由:原文给出 364M 开源权重模型的多语言扩展与自托管延迟数据,可据此判断级联语音架构的部署取舍。
Google DeepMind 发布音乐生成模型 Lyria 3.5,并在 Google Flow Music 中上线。官方称新版本在音乐性、歌词和人声质量上有明显提升,可生成更复杂自然的旋律结构、提示词遵循度和结构感知更好的歌词,以及更具情感表达和发音更准确的人声,同时支持更便捷地控制输出节奏与时长。
推荐理由:官方给出 Lyria 3.5 在旋律、歌词、人声与节奏时长控制上的具体改进,可据此判断音乐生成能力的变化。
Google DeepMind 发布 Gemini 3.5 Live Translate,这是一款支持 70+ 语言的近实时语音到语音翻译音频模型,能自动检测语言并保留说话者的语调、节奏和音高。
推荐理由:官方给出 70+ 语言实时语音翻译的连续生成机制与多产品落地节奏,可据此判断实时翻译的可用边界。
Google DeepMind 发布 Gemini 3.1 Flash TTS,称其在可控性、表现力和语音质量上均有提升,在 Artificial Analysis TTS 榜单上取得 1,211 Elo 分数。
推荐理由:官方给出 Elo 1,211、70+ 语言与音频标签等具体指标,可据此判断语音生成的可控性提升。
Mistral AI 发布首个文本转语音模型 Voxtral TTS,4B 参数,支持英语、法语、德语、西班牙语、荷兰语、葡萄牙语、意大利语、印地语和阿拉伯语共 9 种语言,具备情感表达和零样本跨语言音色适配能力。
推荐理由:官方给出 4B 参数、70ms 延迟与 9 种语言支持,读者可据此判断企业语音智能体的成本与部署门槛。
Mistral AI 发布 Voxtral Transcribe 2,包含面向批量转写的 Voxtral Mini Transcribe V2 和面向实时场景的 Voxtral Realtime,后者以 Apache 2.0 协议开放权重。
推荐理由:官方给出两款语音转写模型的延迟、错误率与定价对比,可据此判断实时语音场景的选型与成本。
Mistral AI 发布 Voxtral 语音理解模型,提供 24B 和 3B 两个版本,均以 Apache 2.0 许可开源并上线 API。模型支持 32k token 上下文,可处理最长 30 分钟音频转写或 40 分钟音频理解,具备内置问答与摘要、多语言自动检测和语音直接触发函数调用等能力。
推荐理由:Mistral 开源两款语音理解模型,给出与 Whisper、GPT-4o mini、ElevenLabs 的对比和 API 定价,便于评估落地成本。