Hugging Face Open ASR Leaderboard 新增首个全球南方语言:印地语与印度英语评测集 Monsoon
Hugging Face 与 Voice Arena 合作,在 Open ASR Leaderboard 上新增 Monsoon en-IN 和 Monsoon hi-IN 两个评测集,印地语由此成为该多语言榜单上首个 Indic 语言。
Hugging Face 与 Voice Arena 合作,在 Open ASR Leaderboard 上新增 Monsoon en-IN 和 Monsoon hi-IN 两个评测集,印地语由此成为该多语言榜单上首个 Indic 语言。
Hugging Face 发布研究,提出共识分歧探针、掩蔽实体检索和拼写切换三项测试来量化语音识别中的基准优化现象。
推荐理由:通过三项探针量化语音模型对基准的过拟合,并给出可复用的检测脚本与榜单入口。
Google Research 发布 AMIE (Video),基于 Gemini 和 Project Astra 构建,可在实时视频问诊中感知非语言线索、引导虚拟体格检查并同步完成诊断推理。
推荐理由:Google 用 300 场随机对照视频问诊给出 AMIE 与真人医生同级的评测结果,可看多智能体架构如何拆分实时对话与推理。
Hume 发布 Real World VoiceEQ 基准,用于评估语音交互的人类质量,覆盖 40 多个专有与开源语音模型、15+ 评测维度和 60 多项指标,涵盖 ASR、TTS、S2S 和语音理解。
推荐理由:原文给出语音 AI 在 15+ 维度上的评测结果,读者可据此理解现有基准为何高估真实表现。
Google DeepMind 宣布 AI co-clinician 研究计划,探索 AI 智能体在医生临床监督下协助患者诊疗的“三方照护”模式。在 98 个真实初级保健问题的盲评中,该系统 97 例无关键错误,医生对其回答的偏好高于现有证据综合工具;在 140 项问诊技能评估中,AI 在 68 项上达到或超过初级保健医生水平,但识别危险信号和指导关键体格检查仍不如专家医生。
推荐理由:Google DeepMind 公布 AI co-clinician 研究计划,用医生盲评和模拟问诊数据说明医疗智能体当前的能力边界。