MindTopo:微软推出评估多模态模型拓扑推理能力的新基准
微软研究院推出 MindTopo 基准,用于评估多模态大语言模型在连通性、分离、顺序、包围和绳结五类拓扑关系上的推理与规划能力。测试显示,当前模型在静态图像识别上明显强于交互式规划任务,失败多发生在规划阶段而非感知阶段,且图像与视频生成工具在跨多步动作中维持拓扑关系并不可靠。
微软研究院推出 MindTopo 基准,用于评估多模态大语言模型在连通性、分离、顺序、包围和绳结五类拓扑关系上的推理与规划能力。测试显示,当前模型在静态图像识别上明显强于交互式规划任务,失败多发生在规划阶段而非感知阶段,且图像与视频生成工具在跨多步动作中维持拓扑关系并不可靠。
Google DeepMind 发布多语言手语转文本模型 SL2T,首次将手语 AI 带入消费产品,在 Pixel 11 的 Gboard 和 Live Transcribe 中支持美国手语(ASL)转英文听写,后续将扩展更多设备与语言。
推荐理由:官方披露 SL2T 的训练规模、手语到文本的翻译路径与隐私设计,可了解手语 AI 从实验室走向消费产品的技术取舍。
Google Research 发布 AMIE (Video),基于 Gemini 和 Project Astra 构建,可在实时视频问诊中感知非语言线索、引导虚拟体格检查并同步完成诊断推理。
推荐理由:Google 用 300 场随机对照视频问诊给出 AMIE 与真人医生同级的评测结果,可看多智能体架构如何拆分实时对话与推理。
微软研究院推出研究模型 CARE-X,一个统一胸部 X 光视觉语言模型,可同时完成报告生成、疾病分类、定位与器械识别等任务,并支持生成式与双推理两种模式。该模型采用强化学习 DAPO 在多任务设置下奖励临床正确性,另有一项独立实验将 Qwen3-VL-4B-Instruct 与确定性测量工具结合,评估直接计算能否改善测量依赖型病症的表现。
NVIDIA 发布 Magpie TTS Multilingual,一个 364M 参数的开源权重语音合成模型,支持英语、西班牙语、法语、德语、意大利语、越南语、普通话、印地语、日语以及新增的现代标准阿拉伯语、韩语和巴西葡萄牙语共 12 种语言,每种语言含男女声。
推荐理由:原文给出 364M 开源权重模型的多语言扩展与自托管延迟数据,可据此判断级联语音架构的部署取舍。
Meta 发布 Muse Glimmer,一个从 Muse 蒸馏到 30B 参数的多模态模型,采用 Apache 2.0 许可,面向本地智能体场景,如编码、文档分析和个人助理。
推荐理由:Meta 开源 30B 多模态模型,附完整基准对比与本地部署路径,可据此判断端侧智能体的可行性。
Mistral AI 发布 Shieldstral,一个 3B 开源权重多模态安全分类器,以 Apache 2.0 许可开放下载,可在单张 16GB NVIDIA GPU 上运行。它把内容审核建模为策略自适应的问答任务,推理时用自然语言写入策略即可返回校准后的安全分数,无需重新训练,统一处理文本与图像。官方称其在文本安全上可匹配最多 7 倍参数量的模型,并在多模态审核上取得新的 SOTA。
推荐理由:3B 开源安全分类器把内容审核变成推理时可换策略的问答任务,可据此判断小模型在审核场景的可用边界。
Google DeepMind 发布 Gemini Robotics ER 2,称其为面向机器人最强大的具身推理模型,可作为高层大脑让机器人对话、理解物理世界并规划多步任务,再把动作执行交给底层 VLA 模型,还能原生调用 Google Search 等工具。
推荐理由:官方给出 ER 2 在进度分类、时刻定位与多机器人协作上的具体指标和开放入口,可据此判断机器人大脑的能力边界。
Google DeepMind 发布 Gemini Robotics 2,作为新一代机器人的智能层,首次实现对完整人形机器人的全身控制,并带来更精细的手部与夹爪操作能力。
推荐理由:Gemini Robotics 2 把机器人控制从上半身扩展到全身,并给出多机协作与端侧快速适配的具体路径。
NVIDIA 推出 Cosmos-H-Dreams,一款面向手术机器人的实时、动作条件生成式仿真器,通过 FlashDreams 推理库在单张 RTX PRO 6000 GPU 上运行,支持人与策略闭环交互。
Google DeepMind 发布 Gemini 3.6 Flash、3.5 Flash-Lite 和面向网络安全的 3.5 Flash Cyber。
推荐理由:官方给出三款新模型的定价、token 效率与基准对比,可据此判断智能体工作流的成本与选型变化。
DharmaOCR 在葡萄牙语 OCR 基准上以 0.925 分领先 Mistral OCR4 的 0.798 和 Unlimited-OCR 的 0.7587。该模型通过葡萄牙语监督微调加 DPO 两阶段训练,将全部参数集中于巴西葡萄牙语,从而在提取质量和稳定性上取得优势。
Thinking Machines Lab 在 Hugging Face 发布 Inkling 系列多模态大模型,Inkling 为约 1T 参数、41B 激活参数的 MoE 模型,原生支持图像、文本、音频输入,上下文窗口 1M,并推出 276B 总参数、12B 激活参数的 Inkling-Small。
推荐理由:原文给出 Inkling 的架构细节、部署配置与基准对比,读者可据此判断这一开源多模态模型的落地门槛。
Google Research 发布 SensorFM,一个直接从无标注可穿戴数据学习的大型传感器基础模型,预训练语料超过一万亿分钟多模态信号,来自五百万名同意参与者。
推荐理由:Google 用一万亿分钟可穿戴数据预训练通用生理表征,读者可了解基础模型在健康领域的规模化路径。
Mistral AI 发布首个具身导航模型 Robostral Navigate,这是一个 8B 模型,仅用单个普通 RGB 相机、无需 LiDAR 或深度传感器,在 R2R-CE 验证集 unseen 上达到 76.6% 成功率,比最佳单相机方案高 9.7 个点,比使用深度或多相机的最佳系统高 4.5 个点。
推荐理由:官方给出单目 RGB 相机在 R2R-CE 上的成绩与训练方法,读者可据此判断具身导航的硬件门槛变化。
Hugging Face 与 Cerebras 联合发布实时语音到语音演示,用 Cerebras 加速 Gemma 4 31B 推理,构建开放的级联语音流水线。
推荐理由:原文给出了可复用的开源语音到语音流水线架构,读者可据此了解各模块如何组合与替换。
Google DeepMind 发布 Nano Banana 2 Lite(gemini-3.1-flash-lite-image)和 Gemini Omni Flash(gemini-omni-flash-preview)。
推荐理由:两款模型同时开放开发者入口,并给出延迟、单价与能力边界,便于判断图像与视频生成链路的成本取舍。
Mistral 发布 OCR 4,在提取文本之外返回边界框、块类型分类和逐页逐词置信度分数,支持 170 种语言、可单容器自托管部署。官方称独立标注者在 600 多份文档的盲评中平均 72% 更偏好 OCR 4,并在 OlmOCRBench 上取得 85.20 的最高总分。
推荐理由:官方给出 OCR 4 的边界框、块分类与置信度输出,以及自托管和按页计价方案,可据此判断文档解析管线的选型。
Google 公布多项关于消费者使用 AI 工具理解皮肤问题的研究,其中发表于 JAMA Dermatology 的大规模调查显示,2345 名参与者使用 AI 原型工具后,尝试命名皮肤状况的比例超 62%,命名准确率 23%,约为无辅助对照组 8% 的三倍。但研究也发现,AI 辅助在判断下一步就医建议上未带来统计显著改善,用户比皮肤科医生更倾向选择不那么紧急的处理方式。
Google DeepMind 发布 Gemini 3.5 Live Translate,这是一款支持 70+ 语言的近实时语音到语音翻译音频模型,能自动检测语言并保留说话者的语调、节奏和音高。
推荐理由:官方给出 70+ 语言实时语音翻译的连续生成机制与多产品落地节奏,可据此判断实时翻译的可用边界。
Google DeepMind 发布 Gemma 4 12B,一款面向笔记本电脑的智能体多模态模型,介于边缘端 E4B 与 26B MoE 之间,是首个支持原生音频输入的中等规模 Gemma 模型。
推荐理由:Gemma 4 12B 用无编码器架构把视觉和音频直接接入 LLM,读者可据此判断本地多模态智能体的硬件门槛。
Google Research 在 Nature 发表研究,提出 PHRM 系统,可在日常使用手机时通过前摄在面部解锁后采集 8 秒视频,被动估算心率与每日静息心率。
推荐理由:Google 用手机前摄在解锁后被动测心率,并公开迄今最大规模多肤色 rPPG 数据集与预训练模型。
Google DeepMind 在实验性原型 Project Genie 中上线 Street View 真实影像锚定能力,用户可在地图上选择美国地点并搭配风格与角色描述,生成以真实地点为起点的可交互世界。
推荐理由:官方说明 Genie 接入 Street View 真实影像,读者可了解世界模型如何以真实地点为锚点生成可交互环境。
Google DeepMind 发布 Omni 家族首个模型 Gemini Omni Flash,可组合图像、音频、视频和文本作为输入生成高质量视频,并通过自然语言多轮对话编辑视频。
推荐理由:Gemini Omni Flash 把对话式视频编辑和多模态输入生成整合进 Gemini 应用与 YouTube Shorts,可据此判断视频创作流程的变化。
Google 扩展内容透明度与验证工具,把 SynthID 的图像、视频和音频验证从 Gemini 应用带到搜索,并将在未来几周进入 Chrome;该验证功能在 Gemini 中已被使用 5000 万次。
推荐理由:Google 把 SynthID 与 C2PA 验证铺到搜索、Gemini 和 Chrome,读者可据此了解内容溯源工具的落地范围。
Google DeepMind 与新加坡政府达成国家 AI 合作,在医疗、科研、教育和可持续发展领域推出新项目。合作探索 AI 辅助临床的“三方护理”模式,并用 AlphaFold、Google Earth 等工具推进东南亚传染病与疫情防范研究,同时开发基于 Gemma 的视障跑者助手。
Google DeepMind 发布 Gemini 3.5 模型系列,首发的 3.5 Flash 面向智能体与编码任务,在 Terminal-Bench 2.1 取得 76.2%、GDPval-AA 取得 1656 Elo、MCP Atlas 取得 83.6%,多模态理解在 CharXiv Reasoning 上为 84.2%,输出速度是其他前沿模型的 4 倍。
推荐理由:官方给出 3.5 Flash 在编码与智能体基准上的具体分数和速度对比,可据此判断其能力定位。
Google DeepMind 宣布 AI co-clinician 研究计划,探索 AI 智能体在医生临床监督下协助患者诊疗的“三方照护”模式。在 98 个真实初级保健问题的盲评中,该系统 97 例无关键错误,医生对其回答的偏好高于现有证据综合工具;在 140 项问诊技能评估中,AI 在 68 项上达到或超过初级保健医生水平,但识别危险信号和指导关键体格检查仍不如专家医生。
推荐理由:Google DeepMind 公布 AI co-clinician 研究计划,用医生盲评和模拟问诊数据说明医疗智能体当前的能力边界。
Google DeepMind 发布 Gemini 3.1 Flash TTS,称其在可控性、表现力和语音质量上均有提升,在 Artificial Analysis TTS 榜单上取得 1,211 Elo 分数。
推荐理由:官方给出 Elo 1,211、70+ 语言与音频标签等具体指标,可据此判断语音生成的可控性提升。
Google DeepMind 发布 Gemini Robotics-ER 1.6,这是其面向机器人的推理优先模型升级版,重点增强空间推理与多视角理解,并新增仪表读数能力,可读取压力表、液位计和数字读数。
推荐理由:官方给出与前代及 Gemini 3.0 Flash 的对比,并首次加入仪表读数能力,可据此判断机器人在设施巡检中的自主程度。
Google 发布两款学术智能体:PaperVizAgent 用于生成论文配图,ScholarPeer 用于自动同行评审。PaperVizAgent 由检索、规划、风格、可视化和评审五个智能体协作,在 0-100 分评测中总分 60.2,超过 GPT-Image-1.5、Nano-Banana-Pro、Paper2Any,是唯一超过 50.0 人类基线的框架。
Google DeepMind 发布 Gemma 4 开源模型家族,包含 E2B、E4B、26B MoE 和 31B Dense 四个尺寸,采用 Apache 2.0 许可。
推荐理由:Gemma 4 以四个尺寸覆盖从手机到工作站的部署,并给出 Arena 排名与 Apache 2.0 许可,便于判断开源模型的可用边界。
Google DeepMind 公布 AI 指针的四条交互原则,并展示由 Gemini 驱动的实验性指针演示,用户可在 Google AI Studio 中通过指向和语音编辑图片或查找地点。
推荐理由:Google DeepMind 公开 AI 指针的四条交互原则,并已在 Chrome 落地,读者可据此判断 AI 交互从提示词转向指向与语音的路径。
Google 发布 Vibe Coding XR 工作流,将 Gemini 与基于 WebXR、three.js、LiteRT.js 的 XR Blocks 框架结合,把自然语言提示词直接转成具备物理感知的 Android XR 应用,耗时不到 60 秒。
推荐理由:Google 把 Gemini 的长上下文推理接到 WebXR 框架上,读者可据此判断自然语言生成 XR 原型的可行边界。
Google Research 在 The Check Up 活动上公布多项医疗 AI 进展:与 Fitbit 合作研究发现,模拟协作医疗团队的 Personal Health Agent(PHA)比单一任务应用更能支持长期健康。
Google Research 与多家 NHS 机构合作的 AIMS 研究在 Nature Cancer 发表两项配套研究,评估 AI 乳腺癌检测系统。
推荐理由:两项 Nature Cancer 研究给出 AI 读片在 NHS 双读流程中的敏感度、时间与仲裁数据,可了解医疗 AI 落地的真实约束。
Mistral AI 发布 Mistral Small 4,这是 Mistral Small 系列的下一个重大版本,也是首个把 Magistral 的推理、Pixtral 的多模态和 Devstral 的智能体编码能力统一到单一模型的 Mistral 模型,采用 Apache 2.0 许可。
推荐理由:Mistral 把推理、多模态与编码智能体能力合并进单一开源模型,并给出可调推理强度与部署门槛。
Mistral AI 发布 Mistral OCR 3,在表单、扫描文档、复杂表格和手写内容上相对 Mistral OCR 2 的整体胜率为 74%,官方称其准确率超过企业级文档处理方案和 AI 原生 OCR 方案。
推荐理由:官方给出与上一代在表单、手写和复杂表格上的胜率对比,以及每千页定价,可据此判断文档解析成本与适用场景。
Mistral 发布 Mistral 3 系列,包括 14B、8B、3B 三个小尺寸稠密模型和迄今最强的 Mistral Large 3,后者为稀疏 MoE 架构,41B 激活参数、675B 总参数,全部以 Apache 2.0 许可开源。
推荐理由:Mistral 3 系列以 Apache 2.0 开源并给出参数与部署路径,读者可据此判断开源前沿模型的可用边界。
Mistral 用 LoRA 微调 Pixtral-12B 处理卫星图像,在 Aerial Image Dataset(AID)上显著优于未微调基线,改善了密集住宅与中等住宅、Playground 与 Stadium 等易混类别的分类,并减少了模型幻觉出的无效类别名。