Google DeepMind 发布语音转文字模型 Gemini 3.5 Transcribe
Google DeepMind 发布 Gemini 3.5 Transcribe,称其为目前最精确的语音转文字模型,可将原始音频直接转为准确、经过润色和格式化的文本。
推荐理由:官方给出 WER、延迟与多语言等量化指标,并说明两套 API 的接入方式,便于开发者评估语音链路选型。
Google DeepMind 发布 Gemini 3.5 Transcribe,称其为目前最精确的语音转文字模型,可将原始音频直接转为准确、经过润色和格式化的文本。
推荐理由:官方给出 WER、延迟与多语言等量化指标,并说明两套 API 的接入方式,便于开发者评估语音链路选型。
Google 在 CHI 2026 发布研究原型 AgentHands,可将 LLM 的高层推理映射为 XR 中与语音同步的手势,让智能体在 3D 空间里边说边演示。
Google 推出 Biomarker Discovery Framework,一个在人类监督下将候选生物标志物优先级排序结构化为迭代研究循环的多智能体系统,结合假设生成、并行统计分析、模型训练、对抗验证与文献推理。
Google DeepMind 宣布与游戏开发商合作,围绕 EVE Online 等游戏原型化新玩法体验,延续其 15 年游戏 AI 研究。其 SIMA 2 由 Gemini 驱动,能像玩家一样看屏幕、理解自然语言指令并通过键鼠操作,已在 No Man's Sky、Valheim、Hydroneer 等 3D 游戏中实现类人游玩,无需 API 或源码。
Google Research 提出 ME-POIs 框架,将匿名化移动性模式(到达时间、停留时长、周边移动)与文本描述结合,为地点生成同时编码身份与动态功能的嵌入向量。在公开基准上,该方法使访问意图预测相对提升最高 81.9%,价格水平分类提升 75.1%,繁忙度估计准确率提升 24.7%。框架通过访问对齐、空间多尺度访问传播和文本-移动性协同三步流程,缓解稀疏地点数据不足问题。
Import AI 第 469 期介绍了 DiG-bench(Discovery in Games)基准,包含 70 款隐藏规则的游戏,用于测试 AI 通过探索自主发现环境规则的能力,目前仅公开 21 款。
Google Research 提出 PhotoScan,一个可从普通 2D 手机照片估算体脂率、Android-to-Gynoid 脂肪比(A/G)和内脏与皮下脂肪面积比(V/S)的深度学习框架,用于预测胰岛素抵抗。
推荐理由:Google Research 用手机照片估算体成分并预测胰岛素抵抗,读者可了解其与 DXA、BIA 的精度对比。
Google DeepMind 发布 Gemini 3.7 Flash,称其为面向编码与智能体最强的工作主力模型,距 Gemini 3.6 Flash 发布仅三周。
推荐理由:官方给出与 3.6 Flash 的多项基准对比和半价定价,可据此判断编码与智能体场景的升级幅度。
Google DeepMind 发布多语言手语转文本模型 SL2T,首次将手语 AI 带入消费产品,在 Pixel 11 的 Gboard 和 Live Transcribe 中支持美国手语(ASL)转英文听写,后续将扩展更多设备与语言。
推荐理由:官方披露 SL2T 的训练规模、手语到文本的翻译路径与隐私设计,可了解手语 AI 从实验室走向消费产品的技术取舍。
Google Research 提出知识画像框架,用编码、知识、召回三个行为概念区分事实错误来自知识未编码还是已编码但无法访问,并发布包含 2,150 条 Wikipedia 事实、每条配 10 个问题的 WikiProfile 基准。
推荐理由:Google Research 用知识画像区分编码与召回失败,指出前沿模型的事实错误更多来自知识可访问性而非知识缺失。
Google Research 发布 AMIE (Video),基于 Gemini 和 Project Astra 构建,可在实时视频问诊中感知非语言线索、引导虚拟体格检查并同步完成诊断推理。
推荐理由:Google 用 300 场随机对照视频问诊给出 AMIE 与真人医生同级的评测结果,可看多智能体架构如何拆分实时对话与推理。
Google DeepMind 在 Nature 发表论文,称 WeatherNext AI 模型在气旋路径、强度和风场结构预报上达到 SOTA,平均多出一天预报提前量,三天预报精度相当于此前模型的两天水平。
推荐理由:原文给出气旋路径与强度预报的领先幅度和开源范围,读者可据此判断气象预报模型的进展与可用性。
Google Research 提出 Chain-of-Evidence(CoE)可验证性框架,并以此构建自主科研原型 Science One Framework,配套 CoE Audit 自动评估指标。
推荐理由:原文给出可验证性框架与审计指标,并对比多个自主科研系统的引用与代码对齐表现。
Google DeepMind 发布 Gemini Robotics ER 2,称其为面向机器人最强大的具身推理模型,可作为高层大脑让机器人对话、理解物理世界并规划多步任务,再把动作执行交给底层 VLA 模型,还能原生调用 Google Search 等工具。
推荐理由:官方给出 ER 2 在进度分类、时刻定位与多机器人协作上的具体指标和开放入口,可据此判断机器人大脑的能力边界。
Google DeepMind 发布音乐生成模型 Lyria 3.5,并在 Google Flow Music 中上线。官方称新版本在音乐性、歌词和人声质量上有明显提升,可生成更复杂自然的旋律结构、提示词遵循度和结构感知更好的歌词,以及更具情感表达和发音更准确的人声,同时支持更便捷地控制输出节奏与时长。
推荐理由:官方给出 Lyria 3.5 在旋律、歌词、人声与节奏时长控制上的具体改进,可据此判断音乐生成能力的变化。
Google DeepMind 发布 Gemini Robotics 2,作为新一代机器人的智能层,首次实现对完整人形机器人的全身控制,并带来更精细的手部与夹爪操作能力。
推荐理由:Gemini Robotics 2 把机器人控制从上半身扩展到全身,并给出多机协作与端侧快速适配的具体路径。
Google Research 发布研究论文 SymptomAI,用五个基于 Gemini Flash 2.0 的对话式智能体对 13917 名参与者进行端到端症状问诊与鉴别诊断(DDx)评估。
推荐理由:Google 用 13917 人随机对照研究比较 SymptomAI 与真实临床医生的鉴别诊断,并给出可穿戴生物信号佐证。
Google Research 在 Nature 发表论文,提出一种强化学习框架,让自主智能体从量子错误检测事件中学习,在计算过程中持续调节数千个控制参数以对抗漂移。
推荐理由:Google 用强化学习让量子纠错在计算过程中持续校准,读者可了解其 3.5 倍稳定性提升与规模化模拟结论。
Google 在 DOE Genesis Mission Summit 2026 上宣布投入 4000 万美元 AI tokens 和云 credits,支持 Genesis Mission 的科研人员。
Google DeepMind 发布 Gemini 3.6 Flash、3.5 Flash-Lite 和面向网络安全的 3.5 Flash Cyber。
推荐理由:官方给出三款新模型的定价、token 效率与基准对比,可据此判断智能体工作流的成本与选型变化。
英国 AI Security Institute 分析显示,开放权重模型与闭源前沿模型在网络安全能力上的差距正在收窄:GLM-5.2 与 DeepSeek V4-Pro 的表现接近 4 到 7 个月前发布的闭源前沿模型,而 2025 年大部分时间这一差距为 6 到 10 个月。
Google DeepMind 发布 Gemini 3.5 Flash Cyber,这是基于 3.5 Flash 微调的轻量网络安全模型,用于快速发现、验证和修补漏洞。
推荐理由:官方给出轻量安全模型在 CyberGym、Chrome 提交扫描等基准上的对比数据,可了解其成本与能力取舍。
Google DeepMind 与 Isomorphic Labs 公布联合生物韧性方案,一方面防止威胁行为者滥用其模型,另一方面让政府和科研机构用 AI 应对疫情。
Google Research 在 ICLR 2026 论文中指出,扩散模型的创造力源于神经网络训练中的"分数平滑"效应:权重衰减等正则化使学到的分数函数变平滑,去噪过程因此生成落在训练数据点之间的插值样本,而非简单记忆。研究用一维两点实验验证,权重衰减越强、分数函数越平滑,粒子越易停在插值区。
Google DeepMind 面向印度 Atal Tinkering Labs 启动 ATL Saathi 试点,这是一款由 Gemini 驱动的 Web 应用,为教师提供 24/7 备课与培训助手。
Google Research 发布 SensorFM,一个直接从无标注可穿戴数据学习的大型传感器基础模型,预训练语料超过一万亿分钟多模态信号,来自五百万名同意参与者。
推荐理由:Google 用一万亿分钟可穿戴数据预训练通用生理表征,读者可了解基础模型在健康领域的规模化路径。
Google Research 在 Nature Cities 发表研究,在 10 座美国城市用修改后的 Google Maps 算法将约 2% 的行程引导至耗时相近的替代路线,为期六个月。
Google DeepMind 与 A24 宣布达成首个此类研究合作,双方将围绕多个项目展开长期研发协作,让 A24 及其电影人参与塑造新技术。Google 同时已对 A24 进行投资。合作初期聚焦于弥合前沿技术与下一代娱乐之间的差距,具体目标与技术产出将随时间演进。
Hugging Face 与 Cerebras 联合发布实时语音到语音演示,用 Cerebras 加速 Gemma 4 31B 推理,构建开放的级联语音流水线。
推荐理由:原文给出了可复用的开源语音到语音流水线架构,读者可据此了解各模块如何组合与替换。
Google Research 将建筑级屋顶反射率数据集扩展至 9 个国家 50+ 城市,并通过新的 Heat Resilience Earth Engine App 开放访问。该方法融合 Sentinel-2 与 30-cm 高分辨率卫星影像,在 Boulder 验证中 RMSE 仅 0.04,建模显示针对性冷屋顶规划可使全球城市极端高温降低最多 0.5°C。
Google DeepMind 发布 Nano Banana 2 Lite(gemini-3.1-flash-lite-image)和 Gemini Omni Flash(gemini-omni-flash-preview)。
推荐理由:两款模型同时开放开发者入口,并给出延迟、单价与能力边界,便于判断图像与视频生成链路的成本取舍。
Google Research 发布面向表格数据分类与回归的基础模型 TabFM,将表格预测重构为上下文学习问题,无需手动训练、超参数调优和特征工程,单次前向传播即可对未见过的表格生成预测。
推荐理由:Google 把零样本思路从时序预测搬到表格数据,读者可了解其架构设计与 TabArena 基准表现。
Google Research 发布新架构,将多 Token 预测(MTP)头挂载到已冻结的 Gemini Nano v3 模型上,已在 Pixel 9 和 10 系列上线,作为开箱即用的加速方案。
推荐理由:Google 把 MTP 头挂到冻结的 Gemini Nano v3 上,读者可了解端侧推测解码如何省内存并提速。
Google Research 提出线性弹性缓存,将页面淘汰建模为滑雪租赁问题,用轻量机器学习动态调整缓存大小。在 Spanner 生产环境测试中,内存用量降低 15.5%,缓存未命中仅增加 5.5%,总拥有成本(TCO)降低约 5%,实际 I/O 成本影响仅 0.5%。该方案用浅层决策树预测页面 TTL,可翻译为几行 C++ 代码。
Google Research 在 COLM 2026 论文中揭示,让模型生成推理链能解锁原本无法召回的事实答案,即使问题只是单跳事实查询。研究用 Gemini-2.5(Flash 和 Pro)与 Qwen3-32B 在 SimpleQA Verified 和 EntityQuestions 上对比推理开关两种模式,发现两个机制:额外 token 充当计算缓冲,以及生成相关事实的"事实启动"效应。
Google DeepMind 将 computer use 作为内置工具集成进 Gemini 3.5 Flash,此前该能力仅以独立的 Gemini 2.5 computer use 模型形式提供。
推荐理由:原文说明 computer use 从独立模型并入主 Flash 模型,并给出企业级安全防护选项,读者可据此判断智能体跨平台自动化的落地路径。
牛津大学、英国 AI 安全研究所、斯坦福大学和伦敦政治经济学院的研究者通过四项实验、6,923 人参与的 18,978 场对话发现,AI 系统在文本说服上稳定强于人类专家,即使专家自选议题、提前研究、接受数小时结构化训练并获 1,000 英镑奖金激励。
Google DeepMind 宣布与英国政府、Google Cloud、Faculty 及 Barnet、Dorset、Camden 三地规划部门合作,共同开发一款 AI 规划审批原型工具,目标是将住户规划申请的处理时间缩短 50%。
推荐理由:英国政府与 Google DeepMind 合作开发的规划审批原型进入三地试点,读者可了解 AI 在公共行政流程中的落地方式与人工把关机制。
Google Research 发布矢量化数据集,将 Farmscapes 2020 的高分辨率栅格地图转化为可操作的树篱、石墙和矮林清单,覆盖英国超 13 万平方公里。该框架基于在 3 亿多张全球卫星图像上预训练的 RSF Vision-Transformer 骨干微调,并用 Polsby–Popper 紧凑度评分(线性特征阈值低于 0.5)自动区分林地、树丛与树篱。
Google DeepMind 发布 AI Control Roadmap,一套用于在 Google 内部构建和管理高级 AI 的框架,采用纵深防御思路,在模型对齐之外增加系统级安全层,即使对齐不完美也能提供保障。
推荐理由:DeepMind 公开内部 AI 控制路线图,给出检测与响应分级和百万条编码智能体轨迹的监控数据。