Google Research 提出 Simula:从第一性原理出发的合成数据生成框架
Google Research 提出推理优先的合成数据生成框架 Simula,将数据集生成重构为机制设计问题,通过全局多样化、局部多样化、复杂化和双批评者质量检查四个步骤,实现无种子、智能体式的数据集构建。
Google Research 提出推理优先的合成数据生成框架 Simula,将数据集生成重构为机制设计问题,通过全局多样化、局部多样化、复杂化和双批评者质量检查四个步骤,实现无种子、智能体式的数据集构建。
Google Research 提出 MoGen(Neuronal Morphology Generation),用 PointInfinity 点云流匹配模型生成合成神经元形态,为 PATHFINDER 重建模型补充训练数据,使小鼠轴突重建误差率降低 4.4%,主要来自 merge error 的减少。
Google DeepMind 发布 Gemini 3.1 Flash TTS,称其在可控性、表现力和语音质量上均有提升,在 Artificial Analysis TTS 榜单上取得 1,211 Elo 分数。
推荐理由:官方给出 Elo 1,211、70+ 语言与音频标签等具体指标,可据此判断语音生成的可控性提升。
Google 在 Google Labs 上线研究实验 Vantage,用生成式 AI 构建模拟对话环境,评估高中与大学生面向未来的技能,目前提供英文版并可注册。Vantage 与纽约大学合作开发,由 Executive LLM 动态引导对话、AI Evaluator 依据评分量表打分,在 188 名 18-25 岁美国测试者中,AI 评分与人类专家评分的一致性接近两位专家评分者之间的一致性。
Google DeepMind 发布 Gemini Robotics-ER 1.6,这是其面向机器人的推理优先模型升级版,重点增强空间推理与多视角理解,并新增仪表读数能力,可读取压力表、液位计和数字读数。
推荐理由:官方给出与前代及 Gemini 3.0 Flash 的对比,并首次加入仪表读数能力,可据此判断机器人在设施巡检中的自主程度。
Google Research 推出 ConvApparel 数据集,包含超 4,000 段人机多轮对话、近 15,000 轮,用于量化 LLM 用户模拟器与真实人类的真实感差距。该数据集采用双智能体采集协议,参与者被随机分配到有帮助的 "Good" 智能体或故意不帮忙的 "Bad" 智能体,并配有逐轮用户满意度标注。研究同时提出基于群体统计对齐、人类相似度评分和反事实验证的三支柱评估框架。
Google 发布两款学术智能体:PaperVizAgent 用于生成论文配图,ScholarPeer 用于自动同行评审。PaperVizAgent 由检索、规划、风格、可视化和评审五个智能体协作,在 0-100 分评测中总分 60.2,超过 GPT-Image-1.5、Nano-Banana-Pro、Paper2Any,是唯一超过 50.0 人类基线的框架。
Google Research 提出一套框架,用改编自 IRI、ERQ 等心理学问卷的情境判断测试(SJT),在真实用户-助手场景中评估 LLM 行为倾向与人类共识的对齐程度。
Google DeepMind 发布 Gemma 4 开源模型家族,包含 E2B、E4B、26B MoE 和 31B Dense 四个尺寸,采用 Apache 2.0 许可。
推荐理由:Gemma 4 以四个尺寸覆盖从手机到工作站的部署,并给出 Arena 排名与 Apache 2.0 许可,便于判断开源模型的可用边界。
Google Research 在《Forest vs Tree: The (N, K) Trade-off in Reproducible ML Evaluation》中研究了评测条目数与每条目标注者数的权衡,发现常用的 1、3、5 名标注者往往不足,可靠结果常需每条目 10 名以上标注者。
Google Quantum AI 发布白皮书,给出破解 256 位椭圆曲线离散对数问题(ECDLP-256)的更新量子资源估算:两个实现 Shor 算法的量子电路分别使用不到 1。
推荐理由:Google Quantum AI 给出破解 ECDLP-256 的更新资源估算,并用零知识证明确认结论而不泄露攻击细节。
Google DeepMind 公布 AI 指针的四条交互原则,并展示由 Gemini 驱动的实验性指针演示,用户可在 Google AI Studio 中通过指向和语音编辑图片或查找地点。
推荐理由:Google DeepMind 公开 AI 指针的四条交互原则,并已在 Chrome 落地,读者可据此判断 AI 交互从提示词转向指向与语音的路径。
Google 发布 Vibe Coding XR 工作流,将 Gemini 与基于 WebXR、three.js、LiteRT.js 的 XR Blocks 框架结合,把自然语言提示词直接转成具备物理感知的 Android XR 应用,耗时不到 60 秒。
推荐理由:Google 把 Gemini 的长上下文推理接到 WebXR 框架上,读者可据此判断自然语言生成 XR 原型的可行边界。
Google 发布 TurboQuant 压缩算法,用于解决向量量化中的内存开销问题,并同时提出 QJL 和 PolarQuant 两种配套方法,三篇工作将分别亮相 ICLR 2026 和 AISTATS 2026。
推荐理由:Google 提出的向量量化方法把 KV cache 压到 3 bit 且不损失精度,读者可据此判断长上下文推理的内存成本走向。
Google Research 发布 S2Vec,一个自监督框架,用于学习建成环境的通用嵌入向量,将建筑、道路等地理要素栅格化为多层图像后用掩码自编码(MAE)训练。在人口密度、收入等社会经济预测的零样本地理外推任务上,S2Vec 通常是最佳单一模型,与图像嵌入做多模态融合后表现普遍优于任一单一模态;但在树木覆盖、海拔等环境任务上仍需改进。
Google Research 在 The Check Up 活动上公布多项医疗 AI 进展:与 Fitbit 合作研究发现,模拟协作医疗团队的 Personal Health Agent(PHA)比单一任务应用更能支持长期健康。
Google Research 与多家 NHS 机构合作的 AIMS 研究在 Nature Cancer 发表两项配套研究,评估 AI 乳腺癌检测系统。
推荐理由:两项 Nature Cancer 研究给出 AI 读片在 NHS 双读流程中的敏感度、时间与仲裁数据,可了解医疗 AI 落地的真实约束。
Google 与康奈尔大学在《美国国家科学院院刊》发表研究,让 GPT-4o、Perplexity、Claude 3.5、Gemini Advanced Pro 1.5、NotebookLM 和一套自建 RAG 系统回答 67 道高温超导专家级问题,由 12 位国际专家按平衡性、全面性、简洁性、证据、图像相关性和定性反馈六项指标盲评打分。
Google 宣布在 Flood Hub 上线城市山洪预报,利用 AI 方法可提前最多 24 小时预测城市山洪风险。
推荐理由:Google 把城市山洪预警接入 Flood Hub,读者可了解其用新闻数据训练模型、以 20x20 公里分辨率覆盖全球的思路。
Google Research 推出 Groundsource,用 Gemini 从新闻报道中抽取结构化灾害数据,首个开放数据集包含 260 万条城市山洪记录,覆盖 150 多个国家、时间跨度从 2000 年至今。
推荐理由:Google 用 Gemini 从 80 种语言新闻中抽取洪水事件,其 60% 定位与时间准确率可供评估 LLM 做数据抽取的可靠性。
Google Research 与 Beth Israel Deaconess Medical Center 合作开展了一项前瞻性单中心可行性研究,让 AMIE 在门诊初级保健就诊前与患者进行文本问诊,全程由医生通过视频监督。
推荐理由:Google 与 BIDMC 的 AMIE 真实门诊可行性研究,给出安全停用次数、诊断一致率与患者态度变化等一手数据。