Google 发布 ERA 科研编码工具并开放 Computational Discovery
Google 发布 Empirical Research Assistance(ERA),一个用 Gemini 编写和优化科学代码的研究工具,相关论文今日发表于 Nature。
推荐理由:Google 把 ERA 从 Nature 论文推进到可申请使用的工具,读者可据此判断科研编码自动化的落地进度。
Google 发布 Empirical Research Assistance(ERA),一个用 Gemini 编写和优化科学代码的研究工具,相关论文今日发表于 Nature。
推荐理由:Google 把 ERA 从 Nature 论文推进到可申请使用的工具,读者可据此判断科研编码自动化的落地进度。
Import AI 457 期聚焦三项研究:SentinelOne 拆解了 20 多年前的病毒 fast16.sys,它通过篡改 LS-DYNA 970、PKPM、MOHID 等高精度计算软件的内存结果,定向破坏工程与物理仿真。
斯坦福大学医学院 Gary Peltz 团队利用 Google Co-Scientist 从已有药物文献中筛选肝纤维化候选药,其提出的 3 个候选中有 2 个在活体人类肝细胞测试中阻断纤维化并促进肝细胞再生,而 Peltz 自行挑选的 2 个药物均无效。表现最突出的是抗癌药 vorinostat,阻断了 91% 可驱动肝瘢痕形成的损伤反应。相关研究已发表于 Advanced Science。
Google DeepMind 宣布 AI co-clinician 研究计划,探索 AI 智能体在医生临床监督下协助患者诊疗的“三方照护”模式。在 98 个真实初级保健问题的盲评中,该系统 97 例无关键错误,医生对其回答的偏好高于现有证据综合工具;在 140 项问诊技能评估中,AI 在 68 项上达到或超过初级保健医生水平,但识别危险信号和指导关键体格检查仍不如专家医生。
推荐理由:Google DeepMind 公布 AI co-clinician 研究计划,用医生盲评和模拟问诊数据说明医疗智能体当前的能力边界。
Google DeepMind 发布 Decoupled DiLoCo 分布式训练架构,把大规模训练拆成相互解耦的计算“岛屿”,岛屿间异步传输数据,从而隔离局部硬件故障。
推荐理由:原文给出跨数据中心异步训练在带宽、容错和跨代硬件上的实测结果,可据此判断分布式预训练的工程取舍。
Google Research 在 ICLR 论文中提出 ReasoningBank,一个从成功和失败经验中蒸馏高层推理记忆的智能体框架,代码已开源。
推荐理由:论文给出从成功与失败经验中蒸馏记忆的框架,并附 WebArena 与 SWE-Bench-Verified 上的成功率与步数对比。
伯克利 AI 研究团队提出基于梯度的规划器 GRASP,通过将轨迹提升到虚拟状态实现跨时间并行优化、向状态迭代直接注入随机性以探索、并重塑梯度让动作获得清晰信号,从而让世界模型的长时程规划变得可行。
Google Research 提出推理优先的合成数据生成框架 Simula,将数据集生成重构为机制设计问题,通过全局多样化、局部多样化、复杂化和双批评者质量检查四个步骤,实现无种子、智能体式的数据集构建。
Google Research 提出 MoGen(Neuronal Morphology Generation),用 PointInfinity 点云流匹配模型生成合成神经元形态,为 PATHFINDER 重建模型补充训练数据,使小鼠轴突重建误差率降低 4.4%,主要来自 merge error 的减少。
Google 在 Google Labs 上线研究实验 Vantage,用生成式 AI 构建模拟对话环境,评估高中与大学生面向未来的技能,目前提供英文版并可注册。Vantage 与纽约大学合作开发,由 Executive LLM 动态引导对话、AI Evaluator 依据评分量表打分,在 188 名 18-25 岁美国测试者中,AI 评分与人类专家评分的一致性接近两位专家评分者之间的一致性。
Google Research 推出 ConvApparel 数据集,包含超 4,000 段人机多轮对话、近 15,000 轮,用于量化 LLM 用户模拟器与真实人类的真实感差距。该数据集采用双智能体采集协议,参与者被随机分配到有帮助的 "Good" 智能体或故意不帮忙的 "Bad" 智能体,并配有逐轮用户满意度标注。研究同时提出基于群体统计对齐、人类相似度评分和反事实验证的三支柱评估框架。
Google 发布两款学术智能体:PaperVizAgent 用于生成论文配图,ScholarPeer 用于自动同行评审。PaperVizAgent 由检索、规划、风格、可视化和评审五个智能体协作,在 0-100 分评测中总分 60.2,超过 GPT-Image-1.5、Nano-Banana-Pro、Paper2Any,是唯一超过 50.0 人类基线的框架。
Google Research 提出一套框架,用改编自 IRI、ERQ 等心理学问卷的情境判断测试(SJT),在真实用户-助手场景中评估 LLM 行为倾向与人类共识的对齐程度。
Google Research 在《Forest vs Tree: The (N, K) Trade-off in Reproducible ML Evaluation》中研究了评测条目数与每条目标注者数的权衡,发现常用的 1、3、5 名标注者往往不足,可靠结果常需每条目 10 名以上标注者。
Google Quantum AI 发布白皮书,给出破解 256 位椭圆曲线离散对数问题(ECDLP-256)的更新量子资源估算:两个实现 Shor 算法的量子电路分别使用不到 1。
推荐理由:Google Quantum AI 给出破解 ECDLP-256 的更新资源估算,并用零知识证明确认结论而不泄露攻击细节。
Google 发布 TurboQuant 压缩算法,用于解决向量量化中的内存开销问题,并同时提出 QJL 和 PolarQuant 两种配套方法,三篇工作将分别亮相 ICLR 2026 和 AISTATS 2026。
推荐理由:Google 提出的向量量化方法把 KV cache 压到 3 bit 且不损失精度,读者可据此判断长上下文推理的内存成本走向。
Google Research 发布 S2Vec,一个自监督框架,用于学习建成环境的通用嵌入向量,将建筑、道路等地理要素栅格化为多层图像后用掩码自编码(MAE)训练。在人口密度、收入等社会经济预测的零样本地理外推任务上,S2Vec 通常是最佳单一模型,与图像嵌入做多模态融合后表现普遍优于任一单一模态;但在树木覆盖、海拔等环境任务上仍需改进。
Google Research 与多家 NHS 机构合作的 AIMS 研究在 Nature Cancer 发表两项配套研究,评估 AI 乳腺癌检测系统。
推荐理由:两项 Nature Cancer 研究给出 AI 读片在 NHS 双读流程中的敏感度、时间与仲裁数据,可了解医疗 AI 落地的真实约束。
Google 与康奈尔大学在《美国国家科学院院刊》发表研究,让 GPT-4o、Perplexity、Claude 3.5、Gemini Advanced Pro 1.5、NotebookLM 和一套自建 RAG 系统回答 67 道高温超导专家级问题,由 12 位国际专家按平衡性、全面性、简洁性、证据、图像相关性和定性反馈六项指标盲评打分。
Berkeley AI Research 提出 SPEX 与 ProxySPEX 算法,用于在规模化下识别 LLM 的关键交互。SPEX 利用稀疏性与低阶性,将交互搜索转化为稀疏恢复问题;ProxySPEX 进一步利用层次结构,以约 10 倍更少的消融达到 SPEX 的性能。在情感分析任务上,SPEX 在上下文扩展至数千特征时仍保持高忠实度,而 LIME、Banzhaf 等边际方法忠实度明显更低。
Google Research 与 Beth Israel Deaconess Medical Center 合作开展了一项前瞻性单中心可行性研究,让 AMIE 在门诊初级保健就诊前与患者进行文本问诊,全程由医生通过视频监督。
推荐理由:Google 与 BIDMC 的 AMIE 真实门诊可行性研究,给出安全停用次数、诊断一致率与患者态度变化等一手数据。
伯克利 AI 研究团队提出一种直接评估和优化成像系统信息量的框架,仅用含噪测量和噪声模型即可估计互信息,无需任务专用解码器。该信息指标在彩色摄影、射电天文、无镜头成像和显微镜四个领域均能预测解码器性能,优化后的设计可媲美端到端方法,且内存和算力需求更低。相关成果发表于 NeurIPS 2025。
伯克利 AI 研究团队证明,在若干温和近似条件下,word2vec 的学习问题可化简为无权重最小二乘矩阵分解,其梯度流动力学有闭式解,最终学到的表示等价于对目标矩阵 M* 做 PCA。该矩阵仅由词共现概率、unigram 概率和算法超参数决定,从小初始化训练时模型按离散步骤逐个学习正交线性子空间,每步提升嵌入矩阵的秩并降低损失,理论预测与数值实验高度吻合。