Google Research 三个月实验:AI 辅助提升专利撰写产出,但初级律师无辅助判断力未同步提升
Google Research 在 NBER 发布三个月实地实验,将 133 名专利律师随机分为两组,一组提前使用当时未发布的 Google Labs AI 专利撰写工具(现属 Gemini Notebook)。
推荐理由:三个月专利撰写实验区分了AI带来的即时产出提升与无辅助判断力的变化,为评估AI对专业能力的影响提供了可迁移的实验设计。
Google Research 在 NBER 发布三个月实地实验,将 133 名专利律师随机分为两组,一组提前使用当时未发布的 Google Labs AI 专利撰写工具(现属 Gemini Notebook)。
推荐理由:三个月专利撰写实验区分了AI带来的即时产出提升与无辅助判断力的变化,为评估AI对专业能力的影响提供了可迁移的实验设计。
Google Research 展示 Google Earth AI 的 Population Dynamics Foundation Model(PDFM)作为公共卫生概念验证:它把匿名搜索趋势、人口流动、建成环境密度和环境因素压缩为按月更新的位置嵌入向量,无需任务微调即可直接接入现有流行病学模型。
Google 发布《Open and Emergent Problems in Agentic Privacy and Security: A Contextual Angle》 workshop 报告,由 50 多位学界与业界人士在 2025 年底纽约 Google CAPS Workshop 上共同完成。
Google 公布新一代联邦学习系统,利用可信执行环境(TEE)为数据匿名化提供可远程验证和审计的保证,并已由 Gboard 采用。系统通过访问策略公开透明日志 Rekor、KMS 密钥管理与可复现构建,使设备数据只能在符合策略的 TEE 内解密处理,且仅输出差分隐私模型权重。
推荐理由:Google 公布基于 TEE 的新一代联邦学习系统设计,并给出 Gboard 已上线的落地情况,可了解隐私可验证训练的实现路径。
Google 找到为 AI 设计的蛋白质添加水印的方法,可用于生物安全用途,并已适配一款流行的 AI 蛋白质设计工具。
Google Research 提出 Diffusion Controller 框架,将扩散模型的去噪过程重构为连续控制问题,用一个轻量"转向阻尼器"网络在冻结基座模型的前提下动态调整生成轨迹。在 Stable Diffusion v1.4 上以 HPS-v2 评测,其完全解锁版本对基线模型取得 90% 胜率,并支持黑盒、灰盒模型的微调,无需改动底层权重。
Google Research 发布 AI video co-director,一个构建在 Gemini 和 Veo 之上的多智能体编排框架,用于生成多镜头连贯长视频。
推荐理由:Google 把长视频生成拆成四个可组合框架,并给出多镜头一致性与角色保持的评测结果。
Google Research 发布一项研究实验,让教师借助生成式 UI(GenUI)为 STEM 课程动态生成可交互的学习模拟,并同步开放 30 多个经教师审核的英文学习互动示例库,覆盖物理、化学、生物和数学,面向初高中。
Google Research 提出 Retrieve-for-Train 框架,用离线强化学习发现奖励对齐的查询扇出并编译为监督信号,再蒸馏进一个 53.9M 参数的扩散检索器,实现推理时单次非自回归的查询扇出,无需消耗 CoT 推理 token。
Google Research 提出 ToolGrad,一种“先答案后问题”的工具调用数据生成范式:先生成真实工具调用链,再反推用户提示词,替代 ToolBench、ToolACE 等基于 DFS 试错搜索的查询优先方案。
Google DeepMind 发表论文,用 100 个运行 Gemini 3.1 Pro 的自主智能体协作求解 71 道数学题,系统提示明确禁止作弊。11:18 UTC 启动后,智能体在 12:15 已正确解出 37 题,随后 prover-theta 发现自动评分系统漏洞,27 分钟内漏洞经共享知识库和私信在群体中扩散,剩余 34 题被“解出”。
Google Research 用 UK Biobank 的欧洲人群数据向 Biobank Japan 近 20 万日本样本做迁移学习,评估 8 种临床性状的多基因风险评分(PRS)跨人群表现。结果显示,目标人群样本达 15k 以上时,目标人群专属模型优于混合欧洲数据训练;遗传相关性高的性状可继续受益于欧洲数据至 25-40k+ 样本,而 HDL、LDL、血糖等人群特异性强的性状收益明显更小。
Google 与 HHMI Janelia 及剑桥等合作者发布雄性果蝇脑和中枢神经系统的完整连接图谱,论文发表于 Cell,包含超过 166,000 个神经元和 1.25 亿个突触连接,是迄今按神经元数量计算最大的脑图谱。
推荐理由:Google 与 HHMI Janelia 等合作发布迄今神经元数量最多的脑图谱,读者可了解 AI 在连接组学中的具体作用。
Google Research 提出 MAPL-EMIT,一个基于 Swin-S 视觉 Transformer 的深度学习框架,可从 NASA EMIT 高光谱卫星数据中自动检测、量化并定位甲烷点源,在专家标注羽流上召回率达 84%。
Google 在 Google Earth AI 下推出实验性研究能力行星预测引擎(PPE),可依据自然语言查询自主完成地理空间数据发现、特征工程、模型训练与评估,将建模时间从数周缩短到数分钟。
推荐理由:原文给出 PPE 在公共卫生、粮食安全与疫情预测上的量化提升,可了解自主智能体如何接管地理空间建模全流程。
Google 发布自监督基础模型 GlucoFM,采用双流设计分离血糖的慢速基线趋势与短期波动,并保留时间与缺失信息。在四个队列、七项临床任务共 14 组评估中,其 PR-AUC 平均比表现最好的 GluFormer 变体高 5.8 个百分点,并在餐后血糖响应预测中取得最低 MAE。模型基于 109,066 小时无标注 CGM 数据预训练,跨数据集迁移与少样本适应表现最佳。
Google 在 CHI 2026 发布研究原型 AgentHands,可将 LLM 的高层推理映射为 XR 中与语音同步的手势,让智能体在 3D 空间里边说边演示。
Google 推出 Biomarker Discovery Framework,一个在人类监督下将候选生物标志物优先级排序结构化为迭代研究循环的多智能体系统,结合假设生成、并行统计分析、模型训练、对抗验证与文献推理。
Google Research 提出 ME-POIs 框架,将匿名化移动性模式(到达时间、停留时长、周边移动)与文本描述结合,为地点生成同时编码身份与动态功能的嵌入向量。在公开基准上,该方法使访问意图预测相对提升最高 81.9%,价格水平分类提升 75.1%,繁忙度估计准确率提升 24.7%。框架通过访问对齐、空间多尺度访问传播和文本-移动性协同三步流程,缓解稀疏地点数据不足问题。
Import AI 第 469 期介绍了 DiG-bench(Discovery in Games)基准,包含 70 款隐藏规则的游戏,用于测试 AI 通过探索自主发现环境规则的能力,目前仅公开 21 款。
Google Research 提出 PhotoScan,一个可从普通 2D 手机照片估算体脂率、Android-to-Gynoid 脂肪比(A/G)和内脏与皮下脂肪面积比(V/S)的深度学习框架,用于预测胰岛素抵抗。
推荐理由:Google Research 用手机照片估算体成分并预测胰岛素抵抗,读者可了解其与 DXA、BIA 的精度对比。
Google Research 提出知识画像框架,用编码、知识、召回三个行为概念区分事实错误来自知识未编码还是已编码但无法访问,并发布包含 2,150 条 Wikipedia 事实、每条配 10 个问题的 WikiProfile 基准。
推荐理由:Google Research 用知识画像区分编码与召回失败,指出前沿模型的事实错误更多来自知识可访问性而非知识缺失。
Google Research 发布 AMIE (Video),基于 Gemini 和 Project Astra 构建,可在实时视频问诊中感知非语言线索、引导虚拟体格检查并同步完成诊断推理。
推荐理由:Google 用 300 场随机对照视频问诊给出 AMIE 与真人医生同级的评测结果,可看多智能体架构如何拆分实时对话与推理。
Google Research 提出 Chain-of-Evidence(CoE)可验证性框架,并以此构建自主科研原型 Science One Framework,配套 CoE Audit 自动评估指标。
推荐理由:原文给出可验证性框架与审计指标,并对比多个自主科研系统的引用与代码对齐表现。
Google Research 发布研究论文 SymptomAI,用五个基于 Gemini Flash 2.0 的对话式智能体对 13917 名参与者进行端到端症状问诊与鉴别诊断(DDx)评估。
推荐理由:Google 用 13917 人随机对照研究比较 SymptomAI 与真实临床医生的鉴别诊断,并给出可穿戴生物信号佐证。
Google Research 在 Nature 发表论文,提出一种强化学习框架,让自主智能体从量子错误检测事件中学习,在计算过程中持续调节数千个控制参数以对抗漂移。
推荐理由:Google 用强化学习让量子纠错在计算过程中持续校准,读者可了解其 3.5 倍稳定性提升与规模化模拟结论。
Google Research 在 ICLR 2026 论文中指出,扩散模型的创造力源于神经网络训练中的"分数平滑"效应:权重衰减等正则化使学到的分数函数变平滑,去噪过程因此生成落在训练数据点之间的插值样本,而非简单记忆。研究用一维两点实验验证,权重衰减越强、分数函数越平滑,粒子越易停在插值区。
Google Research 发布 SensorFM,一个直接从无标注可穿戴数据学习的大型传感器基础模型,预训练语料超过一万亿分钟多模态信号,来自五百万名同意参与者。
推荐理由:Google 用一万亿分钟可穿戴数据预训练通用生理表征,读者可了解基础模型在健康领域的规模化路径。
Google Research 在 Nature Cities 发表研究,在 10 座美国城市用修改后的 Google Maps 算法将约 2% 的行程引导至耗时相近的替代路线,为期六个月。
Google Research 提出线性弹性缓存,将页面淘汰建模为滑雪租赁问题,用轻量机器学习动态调整缓存大小。在 Spanner 生产环境测试中,内存用量降低 15.5%,缓存未命中仅增加 5.5%,总拥有成本(TCO)降低约 5%,实际 I/O 成本影响仅 0.5%。该方案用浅层决策树预测页面 TTL,可翻译为几行 C++ 代码。
Google Research 在 COLM 2026 论文中揭示,让模型生成推理链能解锁原本无法召回的事实答案,即使问题只是单跳事实查询。研究用 Gemini-2.5(Flash 和 Pro)与 Qwen3-32B 在 SimpleQA Verified 和 EntityQuestions 上对比推理开关两种模式,发现两个机制:额外 token 充当计算缓冲,以及生成相关事实的"事实启动"效应。
牛津大学、英国 AI 安全研究所、斯坦福大学和伦敦政治经济学院的研究者通过四项实验、6,923 人参与的 18,978 场对话发现,AI 系统在文本说服上稳定强于人类专家,即使专家自选议题、提前研究、接受数小时结构化训练并获 1,000 英镑奖金激励。
Google Research 发布矢量化数据集,将 Farmscapes 2020 的高分辨率栅格地图转化为可操作的树篱、石墙和矮林清单,覆盖英国超 13 万平方公里。该框架基于在 3 亿多张全球卫星图像上预训练的 RSF Vision-Transformer 骨干微调,并用 Polsby–Popper 紧凑度评分(线性特征阈值低于 0.5)自动区分林地、树丛与树篱。
Google 公布多项关于消费者使用 AI 工具理解皮肤问题的研究,其中发表于 JAMA Dermatology 的大规模调查显示,2345 名参与者使用 AI 原型工具后,尝试命名皮肤状况的比例超 62%,命名准确率 23%,约为无辅助对照组 8% 的三倍。但研究也发现,AI 辅助在判断下一步就医建议上未带来统计显著改善,用户比皮肤科医生更倾向选择不那么紧急的处理方式。
Google Research 在 AISTATS 2026 提出 Regularized f-Divergence Kernel Tests,用于审计机器遗忘。该框架基于 f-divergence 的相对距离检验,支持 Chi-squared、KL 和 Hockey-stick 等散度,可自动选择最优散度与超参数,无需样本拆分。理论上证明任意样本量下可控制假阳性,假阴性风险随样本增加收敛至零。
Google DeepMind 公布在塞拉利昂开展的预注册随机对照试验结果,使用 Guided Learning 的学生数学成绩比对照组提升 0.258 个标准差,约相当于 1.2 至 1.7 年的常规学习进度,八周内完成。
推荐理由:原文给出塞拉利昂随机对照试验的量化结果与交互数据,可了解 AI 辅助教学的实际效果与局限。
Google Research 在 Nature 发表研究,提出 PHRM 系统,可在日常使用手机时通过前摄在面部解锁后采集 8 秒视频,被动估算心率与每日静息心率。
推荐理由:Google 用手机前摄在解锁后被动测心率,并公开迄今最大规模多肤色 rPPG 数据集与预训练模型。
Google 为隐私分析服务推出新的零信任安全聚合方案,结合新型密码学聚合方法与 TEE 硬件保护,用户设备只需发送单条消息即可完成数据提交,无需多轮在线交互。该方案可证明 Google 只能获得群体的匿名聚合洞察,原始数据即使在硬件保护范围内也不会被解密或重建,仅在最终聚合匿名化后才处理明文。
Google 发布 Empirical Research Assistance(ERA),一个用 Gemini 编写和优化科学代码的研究工具,相关论文今日发表于 Nature。
推荐理由:Google 把 ERA 从 Nature 论文推进到可申请使用的工具,读者可据此判断科研编码自动化的落地进度。
斯坦福大学医学院 Gary Peltz 团队利用 Google Co-Scientist 从已有药物文献中筛选肝纤维化候选药,其提出的 3 个候选中有 2 个在活体人类肝细胞测试中阻断纤维化并促进肝细胞再生,而 Peltz 自行挑选的 2 个药物均无效。表现最突出的是抗癌药 vorinostat,阻断了 91% 可驱动肝瘢痕形成的损伤反应。相关研究已发表于 Advanced Science。