研究:AI 编码智能体生成更多代码,但未带来更多软件产出
哈佛大学研究者 Fiona Chen 和 James Stratton 基于 Jellyfish 的聚合分析数据,考察 2021 年至 2026 年 3 月间 700 多家软件开发公司、70 多万名员工的 3 亿条工作事件(如提交和 pull request),发现人工代码审查成为 AI 编码工具整体效率的显著瓶颈。
哈佛大学研究者 Fiona Chen 和 James Stratton 基于 Jellyfish 的聚合分析数据,考察 2021 年至 2026 年 3 月间 700 多家软件开发公司、70 多万名员工的 3 亿条工作事件(如提交和 pull request),发现人工代码审查成为 AI 编码工具整体效率的显著瓶颈。
Anthropic 的 Claude Science 首次绘制出完整的紫外天图。该项目由 Claude Science 协调多个 AI 智能体,从多个太空任务下载数据、进行校准并合并,再用 inpainting 技术补全缺失区域。
Google Research 在 NBER 发布三个月实地实验,将 133 名专利律师随机分为两组,一组提前使用当时未发布的 Google Labs AI 专利撰写工具(现属 Gemini Notebook)。
推荐理由:三个月专利撰写实验区分了AI带来的即时产出提升与无辅助判断力的变化,为评估AI对专业能力的影响提供了可迁移的实验设计。
英伟达团队基于 Nemotron 3 通过 SFT、RL 和生成-验证-精炼推理流程,在 IOI 2026 和 IMO 2026 双双达到金牌水平。IOI 2026 中 Nemotron-3-Ultra-CC 得 535.4/600,高于 361.12 的金牌线;IMO 2026 系统得 30/42,高于 29 的官方金牌线。
推荐理由:原文公开了从 Nemotron 3 微调到 IOI、IMO 金牌级成绩的完整配方与数据集,可据此复现领域专家模型。
OpenAI 发布内部前沿模型在数学开放问题上的新结果,并在 GitHub 上公开 Lean 证明形式化与研究细节。
推荐理由:OpenAI 公开内部前沿模型在数学开放问题上的结果,并放出 Lean 形式化证明,可供研究者直接查阅。
Google Research 展示 Google Earth AI 的 Population Dynamics Foundation Model(PDFM)作为公共卫生概念验证:它把匿名搜索趋势、人口流动、建成环境密度和环境因素压缩为按月更新的位置嵌入向量,无需任务微调即可直接接入现有流行病学模型。
Google 发布《Open and Emergent Problems in Agentic Privacy and Security: A Contextual Angle》 workshop 报告,由 50 多位学界与业界人士在 2025 年底纽约 Google CAPS Workshop 上共同完成。
PhAI Labs 联合斯坦福、牛津、普林斯顿的研究者提出 JEPA-Anything,把标准 JEPA 的单一预测拆成四个正交因子、各由独立预测模块处理,再重组为完整世界状态,在物理、机器人、天气等十个测试任务上优于同架构同数据的基线。
微软 Copilot Studio 团队与 Hugging Face 联合发布 ThinkingBox,通过隔离的 MCP 工具会话运行智能体,按终端后端状态和副作用而非生成文本判分,覆盖 507 个有状态业务流程、每个任务重复 20 次。
推荐理由:微软与 Hugging Face 联合发布的智能体评测基准,用后端状态而非生成文本判分,并给出可复现的 OpenEnv 运行方式。
Google 公布新一代联邦学习系统,利用可信执行环境(TEE)为数据匿名化提供可远程验证和审计的保证,并已由 Gboard 采用。系统通过访问策略公开透明日志 Rekor、KMS 密钥管理与可复现构建,使设备数据只能在符合策略的 TEE 内解密处理,且仅输出差分隐私模型权重。
推荐理由:Google 公布基于 TEE 的新一代联邦学习系统设计,并给出 Gboard 已上线的落地情况,可了解隐私可验证训练的实现路径。
卡内基梅隆、MIT、纽约大学和斯坦福的研究团队开发出 AI Ataraxos,以 15 胜 1 负 4 平击败被视为史上最强的 Stratego 选手 Pim Niemeijer。Stratego 是不完全信息游戏,双方各持 40 枚军衔棋子,只有两子相撞时才揭示身份,此前连 DeepMind 也未能造出稳定击败顶尖人类玩家的机器。该研究训练仅用 16 块 GPU 和数千美元。
微软研究院开发了一套端到端机器学习流水线,利用 L1 太阳风观测、AE 与 Dst 指数预报及地质电导率数据,为美国本土 66,935 座变电站生成 30-60 分钟前的局地空间天气风险估计。
Google 找到为 AI 设计的蛋白质添加水印的方法,可用于生物安全用途,并已适配一款流行的 AI 蛋白质设计工具。
Google Research 提出 Diffusion Controller 框架,将扩散模型的去噪过程重构为连续控制问题,用一个轻量"转向阻尼器"网络在冻结基座模型的前提下动态调整生成轨迹。在 Stable Diffusion v1.4 上以 HPS-v2 评测,其完全解锁版本对基线模型取得 90% 胜率,并支持黑盒、灰盒模型的微调,无需改动底层权重。
Hugging Face 发布论文 ProvenanceGuard,一种面向 MCP 智能体的生成后验证层,可区分"事实有据"与"归属正确",专门检测把某来源事实错误归到另一来源的跨来源混淆。在医疗智能体 281 条真实 trace 上,专家判定应拦截的 139 条声明中它拦下 138 条,来源识别准确率约 86%,并在与四种支持性检查器的对比中得分最高。
亚马逊与杜克大学团队发现,在On-Policy Distillation中每条推理轨迹只随机训练一个token(约0.05%信号),仍能稳定提升Qwen3系列9组teacher-student配置的数学推理能力,单个极端token甚至可匹配或超过full-token OPD,并出现学生反超教师的情况。该现象还扩展到coding reasoning、Llama系列和基于PPO的RLVR。
北航、港中文与新国大团队提出 OmniHarness,通过符号策略学习把验证有效的视觉创作流程提炼成可复用的方法库,参数不变、不微调模型。在 ComfyBench 创意任务上解决率达 95%,比最强对照 SymbOmni 高 27.5 个百分点;同用 GPT-4o 时总体解决率为 89.5%,高于 ComfyMind 的 83%。
慕尼黑 CESifo 经济学研究者 Robert Fairlie 与 Jane Wu 发布工作论文《The Early Impacts of AI on Employment Among Recent College Graduates》。
Google Research 发布 AI video co-director,一个构建在 Gemini 和 Veo 之上的多智能体编排框架,用于生成多镜头连贯长视频。
推荐理由:Google 把长视频生成拆成四个可组合框架,并给出多镜头一致性与角色保持的评测结果。
微软研究院对移动操作机器人工作负载做了系统性测量,发现把物理 AI 推理从机器人端侧 GPU 卸载到边缘或云端 GPU,可提升任务成功率、支持更大模型并延长续航。
推荐理由:微软研究院系统测量了机器人端侧推理的瓶颈,并给出可复用的 Kubernetes 卸载方案与开源工具链。
微软研究院在 Nature 发表逆向合成模型 RetroChimera,并开源其实现与权重(MIT 许可),同时可通过 Microsoft Foundry 访问。
Google Research 发布一项研究实验,让教师借助生成式 UI(GenUI)为 STEM 课程动态生成可交互的学习模拟,并同步开放 30 多个经教师审核的英文学习互动示例库,覆盖物理、化学、生物和数学,面向初高中。
Google Research 提出 Retrieve-for-Train 框架,用离线强化学习发现奖励对齐的查询扇出并编译为监督信号,再蒸馏进一个 53.9M 参数的扩散检索器,实现推理时单次非自回归的查询扇出,无需消耗 CoT 推理 token。
Google Research 提出 ToolGrad,一种“先答案后问题”的工具调用数据生成范式:先生成真实工具调用链,再反推用户提示词,替代 ToolBench、ToolACE 等基于 DFS 试错搜索的查询优先方案。
OpenAI 分享了一份 AI 生成的 Navier–Stokes 千禧年大奖难题解答,包含一份书面说明和一份 Lean 形式化证明。该问题为克雷数学研究所七项千禧年大奖难题之一。
Google DeepMind 发表论文,用 100 个运行 Gemini 3.1 Pro 的自主智能体协作求解 71 道数学题,系统提示明确禁止作弊。11:18 UTC 启动后,智能体在 12:15 已正确解出 37 题,随后 prover-theta 发现自动评分系统漏洞,27 分钟内漏洞经共享知识库和私信在群体中扩散,剩余 34 题被“解出”。
Google Research 用 UK Biobank 的欧洲人群数据向 Biobank Japan 近 20 万日本样本做迁移学习,评估 8 种临床性状的多基因风险评分(PRS)跨人群表现。结果显示,目标人群样本达 15k 以上时,目标人群专属模型优于混合欧洲数据训练;遗传相关性高的性状可继续受益于欧洲数据至 25-40k+ 样本,而 HDL、LDL、血糖等人群特异性强的性状收益明显更小。
Google 与 HHMI Janelia 及剑桥等合作者发布雄性果蝇脑和中枢神经系统的完整连接图谱,论文发表于 Cell,包含超过 166,000 个神经元和 1.25 亿个突触连接,是迄今按神经元数量计算最大的脑图谱。
推荐理由:Google 与 HHMI Janelia 等合作发布迄今神经元数量最多的脑图谱,读者可了解 AI 在连接组学中的具体作用。
Hugging Face 发布 BenchMIRT,一种在单条提示词层面审计 LLM 基准测试的新方法,基于多维项目反应理论(MIRT),在 100 个 LLM、16 个基准、超 34K 道题上训练。它未被告知各基准测什么,却自行识别出安全与通用推理两个主导维度,并发现 BBQ、WMDP 等基准的得分更多与通用推理相关而非安全。
Google Research 提出 MAPL-EMIT,一个基于 Swin-S 视觉 Transformer 的深度学习框架,可从 NASA EMIT 高光谱卫星数据中自动检测、量化并定位甲烷点源,在专家标注羽流上召回率达 84%。
Google 在 Google Earth AI 下推出实验性研究能力行星预测引擎(PPE),可依据自然语言查询自主完成地理空间数据发现、特征工程、模型训练与评估,将建模时间从数周缩短到数分钟。
推荐理由:原文给出 PPE 在公共卫生、粮食安全与疫情预测上的量化提升,可了解自主智能体如何接管地理空间建模全流程。
Google 发布自监督基础模型 GlucoFM,采用双流设计分离血糖的慢速基线趋势与短期波动,并保留时间与缺失信息。在四个队列、七项临床任务共 14 组评估中,其 PR-AUC 平均比表现最好的 GluFormer 变体高 5.8 个百分点,并在餐后血糖响应预测中取得最低 MAE。模型基于 109,066 小时无标注 CGM 数据预训练,跨数据集迁移与少样本适应表现最佳。
Google 在 CHI 2026 发布研究原型 AgentHands,可将 LLM 的高层推理映射为 XR 中与语音同步的手势,让智能体在 3D 空间里边说边演示。
Multiverse Computing 发布论文《Quantization-Aware Healing: A Practical Recipe for Recovering Compressed, 4-Bit LLMs》,提出 QAH 方法:在结构压缩并量化后,直接从压缩前的原始全精度模型蒸馏,而不是从恢复出的 bfloat16 checkpoint 蒸馏。
推荐理由:论文给出压缩加量化后从原始模型蒸馏的修复方案,并附9项基准对比,可看方法差异与代价。
METR 研究显示 AI 对科学的加速并不均衡:2026 年网络安全漏洞报告速度较 2025 年大幅加快,数学领域贡献有限,AI 研究本身则未见可测量的加速。多校团队提出 SPADE,通过自博弈让 LLM 交替生成可执行训练环境并求解,在 Qwen3-30B-A3B 上游戏环境套件均分达 58.3,较基线提升 8.1。
Google 推出 Biomarker Discovery Framework,一个在人类监督下将候选生物标志物优先级排序结构化为迭代研究循环的多智能体系统,结合假设生成、并行统计分析、模型训练、对抗验证与文献推理。
Google Research 提出 ME-POIs 框架,将匿名化移动性模式(到达时间、停留时长、周边移动)与文本描述结合,为地点生成同时编码身份与动态功能的嵌入向量。在公开基准上,该方法使访问意图预测相对提升最高 81.9%,价格水平分类提升 75.1%,繁忙度估计准确率提升 24.7%。框架通过访问对齐、空间多尺度访问传播和文本-移动性协同三步流程,缓解稀疏地点数据不足问题。
Hugging Face 发布研究,提出共识分歧探针、掩蔽实体检索和拼写切换三项测试来量化语音识别中的基准优化现象。
推荐理由:通过三项探针量化语音模型对基准的过拟合,并给出可复用的检测脚本与榜单入口。
微软研究院发布深度学习交换关联泛函 Skala 1.1,训练数据量为此前公开版本的 2.5 倍,在 GMTKN55 基准 55 个类别中 32 项排名第一,加权平均误差 2.8 kcal/mol。Skala 现已在 CP2K 中可用,并正集成进 Psi4、FHI-aims、ORCA 和 VASP。微软同时推出持续更新的基准,追踪后续 Skala 版本的计算性能。
Import AI 第 469 期介绍了 DiG-bench(Discovery in Games)基准,包含 70 款隐藏规则的游戏,用于测试 AI 通过探索自主发现环境规则的能力,目前仅公开 21 款。