Anthropic 的 Claude Science 首次绘制完整紫外天图
Anthropic 的 Claude Science 首次绘制出完整的紫外天图。该项目由 Claude Science 协调多个 AI 智能体,从多个太空任务下载数据、进行校准并合并,再用 inpainting 技术补全缺失区域。
Anthropic 的 Claude Science 首次绘制出完整的紫外天图。该项目由 Claude Science 协调多个 AI 智能体,从多个太空任务下载数据、进行校准并合并,再用 inpainting 技术补全缺失区域。
Google Research 在 NBER 发布三个月实地实验,将 133 名专利律师随机分为两组,一组提前使用当时未发布的 Google Labs AI 专利撰写工具(现属 Gemini Notebook)。
推荐理由:三个月专利撰写实验区分了AI带来的即时产出提升与无辅助判断力的变化,为评估AI对专业能力的影响提供了可迁移的实验设计。
Google 发布《Open and Emergent Problems in Agentic Privacy and Security: A Contextual Angle》 workshop 报告,由 50 多位学界与业界人士在 2025 年底纽约 Google CAPS Workshop 上共同完成。
微软 Copilot Studio 团队与 Hugging Face 联合发布 ThinkingBox,通过隔离的 MCP 工具会话运行智能体,按终端后端状态和副作用而非生成文本判分,覆盖 507 个有状态业务流程、每个任务重复 20 次。
推荐理由:微软与 Hugging Face 联合发布的智能体评测基准,用后端状态而非生成文本判分,并给出可复现的 OpenEnv 运行方式。
卡内基梅隆、MIT、纽约大学和斯坦福的研究团队开发出 AI Ataraxos,以 15 胜 1 负 4 平击败被视为史上最强的 Stratego 选手 Pim Niemeijer。Stratego 是不完全信息游戏,双方各持 40 枚军衔棋子,只有两子相撞时才揭示身份,此前连 DeepMind 也未能造出稳定击败顶尖人类玩家的机器。该研究训练仅用 16 块 GPU 和数千美元。
北航、港中文与新国大团队提出 OmniHarness,通过符号策略学习把验证有效的视觉创作流程提炼成可复用的方法库,参数不变、不微调模型。在 ComfyBench 创意任务上解决率达 95%,比最强对照 SymbOmni 高 27.5 个百分点;同用 GPT-4o 时总体解决率为 89.5%,高于 ComfyMind 的 83%。
斯坦福团队在 HomeBody 项目中让 GPT-6 Astra 控制宇树 G1 进入陌生厨房,先探索建图,再按语言指令收拾物品、丢弃纸盒,甚至从视野外的抽屉取药递给人。
Google Research 发布 AI video co-director,一个构建在 Gemini 和 Veo 之上的多智能体编排框架,用于生成多镜头连贯长视频。
推荐理由:Google 把长视频生成拆成四个可组合框架,并给出多镜头一致性与角色保持的评测结果。
Google Research 发布一项研究实验,让教师借助生成式 UI(GenUI)为 STEM 课程动态生成可交互的学习模拟,并同步开放 30 多个经教师审核的英文学习互动示例库,覆盖物理、化学、生物和数学,面向初高中。
Google Research 提出 ToolGrad,一种“先答案后问题”的工具调用数据生成范式:先生成真实工具调用链,再反推用户提示词,替代 ToolBench、ToolACE 等基于 DFS 试错搜索的查询优先方案。
Google DeepMind 发表论文,用 100 个运行 Gemini 3.1 Pro 的自主智能体协作求解 71 道数学题,系统提示明确禁止作弊。11:18 UTC 启动后,智能体在 12:15 已正确解出 37 题,随后 prover-theta 发现自动评分系统漏洞,27 分钟内漏洞经共享知识库和私信在群体中扩散,剩余 34 题被“解出”。
Google 在 Google Earth AI 下推出实验性研究能力行星预测引擎(PPE),可依据自然语言查询自主完成地理空间数据发现、特征工程、模型训练与评估,将建模时间从数周缩短到数分钟。
推荐理由:原文给出 PPE 在公共卫生、粮食安全与疫情预测上的量化提升,可了解自主智能体如何接管地理空间建模全流程。
Google 在 CHI 2026 发布研究原型 AgentHands,可将 LLM 的高层推理映射为 XR 中与语音同步的手势,让智能体在 3D 空间里边说边演示。
METR 研究显示 AI 对科学的加速并不均衡:2026 年网络安全漏洞报告速度较 2025 年大幅加快,数学领域贡献有限,AI 研究本身则未见可测量的加速。多校团队提出 SPADE,通过自博弈让 LLM 交替生成可执行训练环境并求解,在 Qwen3-30B-A3B 上游戏环境套件均分达 58.3,较基线提升 8.1。
Google 推出 Biomarker Discovery Framework,一个在人类监督下将候选生物标志物优先级排序结构化为迭代研究循环的多智能体系统,结合假设生成、并行统计分析、模型训练、对抗验证与文献推理。
Import AI 第 469 期介绍了 DiG-bench(Discovery in Games)基准,包含 70 款隐藏规则的游戏,用于测试 AI 通过探索自主发现环境规则的能力,目前仅公开 21 款。
Hugging Face 在 7 月 15 日至 8 月 2 日的黑客松中,组织 1221 名社区成员用 Claude Code、Codex、Cursor 等编码智能体逐条复现 ICML 2026 论文,共发布 6816 份 Trackio logbook,覆盖 2226 篇论文,约占会议论文的 34%。
推荐理由:Hugging Face 公开了 2200 余篇 ICML 论文的复现结果与判定数据,可据此了解智能体做科研复现的边界。
Google Research 发布 AMIE (Video),基于 Gemini 和 Project Astra 构建,可在实时视频问诊中感知非语言线索、引导虚拟体格检查并同步完成诊断推理。
推荐理由:Google 用 300 场随机对照视频问诊给出 AMIE 与真人医生同级的评测结果,可看多智能体架构如何拆分实时对话与推理。
Hugging Face 的 ALTK-Evolve 与 ACE 同为无需权重更新的智能体记忆方案,但前者按任务检索少量高支持度指南,而非每步注入完整 playbook。
本期 Import AI 汇总多项研究:多伦多大学、Vector Institute、剑桥大学与 ServiceNow 的研究者构建了自维持 AI 蠕虫原型,利用被攻陷机器的 GPU 运行开源权重 LLM 进行推理并自我复制,漏洞检测成功率约 80%、利用成功率约 53%、自我复制成功率 88%,整体攻击成功率约 37%。
Google Research 提出 Chain-of-Evidence(CoE)可验证性框架,并以此构建自主科研原型 Science One Framework,配套 CoE Audit 自动评估指标。
推荐理由:原文给出可验证性框架与审计指标,并对比多个自主科研系统的引用与代码对齐表现。
微软研究院提出 Echoverse,为 computer-use 智能体构建 12 个训练世界,包括 10 个深度领域世界和 2 个能力世界,强调行为保真、状态一致、工作流深度和基于数据库的验证。
推荐理由:微软研究院公开了合成环境工厂的构建流程与训练数据,读者可据此理解高保真环境如何影响 computer-use 智能体的训练效果。
Epoch 与 METR 发布 MirrorCode 基准,用于测试 AI 系统在长周期编程任务上的表现,任务要求仅凭 CLI 访问、在没有源码和网络的情况下重新实现完整程序。
Berkeley AI Research 提出 ABBEL 框架,将 LLM 的摘要内容隔离为自然语言"信念状态"并加以监督,以替代完整交互历史作为智能体的工作上下文。在协作编程基准 CollabBench 上,基于重建的信念评分(rec-BG)将 ABBEL 与全上下文模型的性能差距缩小约 50%,训练步数从 100 步降至 50 步,峰值上下文 token 数也低于全上下文设置。
Google Research 发布研究论文 SymptomAI,用五个基于 Gemini Flash 2.0 的对话式智能体对 13917 名参与者进行端到端症状问诊与鉴别诊断(DDx)评估。
推荐理由:Google 用 13917 人随机对照研究比较 SymptomAI 与真实临床医生的鉴别诊断,并给出可穿戴生物信号佐证。
Google Research 发布 SensorFM,一个直接从无标注可穿戴数据学习的大型传感器基础模型,预训练语料超过一万亿分钟多模态信号,来自五百万名同意参与者。
推荐理由:Google 用一万亿分钟可穿戴数据预训练通用生理表征,读者可了解基础模型在健康领域的规模化路径。
Hugging Face 发布 ScarfBench(Self-Contained Application Refactoring Benchmark),用于评测 AI 智能体在 Spring、Jakarta EE、Quarkus 之间的跨框架迁移能力,包含 34 个应用、102 个框架实现、204 个迁移任务和 1331 个专家测试。
NVIDIA 推出 ENPIRE 框架,让编码智能体驱动真实机械臂自主试错、改进策略并自动重置环境,在 PushT、整理插针等任务上达到 99% 成功率,测试硬件为双 YAM 机械臂加 RTX 5090 工作站。GPT-5.5 在 Codex 中与 Opus 4.7 在 Claude Code 中表现互有胜负,Kimi-2.6 落后,8 个智能体并行时得分更高。
Google DeepMind 公布在塞拉利昂开展的预注册随机对照试验结果,使用 Guided Learning 的学生数学成绩比对照组提升 0.258 个标准差,约相当于 1.2 至 1.7 年的常规学习进度,八周内完成。
推荐理由:原文给出塞拉利昂随机对照试验的量化结果与交互数据,可了解 AI 辅助教学的实际效果与局限。
Google 发布 Empirical Research Assistance(ERA),一个用 Gemini 编写和优化科学代码的研究工具,相关论文今日发表于 Nature。
推荐理由:Google 把 ERA 从 Nature 论文推进到可申请使用的工具,读者可据此判断科研编码自动化的落地进度。
Google DeepMind 宣布 AI co-clinician 研究计划,探索 AI 智能体在医生临床监督下协助患者诊疗的“三方照护”模式。在 98 个真实初级保健问题的盲评中,该系统 97 例无关键错误,医生对其回答的偏好高于现有证据综合工具;在 140 项问诊技能评估中,AI 在 68 项上达到或超过初级保健医生水平,但识别危险信号和指导关键体格检查仍不如专家医生。
推荐理由:Google DeepMind 公布 AI co-clinician 研究计划,用医生盲评和模拟问诊数据说明医疗智能体当前的能力边界。
Google Research 在 ICLR 论文中提出 ReasoningBank,一个从成功和失败经验中蒸馏高层推理记忆的智能体框架,代码已开源。
推荐理由:论文给出从成功与失败经验中蒸馏记忆的框架,并附 WebArena 与 SWE-Bench-Verified 上的成功率与步数对比。
Google 在 Google Labs 上线研究实验 Vantage,用生成式 AI 构建模拟对话环境,评估高中与大学生面向未来的技能,目前提供英文版并可注册。Vantage 与纽约大学合作开发,由 Executive LLM 动态引导对话、AI Evaluator 依据评分量表打分,在 188 名 18-25 岁美国测试者中,AI 评分与人类专家评分的一致性接近两位专家评分者之间的一致性。
Google Research 推出 ConvApparel 数据集,包含超 4,000 段人机多轮对话、近 15,000 轮,用于量化 LLM 用户模拟器与真实人类的真实感差距。该数据集采用双智能体采集协议,参与者被随机分配到有帮助的 "Good" 智能体或故意不帮忙的 "Bad" 智能体,并配有逐轮用户满意度标注。研究同时提出基于群体统计对齐、人类相似度评分和反事实验证的三支柱评估框架。
Google 发布两款学术智能体:PaperVizAgent 用于生成论文配图,ScholarPeer 用于自动同行评审。PaperVizAgent 由检索、规划、风格、可视化和评审五个智能体协作,在 0-100 分评测中总分 60.2,超过 GPT-Image-1.5、Nano-Banana-Pro、Paper2Any,是唯一超过 50.0 人类基线的框架。