Google DeepMind 联合多方发起最高 1000 万美元多智能体 AI 安全研究资助
Google DeepMind 联合 Schmidt Sciences、Cooperative AI Foundation、ARIA 并获 Google.org 支持,发起最高 1000 万美元的多智能体 AI 安全技术研究资助,面向全球研究者征集方案。
Google DeepMind 联合 Schmidt Sciences、Cooperative AI Foundation、ARIA 并获 Google.org 支持,发起最高 1000 万美元的多智能体 AI 安全技术研究资助,面向全球研究者征集方案。
Google DeepMind 公布在塞拉利昂开展的预注册随机对照试验结果,使用 Guided Learning 的学生数学成绩比对照组提升 0.258 个标准差,约相当于 1.2 至 1.7 年的常规学习进度,八周内完成。
推荐理由:原文给出塞拉利昂随机对照试验的量化结果与交互数据,可了解 AI 辅助教学的实际效果与局限。
本期 Import AI 汇总多项研究:伦敦国王学院、复旦大学与艾伦图灵研究所构建 SocioHack 基准,含 72 个沙盒社会环境,测试 AI 在信用卡积分、学校评分等场景中钻制度漏洞的能力,RL 训练的 LLM 在历史子集上以 61.25% 召回率、90.85% 精确率重新发现已被修补的漏洞策略。
Google 在 Gemini Enterprise Agent Platform 上推出由 Agentic RAG 驱动的 Cross-Corpus Retrieval 公开预览版。
推荐理由:原文给出多智能体 RAG 的架构细节与跨语料评测数据,读者可据此判断复杂多跳查询的落地方式。
Google Research 在 I/O 2026 发布 Gemini for Science,包含基于 ERA 与 AlphaEvolve 的 Computational Discovery、基于 Co-Scientist 的 Hypothesis Generation 及基于 NotebookLM 的 Literature Insights。
Mistral 在 AI Now Summit 2026 上发布面向工业工程的 AI 栈,与 Airbus、BMW、ASML 合作优化设计、仿真与生产,同时保持对专有数据和 IP 的控制。
推荐理由:Mistral 一次性给出工业 AI 栈、Vibe 智能体和自建推理数据中心三条产品线,可据此判断其企业级全栈布局。
Mistral 将 Le Chat 升级为统一 AI 智能体 Vibe,同时覆盖办公与编码场景,原有对话、设置和订阅方案全部保留。
推荐理由:Mistral 把 Le Chat 升级为统一智能体 Vibe,同时覆盖办公长任务与编码流程,读者可据此判断其与现有 Agent 产品的差异。
Mistral 发布 Mistral Medium 3.5,这是其首个合并指令遵循、推理与编码的 128B 稠密旗舰模型,采用修改版 MIT 许可开放权重,支持 256k 上下文窗口,最少四块 GPU 即可自托管,在 SWE-Bench Verified 上得分 77.6%,超过 Devstral 2 和 Qwen3.5 397B A17B。
推荐理由:Mistral 把编码智能体搬到云端并同步开源 128B 旗舰模型,读者可据此判断自托管与异步编码的可行边界。
Mistral AI 在 Studio 发布 Connectors,内置连接器和自定义 MCP 均可通过 API/SDK 用于所有模型与 Agent 调用,目前处于 Public Preview。
推荐理由:原文给出连接器注册、直接工具调用与人工审批三段能力,读者可据此判断企业级 Agent 集成层的落地方式。
Google 发布 Empirical Research Assistance(ERA),一个用 Gemini 编写和优化科学代码的研究工具,相关论文今日发表于 Nature。
推荐理由:Google 把 ERA 从 Nature 论文推进到可申请使用的工具,读者可据此判断科研编码自动化的落地进度。
Google DeepMind 介绍生物学家 Omar Abudayyeh 和 Jonathan Gootenberg 的实验室使用 Co-Scientist 加速衰老研究。
Google DeepMind 在实验性原型 Project Genie 中上线 Street View 真实影像锚定能力,用户可在地图上选择美国地点并搭配风格与角色描述,生成以真实地点为起点的可交互世界。
推荐理由:官方说明 Genie 接入 Street View 真实影像,读者可了解世界模型如何以真实地点为锚点生成可交互环境。
Google DeepMind 发布 Gemini for Science,包含 Google Labs 上三项实验原型:基于 Co-Scientist 的 Hypothesis Generation。
推荐理由:Google 把 Co-Scientist、AlphaEvolve 等研究原型打包成可申请试用的科学工具,读者可据此判断科研智能体的落地路径。
Google DeepMind 与新加坡政府达成国家 AI 合作,在医疗、科研、教育和可持续发展领域推出新项目。合作探索 AI 辅助临床的“三方护理”模式,并用 AlphaFold、Google Earth 等工具推进东南亚传染病与疫情防范研究,同时开发基于 Gemma 的视障跑者助手。
Calico Life Sciences 的 Matt Onsum 与 Katherine Labbé 正使用 Google 的 Co-Scientist 整合衰老生物学中零散的研究发现并转化为可验证假设。
爱丁堡大学生物工程师 Filippo Menolascina 使用 Google Co-Scientist 梳理文献、生成新假说,以缩小 MASH 潜在药物组合的搜索范围。该系统针对 resmetirom 为何仅对少数合格患者有效,提出 NLRP3 炎症小体是连接炎症与代谢的分子桥梁,该假说随后经实验验证,或为靶向双重疗法铺路。
Google DeepMind 发布 Gemini 3.5 模型系列,首发的 3.5 Flash 面向智能体与编码任务,在 Terminal-Bench 2.1 取得 76.2%、GDPval-AA 取得 1656 Elo、MCP Atlas 取得 83.6%,多模态理解在 CharXiv Reasoning 上为 84.2%,输出速度是其他前沿模型的 4 倍。
推荐理由:官方给出 3.5 Flash 在编码与智能体基准上的具体分数和速度对比,可据此判断其能力定位。
Google DeepMind 在 Nature 发表 Co-Scientist 研究,推出基于 Gemini 的多智能体 AI 系统,可迭代生成、辩论和演化复杂科学问题的新假设。
推荐理由:原文给出多智能体系统的三阶段架构与真实科研案例,读者可据此判断它在假设生成环节的可用边界。
Google DeepMind 回顾 Gemini 驱动的编码智能体 AlphaEvolve 发布一年来的应用成果,称其已从试点成为 Google 基础设施的核心组件。
推荐理由:官方汇总 AlphaEvolve 一年间在基因组、电网、量子与 TPU 设计等领域的落地数据,可据此判断编码智能体的实际外溢范围。
Jack Clark 在 Import AI 455 中判断,到 2028 年底前有 60% 以上概率出现无需人类参与的 AI 研发,即 AI 系统能自主训练出自己的后继版本;若只看 2027 年,他给出的概率是 30%。
Google DeepMind 宣布 AI co-clinician 研究计划,探索 AI 智能体在医生临床监督下协助患者诊疗的“三方照护”模式。在 98 个真实初级保健问题的盲评中,该系统 97 例无关键错误,医生对其回答的偏好高于现有证据综合工具;在 140 项问诊技能评估中,AI 在 68 项上达到或超过初级保健医生水平,但识别危险信号和指导关键体格检查仍不如专家医生。
推荐理由:Google DeepMind 公布 AI co-clinician 研究计划,用医生盲评和模拟问诊数据说明医疗智能体当前的能力边界。
Google Research 介绍了科学家使用 Empirical Research Assistance(ERA)的四类实践:公共卫生领域,团队每周向 CDC 的流感。
推荐理由:Google 官方汇总 ERA 在流行病预测、宇宙学、碳监测与神经科学四个方向的落地结果,可看到 AI 辅助科研的具体边界。
Mistral AI 发布企业 AI 编排层 Workflows 公开预览版,提供持久化执行、可观测性和人工介入能力,ASML、ABANCA、CMA-CGM、France Travail、La Banque Postale、Moeve 等客户已用它自动化关键流程。
推荐理由:Mistral 把企业级 AI 编排的持久化执行、可观测与人工审批打包进 Studio,读者可据此判断生产化落地的门槛变化。
Google Research 在 ICLR 论文中提出 ReasoningBank,一个从成功和失败经验中蒸馏高层推理记忆的智能体框架,代码已开源。
推荐理由:论文给出从成功与失败经验中蒸馏记忆的框架,并附 WebArena 与 SWE-Bench-Verified 上的成功率与步数对比。
Google DeepMind 宣布与 Accenture、Bain & Company、BCG、Deloitte、McKinsey 五家咨询公司合作,推动前沿 AI 在企业的大规模落地。合作方将获得 Gemini 系列前沿模型的早期访问权,并与 Google DeepMind 技术团队直接协作,聚焦金融、制造、零售、媒体娱乐等行业的智能体转型。目前仅 25% 的组织成功将 AI 规模化投入生产。
Google 在 Google Labs 上线研究实验 Vantage,用生成式 AI 构建模拟对话环境,评估高中与大学生面向未来的技能,目前提供英文版并可注册。Vantage 与纽约大学合作开发,由 Executive LLM 动态引导对话、AI Evaluator 依据评分量表打分,在 188 名 18-25 岁美国测试者中,AI 评分与人类专家评分的一致性接近两位专家评分者之间的一致性。
Google Research 推出 ConvApparel 数据集,包含超 4,000 段人机多轮对话、近 15,000 轮,用于量化 LLM 用户模拟器与真实人类的真实感差距。该数据集采用双智能体采集协议,参与者被随机分配到有帮助的 "Good" 智能体或故意不帮忙的 "Bad" 智能体,并配有逐轮用户满意度标注。研究同时提出基于群体统计对齐、人类相似度评分和反事实验证的三支柱评估框架。
Google 发布两款学术智能体:PaperVizAgent 用于生成论文配图,ScholarPeer 用于自动同行评审。PaperVizAgent 由检索、规划、风格、可视化和评审五个智能体协作,在 0-100 分评测中总分 60.2,超过 GPT-Image-1.5、Nano-Banana-Pro、Paper2Any,是唯一超过 50.0 人类基线的框架。
Google DeepMind 发布 Gemma 4 开源模型家族,包含 E2B、E4B、26B MoE 和 31B Dense 四个尺寸,采用 Apache 2.0 许可。
推荐理由:Gemma 4 以四个尺寸覆盖从手机到工作站的部署,并给出 Arena 排名与 Apache 2.0 许可,便于判断开源模型的可用边界。
Mistral AI 发布 CLI 工具 Spaces,同时面向人类开发者与编码智能体。它通过 `spaces init`、`spaces dev` 等命令完成项目脚手架、开发环境与部署,并为每个交互式提示提供等价的 flag 或配置文件,使智能体可自主操作。每次 init 还会生成 context.json 与 AGENTS.md,帮助智能体理解项目结构、端口与命令。
Google DeepMind 公布 AI 指针的四条交互原则,并展示由 Gemini 驱动的实验性指针演示,用户可在 Google AI Studio 中通过指向和语音编辑图片或查找地点。
推荐理由:Google DeepMind 公开 AI 指针的四条交互原则,并已在 Chrome 落地,读者可据此判断 AI 交互从提示词转向指向与语音的路径。
Google 发布 Vibe Coding XR 工作流,将 Gemini 与基于 WebXR、three.js、LiteRT.js 的 XR Blocks 框架结合,把自然语言提示词直接转成具备物理感知的 Android XR 应用,耗时不到 60 秒。
推荐理由:Google 把 Gemini 的长上下文推理接到 WebXR 框架上,读者可据此判断自然语言生成 XR 原型的可行边界。
Google Research 在 The Check Up 活动上公布多项医疗 AI 进展:与 Fitbit 合作研究发现,模拟协作医疗团队的 Personal Health Agent(PHA)比单一任务应用更能支持长期健康。
Mistral AI 推出 Forge,一套让企业基于自有专有知识构建前沿级 AI 模型的系统,支持预训练、后训练和强化学习等阶段,并支持 dense 与 MoE 架构及多模态输入。
推荐理由:原文给出企业用自有知识训练前沿模型的分阶段训练路径与智能体落地方式,可据此判断企业自建模型的门槛与形态。
Mistral 基于其开源编码助手 Vibe 构建了一个自动编写 Rails 测试的智能体,可读取源码、生成或改进 RSpec 测试并在 CI/CD 中无人干预运行。
推荐理由:Mistral 公开了用 Vibe 构建自动写 RSpec 测试智能体的完整方法,包括 AGENTS.md、技能文件和自定义工具的具体做法。
Mistral 发布终端原生编码智能体 Mistral Vibe 2.0,由 Devstral 2 模型家族驱动,新增自定义子智能体、多选项澄清、斜杠命令技能、统一智能体模式和自动更新。
推荐理由:官方给出 Vibe 2.0 的自定义子智能体、斜杠命令技能等能力与订阅入口,可据此判断终端编码智能体的工作流变化。
Mistral 发布下一代编码模型家族 Devstral 2,含 123B 的 Devstral 2 和 24B 的 Devstral Small 2,两者均为开源许可,Devstral 2 采用修改版 MIT、Small 2 采用 Apache 2.0。
推荐理由:原文给出 Devstral 2 的 SWE-bench 成绩、开源许可与部署门槛,读者可据此判断开源编码模型与闭源模型的差距。
Mistral 发布 Mistral AI Studio,一个面向企业团队的生产级 AI 平台,由 Observability、Agent Runtime 和 AI Registry 三大支柱组成。
推荐理由:Mistral 把自家大规模系统的运维经验产品化,读者可据此了解企业级 AI 从原型走向生产需要哪些基础设施。
Mistral AI 为 Le Chat 推出 Memories(beta),采用自动保存、智能召回并显示来源链接的混合方案。用户可随时关闭记忆、开启不使用记忆的隐身对话、编辑或删除单条记忆,并支持导出与导入。同步上线的 Memory Insights 会基于用户数据提示记忆趋势与摘要,移动端可在 App Store 或 Google Play 下载体验。
Mistral 在 Le Chat 中发布 20+ 个基于 MCP 的安全连接器目录(beta),覆盖数据、生产力、开发、自动化与商务等类别,可连接 Databricks、Snowflake、GitHub、Atlassian、Asana、Outlook、Box、Stripe、Zapier 等工具,并支持添加自定义 MCP 连接器及连接任意远程 MCP 服务器。
推荐理由:官方给出连接器目录、自定义 MCP 与记忆功能的开放范围,读者可据此判断企业工作流接入方式。