微软研究院发布 Echoverse:面向 computer-use 智能体的深度演化环境
微软研究院提出 Echoverse,为 computer-use 智能体构建 12 个训练世界,包括 10 个深度领域世界和 2 个能力世界,强调行为保真、状态一致、工作流深度和基于数据库的验证。
推荐理由:微软研究院公开了合成环境工厂的构建流程与训练数据,读者可据此理解高保真环境如何影响 computer-use 智能体的训练效果。
微软研究院提出 Echoverse,为 computer-use 智能体构建 12 个训练世界,包括 10 个深度领域世界和 2 个能力世界,强调行为保真、状态一致、工作流深度和基于数据库的验证。
推荐理由:微软研究院公开了合成环境工厂的构建流程与训练数据,读者可据此理解高保真环境如何影响 computer-use 智能体的训练效果。
Hugging Face 博客指出,AI 的下一个真正约束是 GPU 利用率而非智能水平。GPU 按日历小时计费,却只在计算小时产出,企业自购 GPU 后问题从"能否买到"变成"能否让它们保持忙碌"。集群按峰值需求配置,但需求并不持续,满载 GPU 的集群仍可能浪费大部分产能。
Berkeley AI Research 提出 ABBEL 框架,将 LLM 的摘要内容隔离为自然语言"信念状态"并加以监督,以替代完整交互历史作为智能体的工作上下文。在协作编程基准 CollabBench 上,基于重建的信念评分(rec-BG)将 ABBEL 与全上下文模型的性能差距缩小约 50%,训练步数从 100 步降至 50 步,峰值上下文 token 数也低于全上下文设置。
Google 在 DOE Genesis Mission Summit 2026 上宣布投入 4000 万美元 AI tokens 和云 credits,支持 Genesis Mission 的科研人员。
DharmaOCR 在葡萄牙语 OCR 基准上以 0.925 分领先 Mistral OCR4 的 0.798 和 Unlimited-OCR 的 0.7587。该模型通过葡萄牙语监督微调加 DPO 两阶段训练,将全部参数集中于巴西葡萄牙语,从而在提取质量和稳定性上取得优势。
Google Research 在 ICLR 2026 论文中指出,扩散模型的创造力源于神经网络训练中的"分数平滑"效应:权重衰减等正则化使学到的分数函数变平滑,去噪过程因此生成落在训练数据点之间的插值样本,而非简单记忆。研究用一维两点实验验证,权重衰减越强、分数函数越平滑,粒子越易停在插值区。
Google Research 发布 SensorFM,一个直接从无标注可穿戴数据学习的大型传感器基础模型,预训练语料超过一万亿分钟多模态信号,来自五百万名同意参与者。
推荐理由:Google 用一万亿分钟可穿戴数据预训练通用生理表征,读者可了解基础模型在健康领域的规模化路径。
伯克利 EPIC Data Lab 提出近零推理成本时代数据系统面临三大挑战:为智能体服务、由智能体运行、由智能体构建。GPT-4 级能力从 2023 年初约 $30/百万 token 降至如今不到 $1,部分厂商已低于 $0.10,推理价格年降幅在 9x 到 900x 之间,中位数约 50x。
PRX 系列第 4 篇披露其数据策略:训练数据由公开与内部数据集混合组成,用 VLM 重新生成图像描述,再转为可流式语料。团队改用 Qwen3-VL 在训练中实时计算文本 latent,7B 规模下吞吐仅损失约 3–4%(30 天训练多约 1 天),并采用 Lance 构建、MDS 流式的双格式方案。
Google Research 将建筑级屋顶反射率数据集扩展至 9 个国家 50+ 城市,并通过新的 Heat Resilience Earth Engine App 开放访问。该方法融合 Sentinel-2 与 30-cm 高分辨率卫星影像,在 Boulder 验证中 RMSE 仅 0.04,建模显示针对性冷屋顶规划可使全球城市极端高温降低最多 0.5°C。
Dharma AI 撰文解读 Goldfeder、Wyder、LeCun 与 Shwartz-Ziv 的 2026 年论文《AI Must Embrace Specialization via Superhuman Adaptable Intelligence》。
Google Research 发布面向表格数据分类与回归的基础模型 TabFM,将表格预测重构为上下文学习问题,无需手动训练、超参数调优和特征工程,单次前向传播即可对未见过的表格生成预测。
推荐理由:Google 把零样本思路从时序预测搬到表格数据,读者可了解其架构设计与 TabArena 基准表现。
Hugging Face 博客介绍 DiScoFormer(Density and Score Transformer),一个 Transformer 模型可在单次前向传播中同时估计数据分布的密度与 score,无需针对新分布重新训练。
NVIDIA 推出 ENPIRE 框架,让编码智能体驱动真实机械臂自主试错、改进策略并自动重置环境,在 PushT、整理插针等任务上达到 99% 成功率,测试硬件为双 YAM 机械臂加 RTX 5090 工作站。GPT-5.5 在 Codex 中与 Opus 4.7 在 Claude Code 中表现互有胜负,Kimi-2.6 落后,8 个智能体并行时得分更高。
Google Research 发布矢量化数据集,将 Farmscapes 2020 的高分辨率栅格地图转化为可操作的树篱、石墙和矮林清单,覆盖英国超 13 万平方公里。该框架基于在 3 亿多张全球卫星图像上预训练的 RSF Vision-Transformer 骨干微调,并用 Polsby–Popper 紧凑度评分(线性特征阈值低于 0.5)自动区分林地、树丛与树篱。
Google Research 在 GitHub 上以 Apache 2.0 许可开源其水文建模框架,让各国气象与水文机构能用与 Google Flood Hub 相同的架构和相近训练数据训练 AI 洪水预报模型。
推荐理由:Google 把驱动 Flood Hub 的水文模型架构与训练流程开源,读者可据此判断本地洪水预报能否自建。
Import AI 459 聚焦三项研究:英国 AI 安全研究所的论文指出,用 AI 监督 AI 训练的自动化对齐研究并非万能方案,实施难度高于预期;另有研究提出蛋白质折叠模型的缩放定律,以及为 AI 系统灭绝风险定价的探讨。
Mistral 宣布将 Emmi AI 并入公司,推出面向工业工程的物理 AI 能力,作为其企业平台的一部分。该能力从几何与边界条件直接预测物理场,单次前向推理在单块 GPU 上以秒级完成,用于加速产品设计、工装工艺设计和实时数字孪生,合作方包括 ASML、Airbus、Safran 和 Siemens Energy。
推荐理由:Mistral 把物理仿真模型并入企业平台,读者可了解其与 ASML、Airbus 等合作方的落地场景。
Mistral 收购 Emmi AI,并加码面向航空航天、汽车、半导体和能源等行业的物理 AI 基础模型研究。其已发布成果包括 AB-UPT,可在单张 GPU 上处理 9M 表面和 140M 体积单元的原始几何数据而无需重新网格化,以及面向大规模多物理过程的端到端深度学习代理模型 NeuralDEM。
Mistral AI 宣布已达成最终协议,收购 Physics AI 先驱 Emmi AI,以强化其面向工业企业的 AI 转型伙伴地位。Emmi AI 总部位于奥地利,专注物理 AI 与大型工程模型,可把多日计算替换为实时仿真并构建数字孪生;其联合创始人及 30 多名研究人员和工程师将于 5 月加入 Mistral 的 Science 与 Applied AI 团队。
推荐理由:Mistral 通过收购 Emmi AI 补上物理仿真能力,读者可据此判断工业 AI 平台的整合方向。
Google 发布 Empirical Research Assistance(ERA),一个用 Gemini 编写和优化科学代码的研究工具,相关论文今日发表于 Nature。
推荐理由:Google 把 ERA 从 Nature 论文推进到可申请使用的工具,读者可据此判断科研编码自动化的落地进度。
Import AI 457 期聚焦三项研究:SentinelOne 拆解了 20 多年前的病毒 fast16.sys,它通过篡改 LS-DYNA 970、PKPM、MOHID 等高精度计算软件的内存结果,定向破坏工程与物理仿真。
剑桥大学 Clare Bryant 教授用 Google Co-Scientist 研究流感等病原体跨物种传播引发脓毒症的分子开关,该工具生成并排序了一批候选假设,并优先标记出一个她此前未关注的蛋白。加入未发表数据后,假设逐步收敛到具体氨基酸,团队正构建携带这些突变的细胞系验证。她称原本需两到三年的工作有望在六个月内完成。
Google Co-Scientist 帮助 MIT 机械工程师 Ritu Raman 快速梳理 ALS 相关矛盾文献,将想法转化为可验证假设并按可行性与风险收益排序。
斯坦福大学医学院 Gary Peltz 团队利用 Google Co-Scientist 从已有药物文献中筛选肝纤维化候选药,其提出的 3 个候选中有 2 个在活体人类肝细胞测试中阻断纤维化并促进肝细胞再生,而 Peltz 自行挑选的 2 个药物均无效。表现最突出的是抗癌药 vorinostat,阻断了 91% 可驱动肝瘢痕形成的损伤反应。相关研究已发表于 Advanced Science。
Jack Clark 在 Import AI 455 中判断,到 2028 年底前有 60% 以上概率出现无需人类参与的 AI 研发,即 AI 系统能自主训练出自己的后继版本;若只看 2027 年,他给出的概率是 30%。
Google Research 公布其开放科学成果:十余年积累的开源工具与开放数据集已服务全球超 25 万名研究者和开发者。
Google Research 介绍了科学家使用 Empirical Research Assistance(ERA)的四类实践:公共卫生领域,团队每周向 CDC 的流感。
推荐理由:Google 官方汇总 ERA 在流行病预测、宇宙学、碳监测与神经科学四个方向的落地结果,可看到 AI 辅助科研的具体边界。
Google DeepMind 发布 Decoupled DiLoCo 分布式训练架构,把大规模训练拆成相互解耦的计算“岛屿”,岛屿间异步传输数据,从而隔离局部硬件故障。
推荐理由:原文给出跨数据中心异步训练在带宽、容错和跨代硬件上的实测结果,可据此判断分布式预训练的工程取舍。
伯克利 AI 研究团队提出基于梯度的规划器 GRASP,通过将轨迹提升到虚拟状态实现跨时间并行优化、向状态迭代直接注入随机性以探索、并重塑梯度让动作获得清晰信号,从而让世界模型的长时程规划变得可行。
Google Research 提出推理优先的合成数据生成框架 Simula,将数据集生成重构为机制设计问题,通过全局多样化、局部多样化、复杂化和双批评者质量检查四个步骤,实现无种子、智能体式的数据集构建。
Google Research 提出 MoGen(Neuronal Morphology Generation),用 PointInfinity 点云流匹配模型生成合成神经元形态,为 PATHFINDER 重建模型补充训练数据,使小鼠轴突重建误差率降低 4.4%,主要来自 merge error 的减少。
Google Research 推出 ConvApparel 数据集,包含超 4,000 段人机多轮对话、近 15,000 轮,用于量化 LLM 用户模拟器与真实人类的真实感差距。该数据集采用双智能体采集协议,参与者被随机分配到有帮助的 "Good" 智能体或故意不帮忙的 "Bad" 智能体,并配有逐轮用户满意度标注。研究同时提出基于群体统计对齐、人类相似度评分和反事实验证的三支柱评估框架。
Google Research 在《Forest vs Tree: The (N, K) Trade-off in Reproducible ML Evaluation》中研究了评测条目数与每条目标注者数的权衡,发现常用的 1、3、5 名标注者往往不足,可靠结果常需每条目 10 名以上标注者。
Google Research 发布 S2Vec,一个自监督框架,用于学习建成环境的通用嵌入向量,将建筑、道路等地理要素栅格化为多层图像后用掩码自编码(MAE)训练。在人口密度、收入等社会经济预测的零样本地理外推任务上,S2Vec 通常是最佳单一模型,与图像嵌入做多模态融合后表现普遍优于任一单一模态;但在树木覆盖、海拔等环境任务上仍需改进。
Mistral AI 推出 Forge,一套让企业基于自有专有知识构建前沿级 AI 模型的系统,支持预训练、后训练和强化学习等阶段,并支持 dense 与 MoE 架构及多模态输入。
推荐理由:原文给出企业用自有知识训练前沿模型的分阶段训练路径与智能体落地方式,可据此判断企业自建模型的门槛与形态。
Mistral AI 宣布以创始成员身份加入 NVIDIA Nemotron Coalition,双方计划共同开发前沿开源模型,Mistral 提供模型架构、多模态能力与企业级微调工具,NVIDIA 提供算力、模型开发工具和合成数据生成管线。
推荐理由:Mistral 以创始成员身份加入 NVIDIA Nemotron Coalition,读者可了解开源前沿模型的联合训练分工与后续 Nemotron 4 的开放计划。
Berkeley AI Research 提出 SPEX 与 ProxySPEX 算法,用于在规模化下识别 LLM 的关键交互。SPEX 利用稀疏性与低阶性,将交互搜索转化为稀疏恢复问题;ProxySPEX 进一步利用层次结构,以约 10 倍更少的消融达到 SPEX 的性能。在情感分析任务上,SPEX 在上下文扩展至数千特征时仍保持高忠实度,而 LIME、Banzhaf 等边际方法忠实度明显更低。
Google 宣布在 Flood Hub 上线城市山洪预报,利用 AI 方法可提前最多 24 小时预测城市山洪风险。
推荐理由:Google 把城市山洪预警接入 Flood Hub,读者可了解其用新闻数据训练模型、以 20x20 公里分辨率覆盖全球的思路。
Google Research 推出 Groundsource,用 Gemini 从新闻报道中抽取结构化灾害数据,首个开放数据集包含 260 万条城市山洪记录,覆盖 150 多个国家、时间跨度从 2000 年至今。
推荐理由:Google 用 Gemini 从 80 种语言新闻中抽取洪水事件,其 60% 定位与时间准确率可供评估 LLM 做数据抽取的可靠性。