跳到正文
5月16日周六
  1. Google DeepMind30

    Google Co-Scientist 加速肝病机制发现,提出 MASH 组合疗法新假说

    爱丁堡大学生物工程师 Filippo Menolascina 使用 Google Co-Scientist 梳理文献、生成新假说,以缩小 MASH 潜在药物组合的搜索范围。该系统针对 resmetirom 为何仅对少数合格患者有效,提出 NLRP3 炎症小体是连接炎症与代谢的分子桥梁,该假说随后经实验验证,或为靶向双重疗法铺路。

  2. Google DeepMind87

    Google DeepMind 发布 Gemini 3.5 Flash,主打智能体与编码

    Google DeepMind 发布 Gemini 3.5 模型系列,首发的 3.5 Flash 面向智能体与编码任务,在 Terminal-Bench 2.1 取得 76.2%、GDPval-AA 取得 1656 Elo、MCP Atlas 取得 83.6%,多模态理解在 CharXiv Reasoning 上为 84.2%,输出速度是其他前沿模型的 4 倍。

    推荐理由:官方给出 3.5 Flash 在编码与智能体基准上的具体分数和速度对比,可据此判断其能力定位。

5月12日周二
5月6日周三
  1. Google DeepMind74

    Google DeepMind 盘点 AlphaEvolve 一年成果:从基因组到 TPU 设计的多领域落地

    Google DeepMind 回顾 Gemini 驱动的编码智能体 AlphaEvolve 发布一年来的应用成果,称其已从试点成为 Google 基础设施的核心组件。

    推荐理由:官方汇总 AlphaEvolve 一年间在基因组、电网、量子与 TPU 设计等领域的落地数据,可据此判断编码智能体的实际外溢范围。

4月30日周四
  1. Google DeepMind62

    Google DeepMind 发布 AI co-clinician 医疗 AI 研究计划

    Google DeepMind 宣布 AI co-clinician 研究计划,探索 AI 智能体在医生临床监督下协助患者诊疗的“三方照护”模式。在 98 个真实初级保健问题的盲评中,该系统 97 例无关键错误,医生对其回答的偏好高于现有证据综合工具;在 140 项问诊技能评估中,AI 在 68 项上达到或超过初级保健医生水平,但识别危险信号和指导关键体格检查仍不如专家医生。

    推荐理由:Google DeepMind 公布 AI co-clinician 研究计划,用医生盲评和模拟问诊数据说明医疗智能体当前的能力边界。

4月27日周一
  1. Mistral AI71

    Mistral AI 发布 Workflows 公开预览版

    Mistral AI 发布企业 AI 编排层 Workflows 公开预览版,提供持久化执行、可观测性和人工介入能力,ASML、ABANCA、CMA-CGM、France Travail、La Banque Postale、Moeve 等客户已用它自动化关键流程。

    推荐理由:Mistral 把企业级 AI 编排的持久化执行、可观测与人工审批打包进 Studio,读者可据此判断生产化落地的门槛变化。

4月22日周三
4月21日周二
  1. Google DeepMind22

    Google DeepMind 与埃森哲、贝恩、BCG、德勤、麦肯锡合作加速企业 AI 转型

    Google DeepMind 宣布与 Accenture、Bain & Company、BCG、Deloitte、McKinsey 五家咨询公司合作,推动前沿 AI 在企业的大规模落地。合作方将获得 Gemini 系列前沿模型的早期访问权,并与 Google DeepMind 技术团队直接协作,聚焦金融、制造、零售、媒体娱乐等行业的智能体转型。目前仅 25% 的组织成功将 AI 规模化投入生产。

4月14日周二
  1. Google Research48

    Google 推出 Vantage:用生成式 AI 评估未来技能

    Google 在 Google Labs 上线研究实验 Vantage,用生成式 AI 构建模拟对话环境,评估高中与大学生面向未来的技能,目前提供英文版并可注册。Vantage 与纽约大学合作开发,由 Executive LLM 动态引导对话、AI Evaluator 依据评分量表打分,在 188 名 18-25 岁美国测试者中,AI 评分与人类专家评分的一致性接近两位专家评分者之间的一致性。

4月9日周四
  1. Google Research31

    Google Research 发布 ConvApparel:测量并弥合用户模拟器的真实感差距

    Google Research 推出 ConvApparel 数据集,包含超 4,000 段人机多轮对话、近 15,000 轮,用于量化 LLM 用户模拟器与真实人类的真实感差距。该数据集采用双智能体采集协议,参与者被随机分配到有帮助的 "Good" 智能体或故意不帮忙的 "Bad" 智能体,并配有逐轮用户满意度标注。研究同时提出基于群体统计对齐、人类相似度评分和反事实验证的三支柱评估框架。

4月3日周五
3月31日周二
  1. Mistral AI34

    Mistral AI 推出 Spaces:一款为人类与智能体打造的 CLI

    Mistral AI 发布 CLI 工具 Spaces,同时面向人类开发者与编码智能体。它通过 `spaces init`、`spaces dev` 等命令完成项目脚手架、开发环境与部署,并为每个交互式提示提供等价的 flag 或配置文件,使智能体可自主操作。每次 init 还会生成 context.json 与 AGENTS.md,帮助智能体理解项目结构、端口与命令。

3月29日周日
  1. Google DeepMind62

    Google DeepMind 为 AI 时代重新设计鼠标指针,Chrome 已上线 Gemini 指向交互

    Google DeepMind 公布 AI 指针的四条交互原则,并展示由 Gemini 驱动的实验性指针演示,用户可在 Google AI Studio 中通过指向和语音编辑图片或查找地点。

    推荐理由:Google DeepMind 公开 AI 指针的四条交互原则,并已在 Chrome 落地,读者可据此判断 AI 交互从提示词转向指向与语音的路径。

3月25日周三
  1. Google Research62

    Google 发布 Vibe Coding XR:用 Gemini 和 XR Blocks 把自然语言变成 Android XR 应用

    Google 发布 Vibe Coding XR 工作流,将 Gemini 与基于 WebXR、three.js、LiteRT.js 的 XR Blocks 框架结合,把自然语言提示词直接转成具备物理感知的 Android XR 应用,耗时不到 60 秒。

    推荐理由:Google 把 Gemini 的长上下文推理接到 WebXR 框架上,读者可据此判断自然语言生成 XR 原型的可行边界。

3月18日周三
  1. Mistral AI62

    Mistral AI 推出 Forge,让企业用自有知识训练前沿模型

    Mistral AI 推出 Forge,一套让企业基于自有专有知识构建前沿级 AI 模型的系统,支持预训练、后训练和强化学习等阶段,并支持 dense 与 MoE 架构及多模态输入。

    推荐理由:原文给出企业用自有知识训练前沿模型的分阶段训练路径与智能体落地方式,可据此判断企业自建模型的门槛与形态。

3月11日周三
1月28日周三
  1. Mistral AI62

    Mistral 发布终端编码智能体 Mistral Vibe 2.0

    Mistral 发布终端原生编码智能体 Mistral Vibe 2.0,由 Devstral 2 模型家族驱动,新增自定义子智能体、多选项澄清、斜杠命令技能、统一智能体模式和自动更新。

    推荐理由:官方给出 Vibe 2.0 的自定义子智能体、斜杠命令技能等能力与订阅入口,可据此判断终端编码智能体的工作流变化。

12月9日周二
  1. Mistral AI82

    Mistral 发布 Devstral 2 编码模型与 Mistral Vibe CLI

    Mistral 发布下一代编码模型家族 Devstral 2,含 123B 的 Devstral 2 和 24B 的 Devstral Small 2,两者均为开源许可,Devstral 2 采用修改版 MIT、Small 2 采用 Apache 2.0。

    推荐理由:原文给出 Devstral 2 的 SWE-bench 成绩、开源许可与部署门槛,读者可据此判断开源编码模型与闭源模型的差距。

10月24日周五
  1. Mistral AI62

    Mistral 发布 AI Studio 生产级 AI 平台

    Mistral 发布 Mistral AI Studio,一个面向企业团队的生产级 AI 平台,由 Observability、Agent Runtime 和 AI Registry 三大支柱组成。

    推荐理由:Mistral 把自家大规模系统的运维经验产品化,读者可据此了解企业级 AI 从原型走向生产需要哪些基础设施。

9月2日周二
  1. Mistral AI42

    Mistral AI 为 Le Chat 推出 Memories 记忆功能(beta)

    Mistral AI 为 Le Chat 推出 Memories(beta),采用自动保存、智能召回并显示来源链接的混合方案。用户可随时关闭记忆、开启不使用记忆的隐身对话、编辑或删除单条记忆,并支持导出与导入。同步上线的 Memory Insights 会基于用户数据提示记忆趋势与摘要,移动端可在 App Store 或 Google Play 下载体验。

  2. Mistral AI62

    Mistral 为 Le Chat 上线 20+ MCP 连接器与 Memories 记忆功能

    Mistral 在 Le Chat 中发布 20+ 个基于 MCP 的安全连接器目录(beta),覆盖数据、生产力、开发、自动化与商务等类别,可连接 Databricks、Snowflake、GitHub、Atlassian、Asana、Outlook、Box、Stripe、Zapier 等工具,并支持添加自定义 MCP 连接器及连接任意远程 MCP 服务器。

    推荐理由:官方给出连接器目录、自定义 MCP 与记忆功能的开放范围,读者可据此判断企业工作流接入方式。

7月30日周三
  1. Mistral AI62

    Mistral 发布 Codestral 25.08 及企业级编码栈

    Mistral AI 发布 Codestral 25.08 代码模型,并推出覆盖补全、语义检索与智能体工作流的企业编码栈。Codestral 25.08 相比此前版本接受的补全增加 30%,建议后保留代码增加 10%,失控生成减少 50%。

    推荐理由:Mistral 把补全、代码检索和智能体工作流打包成可私有化部署的企业编码栈,读者可据此判断自托管 AI 编码方案的落地边界。

7月17日周四
  1. Mistral AI62

    Mistral 为 Le Chat 推出 Deep Research、语音模式等多项新功能

    Mistral 为 Le Chat 上线一批新功能,包括预览版 Deep Research 模式、由新语音模型 Voxtral 驱动的语音模式、由推理模型 Magistral 支持的多语言推理、用于整理对话的 Projects,以及与 Black Forest Labs 合作的图像编辑。

    推荐理由:Mistral 一次性为 Le Chat 补齐深度研究、语音、推理与图像编辑,读者可据此判断其产品线布局。

7月11日周五
6月4日周三
5月27日周二
5月21日周三
  1. Mistral AI78

    Mistral AI 与 All Hands AI 发布编码智能体模型 Devstral

    Mistral AI 与 All Hands AI 合作发布面向软件工程任务的智能体模型 Devstral,在 SWE-Bench Verified 上取得 46.8%,比此前开源 SoTA 高出 6 个百分点以上,并以 Apache 2.0 许可开源。

    推荐理由:官方给出 Devstral 在 SWE-Bench Verified 上的分数与开源许可,读者可据此判断开源编码智能体的当前水位。

5月7日周三
  1. Mistral AI62

    Mistral AI 推出 Le Chat Enterprise,由 Mistral Medium 3 驱动

    Mistral AI 发布 Le Chat Enterprise,一款由全新 Mistral Medium 3 模型驱动的企业级 AI 助手,包含企业搜索、Agent 构建器、自定义数据与工具连接器、文档库、自定义模型和混合部署等功能,全部功能将在未来两周内逐步上线。

    推荐理由:官方给出 Le Chat Enterprise 的功能清单与部署方式,可据此判断企业级 AI 助手的落地路径。

3月4日周二