微软与 Hugging Face 发布 ThinkingBox:按数据库终态给 AI 智能体打分
微软 Copilot Studio 团队与 Hugging Face 联合发布 ThinkingBox,通过隔离的 MCP 工具会话运行智能体,按终端后端状态和副作用而非生成文本判分,覆盖 507 个有状态业务流程、每个任务重复 20 次。
推荐理由:微软与 Hugging Face 联合发布的智能体评测基准,用后端状态而非生成文本判分,并给出可复现的 OpenEnv 运行方式。
微软 Copilot Studio 团队与 Hugging Face 联合发布 ThinkingBox,通过隔离的 MCP 工具会话运行智能体,按终端后端状态和副作用而非生成文本判分,覆盖 507 个有状态业务流程、每个任务重复 20 次。
推荐理由:微软与 Hugging Face 联合发布的智能体评测基准,用后端状态而非生成文本判分,并给出可复现的 OpenEnv 运行方式。
OpenAI 发布 GPT-6 家族模型指南,面向初创公司说明如何选择 GPT-6 模型、调整推理强度、改进提示词与技能、协调工具,并为生产环境准备工作流。
推荐理由:OpenAI 官方给出 GPT-6 家族的选型与调优路径,可帮助团队把模型能力落到生产工作流。
AWS 官方博客演示在 Amazon Bedrock AgentCore Runtime Instances 上部署三智能体音乐制作流水线:作曲智能体用 Claude Sonnet 4.6 生成音乐简报并在实例的 NVIDIA L4 上运行 ACE-Step 渲染音频,交付智能体读取共享文件做 DSP 处理,合规智能体独立复测并比对曲库。
推荐理由:AWS 官方给出三智能体共享 GPU 实例的完整代码与实测数据,可迁移到其他长时多智能体工作流。
OpenAI 在旧金山 DevDay 2026 上公布 25 项更新,覆盖 ChatGPT、Codex、GPT-6 模型和 API,官方称这是历届规模最大的一次 DevDay。
推荐理由:梳理了 DevDay 25 项更新中 Dots、GPT-6.1 Sol、Codex 与 Agents API 的定位,可看清 OpenAI 把 Agent 从单次任务推向长期运行的产品线。
H 公司发布 Holo4 系列智能体模型,包含 27B 稠密版和 35B-A3B MoE 版,两者均已在 H Models API 上线,权重以 BF16、FP8、NVFP4 和 4-bit GGUF 格式开源在 Hugging Face。
推荐理由:Holo4 同时覆盖 GUI、代码、MCP 与 API 四种接口,并公开全部评测轨迹,读者可据此判断通用计算机操作智能体的成本与能力边界。
GitHub Security Lab 发布 Fuzzing Taskflow,一个面向 C/C++ 项目的自主模糊测试流水线,只需指向一个 GitHub 仓库,它就会自动识别入口点、分析构建系统、编写 harness、运行 AFL++、读取覆盖率报告并改进 harness,最后对每个崩溃做分诊并生成漏洞报告。
推荐理由:GitHub Security Lab 把模糊测试的 harness 编写、覆盖率追踪与崩溃分诊交给 LLM 智能体,并公开了可复用的开源流水线。
OpenAI 发布 Agents API,用于构建和上线云端智能体。该服务为托管式,由 Codex harness 提供编排、长时间运行会话和工具调用支持。
推荐理由:OpenAI 官方发布托管式 Agents API,读者可了解其编排、长会话与工具调用能力。
Hugging Face 团队用 Gradio Workflow 重建了 AUTOMATIC1111 的大部分功能,做成名为 Workflow1111 的画布,由 11 条媒体流水线和 73 个节点组成,覆盖文生图、高清修复、图生图、提示词矩阵、VLM 反推、检测生成 inpaint 掩码、ControlNet 风格标注器、背景移除、PNG Info 存储和图生视频。
推荐理由:原文用 73 个节点复刻 A1111 的十一条图像流水线,并说明输出如何变成 REST 端点和 MCP 工具。
Hugging Face 发布 funes,一个面向编码智能体的持久记忆层,支持 Claude Code、Codex、pi 和 Hermes,通过一条 add 命令把本机已有会话索引为可检索记忆。
推荐理由:funes 把编码智能体的会话轨迹变成可检索的本地记忆,并给出跨机器、跨智能体共享的用法与成本对比。
Mistral 发布 Agentic Search,一个让模型在多步检索循环中查找、检查和验证信息的检索层,通过 Mistral Search Toolkit 提供,并内置于 Studio 和 Vibe 的 Libraries 中。
推荐理由:原文给出多步检索循环的工具设计与两组基准数字,可据此判断传统一次性 RAG 在长文档场景的边界。
Mistral 将 Le Chat 升级为统一 AI 智能体 Vibe,同时覆盖办公与编码场景,原有对话、设置和订阅方案全部保留。
推荐理由:Mistral 把 Le Chat 升级为统一智能体 Vibe,同时覆盖办公长任务与编码流程,读者可据此判断其与现有 Agent 产品的差异。
Mistral AI 发布 Search Toolkit 公开预览版,一个用于构建 AI 应用生产级搜索管线的可组合框架,将数据摄取、检索与评测整合到共享接口下,开源并支持云端、本地和边缘部署。
推荐理由:Mistral 把检索、索引与评测收进同一框架,读者可据此判断自建 RAG 管线的整合成本是否被压缩。
Mistral AI 在 Studio 发布 Connectors,内置连接器和自定义 MCP 均可通过 API/SDK 用于所有模型与 Agent 调用,目前处于 Public Preview。
推荐理由:原文给出连接器注册、直接工具调用与人工审批三段能力,读者可据此判断企业级 Agent 集成层的落地方式。
Mistral AI 发布企业 AI 编排层 Workflows 公开预览版,提供持久化执行、可观测性和人工介入能力,ASML、ABANCA、CMA-CGM、France Travail、La Banque Postale、Moeve 等客户已用它自动化关键流程。
推荐理由:Mistral 把企业级 AI 编排的持久化执行、可观测与人工审批打包进 Studio,读者可据此判断生产化落地的门槛变化。
Mistral 发布 Leanstral,称其为首个面向 Lean 4 的开源代码智能体,采用 6B 激活参数的稀疏架构,权重以 Apache 2.0 许可开放,并接入 Mistral Vibe 与免费 API 端点 labs-leanstral-2603。
推荐理由:官方给出 Leanstral 在 FLTEval 上的分数与成本对比,可据此判断形式化证明智能体的性价比路线。
Mistral 发布终端原生编码智能体 Mistral Vibe 2.0,由 Devstral 2 模型家族驱动,新增自定义子智能体、多选项澄清、斜杠命令技能、统一智能体模式和自动更新。
推荐理由:官方给出 Vibe 2.0 的自定义子智能体、斜杠命令技能等能力与订阅入口,可据此判断终端编码智能体的工作流变化。
Mistral 在 Le Chat 中发布 20+ 个基于 MCP 的安全连接器目录(beta),覆盖数据、生产力、开发、自动化与商务等类别,可连接 Databricks、Snowflake、GitHub、Atlassian、Asana、Outlook、Box、Stripe、Zapier 等工具,并支持添加自定义 MCP 连接器及连接任意远程 MCP 服务器。
推荐理由:官方给出连接器目录、自定义 MCP 与记忆功能的开放范围,读者可据此判断企业工作流接入方式。
Mistral AI 发布 Agents API,将自家语言模型与代码执行、图像生成、文档库、网页搜索等内置连接器以及 MCP 工具结合,并提供跨对话的持久记忆和智能体编排能力。
推荐理由:官方给出 Agents API 的连接器、记忆与编排能力,读者可据此判断企业级智能体平台的搭建方式。
Mistral AI 发布 Le Chat Enterprise,一款由全新 Mistral Medium 3 模型驱动的企业级 AI 助手,包含企业搜索、Agent 构建器、自定义数据与工具连接器、文档库、自定义模型和混合部署等功能,全部功能将在未来两周内逐步上线。
推荐理由:官方给出 Le Chat Enterprise 的功能清单与部署方式,可据此判断企业级 AI 助手的落地路径。