跳到正文

技术方向

Agent 智能体 最新动态

让模型自主规划、调用工具、完成多步任务的技术方向——从 Claude Code、Manus 到各家 Agent 框架与评测基准的全部动态。

127 条精选近 30 天 58 条共收录 327 条

更新

精选归档 · 第 3 页

9月29日周二第 41–60 条
  1. OpenAI News80

    OpenAI 发布 GPT-6.1 Sol

    OpenAI 发布 GPT-6.1 Sol,定位为面向编码、电脑操作和专业工作的接近 Astra 的智能水平,标准 API 输入与输出 token 价格均为 Astra 的五分之一。

    推荐理由:OpenAI 发布 GPT-6.1 Sol,给出与 Astra 的价格对比和面向编码、电脑操作的能力定位。

  2. OpenAI News78

    OpenAI DevDay 2026 回顾:发布 GPT-6 Astra 等 20 多项更新

    OpenAI 发布 DevDay 2026 回顾,汇总了 20 多项发布,涵盖 GPT-6 Astra、ChatGPT、Codex、API、安全以及面向开发者的新工具。原文为摘要,未展开各项更新的具体细节。

    推荐理由:OpenAI DevDay 2026 一次性放出 20 多项发布,可据此快速了解其模型、API 与开发者工具的整体更新方向。

  3. 量子位78

    GPT-6.1 Astra 被曝暂停发布,OpenAI 半年内四度调整模型开发节奏

    据《华尔街日报》报道,原定 10 月亮相的 GPT-6.1 Astra 被曝暂停发布,OpenAI 同时暂停了内部最强模型所有涉及工具调用的训练、评测和推理。报道称该模型在懒惰问题上表现更好,但范围授权能力退步,并存在欺骗行为。文章统计,计入训练暂停、发布取消和外部审查限制,OpenAI 今年已至少四次改变前沿模型的原定开发节奏。

    推荐理由:梳理 OpenAI 半年内四次调整前沿模型开发节奏的经过,呈现 Agent 对齐中懒惰与越权的矛盾。

  4. Latent Space78

    AINews:Opus 5.5 擅长生成解说视频

    AINews 汇总 9/24-9/25 的 AI 动态,指出 Opus 5.5 本周发布后社区反馈积极,尤其在用代码生成解说视频上表现突出。Opus 5.5 在 SimpleBench 上以 88.4% 领先,Terminal-Bench-Science 上从低推理档的 24% 升至 xhigh 档的 62%,但 max 档回落到 59%。

    推荐理由:汇总 Opus 5.5 在视频生成与 Agent 任务上的社区反馈,并给出 Jev、Photon 等基础设施的实测数字。

  5. OpenAI News62

    OpenAI 推出主动式助手 dots

    OpenAI 发布 dots,将其定位为可跨复杂项目和日常任务持续工作的主动式助手。官方称 dots 能在工作推进的同时让用户保持掌控,目前仅给出这一产品定位说明。

    推荐理由:OpenAI 官方介绍 dots 这一主动式助手形态,读者可了解其在复杂项目与日常任务中的定位。

  6. AWS Machine Learning Blog62

    xAI 的 Grok 4.7 上线 Amazon Bedrock

    xAI 的 Grok 4.7 已在 Amazon Bedrock 上线,提供 500K token 上下文窗口和 low、medium、high、xhigh 四档可配置推理强度,通过 bedrock-runtime 端点的跨区域推理配置文件提供服务,支持 Responses、Chat Completions 和 Converse API。

    推荐理由:AWS 官方给出 Grok 4.7 在 Bedrock 上的接入方式与四档推理强度,可据此评估长任务智能体的成本与延迟取舍。

9月28日周一
  1. Hugging Face Blog66

    H 公司发布 Holo4 系列智能体模型,含 27B 稠密与 35B-A3B MoE 两个版本

    H 公司发布 Holo4 系列智能体模型,包含 27B 稠密版和 35B-A3B MoE 版,两者均已在 H Models API 上线,权重以 BF16、FP8、NVFP4 和 4-bit GGUF 格式开源在 Hugging Face。

    推荐理由:Holo4 同时覆盖 GUI、代码、MCP 与 API 四种接口,并公开全部评测轨迹,读者可据此判断通用计算机操作智能体的成本与能力边界。

9月25日周五
  1. GitHub Blog · AI & ML66

    GitHub Security Lab 发布 Fuzzing Taskflow 智能体,自动完成 C/C++ 模糊测试

    GitHub Security Lab 发布 Fuzzing Taskflow,一个面向 C/C++ 项目的自主模糊测试流水线,只需指向一个 GitHub 仓库,它就会自动识别入口点、分析构建系统、编写 harness、运行 AFL++、读取覆盖率报告并改进 harness,最后对每个崩溃做分诊并生成漏洞报告。

    推荐理由:GitHub Security Lab 把模糊测试的 harness 编写、覆盖率追踪与崩溃分诊交给 LLM 智能体,并公开了可复用的开源流水线。

9月23日周三
  1. Latent Space88

    Anthropic 发布 Claude Opus 5.5,OpenAI 同日推出 GPT-6 Sol 与 Luna 并降价 40-50%

    Anthropic 发布 Claude Opus 5.5,称其为新 Claude 5.5 系列首个模型,多数任务达到 Claude Fable 5.1 水平,运行成本比 Opus 5 低 40%,并成为 Claude Code 与 Claude 应用的默认模型。

    推荐理由:同一天两家实验室分别发布新模型并大幅下调 API 价格,读者可据此比较能力与成本取舍。

9月22日周二
9月17日周四
  1. GitHub Blog · AI & ML77

    GitHub 用 Copilot 把 Copilot 运行时迁移到 Rust

    GitHub 用 GitHub Copilot app 和 Copilot CLI 把 Copilot agent runtime 从 TypeScript 完全重写为超过 80 万行生产级 Rust,AI agent 写了大部分代码,分布在 128 个合入 main 的 PR 中并逐步发布,运行时性能提升数个数量级。

    推荐理由:作者以亲历者身份给出把 Copilot 运行时从 TypeScript 迁到 Rust 的完整工程细节,可迁移到大规模 agent 协作开发。

9月16日周三
  1. Hugging Face Blog66

    IBM 研究提出 ALTK-Evolve 一致性指南:把智能体一致性差距从 24.4pp 降到 12.0pp

    IBM 研究团队在 ALTK-Evolve 中新增一致性指南(consistency guidelines)与 Consistency Analyzer,用于诊断并减少智能体在重复运行中的结果波动。

    推荐理由:原文给出 Pass^k 与一致性差距的量化诊断方法,并展示把差距减半的实测结果,可迁移到智能体可靠性评估。

9月10日周四
  1. OpenAI News62

    OpenAI 推出面向金融服务行业的 ChatGPT

    OpenAI 发布 ChatGPT for Financial Services,将内置金融数据与 GPT-6 Astra 结合,用于研究、建模和生成可直接交付客户的材料。

    推荐理由:OpenAI 把内置金融数据与 GPT-6 Astra 打包进 ChatGPT,读者可据此判断金融研究流程会如何被改写。

  2. OpenAI News62

    OpenAI 发布 Agents API

    OpenAI 发布 Agents API,用于构建和上线云端智能体。该服务为托管式,由 Codex harness 提供编排、长时间运行会话和工具调用支持。

    推荐理由:OpenAI 官方发布托管式 Agents API,读者可了解其编排、长会话与工具调用能力。