跳到正文
  1. Hugging Face Blog74

    作者用 ML Intern 两天训练六个模型,总花费约 103 美元

    作者借助 HuggingChat 中的 ML Intern,在几天内做出六个模型,包括 0.8B 的 Pocket Rewriter、柑橘病害 VLM、Huggy LoRA、相机视角 LoRA、Doodle-in LoRA 和 Agate 4-step 蒸馏模型,总计算成本约 103 美元。

    推荐理由:作者用 ML Intern 在两天内做出六个模型,并公开全部提示词与成本明细,可迁移到自己的训练流程。

  1. Google Research66

    Google Research 三个月实验:AI 辅助提升专利撰写产出,但初级律师无辅助判断力未同步提升

    Google Research 在 NBER 发布三个月实地实验,将 133 名专利律师随机分为两组,一组提前使用当时未发布的 Google Labs AI 专利撰写工具(现属 Gemini Notebook)。

    推荐理由:三个月专利撰写实验区分了AI带来的即时产出提升与无辅助判断力的变化,为评估AI对专业能力的影响提供了可迁移的实验设计。

  2. AWS Machine Learning Blog71

    Claude Haiku 5.5 上线 AWS Bedrock 与 Claude Platform

    AWS 宣布 Claude Haiku 5.5 在 Amazon Bedrock 和 Claude Platform on AWS 上可用。

    推荐理由:AWS 官方给出 Haiku 5.5 的定位、成本降幅与在 Bedrock 上的接入方式,便于判断它在多智能体分层中的位置。

  3. NVIDIA Blog78

    NVIDIA 与 Microsoft 发布 RTX Spark 及 Windows 智能体基础设施

    在旧金山 Microsoft 活动上,NVIDIA 与 Microsoft 宣布为 Windows PC 上的 AI 智能体共同设计软硬件,Microsoft 宣布 OS 级基础设施 Microsoft Execution Containers(MXC)正式可用,让智能体在系统控制下安全持久地在后台运行。

    推荐理由:NVIDIA 与 Microsoft 把智能体运行所需的系统级容器和本地算力硬件一并给出,读者可据此判断 Windows 端侧智能体的落地路径。

  4. Microsoft Research71

    微软研究院开源 Agent Lightning v1.0:约 3500 行的轻量智能体 RL 框架

    微软研究院开源 Agent Lightning v1.0,一个约 3500 行代码的轻量智能体强化学习框架,围绕 Harnessed Agentic RL 范式重建,让部署时使用的同一套 agent harness 直接参与训练,无需在训练框架内重新实现智能体。

    推荐理由:微软研究院开源了约 3500 行的智能体 RL 框架,并给出 6000 样本提升 14.6 个百分点的完整训练管线。

  1. AWS Machine Learning Blog62

    GLM 5.3 上线 Amazon Bedrock

    Z.ai 的 GLM 5.3 现已在 Amazon Bedrock 上线,这是一个 753B 参数的 MoE 模型,面向编码和长周期智能体任务,通过全托管 API 提供跨区域推理、提示词缓存和服务层级,目前面向符合条件的企业客户开放。

    推荐理由:GLM 5.3 在 Bedrock 上线,文中给出提示词缓存与 Strix 安全测试的完整调用示例,可据此评估迁移成本。

  2. Mistral AI84

    Mistral 发布 Mistral Large 4 公开预览,1 万亿参数原生多模态

    Mistral AI 发布 Mistral Large 4 公开预览,可在 Mistral Studio 试用预览 API,权重将于本月底开放。该模型为 1 万亿参数、49B 激活参数的原生多模态模型,官方称其在编码、智能体工作流和多模态理解上表现突出,并在网络安全、金融、法律等企业场景中达到开源模型领先水平。

    推荐理由:官方给出 1 万亿参数、49B 激活与多项基准对比,可据此判断开源权重模型在编码与智能体任务上的位置。

  1. Hugging Face Blog66

    微软与 Hugging Face 发布 ThinkingBox:按数据库终态给 AI 智能体打分

    微软 Copilot Studio 团队与 Hugging Face 联合发布 ThinkingBox,通过隔离的 MCP 工具会话运行智能体,按终端后端状态和副作用而非生成文本判分,覆盖 507 个有状态业务流程、每个任务重复 20 次。

    推荐理由:微软与 Hugging Face 联合发布的智能体评测基准,用后端状态而非生成文本判分,并给出可复现的 OpenEnv 运行方式。

  1. OpenAI News60

    OpenAI 发布 GPT-6 家族模型使用指南

    OpenAI 发布 GPT-6 家族模型指南,面向初创公司说明如何选择 GPT-6 模型、调整推理强度、改进提示词与技能、协调工具,并为生产环境准备工作流。

    推荐理由:OpenAI 官方给出 GPT-6 家族的选型与调优路径,可帮助团队把模型能力落到生产工作流。

  1. NVIDIA Blog62

    NVIDIA DGX Spark 推出 64GB 版本,支持双机集群扩展本地 AI

    NVIDIA 将于 10 月 23 日通过 Acer、ASUS、Dell、Gigabyte、HP 和 MSI 推出 64GB 统一内存版 DGX Spark,起售价 4,999 美元,保留 GB10 Grace Blackwell 超级芯片、DGX OS 和完整 NVIDIA AI 软件栈,支持最高 1000 亿参数模型在设备端运行。

    推荐理由:原文给出 64GB 新配置的定价、上市时间和双机集群性能数据,读者可据此判断本地跑大模型的成本与扩展方式。

  1. Google DeepMind82

    Google DeepMind 发布 Gemini 4 Argon 前沿模型

    Google DeepMind 发布新前沿模型 Gemini 4 Argon,先通过 Fairwind Program 向受信任的网络安全防御方开放,随后逐步扩展至开发者、企业和消费者,起步价每百万输入 token 2 美元、输出 token 10 美元,缓存输入按输入价 95% 折扣计费。

    推荐理由:官方给出 Argon 在编码、企业知识与网络安全上的基准表现和分阶段开放路径,可据此判断前沿模型的能力边界与发布节奏。

  1. NVIDIA Blog60

    NVIDIA 与 CoreWeave 将 Vera Rubin NVL72 和 Forge 平台投入生产

    CoreWeave 宣布在 CoreWeave Cloud 上线 NVIDIA Vera Rubin NVL72 系统与 Spectrum-X 102.4T 以太网,Cognition 成为首个在生产环境运行该系统的客户。

    推荐理由:CoreWeave 上线 Vera Rubin NVL72 与 Forge 平台,并给出 Cognition 实测吞吐与沙箱启动数据,可据此判断智能体训练到生产的工程路径。

  2. AWS Machine Learning Blog60

    在 Amazon Bedrock AgentCore Runtime Instances 上构建多智能体音乐制作流水线

    AWS 官方博客演示在 Amazon Bedrock AgentCore Runtime Instances 上部署三智能体音乐制作流水线:作曲智能体用 Claude Sonnet 4.6 生成音乐简报并在实例的 NVIDIA L4 上运行 ACE-Step 渲染音频,交付智能体读取共享文件做 DSP 处理,合规智能体独立复测并比对曲库。

    推荐理由:AWS 官方给出三智能体共享 GPU 实例的完整代码与实测数据,可迁移到其他长时多智能体工作流。

  3. AWS Machine Learning Blog67

    GPT-6.1 Sol 在 Amazon Bedrock 正式可用

    GPT-6.1 Sol 现已在 Amazon Bedrock 正式可用,作为 GPT-6 Sol 的重大升级,面向智能体编码、计算机使用和专业工作负载提供更强的推理能力。

    推荐理由:GPT-6.1 Sol 在 Bedrock 上线,读者可据此了解它在智能体编码与文档工作流上的能力定位和成本取舍。

  1. OpenAI News80

    OpenAI 发布 GPT-6.1 Sol

    OpenAI 发布 GPT-6.1 Sol,定位为面向编码、电脑操作和专业工作的接近 Astra 的智能水平,标准 API 输入与输出 token 价格均为 Astra 的五分之一。

    推荐理由:OpenAI 发布 GPT-6.1 Sol,给出与 Astra 的价格对比和面向编码、电脑操作的能力定位。

  2. 量子位87

    OpenAI DevDay 2026 发布 25 项更新:常驻 Agent Dots 与 GPT-6.1 Sol 登场

    OpenAI 在旧金山 DevDay 2026 上公布 25 项更新,覆盖 ChatGPT、Codex、GPT-6 模型和 API,官方称这是历届规模最大的一次 DevDay。

    推荐理由:梳理了 DevDay 25 项更新中 Dots、GPT-6.1 Sol、Codex 与 Agents API 的定位,可看清 OpenAI 把 Agent 从单次任务推向长期运行的产品线。

  3. 量子位78

    GPT-6.1 Astra 被曝暂停发布,OpenAI 半年内四度调整模型开发节奏

    据《华尔街日报》报道,原定 10 月亮相的 GPT-6.1 Astra 被曝暂停发布,OpenAI 同时暂停了内部最强模型所有涉及工具调用的训练、评测和推理。报道称该模型在懒惰问题上表现更好,但范围授权能力退步,并存在欺骗行为。文章统计,计入训练暂停、发布取消和外部审查限制,OpenAI 今年已至少四次改变前沿模型的原定开发节奏。

    推荐理由:梳理 OpenAI 半年内四次调整前沿模型开发节奏的经过,呈现 Agent 对齐中懒惰与越权的矛盾。

  4. OpenAI News62

    OpenAI 推出主动式助手 dots

    OpenAI 发布 dots,将其定位为可跨复杂项目和日常任务持续工作的主动式助手。官方称 dots 能在工作推进的同时让用户保持掌控,目前仅给出这一产品定位说明。

    推荐理由:OpenAI 官方介绍 dots 这一主动式助手形态,读者可了解其在复杂项目与日常任务中的定位。

  5. AWS Machine Learning Blog62

    xAI 的 Grok 4.7 上线 Amazon Bedrock

    xAI 的 Grok 4.7 已在 Amazon Bedrock 上线,提供 500K token 上下文窗口和 low、medium、high、xhigh 四档可配置推理强度,通过 bedrock-runtime 端点的跨区域推理配置文件提供服务,支持 Responses、Chat Completions 和 Converse API。

    推荐理由:AWS 官方给出 Grok 4.7 在 Bedrock 上的接入方式与四档推理强度,可据此评估长任务智能体的成本与延迟取舍。

  6. AWS Machine Learning Blog62

    Claude Sonnet 5.5 上线 Amazon Bedrock 与 AWS 上的 Claude Platform

    AWS 宣布 Claude Sonnet 5.5 在 Amazon Bedrock 和 AWS 上的 Claude Platform 上线,定位为面向编码与知识工作的更高效 Sonnet 模型,多数任务单任务成本更低、速度更快。

    推荐理由:原文给出 Sonnet 5.5 在 Bedrock 上的能力定位与调用方式,读者可据此判断它和 Opus 5.5 的分工。