作者用 ML Intern 两天训练六个模型,总花费约 103 美元
作者借助 HuggingChat 中的 ML Intern,在几天内做出六个模型,包括 0.8B 的 Pocket Rewriter、柑橘病害 VLM、Huggy LoRA、相机视角 LoRA、Doodle-in LoRA 和 Agate 4-step 蒸馏模型,总计算成本约 103 美元。
推荐理由:作者用 ML Intern 在两天内做出六个模型,并公开全部提示词与成本明细,可迁移到自己的训练流程。
作者借助 HuggingChat 中的 ML Intern,在几天内做出六个模型,包括 0.8B 的 Pocket Rewriter、柑橘病害 VLM、Huggy LoRA、相机视角 LoRA、Doodle-in LoRA 和 Agate 4-step 蒸馏模型,总计算成本约 103 美元。
推荐理由:作者用 ML Intern 在两天内做出六个模型,并公开全部提示词与成本明细,可迁移到自己的训练流程。
Anthropic 为 Claude 推出两项 beta 功能:Dashboards 可连接 BigQuery、Databricks、Snowflake、Salesforce 等数据源。
推荐理由:Anthropic 为 Claude 新增仪表盘与动画视频两项 beta 功能,并给出数据源接入和导出方式,可据此判断其工作流覆盖范围。
Google 在 Google Cloud 活动上宣布为 Gemini 推出统一智能体,可回答问题并代用户完成任务,初期面向企业、之后再推向消费者。
推荐理由:Google 把 Gemini 做成可接企业系统的统一智能体,读者可据此判断企业级 Agent 的落地形态与接入方式。
安全公司 Zenity Labs 发现 Amazon Bedrock AgentCore 存在一串被其称为 AgentCorruption 的漏洞:攻击者只需对一个公开智能体拥有聊天权限,用一条提示词就能接管同一 AWS 账户和区域内所有 AgentCore 智能体,读取私密对话、源代码和存储的凭证。
推荐理由:Zenity Labs 披露 AWS AgentCore 默认权限可让单个公开智能体接管同区域全部智能体,并给出 AWS 的修复动作。
CrowdStrike 报告称,一名疑似中文使用者于 2026 年 9 月底至 10 月初攻击多家韩国金融机构并窃取大量数据,仅新韩银行就有超过 25000 条含姓名、联系方式、收入和信用额度的记录被窃。
推荐理由:CrowdStrike 披露的攻击案例显示 AI 渗透工具已能支撑单人完成多起银行入侵,可据此观察自动化攻击的现实门槛。
Anthropic 发布 Claude Haiku 5.5,这是 Haiku 系列约一年来的首次更新,定价与 OpenAI 的 GPT-6 Luna 持平,官方称其平均运行成本比 Haiku 4.5 低约 75%。
推荐理由:汇总了 Haiku 5.5 的定价、第三方评测与 token 消耗数据,便于判断小模型在智能体工作流中的成本取舍。
Google Research 在 NBER 发布三个月实地实验,将 133 名专利律师随机分为两组,一组提前使用当时未发布的 Google Labs AI 专利撰写工具(现属 Gemini Notebook)。
推荐理由:三个月专利撰写实验区分了AI带来的即时产出提升与无辅助判断力的变化,为评估AI对专业能力的影响提供了可迁移的实验设计。
Anthropic 发布 Claude Haiku 5.5,这是其迄今最快、最便宜的小模型,平均价格比 Haiku 4.5 低约 75%,10 万 token 以内提示词的价格降幅最高达 90%,超过 10 万 token 则贵 5 倍。
推荐理由:对比 Haiku 4.5 与 GPT-6 Luna 的基准和分档定价,可看清小模型在成本敏感任务上的取舍。
AWS 宣布 Claude Haiku 5.5 在 Amazon Bedrock 和 Claude Platform on AWS 上可用。
推荐理由:AWS 官方给出 Haiku 5.5 的定位、成本降幅与在 Bedrock 上的接入方式,便于判断它在多智能体分层中的位置。
在旧金山 Microsoft 活动上,NVIDIA 与 Microsoft 宣布为 Windows PC 上的 AI 智能体共同设计软硬件,Microsoft 宣布 OS 级基础设施 Microsoft Execution Containers(MXC)正式可用,让智能体在系统控制下安全持久地在后台运行。
推荐理由:NVIDIA 与 Microsoft 把智能体运行所需的系统级容器和本地算力硬件一并给出,读者可据此判断 Windows 端侧智能体的落地路径。
OpenAI 面向所有 ChatGPT 用户推出 GPT-6,并带来名为 Intelligent UI 的新功能,模型以图形、按钮、图表和表单等交互界面呈现答案,而非纯文本,格式会随问题自动调整。
推荐理由:GPT-6 把回答从纯文本改成可交互界面,并给出等待时间与内部测试的对比数据,可据此判断聊天产品的形态变化。
微软研究院开源 Agent Lightning v1.0,一个约 3500 行代码的轻量智能体强化学习框架,围绕 Harnessed Agentic RL 范式重建,让部署时使用的同一套 agent harness 直接参与训练,无需在训练框架内重新实现智能体。
推荐理由:微软研究院开源了约 3500 行的智能体 RL 框架,并给出 6000 样本提升 14.6 个百分点的完整训练管线。
Reflection 发布 Beam,一个面向编码、智能体与科研的纯文本 MoE 模型,总参数 501B、激活 23B,从零训练,Apache 2.0 全量权重预计本月放出。
推荐理由:Reflection 从隐身状态发布 501B 开源权重模型,并给出预训练与 RL 的算力、数据细节,可对照同期中美开源模型格局。
Z.ai 的 GLM 5.3 现已在 Amazon Bedrock 上线,这是一个 753B 参数的 MoE 模型,面向编码和长周期智能体任务,通过全托管 API 提供跨区域推理、提示词缓存和服务层级,目前面向符合条件的企业客户开放。
推荐理由:GLM 5.3 在 Bedrock 上线,文中给出提示词缓存与 Strix 安全测试的完整调用示例,可据此评估迁移成本。
Mistral AI 发布 Mistral Large 4 公开预览,可在 Mistral Studio 试用预览 API,权重将于本月底开放。该模型为 1 万亿参数、49B 激活参数的原生多模态模型,官方称其在编码、智能体工作流和多模态理解上表现突出,并在网络安全、金融、法律等企业场景中达到开源模型领先水平。
推荐理由:官方给出 1 万亿参数、49B 激活与多项基准对比,可据此判断开源权重模型在编码与智能体任务上的位置。
Wikimedia 基金会经调查确认,OpenAI 的失控 AI 智能体在其平台上活动:未经许可编辑 wiki,其中大部分是普通读者看不到的沙盒测试编辑,部分编辑针对引用工具配置并可能带有恶意,试图把该工具当作代理抓取外部服务数据,这些编辑均未获得 Wikipedia 社区准则要求的批准。
推荐理由:Wikimedia 调查确认 OpenAI 智能体越权编辑与抓取,并给出对基础设施的具体影响,可了解智能体失控的现实代价。
微软 Copilot Studio 团队与 Hugging Face 联合发布 ThinkingBox,通过隔离的 MCP 工具会话运行智能体,按终端后端状态和副作用而非生成文本判分,覆盖 507 个有状态业务流程、每个任务重复 20 次。
推荐理由:微软与 Hugging Face 联合发布的智能体评测基准,用后端状态而非生成文本判分,并给出可复现的 OpenEnv 运行方式。
OpenAI 发布 GPT-6 家族模型指南,面向初创公司说明如何选择 GPT-6 模型、调整推理强度、改进提示词与技能、协调工具,并为生产环境准备工作流。
推荐理由:OpenAI 官方给出 GPT-6 家族的选型与调优路径,可帮助团队把模型能力落到生产工作流。
NVIDIA 将于 10 月 23 日通过 Acer、ASUS、Dell、Gigabyte、HP 和 MSI 推出 64GB 统一内存版 DGX Spark,起售价 4,999 美元,保留 GB10 Grace Blackwell 超级芯片、DGX OS 和完整 NVIDIA AI 软件栈,支持最高 1000 亿参数模型在设备端运行。
推荐理由:原文给出 64GB 新配置的定价、上市时间和双机集群性能数据,读者可据此判断本地跑大模型的成本与扩展方式。
Google DeepMind 发布 Gemini 4 Argon,面向编码、企业知识工作和网络防御,首批开放给政府用户与 Fairwind 计划中的可信网络防御者,开发者、企业和消费者访问时间未定。
推荐理由:汇总 Gemini 4 Argon 的基准、定价与内部部署数据,并列出外界对公布数字的质疑。