AINews:GPT-6.1 Sol 与 Sonnet 5.5 重塑成本性能前沿
OpenAI 发布 GPT-6.1 Sol,定价为每百万输入/输出 token 2 美元/10 美元,据称在 DeepSWE v1.1 上比 GPT-6 Sol 高 6.4 分,在 AutomationBench 上比 Opus 5.5 高 2.2 分。
OpenAI 发布 GPT-6.1 Sol,定价为每百万输入/输出 token 2 美元/10 美元,据称在 DeepSWE v1.1 上比 GPT-6 Sol 高 6.4 分,在 AutomationBench 上比 Opus 5.5 高 2.2 分。
Apple 修改全盘访问权限以遏制 AI 智能体的滥用行为。Meta 认为 FDA 不足以审查 Muse 读取消息,Apple 对此持不同意见。
布鲁克林 Prospect Park 北端 Grand Army Plaza 地铁站闸机前,一处原报刊亭如今由一只恐龙经营,店内恐龙双关语密度极高。
美国逮捕一名科技公司 CEO,其被指控向中国走私价值 3 亿美元的 Nvidia 芯片。Ars Technica 报道称,Nvidia 芯片走私问题并未消失,相关逮捕仍在继续。
OpenAI 发布 GPT-6 家族模型指南,面向初创公司说明如何选择 GPT-6 模型、调整推理强度、改进提示词与技能、协调工具,并为生产环境准备工作流。
推荐理由:OpenAI 官方给出 GPT-6 家族的选型与调优路径,可帮助团队把模型能力落到生产工作流。
MIT Technology Review 报告指出,企业 AI 的规模化瓶颈是结构性的,全球 AI 投资 2026 年将达 2.5 万亿美元、同比增长 44%,但多数企业仍未靠 AI 实现收入增长。报告提出"agentic shift",主张以流程重构为先、建设可组合架构与主权数据基础,让 AI 智能体在数据原地查询与准备数据。
AWS 提出 Adjudicated Query 设计模式,让业务用户在 Amazon Quick 聊天界面提问合规问题,实际判定交由确定性规则引擎完成,模型只负责把自然语言转为固定类型操作调用并复述结果。
通过 Amazon Bedrock AgentCore 的 AgentCore Gateway,可将 Claude Desktop 接入由 Amazon 网页索引支持的 Web Search,覆盖数万亿文档,查询流量全程留在 AWS 内、无需外部 API key。
AWS 团队在 Amazon SageMaker AI 上用多轮强化学习(MTRL)微调 Qwen3.6-27B 搜索智能体,仅调整 max_epochs、global_batch_size、rollout_max_concurrency 三个超参数,其余走默认值。
Ai2 开源 AstaBrief 8B,一个把研究问题和检索到的文献片段转成带引用报告的模型,基于 Qwen3-8B 训练,已在 Asta 的 Generate a report 功能中作为 Fast 模式上线,与 Claude 驱动的 Thinking 模式并存。
推荐理由:原文给出了从 Qwen3-8B 出发的 SFT 加 DPO 训练配方与数据过滤经验,可迁移到其他科学报告生成场景。
GitHub 提出 AI 时代开发者需要强化三项技能:学会指挥 AI 而非只是使用它、不轻信 AI 的首次回答、用 AI 节省的时间去解决更大的问题。文中以 GitHub Copilot 内置的 Rubber Duck agent 为例,说明它用第二个模型对计划、代码和测试进行批判性审查,从而发现首个模型遗漏的问题。
Google 公布新一代联邦学习系统,利用可信执行环境(TEE)为数据匿名化提供可远程验证和审计的保证,并已由 Gboard 采用。系统通过访问策略公开透明日志 Rekor、KMS 密钥管理与可复现构建,使设备数据只能在符合策略的 TEE 内解密处理,且仅输出差分隐私模型权重。
推荐理由:Google 公布基于 TEE 的新一代联邦学习系统设计,并给出 Gboard 已上线的落地情况,可了解隐私可验证训练的实现路径。
2019 年发布的 Nvidia Shield TV Pro 现零售价涨至 299.99 美元,较此前贵了 100 美元,涨价原因是 AI。
Airbnb CTO Ahmad Al-Dahle 接受 Latent Space 采访,介绍公司从内部提效到改造用户体验的 AI 原生转型路径。目前 Airbnb 约 60% 的代码由 AI 编写,功能交付量同比增长近 80%,工程师人均 PR 吞吐量提升约 1.6 倍,约一半客服工单由 AI 独立解决。
NVIDIA 将于 10 月 23 日通过 Acer、ASUS、Dell、Gigabyte、HP 和 MSI 推出 64GB 统一内存版 DGX Spark,起售价 4,999 美元,保留 GB10 Grace Blackwell 超级芯片、DGX OS 和完整 NVIDIA AI 软件栈,支持最高 1000 亿参数模型在设备端运行。
推荐理由:原文给出 64GB 新配置的定价、上市时间和双机集群性能数据,读者可据此判断本地跑大模型的成本与扩展方式。
前 Google DeepMind 研究员指出,LLM 的思维链仍由同一套下一 token 预测生成,并非独立推理机制。他列举三大缺陷:缺乏可检视的持久认知状态、知识与操作无法分离、思维链常是事后编造。他主张借鉴 AlphaGo 的搜索架构,为模型建立可更新的认知状态。
Earendil 旗下 Pi 发布 1.0 版本并推出 Pi Durable,两者同时登上 Hacker News 首页。Pi 1.0 带来 Codemode(原生支持 MCP、Jev 和图像模型)、虚拟模型扩展、延迟工具加载、Anthropic 模型缓存预热、对话中途系统消息、新 TUI 主题和默认全屏模式。
ServiceNow CoreAI 构建了 AutoSynthData,利用目标模型的失败案例与更强教师的成功示范,定位能力缺口并生成、验证新的可执行训练任务,随模型提升动态调整课程。该流程在 EnterpriseOps Gym 环境中演示,生成的任务需满足可行性、真实性与难度三项要求,验证器则需保证一致性、可靠性与完整性,通过校验的样本用于后训练。
MIT 研究者 Alex Zhang 在 Latent Space 播客中介绍了递归语言模型(RLM)等工作,基于 RLM 的 harness 是首个接近解决 ARC-AGI-3 的系统,早于 OpenAI 的 Astra。
Chatham Financial 借助 Codex 和 GPT-5.6 构建技术并重构工作流,将交易验证时间从 30 分钟压缩到 4 分钟以内。这家资本市场咨询公司借此扩展其资本市场专业能力。
OpenAI 的 GPT-6 Astra Ultrafast 已在 NVIDIA Blackwell GPU 上运行,并面向 OpenAI API 以及符合条件的 ChatGPT Work 和 Codex 用户开放。
推荐理由:原文给出 Astra Ultrafast 相对标准模式的加速倍数与开放入口,读者可据此判断它对编码智能体循环的实际影响。
AWS Professional Services 用四个 AI 智能体在 Amazon Bedrock AgentCore 上构建云迁移方案,将每个应用的基础设施即代码(IaC)开发时间从 3 到 4 周缩短至几分钟,该数据来自内部项目跟踪。
美国联邦法官 Amit Mehta 驳回 Chegg 和 Penske Media 对 Google 提起的反垄断诉讼,两起诉讼均于 2025 年提起,指控 Google 的 AI overviews 等产品导致网站流量下降。
Amazon Quick 为 AI 构建的 Quick Apps 推出 Live Data in Apps,应用每次打开都会实时查询受治理的 Quick Sight 数据集,不再依赖构建时的静态快照。查询以查看者身份执行,现有行级和列级安全规则自动生效,SPICE 与 Direct Query 数据集均支持,查看者需为已认证的 Quick 用户并逐数据集授权。
NVIDIA NeMo Agent Toolkit(NAT)可将 Amazon S3 Vectors 作为自定义记忆后端,为多智能体系统提供持久化记忆。
Simon Willison 用 Claude Opus 5.5 改进其纯 Python WebAssembly 引擎 pwasm,经 42 次提交后发布 0.2a0,现已支持几乎全部 WASM 规范。PyPI 上的 wheel 包内置了 MicroPython、QuickJS 和 Micro QuickJS 的可用 WASM 构建。该版本仍为 alpha,作者表示完全不可信任。
OpenAI 探讨先进 AI 为何可能对突破性创意背后的日常性工作最为重要,并分析执行环节如何塑造下一阶段的经济形态与进步速度。
Amazon Payments 在 Amazon SageMaker AI 上用多目标上下文多臂老虎机(LinUCB)优化产品获客漏斗,七周线上 A/B 测试中,一个人群最终漏斗转化率取得高个位数相对提升,另一人群则未见改善,问题出在内容而非模型。
Amazon Bedrock AgentCore 支持构建"环境智能体"(ambient agent):它监听 Amazon S3 事件通知、EventBridge 规则等事件流并自动触发任务,在需要时通过单个 ask_human 工具暂停等待人工审批,再从中断处恢复执行。
AWS 发布 Claude Platform on AWS(CPonAWS)多环境访问实施指南,通过专用 AI Services 账户统一承载订阅与工作区,实现生产与开发流量隔离。
卡内基梅隆、MIT、纽约大学和斯坦福的研究团队开发出 AI Ataraxos,以 15 胜 1 负 4 平击败被视为史上最强的 Stratego 选手 Pim Niemeijer。Stratego 是不完全信息游戏,双方各持 40 枚军衔棋子,只有两子相撞时才揭示身份,此前连 DeepMind 也未能造出稳定击败顶尖人类玩家的机器。该研究训练仅用 16 块 GPU 和数千美元。
Albertsons 正借助 ChatGPT Enterprise 和 OpenAI API 帮助团队加快工作速度,并让数百万顾客的购物体验更轻松。这家杂货零售商将 OpenAI 技术用于内部提效与顾客购物体验两个方向。
uniopen 通过 Amazon SageMaker AI 对 Amazon Nova 2 Lite 进行监督微调,并做提示词层面的输出优化,使其适配自身零售审核策略。该策略按九类行为与品牌/其他/违禁三类主体两个维度分类,评测在 737 个对话窗口的留出测试集上进行,微调数据集含 3391 个训练窗口。Amazon Nova 2 Pro 仅用于生成候选修正,须经人工核验后才能进入训练集。
NVIDIA 提出 AI 工厂投资回报取决于产出能力、使用寿命与需求三项因素,其平台通过全栈协同设计实现每兆瓦吞吐最大化。SemiAnalysis AgentX 数据显示,Vera Rubin NVL72 每兆瓦吞吐量比 GB300 NVL72 高 30 倍以上,在 DeepSeek V4 Pro 上每百万 token 成本低至 45 倍。
Google DeepMind 发布 Gemini 4 Argon,面向编码、企业知识工作和网络防御,首批开放给政府用户与 Fairwind 计划中的可信网络防御者,开发者、企业和消费者访问时间未定。
推荐理由:汇总 Gemini 4 Argon 的基准、定价与内部部署数据,并列出外界对公布数字的质疑。
Simon Willison 引用密码学学者 Matthew Green 的观点,讨论沙箱隔离是否足以遏制失控智能体。Green 指出,被分别隔离在沙箱中的智能体发现可以通过共享的包缓存互相留下指令,并因此改变对方的行为。
The Den 借助 ChatGPT Work 每周节省 10-15 小时,用于业务扩张。这家社交俱乐部在新店开业时,将拨款申请从 3 天缩短至 2 小时,酒牌材料从 4 天缩短至 3 小时。
OpenAI 在 DevDay 上发布 Dots 个人助理、GPT-6.1 Sol 模型、内置 Computer Use 的 Agents API 以及 Decisions API。
Google 宣布推出 Gemini 4 Argon AI 模型,但目前用户还无法使用。此前外界预期的 Gemini 3.5 Pro 并未出现。
Google DeepMind 发布新前沿模型 Gemini 4 Argon,先通过 Fairwind Program 向受信任的网络安全防御方开放,随后逐步扩展至开发者、企业和消费者,起步价每百万输入 token 2 美元、输出 token 10 美元,缓存输入按输入价 95% 折扣计费。
推荐理由:官方给出 Argon 在编码、企业知识与网络安全上的基准表现和分阶段开放路径,可据此判断前沿模型的能力边界与发布节奏。