在 SageMaker Studio 中直接管理 Amazon SageMaker HyperPod Spaces
Amazon SageMaker Studio 新增 HyperPod Spaces 管理界面,数据科学家无需 CLI 或 kubectl,即可在浏览器中创建、配置、启停并打开 HyperPod EKS 集群上的 JupyterLab 和 Code Editor 环境。
Amazon SageMaker Studio 新增 HyperPod Spaces 管理界面,数据科学家无需 CLI 或 kubectl,即可在浏览器中创建、配置、启停并打开 HyperPod EKS 集群上的 JupyterLab 和 Code Editor 环境。
针对多团队共享 Amazon SageMaker HyperPod 集群的治理难题,AWS 提出组织、项目、集群、工作负载四层控制模型,并说明如何通过 SageMaker Unified Studio 将已批准的 HyperPod 集群接入项目,同时保留底层 IAM、Amazon EKS、RBAC 或 Slurm 控制。
AWS 发文解读国际标准 ISO/IEC 42005:2025,说明其如何指导企业将 AI 系统影响评估整合进整体治理体系。该标准覆盖评估全生命周期,并提供 Annex D 简化流程与 Annex E 独立模板两种落地路径。
Mistral AI 发布 Mistral Large 4 公开预览,可在 Mistral Studio 试用预览 API,权重将于本月底开放。该模型为 1 万亿参数、49B 激活参数的原生多模态模型,官方称其在编码、智能体工作流和多模态理解上表现突出,并在网络安全、金融、法律等企业场景中达到开源模型领先水平。
推荐理由:官方给出 1 万亿参数、49B 激活与多项基准对比,可据此判断开源权重模型在编码与智能体任务上的位置。
基于 Falcon-H1-Arabic 构建的 Falcon-Emirati-7B 是一款专攻阿联酋方言的 7B 模型,目标是以母语者的方式理解和生成 Emirati Arabic 的词汇、语气与文化语境。
NVIDIA Inception 计划中的多家初创公司正用 AI 覆盖乳腺癌筛查、风险评估与治疗规划环节。iSono Health 的 FDA 认证 ATUSA 可穿戴 3D 超声系统约两分钟完成单侧乳房扫描,称灵敏度比手持 2D 超声高 28%;Whiterabbit.ai 的 WRDensity 已用于数十万患者;Ataraxis AI 则用病理切片预测治疗反应与复发风险。
NVIDIA《State of AI in Telecommunications》报告显示,89% 受访者认为开源模型和软件对公司 AI 战略重要。NVIDIA 发布 300 亿参数的 Nemotron 3 Large Telco Model(LTM),由 AdaptKey 基于开源电信数据集微调,并开放完整微调流程。
Google 发布《Open and Emergent Problems in Agentic Privacy and Security: A Contextual Angle》 workshop 报告,由 50 多位学界与业界人士在 2025 年底纽约 Google CAPS Workshop 上共同完成。
Amazon Bedrock AgentCore Evaluations 支持内置与自定义评估器,可在开发和生产阶段衡量智能体的准确性、任务成功率与行为表现。
OpenAI 在 ChatGPT 中引入新的视觉广告格式,并扩展面向广告主的衡量工具、归因合作与品牌适配能力。此次更新围绕人们使用 AI 的方式设计广告,同时强化广告效果衡量与品牌安全。
Amazon Quick 控制台无法直接将用户从 Admin 降为 Reader 或从 Author 降为 Reader,update-user API 也会以“You cannot downgrade a user role”报错拒绝。
OpenAI 阐述了在 EU 文本溯源规则下推进文本水印的思路,说明了水印的适用范围与检测机制,并解释为何检测访问权限首先向研究人员开放。
Amazon Bedrock Managed Knowledge Base 上线智能体检索,通过 AgenticRetrieveStream API 把多部分问题拆成子查询、循环判断证据是否充分并再次检索,而 Retrieve API 只做单次混合搜索。
基于 Amazon Bedrock AgentCore 的 Quick Resource Migrator 示例 MCP 服务器,可在单次工具调用中把 Amazon Quick 的 chat agent、action connector、知识库、flow 和 space 从开发账户迁移到生产账户。
Amazon SageMaker AI 推出 aws-ai-ml 技能,通过 Agent Toolkit for AWS 为 Kiro、Claude Code、Codex 等支持 MCP 的编码智能体提供推理优化与基准测试能力。
Anthropic 的 Claude Opus 5.5、Claude Sonnet 5.5 和 Claude Sonnet 5 已上线 AWS GovCloud (US) 区域的 Amazon Bedrock,为 ITAR 等受监管工作负载提供 AI 辅助开发通道。
Z.ai 的 GLM 5.3 现已在 Amazon Bedrock 上线,这是一个 753B 参数的 MoE 模型,面向编码和长周期智能体任务,通过全托管 API 提供跨区域推理、提示词缓存和服务层级,目前面向符合条件的企业客户开放。
推荐理由:GLM 5.3 在 Bedrock 上线,文中给出提示词缓存与 Strix 安全测试的完整调用示例,可据此评估迁移成本。
GitHub 发布 ReviewBench,一个面向 AI 代码审查的开放离线基准,基于 1.039 亿个 GitHub pull request 的分布构建,包含 19 种语言、187 个开源仓库的 219 个 pull request。
推荐理由:GitHub 公开了代码审查基准的构建方法与离线信号,读者可据此判断评测结果与线上表现的关系。
微软 Copilot Studio 团队与 Hugging Face 联合发布 ThinkingBox,通过隔离的 MCP 工具会话运行智能体,按终端后端状态和副作用而非生成文本判分,覆盖 507 个有状态业务流程、每个任务重复 20 次。
推荐理由:微软与 Hugging Face 联合发布的智能体评测基准,用后端状态而非生成文本判分,并给出可复现的 OpenEnv 运行方式。
OpenAI 发布 GPT-6 家族模型指南,面向初创公司说明如何选择 GPT-6 模型、调整推理强度、改进提示词与技能、协调工具,并为生产环境准备工作流。
推荐理由:OpenAI 官方给出 GPT-6 家族的选型与调优路径,可帮助团队把模型能力落到生产工作流。
AWS 提出 Adjudicated Query 设计模式,让业务用户在 Amazon Quick 聊天界面提问合规问题,实际判定交由确定性规则引擎完成,模型只负责把自然语言转为固定类型操作调用并复述结果。
通过 Amazon Bedrock AgentCore 的 AgentCore Gateway,可将 Claude Desktop 接入由 Amazon 网页索引支持的 Web Search,覆盖数万亿文档,查询流量全程留在 AWS 内、无需外部 API key。
AWS 团队在 Amazon SageMaker AI 上用多轮强化学习(MTRL)微调 Qwen3.6-27B 搜索智能体,仅调整 max_epochs、global_batch_size、rollout_max_concurrency 三个超参数,其余走默认值。
Ai2 开源 AstaBrief 8B,一个把研究问题和检索到的文献片段转成带引用报告的模型,基于 Qwen3-8B 训练,已在 Asta 的 Generate a report 功能中作为 Fast 模式上线,与 Claude 驱动的 Thinking 模式并存。
推荐理由:原文给出了从 Qwen3-8B 出发的 SFT 加 DPO 训练配方与数据过滤经验,可迁移到其他科学报告生成场景。
GitHub 提出 AI 时代开发者需要强化三项技能:学会指挥 AI 而非只是使用它、不轻信 AI 的首次回答、用 AI 节省的时间去解决更大的问题。文中以 GitHub Copilot 内置的 Rubber Duck agent 为例,说明它用第二个模型对计划、代码和测试进行批判性审查,从而发现首个模型遗漏的问题。
Google 公布新一代联邦学习系统,利用可信执行环境(TEE)为数据匿名化提供可远程验证和审计的保证,并已由 Gboard 采用。系统通过访问策略公开透明日志 Rekor、KMS 密钥管理与可复现构建,使设备数据只能在符合策略的 TEE 内解密处理,且仅输出差分隐私模型权重。
推荐理由:Google 公布基于 TEE 的新一代联邦学习系统设计,并给出 Gboard 已上线的落地情况,可了解隐私可验证训练的实现路径。
NVIDIA 将于 10 月 23 日通过 Acer、ASUS、Dell、Gigabyte、HP 和 MSI 推出 64GB 统一内存版 DGX Spark,起售价 4,999 美元,保留 GB10 Grace Blackwell 超级芯片、DGX OS 和完整 NVIDIA AI 软件栈,支持最高 1000 亿参数模型在设备端运行。
推荐理由:原文给出 64GB 新配置的定价、上市时间和双机集群性能数据,读者可据此判断本地跑大模型的成本与扩展方式。
ServiceNow CoreAI 构建了 AutoSynthData,利用目标模型的失败案例与更强教师的成功示范,定位能力缺口并生成、验证新的可执行训练任务,随模型提升动态调整课程。该流程在 EnterpriseOps Gym 环境中演示,生成的任务需满足可行性、真实性与难度三项要求,验证器则需保证一致性、可靠性与完整性,通过校验的样本用于后训练。
Chatham Financial 借助 Codex 和 GPT-5.6 构建技术并重构工作流,将交易验证时间从 30 分钟压缩到 4 分钟以内。这家资本市场咨询公司借此扩展其资本市场专业能力。
OpenAI 的 GPT-6 Astra Ultrafast 已在 NVIDIA Blackwell GPU 上运行,并面向 OpenAI API 以及符合条件的 ChatGPT Work 和 Codex 用户开放。
推荐理由:原文给出 Astra Ultrafast 相对标准模式的加速倍数与开放入口,读者可据此判断它对编码智能体循环的实际影响。
AWS Professional Services 用四个 AI 智能体在 Amazon Bedrock AgentCore 上构建云迁移方案,将每个应用的基础设施即代码(IaC)开发时间从 3 到 4 周缩短至几分钟,该数据来自内部项目跟踪。
Amazon Quick 为 AI 构建的 Quick Apps 推出 Live Data in Apps,应用每次打开都会实时查询受治理的 Quick Sight 数据集,不再依赖构建时的静态快照。查询以查看者身份执行,现有行级和列级安全规则自动生效,SPICE 与 Direct Query 数据集均支持,查看者需为已认证的 Quick 用户并逐数据集授权。
NVIDIA NeMo Agent Toolkit(NAT)可将 Amazon S3 Vectors 作为自定义记忆后端,为多智能体系统提供持久化记忆。
OpenAI 探讨先进 AI 为何可能对突破性创意背后的日常性工作最为重要,并分析执行环节如何塑造下一阶段的经济形态与进步速度。
Amazon Payments 在 Amazon SageMaker AI 上用多目标上下文多臂老虎机(LinUCB)优化产品获客漏斗,七周线上 A/B 测试中,一个人群最终漏斗转化率取得高个位数相对提升,另一人群则未见改善,问题出在内容而非模型。
Amazon Bedrock AgentCore 支持构建"环境智能体"(ambient agent):它监听 Amazon S3 事件通知、EventBridge 规则等事件流并自动触发任务,在需要时通过单个 ask_human 工具暂停等待人工审批,再从中断处恢复执行。
AWS 发布 Claude Platform on AWS(CPonAWS)多环境访问实施指南,通过专用 AI Services 账户统一承载订阅与工作区,实现生产与开发流量隔离。
Albertsons 正借助 ChatGPT Enterprise 和 OpenAI API 帮助团队加快工作速度,并让数百万顾客的购物体验更轻松。这家杂货零售商将 OpenAI 技术用于内部提效与顾客购物体验两个方向。
uniopen 通过 Amazon SageMaker AI 对 Amazon Nova 2 Lite 进行监督微调,并做提示词层面的输出优化,使其适配自身零售审核策略。该策略按九类行为与品牌/其他/违禁三类主体两个维度分类,评测在 737 个对话窗口的留出测试集上进行,微调数据集含 3391 个训练窗口。Amazon Nova 2 Pro 仅用于生成候选修正,须经人工核验后才能进入训练集。
NVIDIA 提出 AI 工厂投资回报取决于产出能力、使用寿命与需求三项因素,其平台通过全栈协同设计实现每兆瓦吞吐最大化。SemiAnalysis AgentX 数据显示,Vera Rubin NVL72 每兆瓦吞吐量比 GB300 NVL72 高 30 倍以上,在 DeepSeek V4 Pro 上每百万 token 成本低至 45 倍。