Ai2 如何用 GPU 时间预算与分层公平分配改造集群调度
Ai2 用 GPU 时间预算、分层公平分配和时间切片合约替换了原有的优先级调度器,以提升高价值研究获得 GPU 资源的概率。其集群管理数千块 NVIDIA H100、B200 和 B300,规模从 88 到 1024 块 GPU,约 150 名内部研究者的需求长期是可用算力的 2-3 倍。
Ai2 用 GPU 时间预算、分层公平分配和时间切片合约替换了原有的优先级调度器,以提升高价值研究获得 GPU 资源的概率。其集群管理数千块 NVIDIA H100、B200 和 B300,规模从 88 到 1024 块 GPU,约 150 名内部研究者的需求长期是可用算力的 2-3 倍。
Postman 披露其 Agent Mode 在 Amazon Bedrock 上的生产架构:通过向量数据库将 170 多个工具按任务动态收窄至约 15 个,避免工具集超过约 40 个后选择错误率上升。
LegalOn 将 Codex 每日预估成本降低 65%,同时保持开发速度。其做法是按任务匹配 Astra、Sol 和 Luna,并对预算进行策略性管理。
作者借助 HuggingChat 中的 ML Intern,在几天内做出六个模型,包括 0.8B 的 Pocket Rewriter、柑橘病害 VLM、Huggy LoRA、相机视角 LoRA、Doodle-in LoRA 和 Agate 4-step 蒸馏模型,总计算成本约 103 美元。
推荐理由:作者用 ML Intern 在两天内做出六个模型,并公开全部提示词与成本明细,可迁移到自己的训练流程。
AWS 发布基于 Amazon SageMaker HyperPod 与 EKS 的多租户参考架构,让多个团队共享同一 GPU 集群。
Amazon Quick 与 Amazon Bedrock Knowledge Bases 新增实时 ACL 校验层,在查询时直接向 Google Drive 等权威源核实权限,与原有的预检索过滤组成两阶段方案。该方案针对复制-过滤模式的三大缺陷:AI 系统并非权限权威源、同步间隔导致权限过期、数据源权限模型持续变化。未授权文档会被排除在检索结果之外,只有通过校验的片段才送入 LLM 生成回答。
Cornerstone OnDemand 基于 Amazon Bedrock 和 Strands Agents 构建多智能体系统 Orion AI,将数据库诊断时间从 45 分钟降至 10 分钟,减少 78%。该系统还使手动生命周期步骤减少 70%、SRE 与数据团队报告延迟从 15 分钟降至实时、冗余告警中位数减少 65%,由三人团队在六个月内交付。
AWS 设计了一个为期六周、每周约四小时的结构化项目,让非工程背景的业务人员用 Amazon Bedrock AgentCore、Strands Agents SDK 等生产级工具构建可用的 AI 原型。
针对 AWS DevOps Agent 只诊断不改动生产资源的问题,该方案用 Amazon EventBridge 接收调查完成事件,触发 AWS Lambda Durable Functions 调用 Amazon Bedrock 分析根因并从预批准工具白名单中提出修复动作。
Qlik 基于 Amazon Bedrock 打造 Qlik Answers,为全球超 4 万名客户提供有来源、可验证的自然语言问答。其 Discovery Agent 上线以来已为客户发现超 10 万条异常与离群点,多数启用智能体工具的 Qlik Cloud 账户已在日常使用。
AWS 提出 Agentic Value Model,用于替代按“节省工时×人力成本−建设成本”计算的 RPA 时代 ROI 模型,从时间节省、异常处理、决策质量、变更韧性与维护经济性四个维度衡量 agentic automation 的价值。该框架强调价值实现需有明确机制和责任人,并以理赔分流流程为例说明释放工时并不等于节省成本。
Parseable 是一款全新的可观测性工具,兼容 OpenTelemetry,用于存储和查询可观测性数据,提供 AGPL 协议的 Rust 开源实现(单个约 180MB 二进制文件)、带额外功能的企业版以及云托管选项。
基于 Amazon Bedrock AgentCore 运行时与开源智能体系统 OpenClaw,可构建具备持久记忆的上下文感知 AI 助手。AgentCore memory 将一次性对话转为长期知识,并支持结构化元数据标签检索;文本与图像分别路由至 Claude Haiku 4.5 和 Claude Sonnet 4.5。
Simon Willison 让 Claude Opus 5.5 设计一种简单的文本音乐格式并构建可播放的 artifact,要求达到《猴岛小英雄》初代的配乐水准,结果比预期更贴近猴岛主题且质量出人意料地好。他由此猜测,文本模型作曲可能类似此前的 3D 图形能力,是近几个月才涌现的新能力,但需用其他新旧模型做实验才能确认。
基于 Amazon Bedrock AgentCore、Amazon Nova 2.5 Sonic 和 Amazon Bedrock Knowledge Bases,可构建航空应用中的语音旅行助手,支持改座位、查延误、更新餐食偏好、回答政策问题并转接人工客服。
针对多团队共享 Amazon SageMaker HyperPod 集群的治理难题,AWS 提出组织、项目、集群、工作负载四层控制模型,并说明如何通过 SageMaker Unified Studio 将已批准的 HyperPod 集群接入项目,同时保留底层 IAM、Amazon EKS、RBAC 或 Slurm 控制。
AWS 发文解读国际标准 ISO/IEC 42005:2025,说明其如何指导企业将 AI 系统影响评估整合进整体治理体系。该标准覆盖评估全生命周期,并提供 Annex D 简化流程与 Annex E 独立模板两种落地路径。
Amazon Quick 控制台无法直接将用户从 Admin 降为 Reader 或从 Author 降为 Reader,update-user API 也会以“You cannot downgrade a user role”报错拒绝。
Amazon Bedrock Managed Knowledge Base 上线智能体检索,通过 AgenticRetrieveStream API 把多部分问题拆成子查询、循环判断证据是否充分并再次检索,而 Retrieve API 只做单次混合搜索。
OpenAI 发布 GPT-6 家族模型指南,面向初创公司说明如何选择 GPT-6 模型、调整推理强度、改进提示词与技能、协调工具,并为生产环境准备工作流。
推荐理由:OpenAI 官方给出 GPT-6 家族的选型与调优路径,可帮助团队把模型能力落到生产工作流。
AWS 提出 Adjudicated Query 设计模式,让业务用户在 Amazon Quick 聊天界面提问合规问题,实际判定交由确定性规则引擎完成,模型只负责把自然语言转为固定类型操作调用并复述结果。
通过 Amazon Bedrock AgentCore 的 AgentCore Gateway,可将 Claude Desktop 接入由 Amazon 网页索引支持的 Web Search,覆盖数万亿文档,查询流量全程留在 AWS 内、无需外部 API key。
AWS 团队在 Amazon SageMaker AI 上用多轮强化学习(MTRL)微调 Qwen3.6-27B 搜索智能体,仅调整 max_epochs、global_batch_size、rollout_max_concurrency 三个超参数,其余走默认值。
GitHub 提出 AI 时代开发者需要强化三项技能:学会指挥 AI 而非只是使用它、不轻信 AI 的首次回答、用 AI 节省的时间去解决更大的问题。文中以 GitHub Copilot 内置的 Rubber Duck agent 为例,说明它用第二个模型对计划、代码和测试进行批判性审查,从而发现首个模型遗漏的问题。
ServiceNow CoreAI 构建了 AutoSynthData,利用目标模型的失败案例与更强教师的成功示范,定位能力缺口并生成、验证新的可执行训练任务,随模型提升动态调整课程。该流程在 EnterpriseOps Gym 环境中演示,生成的任务需满足可行性、真实性与难度三项要求,验证器则需保证一致性、可靠性与完整性,通过校验的样本用于后训练。
AWS Professional Services 用四个 AI 智能体在 Amazon Bedrock AgentCore 上构建云迁移方案,将每个应用的基础设施即代码(IaC)开发时间从 3 到 4 周缩短至几分钟,该数据来自内部项目跟踪。
NVIDIA NeMo Agent Toolkit(NAT)可将 Amazon S3 Vectors 作为自定义记忆后端,为多智能体系统提供持久化记忆。
Simon Willison 用 Claude Opus 5.5 改进其纯 Python WebAssembly 引擎 pwasm,经 42 次提交后发布 0.2a0,现已支持几乎全部 WASM 规范。PyPI 上的 wheel 包内置了 MicroPython、QuickJS 和 Micro QuickJS 的可用 WASM 构建。该版本仍为 alpha,作者表示完全不可信任。
Amazon Payments 在 Amazon SageMaker AI 上用多目标上下文多臂老虎机(LinUCB)优化产品获客漏斗,七周线上 A/B 测试中,一个人群最终漏斗转化率取得高个位数相对提升,另一人群则未见改善,问题出在内容而非模型。
Amazon Bedrock AgentCore 支持构建"环境智能体"(ambient agent):它监听 Amazon S3 事件通知、EventBridge 规则等事件流并自动触发任务,在需要时通过单个 ask_human 工具暂停等待人工审批,再从中断处恢复执行。
AWS 发布 Claude Platform on AWS(CPonAWS)多环境访问实施指南,通过专用 AI Services 账户统一承载订阅与工作区,实现生产与开发流量隔离。
uniopen 通过 Amazon SageMaker AI 对 Amazon Nova 2 Lite 进行监督微调,并做提示词层面的输出优化,使其适配自身零售审核策略。该策略按九类行为与品牌/其他/违禁三类主体两个维度分类,评测在 737 个对话窗口的留出测试集上进行,微调数据集含 3391 个训练窗口。Amazon Nova 2 Pro 仅用于生成候选修正,须经人工核验后才能进入训练集。
Amazon Bedrock Knowledge Bases 可通过 AgenticRetrieveStream API 用自然语言查询理赔文档,支持多轮追问、按 claim ID 和 claim type 等元数据过滤检索,并返回带引用的答案。
AWS 发布跨账户自动化管理 Amazon Textract 适配器生命周期的方案,通过 AWS CloudFormation 和 Terraform 模板实现适配器在账户间的推广,并将适配器 ID 外置到 AWS Systems Manager Parameter Store,使生产环境适配器引用更新无需重新部署应用、零停机,原本需数小时或数天的协调工作缩短至数秒。
AWS 发布教程,演示在 SageMaker AI 上从同一个 vLLM-Omni DLC 部署两个端点:实时端点运行 FLUX.2-klein-4B 生成图像,异步端点运行 Wan2.1-VACE-1.3B 生成图像条件视频。文本提示词先生成静态图,再连同运动提示词传给视频端点,生成的 MP4 存入 Amazon S3,示例提供命令行与 Streamlit 界面。
AWS 发布教程,演示如何用 vLLM-Omni DLC 在 Amazon SageMaker AI 上部署 Qwen3-TTS,通过 SageMaker 双向流式连接实现文本流入、24 kHz PCM 音频分块流出,并配套 Gradio 应用。
Amazon Quick 的提示词工程决定其 AI 功能对自然语言请求的响应质量,涵盖自定义智能体、自动化流程和对话式分析等场景。文章给出通用原则与可复用框架:以具体性实现清晰、用业务上下文提升相关性、用示例代替描述,并介绍 CRISPE 框架,从上下文与约束、角色与职责、意图与输入、步骤与范围等维度组织复杂提示词。
AWS 详解 Amazon Quick 各组件的提示词工程实践:Quick Research 需明确目标、受众与时间范围,并可从 Quick Index、200+ 家新闻媒体及 S&P Global。
基于 Amazon Bedrock AgentCore 的合同智能平台在 AWS 上落地:Claude Sonnet 系列模型驱动的提取智能体从合同 PDF 中抽取 8 个关键字段并给出置信度,轻量 Claude Haiku 模型独立复核,签名识别分歧由 Amazon Textract 用计算机视觉裁定,结果存入 Amazon Aurora PostgreSQL。
Simon Willison 用 Claude Opus 5.5 将三张鸮鹦鹉照片生成 HTML5 canvas 像素动画 Kākāpō Party,画面中至少 20 只鸮鹦鹉跳跃派对并触发彩带、气球等效果。