用 NVIDIA NeMo Agent Toolkit 和 Amazon S3 Vectors 构建智能体记忆
NVIDIA NeMo Agent Toolkit(NAT)可将 Amazon S3 Vectors 作为自定义记忆后端,为多智能体系统提供持久化记忆。
NVIDIA NeMo Agent Toolkit(NAT)可将 Amazon S3 Vectors 作为自定义记忆后端,为多智能体系统提供持久化记忆。
Amazon Payments 在 Amazon SageMaker AI 上用多目标上下文多臂老虎机(LinUCB)优化产品获客漏斗,七周线上 A/B 测试中,一个人群最终漏斗转化率取得高个位数相对提升,另一人群则未见改善,问题出在内容而非模型。
Amazon Bedrock AgentCore 支持构建"环境智能体"(ambient agent):它监听 Amazon S3 事件通知、EventBridge 规则等事件流并自动触发任务,在需要时通过单个 ask_human 工具暂停等待人工审批,再从中断处恢复执行。
AWS 发布 Claude Platform on AWS(CPonAWS)多环境访问实施指南,通过专用 AI Services 账户统一承载订阅与工作区,实现生产与开发流量隔离。
uniopen 通过 Amazon SageMaker AI 对 Amazon Nova 2 Lite 进行监督微调,并做提示词层面的输出优化,使其适配自身零售审核策略。该策略按九类行为与品牌/其他/违禁三类主体两个维度分类,评测在 737 个对话窗口的留出测试集上进行,微调数据集含 3391 个训练窗口。Amazon Nova 2 Pro 仅用于生成候选修正,须经人工核验后才能进入训练集。
NVIDIA 提出 AI 工厂投资回报取决于产出能力、使用寿命与需求三项因素,其平台通过全栈协同设计实现每兆瓦吞吐最大化。SemiAnalysis AgentX 数据显示,Vera Rubin NVL72 每兆瓦吞吐量比 GB300 NVL72 高 30 倍以上,在 DeepSeek V4 Pro 上每百万 token 成本低至 45 倍。
微软研究院开发了一套端到端机器学习流水线,利用 L1 太阳风观测、AE 与 Dst 指数预报及地质电导率数据,为美国本土 66,935 座变电站生成 30-60 分钟前的局地空间天气风险估计。
Amazon Bedrock Knowledge Bases 可通过 AgenticRetrieveStream API 用自然语言查询理赔文档,支持多轮追问、按 claim ID 和 claim type 等元数据过滤检索,并返回带引用的答案。
CoreWeave 宣布在 CoreWeave Cloud 上线 NVIDIA Vera Rubin NVL72 系统与 Spectrum-X 102.4T 以太网,Cognition 成为首个在生产环境运行该系统的客户。
推荐理由:CoreWeave 上线 Vera Rubin NVL72 与 Forge 平台,并给出 Cognition 实测吞吐与沙箱启动数据,可据此判断智能体训练到生产的工程路径。
AWS 官方博客演示在 Amazon Bedrock AgentCore Runtime Instances 上部署三智能体音乐制作流水线:作曲智能体用 Claude Sonnet 4.6 生成音乐简报并在实例的 NVIDIA L4 上运行 ACE-Step 渲染音频,交付智能体读取共享文件做 DSP 处理,合规智能体独立复测并比对曲库。
推荐理由:AWS 官方给出三智能体共享 GPU 实例的完整代码与实测数据,可迁移到其他长时多智能体工作流。
AWS 发布跨账户自动化管理 Amazon Textract 适配器生命周期的方案,通过 AWS CloudFormation 和 Terraform 模板实现适配器在账户间的推广,并将适配器 ID 外置到 AWS Systems Manager Parameter Store,使生产环境适配器引用更新无需重新部署应用、零停机,原本需数小时或数天的协调工作缩短至数秒。
亚马逊云科技介绍用 Amazon Nova Act 与 Amazon Bedrock AgentCore 构建智能体驱动的合成监控方案,以自然语言动作替代 Selenium、Playwright 的 DOM 选择器脚本。
AWS 发布教程,演示在 SageMaker AI 上从同一个 vLLM-Omni DLC 部署两个端点:实时端点运行 FLUX.2-klein-4B 生成图像,异步端点运行 Wan2.1-VACE-1.3B 生成图像条件视频。文本提示词先生成静态图,再连同运动提示词传给视频端点,生成的 MP4 存入 Amazon S3,示例提供命令行与 Streamlit 界面。
AWS 发布教程,演示如何用 vLLM-Omni DLC 在 Amazon SageMaker AI 上部署 Qwen3-TTS,通过 SageMaker 双向流式连接实现文本流入、24 kHz PCM 音频分块流出,并配套 Gradio 应用。
AWS 宣布 Claude Sonnet 5.5 在 Amazon Bedrock 和 AWS 上的 Claude Platform 上线,定位为面向编码与知识工作的更高效 Sonnet 模型,多数任务单任务成本更低、速度更快。
推荐理由:原文给出 Sonnet 5.5 在 Bedrock 上的能力定位与调用方式,读者可据此判断它和 Opus 5.5 的分工。
西门子Xcelerator中国销售与生态成功负责人顾欣与阿丘科技创始人兼CEO黄耀在量子位对话节目中,围绕工业AI从落地到规模化展开讨论。黄耀介绍,半导体晶圆切割场景导入智能体技术后,设备OEE和产能可提升25%左右。顾欣认为,工业AI必须具备工业级可靠性,做到可信、可追溯、可量化,平台则要充当连接器与放大器,补上从0到1验证之后1到100的商业化拼图。
Momenta 与神龙科技达成战略合作,基于 R7 世界模型共同开发高阶智能辅助驾驶系统,初期搭载在标致、Jeep 等全新量产车型上,覆盖中国、欧洲及全球其他市场。
Amazon Bedrock 在印度上线 Anthropic 的 Claude Opus 5、Claude Sonnet 5 和 Claude Haiku 4.5,通过地理跨区域推理让数据在印度境内处理。
Amazon Bedrock 现已在首尔和新加坡支持 Anthropic Claude 模型的区域内推理:首尔支持 Claude Opus 5 和 Claude Sonnet 5,新加坡支持 Claude Sonnet 5,均通过 bedrock-runtime 端点调用。
OpenAI 在旧金山 DevDay 2026 上公布 25 项更新,覆盖 ChatGPT、Codex、GPT-6 模型和 API,官方称这是历届规模最大的一次 DevDay。
推荐理由:梳理了 DevDay 25 项更新中 Dots、GPT-6.1 Sol、Codex 与 Agents API 的定位,可看清 OpenAI 把 Agent 从单次任务推向长期运行的产品线。
基于 Amazon Bedrock AgentCore 的合同智能平台在 AWS 上落地:Claude Sonnet 系列模型驱动的提取智能体从合同 PDF 中抽取 8 个关键字段并给出置信度,轻量 Claude Haiku 模型独立复核,签名识别分歧由 Amazon Textract 用计算机视觉裁定,结果存入 Amazon Aurora PostgreSQL。
Condé Nast 联合 AWS 生成式 AI 创新中心,基于 Amazon Bedrock 和 Amazon OpenSearch Service 构建多模态视频检索方案,采用 TwelveLabs Marengo 嵌入模型联合编码画面、音频与转录文本。该方案将单次内容检索耗时从 250 分钟降至 2 分钟以内,覆盖超 14 万条视频库,支持自然语言意图搜索、以图搜图和精确时间戳定位。
Mistral 在慕尼黑开设德国中心,组建专注 Physics AI 与工业 AI 的研究团队,并计划到 2030 年建成 1 吉瓦欧洲算力。该中心将与 BMW 合作碰撞仿真、与 Siemens Energy 合作工业 AI 应用,并与慕尼黑工业大学(TUM)共建汽车空气动力学数字孪生研究。Mistral 强调其开放权重架构让模型在客户自有基础设施上运行,数据不出组织。
截至2026年8月,西门子Xcelerator在中国已积累超66万注册用户、600余家生态伙伴和900余项数字化与低碳化解决方案。平台通过共享、共创、共赢机制推动伙伴协作,例如阿丘科技联合推出AI数智化方案已在西门子成都数字化工厂上线,设序科技累计获得1000多条有效线索、成单超百单。
阿里云瓴羊在2026云栖大会推出「AI员工7日上场计划」,企业出真实业务题,瓴羊FDE带AI员工进场,7天内完成场景诊断、方案设计和POC验证,并交付上岗前后效果对比,发布当天27家企业签署意向书。其AgentOne上的营销、销售、客服、运营四类AI员工已于7月底上岗,公式为Data+Agent+FDE=AI员工,验收标准是能干、能信、能打。
华为在全联接大会2026同期AIDC基础设施峰会上介绍源网荷储AIDC 1.0解决方案,并公布供电、储能和液冷最新进展。泰山UPS单柜容量达1280kVA、双变换效率最高98%,恒山直流UPS以一套硬件平台支持270V、400V、800V多种直流制式,SmartLi 5.0面向800V高压直流架构演进。AI赋能液冷系统以TMU为控制核心,与昇腾服务器原生适配,实现冷电联动跟随计算负载响应。
AWS 提出在 Amazon EKS 上结合 EFA 与 DeepEP 扩展 MoE 强化学习训练的架构,吞吐量提升 40%。该方案针对 RLHF 和 GRPO 等大规模 RL 训练中 rollout 生成与策略训练的资源竞争问题,通过 DeepEP 优化 Expert Parallelism 在 EFA 上的 all-to-all 通信。
在 Amazon SageMaker HyperPod 上,开源 RL 框架 SkyRL 用 GRPO 对 Qwen3-VL-8B 视觉语言模型做多模态强化学习后训练,在固定 64 个迷宫评测集上把解迷宫成功率从 43.75% 提升到 95% 以上。
NarrateAI 在 Amazon Bedrock 上通过五项技术实现约 99% 的数值准确率并实时流式返回结果,服务超过 4,000 名 AWS 高管。这五项技术分别是自适应流水线编排、跨账户多模型故障转移、实时流式评估、复合评估框架和数据准确性验证,其中约 90% 的查询走单次快速路径,仅约 10% 走并行批处理路径。
阿里云 Qwen 团队开源的 Qwen3-TTS-12Hz-1.7B-Base 已上线 Amazon SageMaker JumpStart,可部署到全托管实时推理端点,仅凭几秒参考音频和对应文本即可克隆音色,无需重新训练。
Datacor 将 Amazon Quick Sight 嵌入 TrackAbout 方案,为工业气体与焊接分销商提供交互式仪表盘和自然语言查询,业务用户无需再提 IT 工单即可分析租赁数据。TrackAbout 客户合计管理 2750 万件资产、每月处理超 72.5 万张账单,新方案通过跨云数据管道定时刷新 SPICE 数据集,支持车队利用率、计费异常与收入回收等指标分析。
Amazon SageMaker HyperPod 搭配 Qumulo 的 Cloud Native Qumulo(CNQ)与 Cloud Data Fabric(CDF),可让训练计算与数据集分处不同 AWS Region 而无需复制数据。
Wayfair 借助 OpenAI 模型提升电商客服与商品目录准确率,实现工单自动分类,并大规模优化数百万条商品属性。
AWS 发布 WhisperX Deep Learning Container(DLC),在 OpenAI Whisper 基础上加入批处理推理、wav2vec2 强制对齐的逐词时间戳和说话人分离,可部署到 Amazon SageMaker AI 实时或异步端点,无需自建镜像。
Liquid AI 发布实验性 DSpark 草稿模型 LFM2.5-VL-DSpark,为视觉语言模型 LFM2.5-VL-3B 加入推测解码路径。该草稿模型增加 280M 参数(约 8.9%),在设备端解码最高提速 3.13x、H100 上最高 2.66x,端到端最高提升 2.62x 和 2.27x,且不改变输出质量。
NVIDIA 加入由 Google DeepMind、EMBL-EBI 等组成的联盟,通过 AlphaFold Database 开放 2800 多种病毒的蛋白复合物预测 3D 结构,供全球科学家免费使用。
推荐理由:NVIDIA 与 Google DeepMind 等联合开放 2800 多种病毒的蛋白复合物结构预测,并放出生成流程,读者可据此了解开放科学如何提前储备疫情应对知识。
Remedy Entertainment 的 CONTROL Resonant 已在 GeForce NOW 首发上线,Ultimate 会员可以 GeForce RTX 5080 级性能串流游玩,支持 DLSS 4、光线追踪和最高 5K HDR,无需 100GB 本地安装。
GitHub Copilot 应用重建了 pull request 视图,用一个含 2,200 个文件、超百万行改动和 400 多条行内评论的开源 PR 做压力测试。它把文档高度拆成确定性的代码几何与动态评论块两套体系,评论高度按需测量并锚定到文件、行和侧,避免滚动跳变。
微软研究院对移动操作机器人工作负载做了系统性测量,发现把物理 AI 推理从机器人端侧 GPU 卸载到边缘或云端 GPU,可提升任务成功率、支持更大模型并延长续航。
推荐理由:微软研究院系统测量了机器人端侧推理的瓶颈,并给出可复用的 Kubernetes 卸载方案与开源工具链。
Airbnb 正在扩大 GPT-6 Astra 及 OpenAI 前沿模型的使用范围,帮助工程团队排查 bug、设计系统并加快交付速度。