用 Amazon Quick 和 Amazon Bedrock AgentCore 构建 AI 合同智能平台
基于 Amazon Bedrock AgentCore 的合同智能平台在 AWS 上落地:Claude Sonnet 系列模型驱动的提取智能体从合同 PDF 中抽取 8 个关键字段并给出置信度,轻量 Claude Haiku 模型独立复核,签名识别分歧由 Amazon Textract 用计算机视觉裁定,结果存入 Amazon Aurora PostgreSQL。
基于 Amazon Bedrock AgentCore 的合同智能平台在 AWS 上落地:Claude Sonnet 系列模型驱动的提取智能体从合同 PDF 中抽取 8 个关键字段并给出置信度,轻量 Claude Haiku 模型独立复核,签名识别分歧由 Amazon Textract 用计算机视觉裁定,结果存入 Amazon Aurora PostgreSQL。
斯坦福团队在 HomeBody 项目中让 GPT-6 Astra 控制宇树 G1 进入陌生厨房,先探索建图,再按语言指令收拾物品、丢弃纸盒,甚至从视野外的抽屉取药递给人。
Simon Willison 用 Claude Opus 5.5 将三张鸮鹦鹉照片生成 HTML5 canvas 像素动画 Kākāpō Party,画面中至少 20 只鸮鹦鹉跳跃派对并触发彩带、气球等效果。
GitHub Copilot 应用中的 canvas 是一种可自定义的双向界面,用户只需在 agent 会话中输入 /create-canvas 并用自然语言描述需求,即可生成看板、发布清单或仪表盘等界面,无需编写代码。canvas 会保存为扩展,可随项目共享或作为个人扩展复用,社区已在 Awesome Copilot 分享现成模板。
AWS 提出在 Amazon EKS 上结合 EFA 与 DeepEP 扩展 MoE 强化学习训练的架构,吞吐量提升 40%。该方案针对 RLHF 和 GRPO 等大规模 RL 训练中 rollout 生成与策略训练的资源竞争问题,通过 DeepEP 优化 Expert Parallelism 在 EFA 上的 all-to-all 通信。
在 Amazon SageMaker HyperPod 上,开源 RL 框架 SkyRL 用 GRPO 对 Qwen3-VL-8B 视觉语言模型做多模态强化学习后训练,在固定 64 个迷宫评测集上把解迷宫成功率从 43.75% 提升到 95% 以上。
NarrateAI 在 Amazon Bedrock 上通过五项技术实现约 99% 的数值准确率并实时流式返回结果,服务超过 4,000 名 AWS 高管。这五项技术分别是自适应流水线编排、跨账户多模型故障转移、实时流式评估、复合评估框架和数据准确性验证,其中约 90% 的查询走单次快速路径,仅约 10% 走并行批处理路径。
阿里云 Qwen 团队开源的 Qwen3-TTS-12Hz-1.7B-Base 已上线 Amazon SageMaker JumpStart,可部署到全托管实时推理端点,仅凭几秒参考音频和对应文本即可克隆音色,无需重新训练。
Amazon SageMaker HyperPod 搭配 Qumulo 的 Cloud Native Qumulo(CNQ)与 Cloud Data Fabric(CDF),可让训练计算与数据集分处不同 AWS Region 而无需复制数据。
Simon Willison 发布 commit-rewriter 0.2。该工具与 git 相关,具体功能与更新细节原文未作说明。
AWS 发布 WhisperX Deep Learning Container(DLC),在 OpenAI Whisper 基础上加入批处理推理、wav2vec2 强制对齐的逐词时间戳和说话人分离,可部署到 Amazon SageMaker AI 实时或异步端点,无需自建镜像。
GitHub Copilot 应用重建了 pull request 视图,用一个含 2,200 个文件、超百万行改动和 400 多条行内评论的开源 PR 做压力测试。它把文档高度拆成确定性的代码几何与动态评论块两套体系,评论高度按需测量并锚定到文件、行和侧,避免滚动跳变。
一篇用可交互示例讲解 shadow roots 的教程,演示样式封装、继承、slots、parts 以及 JavaScript 访问方式,展示 shadow root 如何创建带私有样式表和元素的隔离 DOM 树,并以特定受控方式与页面 DOM 交互。该示例由 Fable 5.1 Medium 根据提示词生成。
GitHub 用 GitHub Copilot app 和 Copilot CLI 把 Copilot agent runtime 从 TypeScript 完全重写为超过 80 万行生产级 Rust,AI agent 写了大部分代码,分布在 128 个合入 main 的 PR 中并逐步发布,运行时性能提升数个数量级。
推荐理由:作者以亲历者身份给出把 Copilot 运行时从 TypeScript 迁到 Rust 的完整工程细节,可迁移到大规模 agent 协作开发。
GitHub 日本和韩国营销负责人把活动运营流程交给 GitHub Copilot,从单个 GitHub Issue 出发自动完成落地页复制、UTM 链接生成、报名名单清洗和会后 CRM 整理。
GitHub Copilot 应用内置 diff、终端和浏览器三个面板,让开发者无需离开应用即可审查、运行并预览 AI 智能体生成的代码改动。diff 面板以绿色和红色高亮显示新增、删除或修改的行,支持接受改动、留言或让 Copilot 继续修改;终端面板可直接运行项目命令,浏览器面板则通过 Pick & Polish 工具选中页面元素并让智能体调整。
Hugging Face 团队用 Gradio Workflow 重建了 AUTOMATIC1111 的大部分功能,做成名为 Workflow1111 的画布,由 11 条媒体流水线和 73 个节点组成,覆盖文生图、高清修复、图生图、提示词矩阵、VLM 反推、检测生成 inpaint 掩码、ControlNet 风格标注器、背景移除、PNG Info 存储和图生视频。
推荐理由:原文用 73 个节点复刻 A1111 的十一条图像流水线,并说明输出如何变成 REST 端点和 MCP 工具。
TRL v1.14 的 AsyncGRPOTrainer 现已支持只训练并同步 LoRA adapter 到 vLLM,rank-1 adapter 仅几 MB,可通过挂载在多个 Hugging Face Jobs 上的 Storage Bucket 传递,无需 NCCL。
Mistral 帮助一家欧洲能源运营商把 4 万行 Fortran 77 的油藏模拟器迁移到 C++,该代码库没有测试套件也没有集中文档。团队先搭建数值对齐测试框架,用状态快照校验迁移前后结果一致,再用 Vibe CLI 启动上百个智能体解析调用树并补写文档。迁移采用规划、编码、测试、审查多智能体加人工审核的流程,首个冲刺完成 30 万行中的 4 万行。
推荐理由:Mistral 公开了用智能体迁移 4 万行 Fortran 77 的完整流程,其中先建数值对齐测试再迁移的做法可迁移到其他遗留系统改造。
GitHub Copilot 应用支持同时运行多个智能体会话,每个会话运行在独立的 Git worktree 上,互不干扰且各自保留上下文,可随时切换并从中断处继续。在示例仓库 tailspin-toys 中,可并行让 Copilot 构建 funded sort 功能、执行无障碍审查和运行测试,并在会话视图中跟踪进度、查看结果。
Hugging Face 博主用 TRL 和 OpenEnv 复现了 Surya Narreddi 让语言模型画水彩的想法,模型通过 p5.brush 写出约 150 行 JavaScript 来作画。
一份公开教程用 TRL 的 GRPO 对 LFM2.5-350M 做约 500 样本、100 步微调,在 IFStruct 基准上把通过率从 22.6% 提升到 29.7%。微调可在免费 Colab 或 Kaggle GPU 上完成,评测则通过 llama.cpp 在本地 MacBook 上运行,代码已开源在 GitHub。
Sentence Transformers v6.0 新增 MultiVectorEncoder 模型类型,支持 ColBERT 式后期交互检索,并配套完整训练流程。
推荐理由:原文给出多向量检索模型的完整微调配方与实测对比,读者可据此判断自建领域检索模型的成本与起点选择。
Papers with Code 的搜索采用混合检索架构,由 Hugging Face Jobs 批量生成论文嵌入向量、Storage Buckets 做持久化中转、Inference Endpoints 提供在线查询的低延迟嵌入,目前覆盖 arXiv 与 Daily Papers 的逾 11 万篇论文。
Hugging Face 构建了一个约束感知的 GPU 分配器,在七个基准场景中与 FIFO 调度器对比,相同硬件与负载下 GPU 利用率最高提升 33 个百分点,优先级加权产出最高提升 105%。
Hugging Face 博客介绍 Strands Robots 的流式数据闭环:用同一个 Robot() 录制 LeRobotDataset、通过 sync_dataset_to_bucket 同步到 Storage Bucket、再用 stream_dataset 从 Hub 流式读取训练,最后把 checkpoint 以 mode="real" 部署回硬件。
推荐理由:以 Strands Robots 为例拆解机器人数据闭环,读者可了解录制、去重同步、流式训练到部署的完整工程路径。
在 AppWorld Test Challenge 的 417 个任务上,同一 CodeAct 智能体下 Claude Sonnet 4.6 总成本 79 美元(0.19 美元/任务),GPT-4.1 却要 155 美元(0.37 美元/任务),几乎翻倍,原因是缓存命中率拉低了 Sonnet 的实际输入成本。
Hugging Face 博客发布《Profiling in PyTorch》系列第三部分,用 PyTorch 剖析 attention 在 profiler 下的表现。
PRX 系列第 4 篇披露其数据策略:训练数据由公开与内部数据集混合组成,用 VLM 重新生成图像描述,再转为可流式语料。团队改用 Qwen3-VL 在训练中实时计算文本 latent,7B 规模下吞吐仅损失约 3–4%(30 天训练多约 1 天),并采用 Lance 构建、MDS 流式的双格式方案。
Mistral 基于其开源编码助手 Vibe 构建了一个自动编写 Rails 测试的智能体,可读取源码、生成或改进 RSpec 测试并在 CI/CD 中无人干预运行。
推荐理由:Mistral 公开了用 Vibe 构建自动写 RSpec 测试智能体的完整方法,包括 AGENTS.md、技能文件和自定义工具的具体做法。
Mistral AI 团队在 vLLM 上排查一起内存泄漏:在 Mistral Medium 3.1、开启 graph compilation 的 Prefill/Decode 分离部署中,系统内存以每分钟 400 MB 线性增长,数小时后触发 out of memory。Heaptrack 显示堆内存稳定,泄漏发生在堆外,问题仅出现在经 NIXL 传输 KVCache 的 decode 侧。
Berkeley AI Research 提出一种基于分治法的 off-policy 强化学习算法,不依赖时序差分(TD)学习,可将 Bellman 递归次数从线性降为对数级,从而扩展到任意长时程任务。
Mistral 用 LoRA 微调 Pixtral-12B 处理卫星图像,在 Aerial Image Dataset(AID)上显著优于未微调基线,改善了密集住宅与中等住宅、Playground 与 Stadium 等易混类别的分类,并减少了模型幻觉出的无效类别名。
Mistral 提出用 LLM as a Judge 配合 RAG Triad 框架评估 RAG 系统,由 judge LLM 按数值、二元或定性量表为 generator LLM 的回答打分。
Mistral AI 推出 TranscriptToPRDTicket 智能体工作流,由 Mistral Large 2 驱动的 PRDAgent 和 TicketCreationAgent 组成,可将会议转录自动生成 PRD 并转化为结构化开发工单,自动在 Linear / Jira 中创建。