在 Amazon EKS 上用 EFA 和 DeepEP 扩展 MoE 强化学习,吞吐量提升 40%
AWS 提出在 Amazon EKS 上结合 EFA 与 DeepEP 扩展 MoE 强化学习训练的架构,吞吐量提升 40%。该方案针对 RLHF 和 GRPO 等大规模 RL 训练中 rollout 生成与策略训练的资源竞争问题,通过 DeepEP 优化 Expert Parallelism 在 EFA 上的 all-to-all 通信。
AWS 提出在 Amazon EKS 上结合 EFA 与 DeepEP 扩展 MoE 强化学习训练的架构,吞吐量提升 40%。该方案针对 RLHF 和 GRPO 等大规模 RL 训练中 rollout 生成与策略训练的资源竞争问题,通过 DeepEP 优化 Expert Parallelism 在 EFA 上的 all-to-all 通信。
在 Amazon SageMaker HyperPod 上,开源 RL 框架 SkyRL 用 GRPO 对 Qwen3-VL-8B 视觉语言模型做多模态强化学习后训练,在固定 64 个迷宫评测集上把解迷宫成功率从 43.75% 提升到 95% 以上。
NarrateAI 在 Amazon Bedrock 上通过五项技术实现约 99% 的数值准确率并实时流式返回结果,服务超过 4,000 名 AWS 高管。这五项技术分别是自适应流水线编排、跨账户多模型故障转移、实时流式评估、复合评估框架和数据准确性验证,其中约 90% 的查询走单次快速路径,仅约 10% 走并行批处理路径。
阿里云 Qwen 团队开源的 Qwen3-TTS-12Hz-1.7B-Base 已上线 Amazon SageMaker JumpStart,可部署到全托管实时推理端点,仅凭几秒参考音频和对应文本即可克隆音色,无需重新训练。
Amazon SageMaker HyperPod 搭配 Qumulo 的 Cloud Native Qumulo(CNQ)与 Cloud Data Fabric(CDF),可让训练计算与数据集分处不同 AWS Region 而无需复制数据。
AWS 发布 WhisperX Deep Learning Container(DLC),在 OpenAI Whisper 基础上加入批处理推理、wav2vec2 强制对齐的逐词时间戳和说话人分离,可部署到 Amazon SageMaker AI 实时或异步端点,无需自建镜像。
GitHub Copilot 应用重建了 pull request 视图,用一个含 2,200 个文件、超百万行改动和 400 多条行内评论的开源 PR 做压力测试。它把文档高度拆成确定性的代码几何与动态评论块两套体系,评论高度按需测量并锚定到文件、行和侧,避免滚动跳变。
GitHub 用 GitHub Copilot app 和 Copilot CLI 把 Copilot agent runtime 从 TypeScript 完全重写为超过 80 万行生产级 Rust,AI agent 写了大部分代码,分布在 128 个合入 main 的 PR 中并逐步发布,运行时性能提升数个数量级。
推荐理由:作者以亲历者身份给出把 Copilot 运行时从 TypeScript 迁到 Rust 的完整工程细节,可迁移到大规模 agent 协作开发。
GitHub 日本和韩国营销负责人把活动运营流程交给 GitHub Copilot,从单个 GitHub Issue 出发自动完成落地页复制、UTM 链接生成、报名名单清洗和会后 CRM 整理。
GitHub Copilot 应用内置 diff、终端和浏览器三个面板,让开发者无需离开应用即可审查、运行并预览 AI 智能体生成的代码改动。diff 面板以绿色和红色高亮显示新增、删除或修改的行,支持接受改动、留言或让 Copilot 继续修改;终端面板可直接运行项目命令,浏览器面板则通过 Pick & Polish 工具选中页面元素并让智能体调整。
Hugging Face 团队用 Gradio Workflow 重建了 AUTOMATIC1111 的大部分功能,做成名为 Workflow1111 的画布,由 11 条媒体流水线和 73 个节点组成,覆盖文生图、高清修复、图生图、提示词矩阵、VLM 反推、检测生成 inpaint 掩码、ControlNet 风格标注器、背景移除、PNG Info 存储和图生视频。
推荐理由:原文用 73 个节点复刻 A1111 的十一条图像流水线,并说明输出如何变成 REST 端点和 MCP 工具。
TRL v1.14 的 AsyncGRPOTrainer 现已支持只训练并同步 LoRA adapter 到 vLLM,rank-1 adapter 仅几 MB,可通过挂载在多个 Hugging Face Jobs 上的 Storage Bucket 传递,无需 NCCL。
Mistral 帮助一家欧洲能源运营商把 4 万行 Fortran 77 的油藏模拟器迁移到 C++,该代码库没有测试套件也没有集中文档。团队先搭建数值对齐测试框架,用状态快照校验迁移前后结果一致,再用 Vibe CLI 启动上百个智能体解析调用树并补写文档。迁移采用规划、编码、测试、审查多智能体加人工审核的流程,首个冲刺完成 30 万行中的 4 万行。
推荐理由:Mistral 公开了用智能体迁移 4 万行 Fortran 77 的完整流程,其中先建数值对齐测试再迁移的做法可迁移到其他遗留系统改造。
GitHub Copilot 应用支持同时运行多个智能体会话,每个会话运行在独立的 Git worktree 上,互不干扰且各自保留上下文,可随时切换并从中断处继续。在示例仓库 tailspin-toys 中,可并行让 Copilot 构建 funded sort 功能、执行无障碍审查和运行测试,并在会话视图中跟踪进度、查看结果。
Hugging Face 博主用 TRL 和 OpenEnv 复现了 Surya Narreddi 让语言模型画水彩的想法,模型通过 p5.brush 写出约 150 行 JavaScript 来作画。
一份公开教程用 TRL 的 GRPO 对 LFM2.5-350M 做约 500 样本、100 步微调,在 IFStruct 基准上把通过率从 22.6% 提升到 29.7%。微调可在免费 Colab 或 Kaggle GPU 上完成,评测则通过 llama.cpp 在本地 MacBook 上运行,代码已开源在 GitHub。
Sentence Transformers v6.0 新增 MultiVectorEncoder 模型类型,支持 ColBERT 式后期交互检索,并配套完整训练流程。
推荐理由:原文给出多向量检索模型的完整微调配方与实测对比,读者可据此判断自建领域检索模型的成本与起点选择。
Papers with Code 的搜索采用混合检索架构,由 Hugging Face Jobs 批量生成论文嵌入向量、Storage Buckets 做持久化中转、Inference Endpoints 提供在线查询的低延迟嵌入,目前覆盖 arXiv 与 Daily Papers 的逾 11 万篇论文。
Hugging Face 构建了一个约束感知的 GPU 分配器,在七个基准场景中与 FIFO 调度器对比,相同硬件与负载下 GPU 利用率最高提升 33 个百分点,优先级加权产出最高提升 105%。
Hugging Face 博客介绍 Strands Robots 的流式数据闭环:用同一个 Robot() 录制 LeRobotDataset、通过 sync_dataset_to_bucket 同步到 Storage Bucket、再用 stream_dataset 从 Hub 流式读取训练,最后把 checkpoint 以 mode="real" 部署回硬件。
推荐理由:以 Strands Robots 为例拆解机器人数据闭环,读者可了解录制、去重同步、流式训练到部署的完整工程路径。
在 AppWorld Test Challenge 的 417 个任务上,同一 CodeAct 智能体下 Claude Sonnet 4.6 总成本 79 美元(0.19 美元/任务),GPT-4.1 却要 155 美元(0.37 美元/任务),几乎翻倍,原因是缓存命中率拉低了 Sonnet 的实际输入成本。
Hugging Face 博客发布《Profiling in PyTorch》系列第三部分,用 PyTorch 剖析 attention 在 profiler 下的表现。
PRX 系列第 4 篇披露其数据策略:训练数据由公开与内部数据集混合组成,用 VLM 重新生成图像描述,再转为可流式语料。团队改用 Qwen3-VL 在训练中实时计算文本 latent,7B 规模下吞吐仅损失约 3–4%(30 天训练多约 1 天),并采用 Lance 构建、MDS 流式的双格式方案。
Mistral 基于其开源编码助手 Vibe 构建了一个自动编写 Rails 测试的智能体,可读取源码、生成或改进 RSpec 测试并在 CI/CD 中无人干预运行。
推荐理由:Mistral 公开了用 Vibe 构建自动写 RSpec 测试智能体的完整方法,包括 AGENTS.md、技能文件和自定义工具的具体做法。
Mistral AI 团队在 vLLM 上排查一起内存泄漏:在 Mistral Medium 3.1、开启 graph compilation 的 Prefill/Decode 分离部署中,系统内存以每分钟 400 MB 线性增长,数小时后触发 out of memory。Heaptrack 显示堆内存稳定,泄漏发生在堆外,问题仅出现在经 NIXL 传输 KVCache 的 decode 侧。
Berkeley AI Research 提出一种基于分治法的 off-policy 强化学习算法,不依赖时序差分(TD)学习,可将 Bellman 递归次数从线性降为对数级,从而扩展到任意长时程任务。
Mistral 用 LoRA 微调 Pixtral-12B 处理卫星图像,在 Aerial Image Dataset(AID)上显著优于未微调基线,改善了密集住宅与中等住宅、Playground 与 Stadium 等易混类别的分类,并减少了模型幻觉出的无效类别名。
Mistral 提出用 LLM as a Judge 配合 RAG Triad 框架评估 RAG 系统,由 judge LLM 按数值、二元或定性量表为 generator LLM 的回答打分。
Mistral AI 推出 TranscriptToPRDTicket 智能体工作流,由 Mistral Large 2 驱动的 PRDAgent 和 TicketCreationAgent 组成,可将会议转录自动生成 PRD 并转化为结构化开发工单,自动在 Linear / Jira 中创建。