NVIDIA 在 AI Infra Summit 发布 Vera Rubin 与 DSX 平台进展,主打每瓦 token 能效
NVIDIA 在 AI Infra Summit 上公布 Vera Rubin 与 DSX 平台的多项进展,核心指标从峰值性能转向每兆瓦可验证的智能体 token 数。
推荐理由:NVIDIA 在 AI Infra Summit 上集中给出 Vera Rubin、DSX 与 NVLink 6 的多项实测数据,可据此判断 AI 工厂的能效与吞吐走向。
技术方向
把模型跑起来的工程实践:推理优化、显存与成本、Serving 架构与基础设施选型。
55 条精选近 30 天 21 条共收录 199 条
NVIDIA 在 AI Infra Summit 上公布 Vera Rubin 与 DSX 平台的多项进展,核心指标从峰值性能转向每兆瓦可验证的智能体 token 数。
推荐理由:NVIDIA 在 AI Infra Summit 上集中给出 Vera Rubin、DSX 与 NVLink 6 的多项实测数据,可据此判断 AI 工厂的能效与吞吐走向。
Mistral 帮助一家欧洲能源运营商把 4 万行 Fortran 77 的油藏模拟器迁移到 C++,该代码库没有测试套件也没有集中文档。团队先搭建数值对齐测试框架,用状态快照校验迁移前后结果一致,再用 Vibe CLI 启动上百个智能体解析调用树并补写文档。迁移采用规划、编码、测试、审查多智能体加人工审核的流程,首个冲刺完成 30 万行中的 4 万行。
推荐理由:Mistral 公开了用智能体迁移 4 万行 Fortran 77 的完整流程,其中先建数值对齐测试再迁移的做法可迁移到其他遗留系统改造。
Mistral 宣布完成 30 亿欧元 D 轮融资,投后估值超过 210 亿欧元,由三星电子领投,Scaleup Europe Fund 和 PSG Equity 共同领投。
推荐理由:Mistral 完成欧洲最大股权融资,读者可据此理解其主权 AI 全栈路线与开源权重定位。
GitHub 发布研究预览 Project HydraFusion,通过运行时多模型编排为 Copilot 提供前沿级智能,用户可在 GitHub Copilot CLI 中通过 /experimental 选择该模型。
推荐理由:GitHub 官方给出多模型编排的三种执行模式与三项基准的成本质量对比,可据此判断路由式编排在编码任务上的取舍。
Hugging Face 发布 @huggingface/kernels,一个从 Hugging Face Hub 加载并运行优化 WebGPU kernel 的 JavaScript 库,同时上线 207 个 kernel,均以独立仓库形式发布,采用 Apache-2.0 许可。
推荐理由:Hugging Face 发布 207 个 WebGPU kernel 及加载库,并给出与 ORT WebGPU 的实测对比数据,可供浏览器端推理选型参考。
Hugging Face 在 Gradio 中推出 gr.Workflow,把 AI 流水线描述为带类型节点的图,并直接提供可拖拽画布,每个节点可运行、每个中间结果可见。
推荐理由:原文给出 gr.Workflow 的节点类型、并行模式与 API 导出方式,读者可据此判断多步 AI 流水线如何从脚本变成可部署界面。
Liquid AI 为 LFM2.5 家族的 LFM2.5-1.2B-Instruct、LFM2.5-2.6B 和 LFM2.5-8B-A1B 发布 DSpark 草稿模型检查点,通过投机解码在不改变输出质量的前提下提升解码速度,GPU 上吞吐最高提升 3.18 倍,端侧最高提升 2.87 倍。
推荐理由:官方给出三个 LFM2.5 模型的 DSpark 草稿模型与实测加速数据,可据此判断端侧与 GPU 推理的提速幅度。
Mistral 发布 Agentic Search,一个让模型在多步检索循环中查找、检查和验证信息的检索层,通过 Mistral Search Toolkit 提供,并内置于 Studio 和 Vibe 的 Libraries 中。
推荐理由:原文给出多步检索循环的工具设计与两组基准数字,可据此判断传统一次性 RAG 在长文档场景的边界。
Hugging Face 博客介绍 Strands Robots 的流式数据闭环:用同一个 Robot() 录制 LeRobotDataset、通过 sync_dataset_to_bucket 同步到 Storage Bucket、再用 stream_dataset 从 Hub 流式读取训练,最后把 checkpoint 以 mode="real" 部署回硬件。
推荐理由:以 Strands Robots 为例拆解机器人数据闭环,读者可了解录制、去重同步、流式训练到部署的完整工程路径。
Mistral 宣布三项推进 AI 主权的举措:Mistral Regional Endpoints 正式可用,客户可选择推理在欧洲或美国运行;Mistral Priority Tier 进入公开预览,为关键业务负载提供自定义速率限制和带 SLA 的正常运行时间承诺。
推荐理由:Mistral 把区域推理、优先服务层级和第三方开源模型接入放进同一套基础设施,读者可据此判断主权 AI 的落地路径。
NVIDIA 发布 Magpie TTS Multilingual,一个 364M 参数的开源权重语音合成模型,支持英语、西班牙语、法语、德语、意大利语、越南语、普通话、印地语、日语以及新增的现代标准阿拉伯语、韩语和巴西葡萄牙语共 12 种语言,每种语言含男女声。
推荐理由:原文给出 364M 开源权重模型的多语言扩展与自托管延迟数据,可据此判断级联语音架构的部署取舍。
Hugging Face 宣布 vLLM 的 transformers 建模后端在多个 LLM 架构上已追平甚至超过 vLLM 手写原生实现的吞吐。该后端通过 torch.fx 做静态图分析、用 ast 重写算子,在运行时动态应用推理专用层融合,覆盖 MoE 专家并行、TP 张量并行等场景。
推荐理由:原文给出 transformers 后端在 vLLM 中追平原生实现的具体机制与启用方式,读者可据此判断自家模型能否免移植获得同等推理速度。
微软在 Build 2026 宣布 Foundry Managed Compute 与 Hugging Face 模型集合,将 Hugging Face 生态的开源权重模型以每周刷新的策展目录形式引入 Foundry Model Catalog,可一键部署到托管 GPU 平台。
推荐理由:微软把 Hugging Face 开源模型的部署运维层接进 Foundry,读者可据此判断企业自托管开源模型的门槛变化。
Hugging Face 与 SkyPilot 联合推出 store: hf 存储后端,用一条 hf:// URL 和已有的 HF_TOKEN 即可把 Hugging Face Bucket 或任意模型、数据集、Space 仓库挂载进 SkyPilot 任务,并在 20 多个云、Kubernetes、Slurm 和本地集群上运行。
推荐理由:原文给出 hf:// 挂载与零出网费的具体机制和跨云实测数据,读者可据此判断跨云训练存储成本的变化。
Google Research 发布新架构,将多 Token 预测(MTP)头挂载到已冻结的 Gemini Nano v3 模型上,已在 Pixel 9 和 10 系列上线,作为开箱即用的加速方案。
推荐理由:Google 把 MTP 头挂到冻结的 Gemini Nano v3 上,读者可了解端侧推测解码如何省内存并提速。
Mistral 发布 OCR 4,在提取文本之外返回边界框、块类型分类和逐页逐词置信度分数,支持 170 种语言、可单容器自托管部署。官方称独立标注者在 600 多份文档的盲评中平均 72% 更偏好 OCR 4,并在 OlmOCRBench 上取得 85.20 的最高总分。
推荐理由:官方给出 OCR 4 的边界框、块分类与置信度输出,以及自托管和按页计价方案,可据此判断文档解析管线的选型。
Google DeepMind 发布实验性开源模型 DiffusionGemma,采用文本扩散方式并行生成整块文本,在专用 GPU 上推理最高提速 4 倍,单张 NVIDIA H100 上超过 1000 tokens/秒,RTX 5090 上超过 700 tokens/秒。
推荐理由:官方给出 26B MoE 文本扩散模型的速度数据、硬件门槛与质量取舍,便于判断本地低并发场景是否值得尝试。
Mistral 在 AI Now Summit 2026 上发布面向工业工程的 AI 栈,与 Airbus、BMW、ASML 合作优化设计、仿真与生产,同时保持对专有数据和 IP 的控制。
推荐理由:Mistral 一次性给出工业 AI 栈、Vibe 智能体和自建推理数据中心三条产品线,可据此判断其企业级全栈布局。
Mistral 宣布将 Emmi AI 并入公司,推出面向工业工程的物理 AI 能力,作为其企业平台的一部分。该能力从几何与边界条件直接预测物理场,单次前向推理在单块 GPU 上以秒级完成,用于加速产品设计、工装工艺设计和实时数字孪生,合作方包括 ASML、Airbus、Safran 和 Siemens Energy。
推荐理由:Mistral 把物理仿真模型并入企业平台,读者可了解其与 ASML、Airbus 等合作方的落地场景。
Mistral AI 宣布已达成最终协议,收购 Physics AI 先驱 Emmi AI,以强化其面向工业企业的 AI 转型伙伴地位。Emmi AI 总部位于奥地利,专注物理 AI 与大型工程模型,可把多日计算替换为实时仿真并构建数字孪生;其联合创始人及 30 多名研究人员和工程师将于 5 月加入 Mistral 的 Science 与 Applied AI 团队。
推荐理由:Mistral 通过收购 Emmi AI 补上物理仿真能力,读者可据此判断工业 AI 平台的整合方向。