作者用 ML Intern 两天训练六个模型,总花费约 103 美元
作者借助 HuggingChat 中的 ML Intern,在几天内做出六个模型,包括 0.8B 的 Pocket Rewriter、柑橘病害 VLM、Huggy LoRA、相机视角 LoRA、Doodle-in LoRA 和 Agate 4-step 蒸馏模型,总计算成本约 103 美元。
推荐理由:作者用 ML Intern 在两天内做出六个模型,并公开全部提示词与成本明细,可迁移到自己的训练流程。
技术方向
训练侧的门道:数据集构建、合成数据、预训练与后训练方法、算力与训练成本。
45 条精选近 30 天 22 条共收录 125 条
作者借助 HuggingChat 中的 ML Intern,在几天内做出六个模型,包括 0.8B 的 Pocket Rewriter、柑橘病害 VLM、Huggy LoRA、相机视角 LoRA、Doodle-in LoRA 和 Agate 4-step 蒸馏模型,总计算成本约 103 美元。
推荐理由:作者用 ML Intern 在两天内做出六个模型,并公开全部提示词与成本明细,可迁移到自己的训练流程。
Anthropic 为 Claude 推出两项 beta 功能:Dashboards 可连接 BigQuery、Databricks、Snowflake、Salesforce 等数据源。
推荐理由:Anthropic 为 Claude 新增仪表盘与动画视频两项 beta 功能,并给出数据源接入和导出方式,可据此判断其工作流覆盖范围。
数学界部分人士呼吁抵制 OpenAI,起因是该公司一次性放出 700 多份 AI 生成的数学证明文件,被一个顾问小组称为展示力量而非学术成果。菲尔兹奖得主 Terence Tao 在其博客转发该声明,并提出数学应进入不再以解题为主要衡量标准的 Math 2.0 时代;Scott Aaronson 则称这一局面为 Mathocalypse。
推荐理由:围绕 OpenAI 一次性放出 700 多份 AI 数学证明文件,呈现数学界抵制呼声与两种合作模式的对比。
Google Research 在 NBER 发布三个月实地实验,将 133 名专利律师随机分为两组,一组提前使用当时未发布的 Google Labs AI 专利撰写工具(现属 Gemini Notebook)。
推荐理由:三个月专利撰写实验区分了AI带来的即时产出提升与无辅助判断力的变化,为评估AI对专业能力的影响提供了可迁移的实验设计。
微软研究院开源 Agent Lightning v1.0,一个约 3500 行代码的轻量智能体强化学习框架,围绕 Harnessed Agentic RL 范式重建,让部署时使用的同一套 agent harness 直接参与训练,无需在训练框架内重新实现智能体。
推荐理由:微软研究院开源了约 3500 行的智能体 RL 框架,并给出 6000 样本提升 14.6 个百分点的完整训练管线。
英伟达团队基于 Nemotron 3 通过 SFT、RL 和生成-验证-精炼推理流程,在 IOI 2026 和 IMO 2026 双双达到金牌水平。IOI 2026 中 Nemotron-3-Ultra-CC 得 535.4/600,高于 361.12 的金牌线;IMO 2026 系统得 30/42,高于 29 的官方金牌线。
推荐理由:原文公开了从 Nemotron 3 微调到 IOI、IMO 金牌级成绩的完整配方与数据集,可据此复现领域专家模型。
OpenAI 发布内部前沿模型在数学开放问题上的新结果,并在 GitHub 上公开 Lean 证明形式化与研究细节。
推荐理由:OpenAI 公开内部前沿模型在数学开放问题上的结果,并放出 Lean 形式化证明,可供研究者直接查阅。
Reflection 发布 Beam,一个面向编码、智能体与科研的纯文本 MoE 模型,总参数 501B、激活 23B,从零训练,Apache 2.0 全量权重预计本月放出。
推荐理由:Reflection 从隐身状态发布 501B 开源权重模型,并给出预训练与 RL 的算力、数据细节,可对照同期中美开源模型格局。
据 Bloomberg 报道,DeepSeek 接近完成至少 120 亿美元的新一轮融资,最初目标约 75 亿美元、估值约 750 亿美元,知情人士称总额可能接近 150 亿美元,宁德时代与腾讯出资份额最大。
推荐理由:融资规模与投资方构成显示资本对 DeepSeek 的押注,也交代了其自研芯片与 IPO 计划。
Ai2 开源 AstaBrief 8B,一个把研究问题和检索到的文献片段转成带引用报告的模型,基于 Qwen3-8B 训练,已在 Asta 的 Generate a report 功能中作为 Fast 模式上线,与 Claude 驱动的 Thinking 模式并存。
推荐理由:原文给出了从 Qwen3-8B 出发的 SFT 加 DPO 训练配方与数据过滤经验,可迁移到其他科学报告生成场景。
CoreWeave 宣布在 CoreWeave Cloud 上线 NVIDIA Vera Rubin NVL72 系统与 Spectrum-X 102.4T 以太网,Cognition 成为首个在生产环境运行该系统的客户。
推荐理由:CoreWeave 上线 Vera Rubin NVL72 与 Forge 平台,并给出 Cognition 实测吞吐与沙箱启动数据,可据此判断智能体训练到生产的工程路径。
AMD 宣布以约 82 亿美元全股票交易收购专注空间智能的初创公司 World Labs,交易预计在 2026 年底前完成,尚待监管批准。World Labs 创始人李飞飞将加入 AMD 领导团队,出任执行副总裁兼首席科学家,直接向 CEO 苏姿丰汇报并负责前沿研究。
推荐理由:这笔全股票收购把世界模型团队并入芯片厂商,读者可据此观察硬件与模型整合的新路径。
NVIDIA 发布开源表格基础模型 Kumo Tabular,属于 Kumo Structured 模型系列,已上线 Hugging Face,可在单次前向传播中完成分类与回归预测,无需训练、调参和特征工程。
推荐理由:NVIDIA 开源表格基础模型,无需训练和特征工程即可单次前向预测,并给出四个基准的排名与效率对比。
微软研究院发布 Quine,一个面向生物学复杂性的 AI 研究系统,由生物世界模型和连接模型、科学工具、文献与实验人员的交互式 harness 组成。该系统与 Broad Institute 合作用于胰腺导管腺癌研究,预测并优先排序数千种化合物,最高排名化合物在湿实验中产生了最大的经典态向基底态转变,从缩小化合物搜索空间到选出候选验证仅用一个周末。
推荐理由:微软研究院公开 Quine 的多模态生物世界模型与实验闭环设计,并给出胰腺癌化合物筛选的湿实验验证结果。
AMD 宣布以 82 亿美元全股票收购李飞飞的 World Labs,交易预计 2026 年底前完成,仍须取得监管批准。交割后李飞飞将加入 AMD 担任执行副总裁兼首席科学家,直接向苏姿丰汇报,联合创始人 Justin Johnson 和 Ben Mildenhall 继续带领团队并入 AMD。
推荐理由:交易金额、估值倍数与投资方回报结构都有具体数字,可据此观察芯片厂商布局世界模型的路径。
NVIDIA 加入由 Google DeepMind、EMBL-EBI 等组成的联盟,通过 AlphaFold Database 开放 2800 多种病毒的蛋白复合物预测 3D 结构,供全球科学家免费使用。
推荐理由:NVIDIA 与 Google DeepMind 等联合开放 2800 多种病毒的蛋白复合物结构预测,并放出生成流程,读者可据此了解开放科学如何提前储备疫情应对知识。
小米发布 MiMo-V2.6 系列,包含原生全模态的 MiMo-V2.6-Pro 与 MiMo-V2.6-Flash,并推出输出速度最高提升 20 倍的 MiMo-V2.6-Pro-UltraSpeed。
推荐理由:小米首次进入前沿开源模型序列,其 RL 环境与训练配方开源,为观察后训练成本路线提供了具体样本。
NVIDIA 在 MLPerf Inference v6.1 首次提交 Vera Rubin NVL72 预览成绩,在 Qwen3-VL 上吞吐最高达 GB300 NVL72 的 3.7 倍,在 DeepSeek-R1 上最高达 2.5 倍。
推荐理由:MLPerf v6.1 成绩单给出 Vera Rubin 与 GB300 的吞吐、扩展效率和软件优化数据,可作为推理基础设施选型的参照。
Salesforce 在 Dreamforce 上发布其首个 CRM 推理模型 Koa,基于 NVIDIA Nemotron 3 Super 后训练而成,训练数据来自近三十年企业 CRM 部署的专有合成数据集。
推荐理由:Koa 基于 NVIDIA Nemotron 3 Super 后训练,并给出 CRM Bench 上错误率降低 3 倍的具体对比。
NVIDIA 在 AI Infra Summit 上介绍 DSX 平台,聚焦电力管理与电网参与。Lambda 在五机架 19 节点的 HGX B200 集群上验证 DSX MaxLPS。
推荐理由:原文给出 DSX MaxLPS 在 Lambda 集群上的实测数字与 DSX Flex 的电网响应案例,可据此判断 AI 工厂每兆瓦产出如何被重新分配。