跳到正文
10月9日周五
  1. Hugging Face Blog74

    作者用 ML Intern 两天训练六个模型,总花费约 103 美元

    作者借助 HuggingChat 中的 ML Intern,在几天内做出六个模型,包括 0.8B 的 Pocket Rewriter、柑橘病害 VLM、Huggy LoRA、相机视角 LoRA、Doodle-in LoRA 和 Agate 4-step 蒸馏模型,总计算成本约 103 美元。

    推荐理由:作者用 ML Intern 在两天内做出六个模型,并公开全部提示词与成本明细,可迁移到自己的训练流程。

10月8日周四
10月7日周三
  1. Hugging Face Blog62

    Nemotron 微调后在 IOI 2026 与 IMO 2026 双双达到金牌水平

    英伟达团队基于 Nemotron 3 通过 SFT、RL 和生成-验证-精炼推理流程,在 IOI 2026 和 IMO 2026 双双达到金牌水平。IOI 2026 中 Nemotron-3-Ultra-CC 得 535.4/600,高于 361.12 的金牌线;IMO 2026 系统得 30/42,高于 29 的官方金牌线。

    推荐理由:原文公开了从 Nemotron 3 微调到 IOI、IMO 金牌级成绩的完整配方与数据集,可据此复现领域专家模型。

10月6日周二
  1. AWS Machine Learning Blog62

    GLM 5.3 上线 Amazon Bedrock

    Z.ai 的 GLM 5.3 现已在 Amazon Bedrock 上线,这是一个 753B 参数的 MoE 模型,面向编码和长周期智能体任务,通过全托管 API 提供跨区域推理、提示词缓存和服务层级,目前面向符合条件的企业客户开放。

    推荐理由:GLM 5.3 在 Bedrock 上线,文中给出提示词缓存与 Strix 安全测试的完整调用示例,可据此评估迁移成本。

10月4日周日
  1. Hugging Face Blog66

    微软与 Hugging Face 发布 ThinkingBox:按数据库终态给 AI 智能体打分

    微软 Copilot Studio 团队与 Hugging Face 联合发布 ThinkingBox,通过隔离的 MCP 工具会话运行智能体,按终端后端状态和副作用而非生成文本判分,覆盖 507 个有状态业务流程、每个任务重复 20 次。

    推荐理由:微软与 Hugging Face 联合发布的智能体评测基准,用后端状态而非生成文本判分,并给出可复现的 OpenEnv 运行方式。

10月2日周五
  1. Hugging Face Blog60

    Ai2 开源 AstaBrief 8B:Asta 中的快速报告生成模型

    Ai2 开源 AstaBrief 8B,一个把研究问题和检索到的文献片段转成带引用报告的模型,基于 Qwen3-8B 训练,已在 Asta 的 Generate a report 功能中作为 Fast 模式上线,与 Claude 驱动的 Thinking 模式并存。

    推荐理由:原文给出了从 Qwen3-8B 出发的 SFT 加 DPO 训练配方与数据过滤经验,可迁移到其他科学报告生成场景。

  2. Hugging Face Blog38

    ServiceNow CoreAI 推出 AutoSynthData:为企业智能体生成训练数据

    ServiceNow CoreAI 构建了 AutoSynthData,利用目标模型的失败案例与更强教师的成功示范,定位能力缺口并生成、验证新的可执行训练任务,随模型提升动态调整课程。该流程在 EnterpriseOps Gym 环境中演示,生成的任务需满足可行性、真实性与难度三项要求,验证器则需保证一致性、可靠性与完整性,通过校验的样本用于后训练。

9月30日周三
9月29日周二
  1. Hugging Face Blog62

    NVIDIA 发布开源表格基础模型 Kumo Tabular

    NVIDIA 发布开源表格基础模型 Kumo Tabular,属于 Kumo Structured 模型系列,已上线 Hugging Face,可在单次前向传播中完成分类与回归预测,无需训练、调参和特征工程。

    推荐理由:NVIDIA 开源表格基础模型,无需训练和特征工程即可单次前向预测,并给出四个基准的排名与效率对比。

  2. Hugging Face Blog26

    ProvenanceGuard:面向 MCP 智能体的来源感知事实性验证

    Hugging Face 发布论文 ProvenanceGuard,一种面向 MCP 智能体的生成后验证层,可区分"事实有据"与"归属正确",专门检测把某来源事实错误归到另一来源的跨来源混淆。在医疗智能体 281 条真实 trace 上,专家判定应拦截的 139 条声明中它拦下 138 条,来源识别准确率约 86%,并在与四种支持性检查器的对比中得分最高。

9月28日周一
  1. Hugging Face Blog66

    H 公司发布 Holo4 系列智能体模型,含 27B 稠密与 35B-A3B MoE 两个版本

    H 公司发布 Holo4 系列智能体模型,包含 27B 稠密版和 35B-A3B MoE 版,两者均已在 H Models API 上线,权重以 BF16、FP8、NVFP4 和 4-bit GGUF 格式开源在 Hugging Face。

    推荐理由:Holo4 同时覆盖 GUI、代码、MCP 与 API 四种接口,并公开全部评测轨迹,读者可据此判断通用计算机操作智能体的成本与能力边界。

9月24日周四
9月22日周二
  1. Hugging Face Blog66

    Transformers 现已支持运行 llama.cpp 的 GGUF 量化模型

    Hugging Face 为 transformers 加入 GGUF 支持,用户可从 Hub 选取量化 checkpoint,通过 from_pretrained 传入 gguf_file 在本地生成,也可用 transformers serve 暴露 OpenAI 兼容 API。

    推荐理由:Hugging Face 官方说明 transformers 接入 GGUF 的加载方式与性能对比,可据此判断本地推理工作流的变化。

9月21日周一
9月16日周三
  1. Hugging Face Blog66

    IBM 研究提出 ALTK-Evolve 一致性指南:把智能体一致性差距从 24.4pp 降到 12.0pp

    IBM 研究团队在 ALTK-Evolve 中新增一致性指南(consistency guidelines)与 Consistency Analyzer,用于诊断并减少智能体在重复运行中的结果波动。

    推荐理由:原文给出 Pass^k 与一致性差距的量化诊断方法,并展示把差距减半的实测结果,可迁移到智能体可靠性评估。

9月10日周四
  1. Hugging Face Blog62

    用 Gradio Workflow 重建 AUTOMATIC1111:Workflow1111 的 73 节点画布

    Hugging Face 团队用 Gradio Workflow 重建了 AUTOMATIC1111 的大部分功能,做成名为 Workflow1111 的画布,由 11 条媒体流水线和 73 个节点组成,覆盖文生图、高清修复、图生图、提示词矩阵、VLM 反推、检测生成 inpaint 掩码、ControlNet 风格标注器、背景移除、PNG Info 存储和图生视频。

    推荐理由:原文用 73 个节点复刻 A1111 的十一条图像流水线,并说明输出如何变成 REST 端点和 MCP 工具。

9月3日周四
9月2日周三
  1. Hugging Face Blog31

    Hugging Face 推出 BenchMIRT:LLM 基准测试究竟在测什么?

    Hugging Face 发布 BenchMIRT,一种在单条提示词层面审计 LLM 基准测试的新方法,基于多维项目反应理论(MIRT),在 100 个 LLM、16 个基准、超 34K 道题上训练。它未被告知各基准测什么,却自行识别出安全与通用推理两个主导维度,并发现 BBQ、WMDP 等基准的得分更多与通用推理相关而非安全。

9月1日周二
  1. Hugging Face Blog60

    Hugging Face 发布 @huggingface/kernels:207 个 WebGPU kernel 用于本地 AI

    Hugging Face 发布 @huggingface/kernels,一个从 Hugging Face Hub 加载并运行优化 WebGPU kernel 的 JavaScript 库,同时上线 207 个 kernel,均以独立仓库形式发布,采用 Apache-2.0 许可。

    推荐理由:Hugging Face 发布 207 个 WebGPU kernel 及加载库,并给出与 ORT WebGPU 的实测对比数据,可供浏览器端推理选型参考。

8月28日周五
8月26日周三
8月25日周二
  1. Hugging Face Blog62

    Multiverse Computing 提出 Quantization-Aware Healing:4-bit 压缩模型在 7/9 基准上超过自身全精度版本

    Multiverse Computing 发布论文《Quantization-Aware Healing: A Practical Recipe for Recovering Compressed, 4-Bit LLMs》,提出 QAH 方法:在结构压缩并量化后,直接从压缩前的原始全精度模型蒸馏,而不是从恢复出的 bfloat16 checkpoint 蒸馏。

    推荐理由:论文给出压缩加量化后从原始模型蒸馏的修复方案,并附9项基准对比,可看方法差异与代价。

  2. Hugging Face Blog62

    Hugging Face 在 Gradio 中推出 gr.Workflow,把 AI 流水线变成可拖拽画布

    Hugging Face 在 Gradio 中推出 gr.Workflow,把 AI 流水线描述为带类型节点的图,并直接提供可拖拽画布,每个节点可运行、每个中间结果可见。

    推荐理由:原文给出 gr.Workflow 的节点类型、并行模式与 API 导出方式,读者可据此判断多步 AI 流水线如何从脚本变成可部署界面。

8月21日周五
  1. Hugging Face Blog62

    Liquid AI 发布 LFM2.5-DSpark 草稿模型,推理最高提速 3.2 倍

    Liquid AI 为 LFM2.5 家族的 LFM2.5-1.2B-Instruct、LFM2.5-2.6B 和 LFM2.5-8B-A1B 发布 DSpark 草稿模型检查点,通过投机解码在不改变输出质量的前提下提升解码速度,GPU 上吞吐最高提升 3.18 倍,端侧最高提升 2.87 倍。

    推荐理由:官方给出三个 LFM2.5 模型的 DSpark 草稿模型与实测加速数据,可据此判断端侧与 GPU 推理的提速幅度。

8月18日周二
  1. Hugging Face Blog62

    Sentence Transformers v6.0 新增 MultiVectorEncoder 支持晚交互检索

    Sentence Transformers v6.0 新增第四种模型类型 MultiVectorEncoder,用于 ColBERT 式晚交互检索,PyLate 与 Stanford-NLP ColBERT 检查点可直接加载,colpali-engine 的视觉文档检索模型也能通过同一套 API 使用。

    推荐理由:Sentence Transformers v6.0 新增多向量编码器,读者可据此判断晚交互检索的接入方式与索引成本。

8月14日周五
  1. Hugging Face Blog62

    Hugging Face 发布 2026 夏季开源模型观察报告

    Hugging Face 发布 2026 年 1 月至 8 月的开源模型观察报告,基于 Hub 数据给出六项发现。报告显示公开模型仓库从 243 万增至 296 万,数据集从 71.1 万增至 100 万,Spaces 从 100 万增至 144 万,但 85.6% 的模型终身下载量不足 200 次,1.5% 的仓库占据 99.2% 的下载量。

    推荐理由:Hugging Face 用 Hub 七个月数据拆解开源模型格局,下载与点赞的分野、Qwen 衍生生态和智能体流量变化都给出了可核对的数字。