Diffusers 原生支持 Nunchaku 4-bit 扩散推理
Hugging Face 在 Diffusers 中引入 Nunchaku Lite,可直接用 from_pretrained() 加载 Nunchaku 量化检查点,无需自定义 pipeline 或本地 CUDA 编译。
推荐理由:Diffusers 原生支持 Nunchaku 4-bit 推理,读者可据此了解消费级 GPU 跑扩散模型的内存与速度取舍。
公司与模型
Hugging Face 开源社区动态:热门模型与数据集、排行榜变化与开源生态的晴雨表。
31 条精选近 30 天 7 条共收录 63 条
Hugging Face 在 Diffusers 中引入 Nunchaku Lite,可直接用 from_pretrained() 加载 Nunchaku 量化检查点,无需自定义 pipeline 或本地 CUDA 编译。
推荐理由:Diffusers 原生支持 Nunchaku 4-bit 推理,读者可据此了解消费级 GPU 跑扩散模型的内存与速度取舍。
Hugging Face 发布 Grabette,一套开源低成本的手持夹爪系统,用于录制机器人操作演示数据。Grabette 配备广角鱼眼相机与 RGBD 相机,BOM 成本约 490€,配套的机器人端夹爪 Gripette 成本约 120€。
推荐理由:原文给出了一套低成本手持夹爪采集方案与浏览器端处理流程,读者可据此判断机器人操作数据的采集门槛变化。
Hugging Face 披露本周检测到一起针对其部分生产基础设施的入侵,该事件端到端由自主 AI 智能体系统驱动,攻击者通过恶意数据集利用数据集处理中的远程代码加载器和模板注入两条代码执行路径,进而获取节点级权限、窃取云与集群凭证并在周末横向移动至多个内部集群。
推荐理由:Hugging Face 披露首起由自主 AI 智能体端到端驱动的入侵,并说明防御方为何改用自托管开源模型完成取证。
Thinking Machines Lab 在 Hugging Face 发布 Inkling 系列多模态大模型,Inkling 为约 1T 参数、41B 激活参数的 MoE 模型,原生支持图像、文本、音频输入,上下文窗口 1M,并推出 276B 总参数、12B 激活参数的 Inkling-Small。
推荐理由:原文给出 Inkling 的架构细节、部署配置与基准对比,读者可据此判断这一开源多模态模型的落地门槛。
Hume 发布 Real World VoiceEQ 基准,用于评估语音交互的人类质量,覆盖 40 多个专有与开源语音模型、15+ 评测维度和 60 多项指标,涵盖 ASR、TTS、S2S 和语音理解。
推荐理由:原文给出语音 AI 在 15+ 维度上的评测结果,读者可据此理解现有基准为何高估真实表现。
Hugging Face 宣布 vLLM 的 transformers 建模后端在多个 LLM 架构上已追平甚至超过 vLLM 手写原生实现的吞吐。该后端通过 torch.fx 做静态图分析、用 ast 重写算子,在运行时动态应用推理专用层融合,覆盖 MoE 专家并行、TP 张量并行等场景。
推荐理由:原文给出 transformers 后端在 vLLM 中追平原生实现的具体机制与启用方式,读者可据此判断自家模型能否免移植获得同等推理速度。
微软在 Build 2026 宣布 Foundry Managed Compute 与 Hugging Face 模型集合,将 Hugging Face 生态的开源权重模型以每周刷新的策展目录形式引入 Foundry Model Catalog,可一键部署到托管 GPU 平台。
推荐理由:微软把 Hugging Face 开源模型的部署运维层接进 Foundry,读者可据此判断企业自托管开源模型的门槛变化。
Hugging Face 与 SkyPilot 联合推出 store: hf 存储后端,用一条 hf:// URL 和已有的 HF_TOKEN 即可把 Hugging Face Bucket 或任意模型、数据集、Space 仓库挂载进 SkyPilot 任务,并在 20 多个云、Kubernetes、Slurm 和本地集群上运行。
推荐理由:原文给出 hf:// 挂载与零出网费的具体机制和跨云实测数据,读者可据此判断跨云训练存储成本的变化。
Hugging Face 发布 LeRobot v0.6.0,围绕机器人学习闭环引入世界模型策略(VLA-JEPA、FastWAM、LingBot-VA)、新一批 VLA(GR00T N1.7、MolmoAct2、EO-1、EVO1、Multitask DiT)以及统一的奖励模型 API(Robometer、TOPReward)。
推荐理由:LeRobot v0.6.0 把世界模型策略、奖励模型与统一评测串成闭环,读者可据此判断开源机器人学习栈的当前边界。
Mistral 发布 Leanstral 1.5,一个 Apache-2.0 许可的模型,119B 总参数、6B 激活参数,在形式化验证上大幅升级:miniF2F 达到 100%,PutnamBench 解出 587/672 题,FATE-H 达 87%、FATE-X 达 34%。
推荐理由:原文给出 Leanstral 1.5 在形式化验证基准上的成绩与每道题成本,读者可据此判断开源证明模型的性价比。
Hugging Face 与 Cerebras 联合发布实时语音到语音演示,用 Cerebras 加速 Gemma 4 31B 推理,构建开放的级联语音流水线。
推荐理由:原文给出了可复用的开源语音到语音流水线架构,读者可据此了解各模块如何组合与替换。