跳到正文
  1. Hugging Face Blog62

    Liquid AI 发布 d1-3B 与 d1-omni-600M 端侧决策模型

    Liquid AI 开源 d1 决策模型家族的两个模型 d1-3B 和 d1-omni-600M(实验性),二者不生成 token,而是在单次前向传播中给出答案。

    推荐理由:Liquid AI 公开两个决策模型,给出端侧延迟与七项基准对比,可据此判断小模型做结构化决策的可行性。

  1. AWS Machine Learning Blog62

    GLM 5.3 上线 Amazon Bedrock

    Z.ai 的 GLM 5.3 现已在 Amazon Bedrock 上线,这是一个 753B 参数的 MoE 模型,面向编码和长周期智能体任务,通过全托管 API 提供跨区域推理、提示词缓存和服务层级,目前面向符合条件的企业客户开放。

    推荐理由:GLM 5.3 在 Bedrock 上线,文中给出提示词缓存与 Strix 安全测试的完整调用示例,可据此评估迁移成本。

  1. Hugging Face Blog60

    Ai2 开源 AstaBrief 8B:Asta 中的快速报告生成模型

    Ai2 开源 AstaBrief 8B,一个把研究问题和检索到的文献片段转成带引用报告的模型,基于 Qwen3-8B 训练,已在 Asta 的 Generate a report 功能中作为 Fast 模式上线,与 Claude 驱动的 Thinking 模式并存。

    推荐理由:原文给出了从 Qwen3-8B 出发的 SFT 加 DPO 训练配方与数据过滤经验,可迁移到其他科学报告生成场景。

  1. Hugging Face Blog62

    NVIDIA 发布开源表格基础模型 Kumo Tabular

    NVIDIA 发布开源表格基础模型 Kumo Tabular,属于 Kumo Structured 模型系列,已上线 Hugging Face,可在单次前向传播中完成分类与回归预测,无需训练、调参和特征工程。

    推荐理由:NVIDIA 开源表格基础模型,无需训练和特征工程即可单次前向预测,并给出四个基准的排名与效率对比。

  1. Hugging Face Blog66

    H 公司发布 Holo4 系列智能体模型,含 27B 稠密与 35B-A3B MoE 两个版本

    H 公司发布 Holo4 系列智能体模型,包含 27B 稠密版和 35B-A3B MoE 版,两者均已在 H Models API 上线,权重以 BF16、FP8、NVFP4 和 4-bit GGUF 格式开源在 Hugging Face。

    推荐理由:Holo4 同时覆盖 GUI、代码、MCP 与 API 四种接口,并公开全部评测轨迹,读者可据此判断通用计算机操作智能体的成本与能力边界。

  1. Hugging Face Blog62

    IBM 发布 Granite 4.2 推理模型家族:3B、8B、30B 三尺寸及构建方法

    IBM Granite 团队发布 Granite 4.2,这是其首个稠密 decoder-only 推理模型家族,包含 3B、8B、30B 三个尺寸,均以 Apache 2.0 许可开源。

    推荐理由:Granite 4.2 完整公开了预训练、SFT 与多阶段 RL 的配方和超参,可据此理解推理模型与智能体训练如何分阶段衔接。

  1. Hugging Face Blog62

    Liquid AI 发布 LFM2.5-DSpark 草稿模型,推理最高提速 3.2 倍

    Liquid AI 为 LFM2.5 家族的 LFM2.5-1.2B-Instruct、LFM2.5-2.6B 和 LFM2.5-8B-A1B 发布 DSpark 草稿模型检查点,通过投机解码在不改变输出质量的前提下提升解码速度,GPU 上吞吐最高提升 3.18 倍,端侧最高提升 2.87 倍。

    推荐理由:官方给出三个 LFM2.5 模型的 DSpark 草稿模型与实测加速数据,可据此判断端侧与 GPU 推理的提速幅度。

  1. Hugging Face Blog62

    NVIDIA 发布 Magpie TTS 多语言版:开放权重、12 种语言与自托管部署

    NVIDIA 发布 Magpie TTS Multilingual,一个 364M 参数的开源权重语音合成模型,支持英语、西班牙语、法语、德语、意大利语、越南语、普通话、印地语、日语以及新增的现代标准阿拉伯语、韩语和巴西葡萄牙语共 12 种语言,每种语言含男女声。

    推荐理由:原文给出 364M 开源权重模型的多语言扩展与自托管延迟数据,可据此判断级联语音架构的部署取舍。

  1. Hugging Face Blog80

    Meta 发布开源多模态模型 Muse Glimmer 30B,面向本地智能体场景

    Meta 发布 Muse Glimmer,一个从 Muse 蒸馏到 30B 参数的多模态模型,采用 Apache 2.0 许可,面向本地智能体场景,如编码、文档分析和个人助理。

    推荐理由:Meta 开源 30B 多模态模型,附完整基准对比与本地部署路径,可据此判断端侧智能体的可行性。

  1. Hugging Face Blog85

    Thinking Machines 在 Hugging Face 发布 Inkling 及 Inkling-Small 多模态模型

    Thinking Machines Lab 在 Hugging Face 发布 Inkling 系列多模态大模型,Inkling 为约 1T 参数、41B 激活参数的 MoE 模型,原生支持图像、文本、音频输入,上下文窗口 1M,并推出 276B 总参数、12B 激活参数的 Inkling-Small。

    推荐理由:原文给出 Inkling 的架构细节、部署配置与基准对比,读者可据此判断这一开源多模态模型的落地门槛。

  1. Mistral AI71

    Mistral 发布 Leanstral 1.5 形式化验证模型

    Mistral 发布 Leanstral 1.5,一个 Apache-2.0 许可的模型,119B 总参数、6B 激活参数,在形式化验证上大幅升级:miniF2F 达到 100%,PutnamBench 解出 587/672 题,FATE-H 达 87%、FATE-X 达 34%。

    推荐理由:原文给出 Leanstral 1.5 在形式化验证基准上的成绩与每道题成本,读者可据此判断开源证明模型的性价比。

  1. Google Research75

    Google 发布表格数据零样本基础模型 TabFM

    Google Research 发布面向表格数据分类与回归的基础模型 TabFM,将表格预测重构为上下文学习问题,无需手动训练、超参数调优和特征工程,单次前向传播即可对未见过的表格生成预测。

    推荐理由:Google 把零样本思路从时序预测搬到表格数据,读者可了解其架构设计与 TabArena 基准表现。

  1. Google DeepMind78

    Google DeepMind 发布 DiffusionGemma:文本生成最高提速 4 倍

    Google DeepMind 发布实验性开源模型 DiffusionGemma,采用文本扩散方式并行生成整块文本,在专用 GPU 上推理最高提速 4 倍,单张 NVIDIA H100 上超过 1000 tokens/秒,RTX 5090 上超过 700 tokens/秒。

    推荐理由:官方给出 26B MoE 文本扩散模型的速度数据、硬件门槛与质量取舍,便于判断本地低并发场景是否值得尝试。

  1. Mistral AI82

    Mistral 发布 Mistral Medium 3.5 与 Vibe 云端远程智能体

    Mistral 发布 Mistral Medium 3.5,这是其首个合并指令遵循、推理与编码的 128B 稠密旗舰模型,采用修改版 MIT 许可开放权重,支持 256k 上下文窗口,最少四块 GPU 即可自托管,在 SWE-Bench Verified 上得分 77.6%,超过 Devstral 2 和 Qwen3.5 397B A17B。

    推荐理由:Mistral 把编码智能体搬到云端并同步开源 128B 旗舰模型,读者可据此判断自托管与异步编码的可行边界。

  1. Mistral AI72

    Mistral AI 发布 Voxtral TTS 语音合成模型

    Mistral AI 发布首个文本转语音模型 Voxtral TTS,4B 参数,支持英语、法语、德语、西班牙语、荷兰语、葡萄牙语、意大利语、印地语和阿拉伯语共 9 种语言,具备情感表达和零样本跨语言音色适配能力。

    推荐理由:官方给出 4B 参数、70ms 延迟与 9 种语言支持,读者可据此判断企业语音智能体的成本与部署门槛。

  1. Mistral AI75

    Mistral 发布 Voxtral Transcribe 2 语音转写模型家族

    Mistral AI 发布 Voxtral Transcribe 2,包含面向批量转写的 Voxtral Mini Transcribe V2 和面向实时场景的 Voxtral Realtime,后者以 Apache 2.0 协议开放权重。

    推荐理由:官方给出两款语音转写模型的延迟、错误率与定价对比,可据此判断实时语音场景的选型与成本。

  1. Mistral AI80

    Mistral 发布 Voxtral 语音理解模型,24B 与 3B 双版本开源

    Mistral AI 发布 Voxtral 语音理解模型,提供 24B 和 3B 两个版本,均以 Apache 2.0 许可开源并上线 API。模型支持 32k token 上下文,可处理最长 30 分钟音频转写或 40 分钟音频理解,具备内置问答与摘要、多语言自动检测和语音直接触发函数调用等能力。

    推荐理由:Mistral 开源两款语音理解模型,给出与 Whisper、GPT-4o mini、ElevenLabs 的对比和 API 定价,便于评估落地成本。

  1. Mistral AI74

    Mistral AI 发布首个推理模型 Magistral

    Mistral AI 发布首个推理模型 Magistral,分为 24B 参数的开源版 Magistral Small 和更强的企业版 Magistral Medium。

    推荐理由:Mistral 首个推理模型同时给出开源权重与企业版,并公开训练论文,读者可据此判断其多语言推理定位。

  1. Mistral AI78

    Mistral AI 与 All Hands AI 发布编码智能体模型 Devstral

    Mistral AI 与 All Hands AI 合作发布面向软件工程任务的智能体模型 Devstral,在 SWE-Bench Verified 上取得 46.8%,比此前开源 SoTA 高出 6 个百分点以上,并以 Apache 2.0 许可开源。

    推荐理由:官方给出 Devstral 在 SWE-Bench Verified 上的分数与开源许可,读者可据此判断开源编码智能体的当前水位。

  1. Mistral AI71

    Mistral AI 发布 Mistral Small 3.1,支持多模态与 128k 上下文

    Mistral AI 发布 Mistral Small 3.1,在 Mistral Small 3 基础上提升文本性能、多模态理解,并将上下文窗口扩展至 128k tokens,以 Apache 2.0 许可开源。

    推荐理由:官方给出 Mistral Small 3.1 的多模态与长上下文能力及开源许可,读者可据此判断小模型在端侧与私有部署中的可用性。

已经到底了