跳到正文
  1. The Decoder82

    Anthropic 发布 Claude Haiku 5.5,价格最高下调 90%

    Anthropic 发布 Claude Haiku 5.5,这是其迄今最快、最便宜的小模型,平均价格比 Haiku 4.5 低约 75%,10 万 token 以内提示词的价格降幅最高达 90%,超过 10 万 token 则贵 5 倍。

    推荐理由:对比 Haiku 4.5 与 GPT-6 Luna 的基准和分档定价,可看清小模型在成本敏感任务上的取舍。

  1. OpenAI News82

    OpenAI 发布 GPT-6 Astra,面向企业工作场景

    OpenAI 发布 GPT-6 Astra,称其为面向企业的最强模型,具备高级推理、计算机操作能力,并在写作与设计判断上更强。

    推荐理由:OpenAI 公布 GPT-6 Astra 面向企业场景的能力定位,读者可据此了解其推理与计算机操作方向。

  1. Hugging Face Blog62

    IBM 发布 Granite 4.2 推理模型家族:3B、8B、30B 三尺寸及构建方法

    IBM Granite 团队发布 Granite 4.2,这是其首个稠密 decoder-only 推理模型家族,包含 3B、8B、30B 三个尺寸,均以 Apache 2.0 许可开源。

    推荐理由:Granite 4.2 完整公开了预训练、SFT 与多阶段 RL 的配方和超参,可据此理解推理模型与智能体训练如何分阶段衔接。

  1. Hugging Face Blog62

    Liquid AI 发布 LFM2.5-DSpark 草稿模型,推理最高提速 3.2 倍

    Liquid AI 为 LFM2.5 家族的 LFM2.5-1.2B-Instruct、LFM2.5-2.6B 和 LFM2.5-8B-A1B 发布 DSpark 草稿模型检查点,通过投机解码在不改变输出质量的前提下提升解码速度,GPU 上吞吐最高提升 3.18 倍,端侧最高提升 2.87 倍。

    推荐理由:官方给出三个 LFM2.5 模型的 DSpark 草稿模型与实测加速数据,可据此判断端侧与 GPU 推理的提速幅度。

  1. Hugging Face Blog85

    Thinking Machines 在 Hugging Face 发布 Inkling 及 Inkling-Small 多模态模型

    Thinking Machines Lab 在 Hugging Face 发布 Inkling 系列多模态大模型,Inkling 为约 1T 参数、41B 激活参数的 MoE 模型,原生支持图像、文本、音频输入,上下文窗口 1M,并推出 276B 总参数、12B 激活参数的 Inkling-Small。

    推荐理由:原文给出 Inkling 的架构细节、部署配置与基准对比,读者可据此判断这一开源多模态模型的落地门槛。

  1. Mistral AI71

    Mistral 发布 Leanstral 1.5 形式化验证模型

    Mistral 发布 Leanstral 1.5,一个 Apache-2.0 许可的模型,119B 总参数、6B 激活参数,在形式化验证上大幅升级:miniF2F 达到 100%,PutnamBench 解出 587/672 题,FATE-H 达 87%、FATE-X 达 34%。

    推荐理由:原文给出 Leanstral 1.5 在形式化验证基准上的成绩与每道题成本,读者可据此判断开源证明模型的性价比。

  1. Google Research62

    Google 用冻结多 Token 预测加速 Pixel 上的 Gemini Nano 模型

    Google Research 发布新架构,将多 Token 预测(MTP)头挂载到已冻结的 Gemini Nano v3 模型上,已在 Pixel 9 和 10 系列上线,作为开箱即用的加速方案。

    推荐理由:Google 把 MTP 头挂到冻结的 Gemini Nano v3 上,读者可了解端侧推测解码如何省内存并提速。

  1. Google DeepMind78

    Google DeepMind 发布 DiffusionGemma:文本生成最高提速 4 倍

    Google DeepMind 发布实验性开源模型 DiffusionGemma,采用文本扩散方式并行生成整块文本,在专用 GPU 上推理最高提速 4 倍,单张 NVIDIA H100 上超过 1000 tokens/秒,RTX 5090 上超过 700 tokens/秒。

    推荐理由:官方给出 26B MoE 文本扩散模型的速度数据、硬件门槛与质量取舍,便于判断本地低并发场景是否值得尝试。

  1. Mistral AI78

    Mistral 发布 Mistral Small 4,统一推理、多模态与编码智能体能力

    Mistral AI 发布 Mistral Small 4,这是 Mistral Small 系列的下一个重大版本,也是首个把 Magistral 的推理、Pixtral 的多模态和 Devstral 的智能体编码能力统一到单一模型的 Mistral 模型,采用 Apache 2.0 许可。

    推荐理由:Mistral 把推理、多模态与编码智能体能力合并进单一开源模型,并给出可调推理强度与部署门槛。

  1. Mistral AI74

    Mistral AI 发布首个推理模型 Magistral

    Mistral AI 发布首个推理模型 Magistral,分为 24B 参数的开源版 Magistral Small 和更强的企业版 Magistral Medium。

    推荐理由:Mistral 首个推理模型同时给出开源权重与企业版,并公开训练论文,读者可据此判断其多语言推理定位。

已经到底了