Anthropic 发布 Claude Haiku 5.5,价格最高下调 90%
Anthropic 发布 Claude Haiku 5.5,这是其迄今最快、最便宜的小模型,平均价格比 Haiku 4.5 低约 75%,10 万 token 以内提示词的价格降幅最高达 90%,超过 10 万 token 则贵 5 倍。
推荐理由:对比 Haiku 4.5 与 GPT-6 Luna 的基准和分档定价,可看清小模型在成本敏感任务上的取舍。
Anthropic 发布 Claude Haiku 5.5,这是其迄今最快、最便宜的小模型,平均价格比 Haiku 4.5 低约 75%,10 万 token 以内提示词的价格降幅最高达 90%,超过 10 万 token 则贵 5 倍。
推荐理由:对比 Haiku 4.5 与 GPT-6 Luna 的基准和分档定价,可看清小模型在成本敏感任务上的取舍。
OpenAI 发布 GPT-6 Astra,称其为面向企业的最强模型,具备高级推理、计算机操作能力,并在写作与设计判断上更强。
推荐理由:OpenAI 公布 GPT-6 Astra 面向企业场景的能力定位,读者可据此了解其推理与计算机操作方向。
IBM Granite 团队发布 Granite 4.2,这是其首个稠密 decoder-only 推理模型家族,包含 3B、8B、30B 三个尺寸,均以 Apache 2.0 许可开源。
推荐理由:Granite 4.2 完整公开了预训练、SFT 与多阶段 RL 的配方和超参,可据此理解推理模型与智能体训练如何分阶段衔接。
Liquid AI 为 LFM2.5 家族的 LFM2.5-1.2B-Instruct、LFM2.5-2.6B 和 LFM2.5-8B-A1B 发布 DSpark 草稿模型检查点,通过投机解码在不改变输出质量的前提下提升解码速度,GPU 上吞吐最高提升 3.18 倍,端侧最高提升 2.87 倍。
推荐理由:官方给出三个 LFM2.5 模型的 DSpark 草稿模型与实测加速数据,可据此判断端侧与 GPU 推理的提速幅度。
Thinking Machines Lab 在 Hugging Face 发布 Inkling 系列多模态大模型,Inkling 为约 1T 参数、41B 激活参数的 MoE 模型,原生支持图像、文本、音频输入,上下文窗口 1M,并推出 276B 总参数、12B 激活参数的 Inkling-Small。
推荐理由:原文给出 Inkling 的架构细节、部署配置与基准对比,读者可据此判断这一开源多模态模型的落地门槛。
Mistral 发布 Leanstral 1.5,一个 Apache-2.0 许可的模型,119B 总参数、6B 激活参数,在形式化验证上大幅升级:miniF2F 达到 100%,PutnamBench 解出 587/672 题,FATE-H 达 87%、FATE-X 达 34%。
推荐理由:原文给出 Leanstral 1.5 在形式化验证基准上的成绩与每道题成本,读者可据此判断开源证明模型的性价比。
Google Research 发布新架构,将多 Token 预测(MTP)头挂载到已冻结的 Gemini Nano v3 模型上,已在 Pixel 9 和 10 系列上线,作为开箱即用的加速方案。
推荐理由:Google 把 MTP 头挂到冻结的 Gemini Nano v3 上,读者可了解端侧推测解码如何省内存并提速。
Google DeepMind 发布实验性开源模型 DiffusionGemma,采用文本扩散方式并行生成整块文本,在专用 GPU 上推理最高提速 4 倍,单张 NVIDIA H100 上超过 1000 tokens/秒,RTX 5090 上超过 700 tokens/秒。
推荐理由:官方给出 26B MoE 文本扩散模型的速度数据、硬件门槛与质量取舍,便于判断本地低并发场景是否值得尝试。
Mistral AI 发布 Mistral Small 4,这是 Mistral Small 系列的下一个重大版本,也是首个把 Magistral 的推理、Pixtral 的多模态和 Devstral 的智能体编码能力统一到单一模型的 Mistral 模型,采用 Apache 2.0 许可。
推荐理由:Mistral 把推理、多模态与编码智能体能力合并进单一开源模型,并给出可调推理强度与部署门槛。
Mistral AI 发布首个推理模型 Magistral,分为 24B 参数的开源版 Magistral Small 和更强的企业版 Magistral Medium。
推荐理由:Mistral 首个推理模型同时给出开源权重与企业版,并公开训练论文,读者可据此判断其多语言推理定位。