跳到正文
今天10月10日周六1 条
10月9日周五
10月8日周四
  1. The Decoder82

    Anthropic 发布 Claude Haiku 5.5,价格最高下调 90%

    Anthropic 发布 Claude Haiku 5.5,这是其迄今最快、最便宜的小模型,平均价格比 Haiku 4.5 低约 75%,10 万 token 以内提示词的价格降幅最高达 90%,超过 10 万 token 则贵 5 倍。

    推荐理由:对比 Haiku 4.5 与 GPT-6 Luna 的基准和分档定价,可看清小模型在成本敏感任务上的取舍。

10月7日周三
  1. Hugging Face Blog62

    Nemotron 微调后在 IOI 2026 与 IMO 2026 双双达到金牌水平

    英伟达团队基于 Nemotron 3 通过 SFT、RL 和生成-验证-精炼推理流程,在 IOI 2026 和 IMO 2026 双双达到金牌水平。IOI 2026 中 Nemotron-3-Ultra-CC 得 535.4/600,高于 361.12 的金牌线;IMO 2026 系统得 30/42,高于 29 的官方金牌线。

    推荐理由:原文公开了从 Nemotron 3 微调到 IOI、IMO 金牌级成绩的完整配方与数据集,可据此复现领域专家模型。

10月6日周二
  1. Simon Willison22

    Qwen3.8 27B 用英文单词做加法的基准测试

    本地 Qwen3.8-27B-Q4_K_M.gguf 在禁用推理时用英文单词做加法仅得 23.57% 数值准确率,格式合规率 96.17%,一至三位数操作数准确率 97.04%,十至十三位数骤降至 6.44%。启用推理后 169 次配对测试答对 167 次,但每次仅跑一个样本。该实验在 DGX Spark 上复现 GPT-4o 的单词加法测试。

  2. TechCrunch · AI71

    Reflection 发布开源权重模型 Beam,对标中国开源模型

    Reflection AI 正式发布其首个前沿开源权重模型 Beam,称在高级推理基准上匹配领先中国开源模型的性能,且推理成本大幅更低。Beam 是文本 MoE 模型,总参数 5010 亿、激活 230 亿,预训练使用 23.8 万亿 token,上下文窗口 100 万 token;公司称其得分与 Z.ai 的 GLM-5.2 持平,并使用少 3-4 倍的推理算力。

10月2日周五
  1. MIT Technology Review · AI44

    别被迷惑:LLM 并不会真正推理

    前 Google DeepMind 研究员指出,LLM 的思维链仍由同一套下一 token 预测生成,并非独立推理机制。他列举三大缺陷:缺乏可检视的持久认知状态、知识与操作无法分离、思维链常是事后编造。他主张借鉴 AlphaGo 的搜索架构,为模型建立可更新的认知状态。

  2. Ars Technica · AI60

    CMU 等团队用 16 块 GPU 训练 AI Ataraxos,15 比 1 击败最强 Stratego 选手

    卡内基梅隆、MIT、纽约大学和斯坦福的研究团队开发出 AI Ataraxos,以 15 胜 1 负 4 平击败被视为史上最强的 Stratego 选手 Pim Niemeijer。Stratego 是不完全信息游戏,双方各持 40 枚军衔棋子,只有两子相撞时才揭示身份,此前连 DeepMind 也未能造出稳定击败顶尖人类玩家的机器。该研究训练仅用 16 块 GPU 和数千美元。

9月29日周二
  1. 量子位39

    亚马逊与杜克大学研究:删掉99.95%训练信号,大模型推理反而更好

    亚马逊与杜克大学团队发现,在On-Policy Distillation中每条推理轨迹只随机训练一个token(约0.05%信号),仍能稳定提升Qwen3系列9组teacher-student配置的数学推理能力,单个极端token甚至可匹配或超过full-token OPD,并出现学生反超教师的情况。该现象还扩展到coding reasoning、Llama系列和基于PPO的RLVR。

9月24日周四
9月22日周二
9月16日周三
  1. NVIDIA Blog62

    NVIDIA Vera Rubin NVL72 首次亮相 MLPerf Inference v6.1,吞吐最高达 GB300 NVL72 的 3.7 倍

    NVIDIA 在 MLPerf Inference v6.1 首次提交 Vera Rubin NVL72 预览成绩,在 Qwen3-VL 上吞吐最高达 GB300 NVL72 的 3.7 倍,在 DeepSeek-R1 上最高达 2.5 倍。

    推荐理由:MLPerf v6.1 成绩单给出 Vera Rubin 与 GB300 的吞吐、扩展效率和软件优化数据,可作为推理基础设施选型的参照。

9月9日周三
9月8日周二
9月3日周四
8月25日周二
  1. Hugging Face Blog62

    Multiverse Computing 提出 Quantization-Aware Healing:4-bit 压缩模型在 7/9 基准上超过自身全精度版本

    Multiverse Computing 发布论文《Quantization-Aware Healing: A Practical Recipe for Recovering Compressed, 4-Bit LLMs》,提出 QAH 方法:在结构压缩并量化后,直接从压缩前的原始全精度模型蒸馏,而不是从恢复出的 bfloat16 checkpoint 蒸馏。

    推荐理由:论文给出压缩加量化后从原始模型蒸馏的修复方案,并附9项基准对比,可看方法差异与代价。

8月21日周五
  1. Hugging Face Blog62

    Liquid AI 发布 LFM2.5-DSpark 草稿模型,推理最高提速 3.2 倍

    Liquid AI 为 LFM2.5 家族的 LFM2.5-1.2B-Instruct、LFM2.5-2.6B 和 LFM2.5-8B-A1B 发布 DSpark 草稿模型检查点,通过投机解码在不改变输出质量的前提下提升解码速度,GPU 上吞吐最高提升 3.18 倍,端侧最高提升 2.87 倍。

    推荐理由:官方给出三个 LFM2.5 模型的 DSpark 草稿模型与实测加速数据,可据此判断端侧与 GPU 推理的提速幅度。

8月17日周一
8月13日周四
  1. Microsoft Research39

    MindTopo:微软推出评估多模态模型拓扑推理能力的新基准

    微软研究院推出 MindTopo 基准,用于评估多模态大语言模型在连通性、分离、顺序、包围和绳结五类拓扑关系上的推理与规划能力。测试显示,当前模型在静态图像识别上明显强于交互式规划任务,失败多发生在规划阶段而非感知阶段,且图像与视频生成工具在跨多步动作中维持拓扑关系并不可靠。

8月12日周三
  1. Google Research62

    Google Research:召回而非编码是 LLM 参数化事实性的瓶颈

    Google Research 提出知识画像框架,用编码、知识、召回三个行为概念区分事实错误来自知识未编码还是已编码但无法访问,并发布包含 2,150 条 Wikipedia 事实、每条配 10 个问题的 WikiProfile 基准。

    推荐理由:Google Research 用知识画像区分编码与召回失败,指出前沿模型的事实错误更多来自知识可访问性而非知识缺失。

8月11日周二
7月29日周三
7月26日周日
  1. Berkeley AI Research38

    Berkeley AI Research 提出 ABBEL:用信念状态监督让 LLM 高效完成长程交互

    Berkeley AI Research 提出 ABBEL 框架,将 LLM 的摘要内容隔离为自然语言"信念状态"并加以监督,以替代完整交互历史作为智能体的工作上下文。在协作编程基准 CollabBench 上,基于重建的信念评分(rec-BG)将 ABBEL 与全上下文模型的性能差距缩小约 50%,训练步数从 100 步降至 50 步,峰值上下文 token 数也低于全上下文设置。

7月16日周四
7月15日周三
  1. Hugging Face Blog85

    Thinking Machines 在 Hugging Face 发布 Inkling 及 Inkling-Small 多模态模型

    Thinking Machines Lab 在 Hugging Face 发布 Inkling 系列多模态大模型,Inkling 为约 1T 参数、41B 激活参数的 MoE 模型,原生支持图像、文本、音频输入,上下文窗口 1M,并推出 276B 总参数、12B 激活参数的 Inkling-Small。

    推荐理由:原文给出 Inkling 的架构细节、部署配置与基准对比,读者可据此判断这一开源多模态模型的落地门槛。

7月10日周五
7月2日周四
  1. Mistral AI71

    Mistral 发布 Leanstral 1.5 形式化验证模型

    Mistral 发布 Leanstral 1.5,一个 Apache-2.0 许可的模型,119B 总参数、6B 激活参数,在形式化验证上大幅升级:miniF2F 达到 100%,PutnamBench 解出 587/672 题,FATE-H 达 87%、FATE-X 达 34%。

    推荐理由:原文给出 Leanstral 1.5 在形式化验证基准上的成绩与每道题成本,读者可据此判断开源证明模型的性价比。

6月27日周六
6月25日周四
  1. Google Research29

    Google Research 研究:推理如何解锁 LLM 的参数化知识

    Google Research 在 COLM 2026 论文中揭示,让模型生成推理链能解锁原本无法召回的事实答案,即使问题只是单跳事实查询。研究用 Gemini-2.5(Flash 和 Pro)与 Qwen3-32B 在 SimpleQA Verified 和 EntityQuestions 上对比推理开关两种模式,发现两个机制:额外 token 充当计算缓冲,以及生成相关事实的"事实启动"效应。

6月11日周四
  1. Google DeepMind78

    Google DeepMind 发布 DiffusionGemma:文本生成最高提速 4 倍

    Google DeepMind 发布实验性开源模型 DiffusionGemma,采用文本扩散方式并行生成整块文本,在专用 GPU 上推理最高提速 4 倍,单张 NVIDIA H100 上超过 1000 tokens/秒,RTX 5090 上超过 700 tokens/秒。

    推荐理由:官方给出 26B MoE 文本扩散模型的速度数据、硬件门槛与质量取舍,便于判断本地低并发场景是否值得尝试。