Anthropic 发布 Claude Haiku 5.5,定价对齐 GPT-6 Luna
Anthropic 发布 Claude Haiku 5.5,这是 Haiku 系列约一年来的首次更新,定价与 OpenAI 的 GPT-6 Luna 持平,官方称其平均运行成本比 Haiku 4.5 低约 75%。
推荐理由:汇总了 Haiku 5.5 的定价、第三方评测与 token 消耗数据,便于判断小模型在智能体工作流中的成本取舍。
Anthropic 发布 Claude Haiku 5.5,这是 Haiku 系列约一年来的首次更新,定价与 OpenAI 的 GPT-6 Luna 持平,官方称其平均运行成本比 Haiku 4.5 低约 75%。
推荐理由:汇总了 Haiku 5.5 的定价、第三方评测与 token 消耗数据,便于判断小模型在智能体工作流中的成本取舍。
Anthropic 发布 Claude Haiku 5.5,这是其迄今最快、最便宜的小模型,平均价格比 Haiku 4.5 低约 75%,10 万 token 以内提示词的价格降幅最高达 90%,超过 10 万 token 则贵 5 倍。
推荐理由:对比 Haiku 4.5 与 GPT-6 Luna 的基准和分档定价,可看清小模型在成本敏感任务上的取舍。
Google DeepMind 发布 Gemini 4 Argon,面向编码、企业知识工作和网络防御,首批开放给政府用户与 Fairwind 计划中的可信网络防御者,开发者、企业和消费者访问时间未定。
推荐理由:汇总 Gemini 4 Argon 的基准、定价与内部部署数据,并列出外界对公布数字的质疑。
OpenAI 发布 GPT-6.1 Sol,称其在智能体编码、计算机使用和办公任务上接近因安全问题推迟发布的旗舰模型 GPT-6.1 Astra,成本约为后者的五分之一。
推荐理由:OpenAI 用低价模型补位延期旗舰,读者可据此比较同价位模型的成本与能力取舍。
AINews 汇总 9/24-9/25 的 AI 动态,指出 Opus 5.5 本周发布后社区反馈积极,尤其在用代码生成解说视频上表现突出。Opus 5.5 在 SimpleBench 上以 88.4% 领先,Terminal-Bench-Science 上从低推理档的 24% 升至 xhigh 档的 62%,但 max 档回落到 59%。
推荐理由:汇总 Opus 5.5 在视频生成与 Agent 任务上的社区反馈,并给出 Jev、Photon 等基础设施的实测数字。
Anthropic 发布 Claude Sonnet 5.5,在 Terminal-Bench 4.0 上从上一代 Sonnet 5 的 10.3% 提升到 70.6%,超过上周 Opus 5.5 的 66.4%。
推荐理由:Sonnet 5.5 在多项基准上逼近 Opus 5.5,同时价格只有一半,读者可据此判断中端模型的性价比变化。
Anthropic 发布 Claude Opus 5.5,称其为新 Claude 5.5 系列首个模型,多数任务达到 Claude Fable 5.1 水平,运行成本比 Opus 5 低 40%,并成为 Claude Code 与 Claude 应用的默认模型。
推荐理由:同一天两家实验室分别发布新模型并大幅下调 API 价格,读者可据此比较能力与成本取舍。
Anthropic 发布 Claude Opus 5.5,约一小时后 OpenAI 发布 GPT-6 Sol 和 GPT-6 Luna。
推荐理由:作者实测新模型并整理价格表,读者可据此判断这一轮降价对模型选型的影响。