TII 推出 Falcon-ASR:1.6B 参数阿拉伯语语音识别模型
阿布扎比技术创新研究院(TII)发布 Falcon-ASR,一款 1.6B 参数的语音识别模型,重点覆盖阿联酋方言,同时支持英语、法语、西班牙语和葡萄牙语。在六个阿拉伯语测试集上平均 WER 为 20.92%,优于其参考榜单快照中最佳公开结果 23.17%;内部阿联酋方言评测中 WER 22.73%、CER 10.19%,比次优的 Qwen3-Omni 低 4.07 个百分点。
阿布扎比技术创新研究院(TII)发布 Falcon-ASR,一款 1.6B 参数的语音识别模型,重点覆盖阿联酋方言,同时支持英语、法语、西班牙语和葡萄牙语。在六个阿拉伯语测试集上平均 WER 为 20.92%,优于其参考榜单快照中最佳公开结果 23.17%;内部阿联酋方言评测中 WER 22.73%、CER 10.19%,比次优的 Qwen3-Omni 低 4.07 个百分点。
Anthropic 发布 Claude Haiku 5.5,这是 Haiku 系列约一年来的首次更新,定价与 OpenAI 的 GPT-6 Luna 持平,官方称其平均运行成本比 Haiku 4.5 低约 75%。
推荐理由:汇总了 Haiku 5.5 的定价、第三方评测与 token 消耗数据,便于判断小模型在智能体工作流中的成本取舍。
Anthropic 发布 Claude Haiku 5.5,这是其迄今最快、最便宜的小模型,平均价格比 Haiku 4.5 低约 75%,10 万 token 以内提示词的价格降幅最高达 90%,超过 10 万 token 则贵 5 倍。
推荐理由:对比 Haiku 4.5 与 GPT-6 Luna 的基准和分档定价,可看清小模型在成本敏感任务上的取舍。
OpenAI 面向所有 ChatGPT 用户推出 GPT-6,并带来名为 Intelligent UI 的新功能,模型以图形、按钮、图表和表单等交互界面呈现答案,而非纯文本,格式会随问题自动调整。
OpenAI 宣布 GPT-6 正在 ChatGPT 中面向全球上线,并同步引入 Intelligent UI。官方称新版本响应更快,提供可视化内容与可直接探索和使用的交互体验。
推荐理由:OpenAI 官方公布 GPT-6 在 ChatGPT 全球上线,并同步带来 Intelligent UI 的视觉与交互体验。
Liquid AI 开源 d1 决策模型家族的两个模型 d1-3B 和 d1-omni-600M(实验性),二者不生成 token,而是在单次前向传播中给出答案。
推荐理由:Liquid AI 公开两个决策模型,给出端侧延迟与七项基准对比,可据此判断小模型做结构化决策的可行性。
Mistral 表示其新模型 Le Chonk 能够与顶级闭源模型竞争,同时保持开放权重。
Musubi 发布轻量决策模型 PolicyLM-1.7B,以开放权重形式公开,可将纯英文写成的内容政策在 50 毫秒内应用到消息上。该模型定位与主流社交平台的 AI 分类器在成本和速度上相近,但具备现代 LLM 的灵活性,无需专门训练即可执行复杂政策,政策变更时也不必重新训练。Musubi 联合创始人兼首席 AI 官 Filip Jankovic 表示,这让平台管理者可以主动为内容打标签。
Mistral 发布 Mistral Large 4 预览版,这是一个 1 万亿参数、490 亿激活参数的模型,在自有 3,800 块 NVIDIA Grace Blackwell GPU 集群上训练,目前通过其 API 提供。
Google DeepMind 发布 EmbeddingGemma 2,一个基于 Gemma 4 架构、740M 参数的开源多模态嵌入模型,采用 Apache 2.0 许可,可把文本、图像、音频和视频映射到统一嵌入空间。
推荐理由:官方给出 740M 参数、模块化编码器与端侧内存占用,可据此判断本地多模态检索的落地成本。
Google 发布图像生成与编辑模型 Nano Banana 2.1,取代 2026 年 2 月发布的 Nano Banana 2,官方称其在各方面均有提升。价格约为上一代一半,1K 图像从 6.70 美分降至 3.36 美分,4K 从 15.10 美分降至 7.56 美分。
Google 发布开源模型 EmbeddingGemma 2,可将文本、图像、视频、音频和代码转换为数值向量,参数量 740M,Google 称其在多模态嵌入基准上超越规模达其两倍的竞品。
Reflection 发布 Beam,一个面向编码、智能体与科研的纯文本 MoE 模型,总参数 501B、激活 23B,从零训练,Apache 2.0 全量权重预计本月放出。
推荐理由:Reflection 从隐身状态发布 501B 开源权重模型,并给出预训练与 RL 的算力、数据细节,可对照同期中美开源模型格局。
Mistral AI 发布 Mistral Large 4 公开预览,可在 Mistral Studio 试用预览 API,权重将于本月底开放。该模型为 1 万亿参数、49B 激活参数的原生多模态模型,官方称其在编码、智能体工作流和多模态理解上表现突出,并在网络安全、金融、法律等企业场景中达到开源模型领先水平。
推荐理由:官方给出 1 万亿参数、49B 激活与多项基准对比,可据此判断开源权重模型在编码与智能体任务上的位置。
基于 Falcon-H1-Arabic 构建的 Falcon-Emirati-7B 是一款专攻阿联酋方言的 7B 模型,目标是以母语者的方式理解和生成 Emirati Arabic 的词汇、语气与文化语境。
Reka AI 发布 19B 参数全能模型 Rho-1 的研究预览版,可在单一神经网络中处理并生成文本、图像、视频和机器人控制动作。与多数将任务分派给专用模型的系统不同,Rho-1 把所有模态作为 token 放在同一上下文窗口中运行,无需工具调用或外部模型。
AI 公司 Reflection 发布首个免费开放模型 Beam,面向编码、逻辑推理和智能体任务,采用 MoE 架构,每 token 激活 5010 亿总参数中的 230 亿。
Mistral 发布迄今最大模型 Mistral Large 4(ML4),总参数 1 万亿、激活 49B,原生多模态,已在 Mistral Studio 开放 API 预览,权重预计 10 月底发布。
Reflection AI 正式发布其首个前沿开源权重模型 Beam,称在高级推理基准上匹配领先中国开源模型的性能,且推理成本大幅更低。Beam 是文本 MoE 模型,总参数 5010 亿、激活 230 亿,预训练使用 23.8 万亿 token,上下文窗口 100 万 token;公司称其得分与 Z.ai 的 GLM-5.2 持平,并使用少 3-4 倍的推理算力。
法国 AI 实验室 Mistral AI 发布大型多模态模型 Mistral Large 4,参数规模达 1 万亿,绰号 Le Chonk,目前仅通过公开的 guardrail 端点访问,计划在安全测试完成后三周内开放权重。
Ai2 开源 AstaBrief 8B,一个把研究问题和检索到的文献片段转成带引用报告的模型,基于 Qwen3-8B 训练,已在 Asta 的 Generate a report 功能中作为 Fast 模式上线,与 Claude 驱动的 Thinking 模式并存。
推荐理由:原文给出了从 Qwen3-8B 出发的 SFT 加 DPO 训练配方与数据过滤经验,可迁移到其他科学报告生成场景。
Google DeepMind 发布 Gemini 4 Argon,面向编码、企业知识工作和网络防御,首批开放给政府用户与 Fairwind 计划中的可信网络防御者,开发者、企业和消费者访问时间未定。
推荐理由:汇总 Gemini 4 Argon 的基准、定价与内部部署数据,并列出外界对公布数字的质疑。
Google 宣布推出 Gemini 4 Argon AI 模型,但目前用户还无法使用。此前外界预期的 Gemini 3.5 Pro 并未出现。
Google DeepMind 发布新前沿模型 Gemini 4 Argon,先通过 Fairwind Program 向受信任的网络安全防御方开放,随后逐步扩展至开发者、企业和消费者,起步价每百万输入 token 2 美元、输出 token 10 美元,缓存输入按输入价 95% 折扣计费。
推荐理由:官方给出 Argon 在编码、企业知识与网络安全上的基准表现和分阶段开放路径,可据此判断前沿模型的能力边界与发布节奏。
AWS 宣布 Claude Sonnet 5.5 在 Amazon Bedrock 和 AWS 上的 Claude Platform 上线,定位为面向编码与知识工作的更高效 Sonnet 模型,多数任务单任务成本更低、速度更快。
推荐理由:原文给出 Sonnet 5.5 在 Bedrock 上的能力定位与调用方式,读者可据此判断它和 Opus 5.5 的分工。
OpenAI 在 DevDay 上发布 GPT-6.1 Sol,称其在智能体编码、计算机使用和专业工作上接近 GPT-6 Astra 的智能水平,标准输入输出 token 价格仅为后者的五分之一。
推荐理由:OpenAI 在 DevDay 发布 GPT-6.1 Sol,并披露 GPT-6.1 Astra 因内部测试的安全问题被搁置,读者可据此了解其能力定位与定价策略。
Simon Willison 发文点评 GPT 6.1 Sol,称其以五分之一的价格实现接近 Astra 的智能水平。该文于 2026 年 9 月 29 日发布,归类于 OpenAI、生成式 AI 与大语言模型等标签下。
OpenAI 发布 GPT-6.1 Sol,称其在智能体编码、计算机使用和办公任务上接近因安全问题推迟发布的旗舰模型 GPT-6.1 Astra,成本约为后者的五分之一。
推荐理由:OpenAI 用低价模型补位延期旗舰,读者可据此比较同价位模型的成本与能力取舍。
NVIDIA 发布开源表格基础模型 Kumo Tabular,属于 Kumo Structured 模型系列,已上线 Hugging Face,可在单次前向传播中完成分类与回归预测,无需训练、调参和特征工程。
推荐理由:NVIDIA 开源表格基础模型,无需训练和特征工程即可单次前向预测,并给出四个基准的排名与效率对比。
OpenAI 发布 GPT-6.1 Sol,定位为面向编码、电脑操作和专业工作的接近 Astra 的智能水平,标准 API 输入与输出 token 价格均为 Astra 的五分之一。
推荐理由:OpenAI 发布 GPT-6.1 Sol,给出与 Astra 的价格对比和面向编码、电脑操作的能力定位。
至知创新研究院 IQuest Research 发布 IQuest-Q1 模型,采用 decoder-only Transformer 主干与稀疏 MoE 架构,总参数约 320B、激活参数约 15B。
Anthropic 发布 Claude Sonnet 5.5,在 Terminal-Bench 4.0 上从上一代 Sonnet 5 的 10.3% 提升到 70.6%,超过上周 Opus 5.5 的 66.4%。
推荐理由:Sonnet 5.5 在多项基准上逼近 Opus 5.5,同时价格只有一半,读者可据此判断中端模型的性价比变化。
Anthropic 发布新 Sonnet 模型 Claude Sonnet 5.5,官方称其运行速度快 30% 以上、多数工作成本最多降低 30%,定价与 Sonnet 5 相同但在各项基准上均优于 Sonnet 5。
推荐理由:作者用同一组鹈鹕提示词实测新 Sonnet,并对比免费层与 ChatGPT 的能力差异。
上海人工智能实验室团队开源 Intern-Decision 系列多模态决策模型,包含 0.8B、2B 和 4B 三款,权重已在 Hugging Face 发布,代码和样例托管在 GitHub。
H 公司发布 Holo4 系列智能体模型,包含 27B 稠密版和 35B-A3B MoE 版,两者均已在 H Models API 上线,权重以 BF16、FP8、NVFP4 和 4-bit GGUF 格式开源在 Hugging Face。
推荐理由:Holo4 同时覆盖 GUI、代码、MCP 与 API 四种接口,并公开全部评测轨迹,读者可据此判断通用计算机操作智能体的成本与能力边界。
Liquid AI 发布实验性 DSpark 草稿模型 LFM2.5-VL-DSpark,为视觉语言模型 LFM2.5-VL-3B 加入推测解码路径。该草稿模型增加 280M 参数(约 8.9%),在设备端解码最高提速 3.13x、H100 上最高 2.66x,端到端最高提升 2.62x 和 2.27x,且不改变输出质量。
Anthropic 发布 Claude Opus 5.5,称其为新 Claude 5.5 系列首个模型,多数任务达到 Claude Fable 5.1 水平,运行成本比 Opus 5 低 40%,并成为 Claude Code 与 Claude 应用的默认模型。
推荐理由:同一天两家实验室分别发布新模型并大幅下调 API 价格,读者可据此比较能力与成本取舍。
OpenAI 发布 GPT-6 Sol 和 Luna 两款模型,将前沿智能带入日常工作,并在能力与成本上提供不同取舍。
推荐理由:OpenAI 一次推出两款 GPT-6 模型,读者可据此了解其在能力与成本上的不同定位。
小米发布 MiMo-V2.6 系列,包含原生全模态的 MiMo-V2.6-Pro 与 MiMo-V2.6-Flash,并推出输出速度最高提升 20 倍的 MiMo-V2.6-Pro-UltraSpeed。
推荐理由:小米首次进入前沿开源模型序列,其 RL 环境与训练配方开源,为观察后训练成本路线提供了具体样本。
TypeSafe AI 上周发布 Jev,这是其称为 System One 模型(Simon Willison 更倾向叫决策模型)的新类别模型:输入文本,输出对应类别的浮点数、是/否判断、评分及置信度。