TII 推出 Falcon-ASR:1.6B 参数阿拉伯语语音识别模型
阿布扎比技术创新研究院(TII)发布 Falcon-ASR,一款 1.6B 参数的语音识别模型,重点覆盖阿联酋方言,同时支持英语、法语、西班牙语和葡萄牙语。在六个阿拉伯语测试集上平均 WER 为 20.92%,优于其参考榜单快照中最佳公开结果 23.17%;内部阿联酋方言评测中 WER 22.73%、CER 10.19%,比次优的 Qwen3-Omni 低 4.07 个百分点。
阿布扎比技术创新研究院(TII)发布 Falcon-ASR,一款 1.6B 参数的语音识别模型,重点覆盖阿联酋方言,同时支持英语、法语、西班牙语和葡萄牙语。在六个阿拉伯语测试集上平均 WER 为 20.92%,优于其参考榜单快照中最佳公开结果 23.17%;内部阿联酋方言评测中 WER 22.73%、CER 10.19%,比次优的 Qwen3-Omni 低 4.07 个百分点。
OpenAI 宣布 GPT-6 正在 ChatGPT 中面向全球上线,并同步引入 Intelligent UI。官方称新版本响应更快,提供可视化内容与可直接探索和使用的交互体验。
推荐理由:OpenAI 官方公布 GPT-6 在 ChatGPT 全球上线,并同步带来 Intelligent UI 的视觉与交互体验。
Liquid AI 开源 d1 决策模型家族的两个模型 d1-3B 和 d1-omni-600M(实验性),二者不生成 token,而是在单次前向传播中给出答案。
推荐理由:Liquid AI 公开两个决策模型,给出端侧延迟与七项基准对比,可据此判断小模型做结构化决策的可行性。
Google DeepMind 发布 EmbeddingGemma 2,一个基于 Gemma 4 架构、740M 参数的开源多模态嵌入模型,采用 Apache 2.0 许可,可把文本、图像、音频和视频映射到统一嵌入空间。
推荐理由:官方给出 740M 参数、模块化编码器与端侧内存占用,可据此判断本地多模态检索的落地成本。
Google 发布开源模型 EmbeddingGemma 2,可将文本、图像、视频、音频和代码转换为数值向量,参数量 740M,Google 称其在多模态嵌入基准上超越规模达其两倍的竞品。
Mistral AI 发布 Mistral Large 4 公开预览,可在 Mistral Studio 试用预览 API,权重将于本月底开放。该模型为 1 万亿参数、49B 激活参数的原生多模态模型,官方称其在编码、智能体工作流和多模态理解上表现突出,并在网络安全、金融、法律等企业场景中达到开源模型领先水平。
推荐理由:官方给出 1 万亿参数、49B 激活与多项基准对比,可据此判断开源权重模型在编码与智能体任务上的位置。
Reka AI 发布 19B 参数全能模型 Rho-1 的研究预览版,可在单一神经网络中处理并生成文本、图像、视频和机器人控制动作。与多数将任务分派给专用模型的系统不同,Rho-1 把所有模态作为 token 放在同一上下文窗口中运行,无需工具调用或外部模型。
Mistral 发布迄今最大模型 Mistral Large 4(ML4),总参数 1 万亿、激活 49B,原生多模态,已在 Mistral Studio 开放 API 预览,权重预计 10 月底发布。
法国 AI 实验室 Mistral AI 发布大型多模态模型 Mistral Large 4,参数规模达 1 万亿,绰号 Le Chonk,目前仅通过公开的 guardrail 端点访问,计划在安全测试完成后三周内开放权重。
AINews 汇总 9/24-9/25 的 AI 动态,指出 Opus 5.5 本周发布后社区反馈积极,尤其在用代码生成解说视频上表现突出。Opus 5.5 在 SimpleBench 上以 88.4% 领先,Terminal-Bench-Science 上从低推理档的 24% 升至 xhigh 档的 62%,但 max 档回落到 59%。
推荐理由:汇总 Opus 5.5 在视频生成与 Agent 任务上的社区反馈,并给出 Jev、Photon 等基础设施的实测数字。
上海人工智能实验室团队开源 Intern-Decision 系列多模态决策模型,包含 0.8B、2B 和 4B 三款,权重已在 Hugging Face 发布,代码和样例托管在 GitHub。
Runway 推出 GWM Worlds 2 研究预览,把高保真视频与音频生成变成实时交互式模拟,并提出新的输入格式 WorldPrompt,可固定环境部分要素(含首帧)后按时间戳设定事件与动作。
Liquid AI 发布实验性 DSpark 草稿模型 LFM2.5-VL-DSpark,为视觉语言模型 LFM2.5-VL-3B 加入推测解码路径。该草稿模型增加 280M 参数(约 8.9%),在设备端解码最高提速 3.13x、H100 上最高 2.66x,端到端最高提升 2.62x 和 2.27x,且不改变输出质量。
Hugging Face 推出 NeoMME 系列多模态多语言编码器,含 260M 和 800M 两个规模,用单个双向 Transformer 同时处理文本 token 与原始图像 patch,无需独立视觉塔或因果语言模型,并以掩码离散扩散目标从零训练。
Google DeepMind 发布 Gemini Omni 1.1 Flash,为开发者带来一批生成视频创作控制能力,通过 Gemini API 在 Google AI Studio 提供。
推荐理由:官方给出场景延展、首尾帧插值与 4K 上采样等具体能力与开放入口,可据此判断生成视频工作流的变化。
Google DeepMind 发布多语言手语转文本模型 SL2T,首次将手语 AI 带入消费产品,在 Pixel 11 的 Gboard 和 Live Transcribe 中支持美国手语(ASL)转英文听写,后续将扩展更多设备与语言。
推荐理由:官方披露 SL2T 的训练规模、手语到文本的翻译路径与隐私设计,可了解手语 AI 从实验室走向消费产品的技术取舍。
NVIDIA 发布 Magpie TTS Multilingual,一个 364M 参数的开源权重语音合成模型,支持英语、西班牙语、法语、德语、意大利语、越南语、普通话、印地语、日语以及新增的现代标准阿拉伯语、韩语和巴西葡萄牙语共 12 种语言,每种语言含男女声。
推荐理由:原文给出 364M 开源权重模型的多语言扩展与自托管延迟数据,可据此判断级联语音架构的部署取舍。
Meta 发布 Muse Glimmer,一个从 Muse 蒸馏到 30B 参数的多模态模型,采用 Apache 2.0 许可,面向本地智能体场景,如编码、文档分析和个人助理。
推荐理由:Meta 开源 30B 多模态模型,附完整基准对比与本地部署路径,可据此判断端侧智能体的可行性。
Mistral AI 发布 Shieldstral,一个 3B 开源权重多模态安全分类器,以 Apache 2.0 许可开放下载,可在单张 16GB NVIDIA GPU 上运行。它把内容审核建模为策略自适应的问答任务,推理时用自然语言写入策略即可返回校准后的安全分数,无需重新训练,统一处理文本与图像。官方称其在文本安全上可匹配最多 7 倍参数量的模型,并在多模态审核上取得新的 SOTA。
推荐理由:3B 开源安全分类器把内容审核变成推理时可换策略的问答任务,可据此判断小模型在审核场景的可用边界。
Google DeepMind 发布 Gemini Robotics ER 2,称其为面向机器人最强大的具身推理模型,可作为高层大脑让机器人对话、理解物理世界并规划多步任务,再把动作执行交给底层 VLA 模型,还能原生调用 Google Search 等工具。
推荐理由:官方给出 ER 2 在进度分类、时刻定位与多机器人协作上的具体指标和开放入口,可据此判断机器人大脑的能力边界。
Google DeepMind 发布 Gemini Robotics 2,作为新一代机器人的智能层,首次实现对完整人形机器人的全身控制,并带来更精细的手部与夹爪操作能力。
推荐理由:Gemini Robotics 2 把机器人控制从上半身扩展到全身,并给出多机协作与端侧快速适配的具体路径。
NVIDIA 推出 Cosmos-H-Dreams,一款面向手术机器人的实时、动作条件生成式仿真器,通过 FlashDreams 推理库在单张 RTX PRO 6000 GPU 上运行,支持人与策略闭环交互。
Google DeepMind 发布 Gemini 3.6 Flash、3.5 Flash-Lite 和面向网络安全的 3.5 Flash Cyber。
推荐理由:官方给出三款新模型的定价、token 效率与基准对比,可据此判断智能体工作流的成本与选型变化。
Thinking Machines Lab 在 Hugging Face 发布 Inkling 系列多模态大模型,Inkling 为约 1T 参数、41B 激活参数的 MoE 模型,原生支持图像、文本、音频输入,上下文窗口 1M,并推出 276B 总参数、12B 激活参数的 Inkling-Small。
推荐理由:原文给出 Inkling 的架构细节、部署配置与基准对比,读者可据此判断这一开源多模态模型的落地门槛。
Mistral AI 发布首个具身导航模型 Robostral Navigate,这是一个 8B 模型,仅用单个普通 RGB 相机、无需 LiDAR 或深度传感器,在 R2R-CE 验证集 unseen 上达到 76.6% 成功率,比最佳单相机方案高 9.7 个点,比使用深度或多相机的最佳系统高 4.5 个点。
推荐理由:官方给出单目 RGB 相机在 R2R-CE 上的成绩与训练方法,读者可据此判断具身导航的硬件门槛变化。
Google DeepMind 发布 Nano Banana 2 Lite(gemini-3.1-flash-lite-image)和 Gemini Omni Flash(gemini-omni-flash-preview)。
推荐理由:两款模型同时开放开发者入口,并给出延迟、单价与能力边界,便于判断图像与视频生成链路的成本取舍。
Mistral 发布 OCR 4,在提取文本之外返回边界框、块类型分类和逐页逐词置信度分数,支持 170 种语言、可单容器自托管部署。官方称独立标注者在 600 多份文档的盲评中平均 72% 更偏好 OCR 4,并在 OlmOCRBench 上取得 85.20 的最高总分。
推荐理由:官方给出 OCR 4 的边界框、块分类与置信度输出,以及自托管和按页计价方案,可据此判断文档解析管线的选型。
Google DeepMind 发布 Gemini 3.5 Live Translate,这是一款支持 70+ 语言的近实时语音到语音翻译音频模型,能自动检测语言并保留说话者的语调、节奏和音高。
推荐理由:官方给出 70+ 语言实时语音翻译的连续生成机制与多产品落地节奏,可据此判断实时翻译的可用边界。
Google DeepMind 发布 Gemma 4 12B,一款面向笔记本电脑的智能体多模态模型,介于边缘端 E4B 与 26B MoE 之间,是首个支持原生音频输入的中等规模 Gemma 模型。
推荐理由:Gemma 4 12B 用无编码器架构把视觉和音频直接接入 LLM,读者可据此判断本地多模态智能体的硬件门槛。
Google DeepMind 发布 Omni 家族首个模型 Gemini Omni Flash,可组合图像、音频、视频和文本作为输入生成高质量视频,并通过自然语言多轮对话编辑视频。
推荐理由:Gemini Omni Flash 把对话式视频编辑和多模态输入生成整合进 Gemini 应用与 YouTube Shorts,可据此判断视频创作流程的变化。
Google DeepMind 发布 Gemini 3.5 模型系列,首发的 3.5 Flash 面向智能体与编码任务,在 Terminal-Bench 2.1 取得 76.2%、GDPval-AA 取得 1656 Elo、MCP Atlas 取得 83.6%,多模态理解在 CharXiv Reasoning 上为 84.2%,输出速度是其他前沿模型的 4 倍。
推荐理由:官方给出 3.5 Flash 在编码与智能体基准上的具体分数和速度对比,可据此判断其能力定位。
Google DeepMind 发布 Gemini 3.1 Flash TTS,称其在可控性、表现力和语音质量上均有提升,在 Artificial Analysis TTS 榜单上取得 1,211 Elo 分数。
推荐理由:官方给出 Elo 1,211、70+ 语言与音频标签等具体指标,可据此判断语音生成的可控性提升。
Google DeepMind 发布 Gemini Robotics-ER 1.6,这是其面向机器人的推理优先模型升级版,重点增强空间推理与多视角理解,并新增仪表读数能力,可读取压力表、液位计和数字读数。
推荐理由:官方给出与前代及 Gemini 3.0 Flash 的对比,并首次加入仪表读数能力,可据此判断机器人在设施巡检中的自主程度。
Google DeepMind 发布 Gemma 4 开源模型家族,包含 E2B、E4B、26B MoE 和 31B Dense 四个尺寸,采用 Apache 2.0 许可。
推荐理由:Gemma 4 以四个尺寸覆盖从手机到工作站的部署,并给出 Arena 排名与 Apache 2.0 许可,便于判断开源模型的可用边界。
Mistral AI 发布 Mistral Small 4,这是 Mistral Small 系列的下一个重大版本,也是首个把 Magistral 的推理、Pixtral 的多模态和 Devstral 的智能体编码能力统一到单一模型的 Mistral 模型,采用 Apache 2.0 许可。
推荐理由:Mistral 把推理、多模态与编码智能体能力合并进单一开源模型,并给出可调推理强度与部署门槛。
Mistral AI 发布 Mistral OCR 3,在表单、扫描文档、复杂表格和手写内容上相对 Mistral OCR 2 的整体胜率为 74%,官方称其准确率超过企业级文档处理方案和 AI 原生 OCR 方案。
推荐理由:官方给出与上一代在表单、手写和复杂表格上的胜率对比,以及每千页定价,可据此判断文档解析成本与适用场景。
Mistral 发布 Mistral 3 系列,包括 14B、8B、3B 三个小尺寸稠密模型和迄今最强的 Mistral Large 3,后者为稀疏 MoE 架构,41B 激活参数、675B 总参数,全部以 Apache 2.0 许可开源。
推荐理由:Mistral 3 系列以 Apache 2.0 开源并给出参数与部署路径,读者可据此判断开源前沿模型的可用边界。
Mistral AI 发布 Mistral Medium 3,称其在各项基准上达到或超过 Claude Sonnet 3.7 的 90%,成本为每百万 token 输入 0.4 美元、输出 2 美元。
推荐理由:官方给出 Mistral Medium 3 的定价、对标基准与部署门槛,可据此判断企业自部署的成本与可行性。
Mistral AI 发布 Mistral Small 3.1,在 Mistral Small 3 基础上提升文本性能、多模态理解,并将上下文窗口扩展至 128k tokens,以 Apache 2.0 许可开源。
推荐理由:官方给出 Mistral Small 3.1 的多模态与长上下文能力及开源许可,读者可据此判断小模型在端侧与私有部署中的可用性。