跳到正文

内容形态

模型发布 最新动态

新模型的发布、开源与迭代:大模型厂商的旗舰更新、开源权重放出、性能与价格变化的第一时间记录。

66 条精选近 30 天 22 条共收录 91 条

更新

精选归档 · 第 2 页

9月22日周二第 21–40 条
9月16日周三
9月10日周四
9月9日周三
9月3日周四
  1. Google DeepMind80

    Google DeepMind 发布 Gemini 3.8 Flash 与 3.8 Flash Cyber

    Google DeepMind 发布 Gemini 3.8 Flash 和 Gemini 3.8 Flash Cyber 两款模型,前者面向长时程编码与自主智能体,后者面向漏洞发现与自动修补。

    推荐理由:官方给出两款 Flash 新模型的基准表现、定价与开放渠道,可据此判断长时程编码与网络安全任务的成本取舍。

8月28日周五
8月27日周四
8月25日周二
8月14日周五
8月12日周三
  1. Google DeepMind71

    Google DeepMind 发布 SL2T 手语转文本模型,率先落地 Pixel 11 的 Gboard 与 Live Transcribe

    Google DeepMind 发布多语言手语转文本模型 SL2T,首次将手语 AI 带入消费产品,在 Pixel 11 的 Gboard 和 Live Transcribe 中支持美国手语(ASL)转英文听写,后续将扩展更多设备与语言。

    推荐理由:官方披露 SL2T 的训练规模、手语到文本的翻译路径与隐私设计,可了解手语 AI 从实验室走向消费产品的技术取舍。

8月10日周一
8月6日周四
  1. Google DeepMind78

    Google DeepMind 发布 WeatherNext 气旋预报模型并开源

    Google DeepMind 在 Nature 发表论文,称 WeatherNext AI 模型在气旋路径、强度和风场结构预报上达到 SOTA,平均多出一天预报提前量,三天预报精度相当于此前模型的两天水平。

    推荐理由:原文给出气旋路径与强度预报的领先幅度和开源范围,读者可据此判断气象预报模型的进展与可用性。

8月4日周二
  1. Mistral AI66

    Mistral AI 发布 Shieldstral:3B 开源多模态安全分类器

    Mistral AI 发布 Shieldstral,一个 3B 开源权重多模态安全分类器,以 Apache 2.0 许可开放下载,可在单张 16GB NVIDIA GPU 上运行。它把内容审核建模为策略自适应的问答任务,推理时用自然语言写入策略即可返回校准后的安全分数,无需重新训练,统一处理文本与图像。官方称其在文本安全上可匹配最多 7 倍参数量的模型,并在多模态审核上取得新的 SOTA。

    推荐理由:3B 开源安全分类器把内容审核变成推理时可换策略的问答任务,可据此判断小模型在审核场景的可用边界。

7月30日周四
  1. Google DeepMind71

    Google DeepMind 发布 Gemini Robotics ER 2 具身推理模型

    Google DeepMind 发布 Gemini Robotics ER 2,称其为面向机器人最强大的具身推理模型,可作为高层大脑让机器人对话、理解物理世界并规划多步任务,再把动作执行交给底层 VLA 模型,还能原生调用 Google Search 等工具。

    推荐理由:官方给出 ER 2 在进度分类、时刻定位与多机器人协作上的具体指标和开放入口,可据此判断机器人大脑的能力边界。

  2. Google DeepMind60

    Google DeepMind 在 Google Flow Music 发布 Lyria 3.5 音乐生成模型

    Google DeepMind 发布音乐生成模型 Lyria 3.5,并在 Google Flow Music 中上线。官方称新版本在音乐性、歌词和人声质量上有明显提升,可生成更复杂自然的旋律结构、提示词遵循度和结构感知更好的歌词,以及更具情感表达和发音更准确的人声,同时支持更便捷地控制输出节奏与时长。

    推荐理由:官方给出 Lyria 3.5 在旋律、歌词、人声与节奏时长控制上的具体改进,可据此判断音乐生成能力的变化。

7月28日周二
7月21日周二
7月17日周五
7月15日周三
  1. Hugging Face Blog85

    Thinking Machines 在 Hugging Face 发布 Inkling 及 Inkling-Small 多模态模型

    Thinking Machines Lab 在 Hugging Face 发布 Inkling 系列多模态大模型,Inkling 为约 1T 参数、41B 激活参数的 MoE 模型,原生支持图像、文本、音频输入,上下文窗口 1M,并推出 276B 总参数、12B 激活参数的 Inkling-Small。

    推荐理由:原文给出 Inkling 的架构细节、部署配置与基准对比,读者可据此判断这一开源多模态模型的落地门槛。

7月8日周三
  1. Mistral AI66

    Mistral AI 发布 Robostral Navigate 具身导航模型

    Mistral AI 发布首个具身导航模型 Robostral Navigate,这是一个 8B 模型,仅用单个普通 RGB 相机、无需 LiDAR 或深度传感器,在 R2R-CE 验证集 unseen 上达到 76.6% 成功率,比最佳单相机方案高 9.7 个点,比使用深度或多相机的最佳系统高 4.5 个点。

    推荐理由:官方给出单目 RGB 相机在 R2R-CE 上的成绩与训练方法,读者可据此判断具身导航的硬件门槛变化。