跳到正文

技术方向

多模态 最新动态

文本之外的能力:视觉理解、图文混合、音视频输入输出的模型与产品进展。

47 条精选近 30 天 9 条共收录 84 条

更新

精选归档 · 第 2 页

7月15日周三第 21–40 条
  1. Hugging Face Blog85

    Thinking Machines 在 Hugging Face 发布 Inkling 及 Inkling-Small 多模态模型

    Thinking Machines Lab 在 Hugging Face 发布 Inkling 系列多模态大模型,Inkling 为约 1T 参数、41B 激活参数的 MoE 模型,原生支持图像、文本、音频输入,上下文窗口 1M,并推出 276B 总参数、12B 激活参数的 Inkling-Small。

    推荐理由:原文给出 Inkling 的架构细节、部署配置与基准对比,读者可据此判断这一开源多模态模型的落地门槛。

7月9日周四
  1. Google Research60

    Google 发布 SensorFM:面向可穿戴健康数据的通用基础模型

    Google Research 发布 SensorFM,一个直接从无标注可穿戴数据学习的大型传感器基础模型,预训练语料超过一万亿分钟多模态信号,来自五百万名同意参与者。

    推荐理由:Google 用一万亿分钟可穿戴数据预训练通用生理表征,读者可了解基础模型在健康领域的规模化路径。

7月8日周三
  1. Mistral AI66

    Mistral AI 发布 Robostral Navigate 具身导航模型

    Mistral AI 发布首个具身导航模型 Robostral Navigate,这是一个 8B 模型,仅用单个普通 RGB 相机、无需 LiDAR 或深度传感器,在 R2R-CE 验证集 unseen 上达到 76.6% 成功率,比最佳单相机方案高 9.7 个点,比使用深度或多相机的最佳系统高 4.5 个点。

    推荐理由:官方给出单目 RGB 相机在 R2R-CE 上的成绩与训练方法,读者可据此判断具身导航的硬件门槛变化。

7月1日周三
6月23日周二
  1. Mistral AI62

    Mistral 发布 OCR 4 文档解析模型

    Mistral 发布 OCR 4,在提取文本之外返回边界框、块类型分类和逐页逐词置信度分数,支持 170 种语言、可单容器自托管部署。官方称独立标注者在 600 多份文档的盲评中平均 72% 更偏好 OCR 4,并在 OlmOCRBench 上取得 85.20 的最高总分。

    推荐理由:官方给出 OCR 4 的边界框、块分类与置信度输出,以及自托管和按页计价方案,可据此判断文档解析管线的选型。

6月9日周二
6月5日周五
5月18日周一
  1. Google DeepMind62

    Google DeepMind 为 Project Genie 加入 Street View 真实地点生成能力

    Google DeepMind 在实验性原型 Project Genie 中上线 Street View 真实影像锚定能力,用户可在地图上选择美国地点并搭配风格与角色描述,生成以真实地点为起点的可交互世界。

    推荐理由:官方说明 Genie 接入 Street View 真实影像,读者可了解世界模型如何以真实地点为锚点生成可交互环境。

  2. Google DeepMind82

    Google DeepMind 发布 Gemini Omni Flash,支持多模态输入生成与对话式视频编辑

    Google DeepMind 发布 Omni 家族首个模型 Gemini Omni Flash,可组合图像、音频、视频和文本作为输入生成高质量视频,并通过自然语言多轮对话编辑视频。

    推荐理由:Gemini Omni Flash 把对话式视频编辑和多模态输入生成整合进 Gemini 应用与 YouTube Shorts,可据此判断视频创作流程的变化。

5月17日周日
  1. Google DeepMind62

    Google 将 SynthID 与 C2PA 内容验证扩展到搜索、Gemini 和 Chrome

    Google 扩展内容透明度与验证工具,把 SynthID 的图像、视频和音频验证从 Gemini 应用带到搜索,并将在未来几周进入 Chrome;该验证功能在 Gemini 中已被使用 5000 万次。

    推荐理由:Google 把 SynthID 与 C2PA 验证铺到搜索、Gemini 和 Chrome,读者可据此了解内容溯源工具的落地范围。

5月16日周六
  1. Google DeepMind87

    Google DeepMind 发布 Gemini 3.5 Flash,主打智能体与编码

    Google DeepMind 发布 Gemini 3.5 模型系列,首发的 3.5 Flash 面向智能体与编码任务,在 Terminal-Bench 2.1 取得 76.2%、GDPval-AA 取得 1656 Elo、MCP Atlas 取得 83.6%,多模态理解在 CharXiv Reasoning 上为 84.2%,输出速度是其他前沿模型的 4 倍。

    推荐理由:官方给出 3.5 Flash 在编码与智能体基准上的具体分数和速度对比,可据此判断其能力定位。

4月30日周四
  1. Google DeepMind62

    Google DeepMind 发布 AI co-clinician 医疗 AI 研究计划

    Google DeepMind 宣布 AI co-clinician 研究计划,探索 AI 智能体在医生临床监督下协助患者诊疗的“三方照护”模式。在 98 个真实初级保健问题的盲评中,该系统 97 例无关键错误,医生对其回答的偏好高于现有证据综合工具;在 140 项问诊技能评估中,AI 在 68 项上达到或超过初级保健医生水平,但识别危险信号和指导关键体格检查仍不如专家医生。

    推荐理由:Google DeepMind 公布 AI co-clinician 研究计划,用医生盲评和模拟问诊数据说明医疗智能体当前的能力边界。

4月16日周四
4月13日周一
  1. Google DeepMind71

    Google DeepMind 发布 Gemini Robotics-ER 1.6,新增仪表读数能力

    Google DeepMind 发布 Gemini Robotics-ER 1.6,这是其面向机器人的推理优先模型升级版,重点增强空间推理与多视角理解,并新增仪表读数能力,可读取压力表、液位计和数字读数。

    推荐理由:官方给出与前代及 Gemini 3.0 Flash 的对比,并首次加入仪表读数能力,可据此判断机器人在设施巡检中的自主程度。

4月3日周五
3月29日周日
  1. Google DeepMind62

    Google DeepMind 为 AI 时代重新设计鼠标指针,Chrome 已上线 Gemini 指向交互

    Google DeepMind 公布 AI 指针的四条交互原则,并展示由 Gemini 驱动的实验性指针演示,用户可在 Google AI Studio 中通过指向和语音编辑图片或查找地点。

    推荐理由:Google DeepMind 公开 AI 指针的四条交互原则,并已在 Chrome 落地,读者可据此判断 AI 交互从提示词转向指向与语音的路径。

3月25日周三
  1. Google Research62

    Google 发布 Vibe Coding XR:用 Gemini 和 XR Blocks 把自然语言变成 Android XR 应用

    Google 发布 Vibe Coding XR 工作流,将 Gemini 与基于 WebXR、three.js、LiteRT.js 的 XR Blocks 框架结合,把自然语言提示词直接转成具备物理感知的 Android XR 应用,耗时不到 60 秒。

    推荐理由:Google 把 Gemini 的长上下文推理接到 WebXR 框架上,读者可据此判断自然语言生成 XR 原型的可行边界。

3月18日周三