跳到正文
  1. 量子位84

    AMD 以 82 亿美元全股票收购李飞飞 World Labs

    AMD 宣布以 82 亿美元全股票收购李飞飞的 World Labs,交易预计 2026 年底前完成,仍须取得监管批准。交割后李飞飞将加入 AMD 担任执行副总裁兼首席科学家,直接向苏姿丰汇报,联合创始人 Justin Johnson 和 Ben Mildenhall 继续带领团队并入 AMD。

    推荐理由:交易金额、估值倍数与投资方回报结构都有具体数字,可据此观察芯片厂商布局世界模型的路径。

  1. Microsoft Research62

    微软研究院:将物理 AI 推理卸载到边缘或云端可提升机器人性能与续航

    微软研究院对移动操作机器人工作负载做了系统性测量,发现把物理 AI 推理从机器人端侧 GPU 卸载到边缘或云端 GPU,可提升任务成功率、支持更大模型并延长续航。

    推荐理由:微软研究院系统测量了机器人端侧推理的瓶颈,并给出可复用的 Kubernetes 卸载方案与开源工具链。

  1. NVIDIA Blog62

    NVIDIA 发布 Isaac ROS 5.0,推进智能体化开源机器人开发

    NVIDIA 在加拿大多伦多 ROSCon 大会上发布 Isaac ROS 5.0,这是一套基于 ROS 的 GPU 加速软件包集合,新增智能体工作流与平台支持。

    推荐理由:Isaac ROS 5.0 把智能体工作流引入机器人开发,并给出多家厂商的落地案例,可据此判断开源机器人栈的演进方向。

  1. Google DeepMind71

    Google DeepMind 发布 Gemini Robotics ER 2 具身推理模型

    Google DeepMind 发布 Gemini Robotics ER 2,称其为面向机器人最强大的具身推理模型,可作为高层大脑让机器人对话、理解物理世界并规划多步任务,再把动作执行交给底层 VLA 模型,还能原生调用 Google Search 等工具。

    推荐理由:官方给出 ER 2 在进度分类、时刻定位与多机器人协作上的具体指标和开放入口,可据此判断机器人大脑的能力边界。

  1. Google DeepMind80

    Google DeepMind 发布 Gemini Robotics 2,为机器人带来全身智能

    Google DeepMind 发布 Gemini Robotics 2,作为新一代机器人的智能层,首次实现对完整人形机器人的全身控制,并带来更精细的手部与夹爪操作能力。

    推荐理由:Gemini Robotics 2 把机器人控制从上半身扩展到全身,并给出多机协作与端侧快速适配的具体路径。

  1. Hugging Face Blog62

    Hugging Face 发布 Grabette:开源机器人操作数据采集系统

    Hugging Face 发布 Grabette,一套开源低成本的手持夹爪系统,用于录制机器人操作演示数据。Grabette 配备广角鱼眼相机与 RGBD 相机,BOM 成本约 490€,配套的机器人端夹爪 Gripette 成本约 120€。

    推荐理由:原文给出了一套低成本手持夹爪采集方案与浏览器端处理流程,读者可据此判断机器人操作数据的采集门槛变化。

  1. Mistral AI66

    Mistral AI 发布 Robostral Navigate 具身导航模型

    Mistral AI 发布首个具身导航模型 Robostral Navigate,这是一个 8B 模型,仅用单个普通 RGB 相机、无需 LiDAR 或深度传感器,在 R2R-CE 验证集 unseen 上达到 76.6% 成功率,比最佳单相机方案高 9.7 个点,比使用深度或多相机的最佳系统高 4.5 个点。

    推荐理由:官方给出单目 RGB 相机在 R2R-CE 上的成绩与训练方法,读者可据此判断具身导航的硬件门槛变化。

  1. Hugging Face Blog75

    LeRobot v0.6.0 发布:世界模型策略、奖励模型与六大仿真基准

    Hugging Face 发布 LeRobot v0.6.0,围绕机器人学习闭环引入世界模型策略(VLA-JEPA、FastWAM、LingBot-VA)、新一批 VLA(GR00T N1.7、MolmoAct2、EO-1、EVO1、Multitask DiT)以及统一的奖励模型 API(Robometer、TOPReward)。

    推荐理由:LeRobot v0.6.0 把世界模型策略、奖励模型与统一评测串成闭环,读者可据此判断开源机器人学习栈的当前边界。

  1. Google DeepMind71

    Google DeepMind 发布 Gemini Robotics-ER 1.6,新增仪表读数能力

    Google DeepMind 发布 Gemini Robotics-ER 1.6,这是其面向机器人的推理优先模型升级版,重点增强空间推理与多视角理解,并新增仪表读数能力,可读取压力表、液位计和数字读数。

    推荐理由:官方给出与前代及 Gemini 3.0 Flash 的对比,并首次加入仪表读数能力,可据此判断机器人在设施巡检中的自主程度。

已经到底了