Google 研究 AgentHands:为 XR 智能体对话生成空间化手势
Google 在 CHI 2026 发布研究原型 AgentHands,可将 LLM 的高层推理映射为 XR 中与语音同步的手势,让智能体在 3D 空间里边说边演示。
Google 在 CHI 2026 发布研究原型 AgentHands,可将 LLM 的高层推理映射为 XR 中与语音同步的手势,让智能体在 3D 空间里边说边演示。
Multiverse Computing 发布论文《Quantization-Aware Healing: A Practical Recipe for Recovering Compressed, 4-Bit LLMs》,提出 QAH 方法:在结构压缩并量化后,直接从压缩前的原始全精度模型蒸馏,而不是从恢复出的 bfloat16 checkpoint 蒸馏。
推荐理由:论文给出压缩加量化后从原始模型蒸馏的修复方案,并附9项基准对比,可看方法差异与代价。
METR 研究显示 AI 对科学的加速并不均衡:2026 年网络安全漏洞报告速度较 2025 年大幅加快,数学领域贡献有限,AI 研究本身则未见可测量的加速。多校团队提出 SPADE,通过自博弈让 LLM 交替生成可执行训练环境并求解,在 Qwen3-30B-A3B 上游戏环境套件均分达 58.3,较基线提升 8.1。
Google 推出 Biomarker Discovery Framework,一个在人类监督下将候选生物标志物优先级排序结构化为迭代研究循环的多智能体系统,结合假设生成、并行统计分析、模型训练、对抗验证与文献推理。
Google Research 提出 ME-POIs 框架,将匿名化移动性模式(到达时间、停留时长、周边移动)与文本描述结合,为地点生成同时编码身份与动态功能的嵌入向量。在公开基准上,该方法使访问意图预测相对提升最高 81.9%,价格水平分类提升 75.1%,繁忙度估计准确率提升 24.7%。框架通过访问对齐、空间多尺度访问传播和文本-移动性协同三步流程,缓解稀疏地点数据不足问题。
Hugging Face 发布研究,提出共识分歧探针、掩蔽实体检索和拼写切换三项测试来量化语音识别中的基准优化现象。
推荐理由:通过三项探针量化语音模型对基准的过拟合,并给出可复用的检测脚本与榜单入口。
微软研究院发布深度学习交换关联泛函 Skala 1.1,训练数据量为此前公开版本的 2.5 倍,在 GMTKN55 基准 55 个类别中 32 项排名第一,加权平均误差 2.8 kcal/mol。Skala 现已在 CP2K 中可用,并正集成进 Psi4、FHI-aims、ORCA 和 VASP。微软同时推出持续更新的基准,追踪后续 Skala 版本的计算性能。
IBM Research 在 Hugging Face 博客发布 ALTK-Evolve 研究,用 AppWorld 的 585 个多步任务测试八款模型,发现智能体记忆不是开关而是需要按模型校准的剂量。
推荐理由:八模型横评显示智能体记忆的合适剂量随模型能力分层,并给出检索式注入在准确率与 token 成本上的对比。
Import AI 第 469 期介绍了 DiG-bench(Discovery in Games)基准,包含 70 款隐藏规则的游戏,用于测试 AI 通过探索自主发现环境规则的能力,目前仅公开 21 款。
Google Research 提出 PhotoScan,一个可从普通 2D 手机照片估算体脂率、Android-to-Gynoid 脂肪比(A/G)和内脏与皮下脂肪面积比(V/S)的深度学习框架,用于预测胰岛素抵抗。
推荐理由:Google Research 用手机照片估算体成分并预测胰岛素抵抗,读者可了解其与 DXA、BIA 的精度对比。
Hugging Face 发布 2026 年 1 月至 8 月的开源模型观察报告,基于 Hub 数据给出六项发现。报告显示公开模型仓库从 243 万增至 296 万,数据集从 71.1 万增至 100 万,Spaces 从 100 万增至 144 万,但 85.6% 的模型终身下载量不足 200 次,1.5% 的仓库占据 99.2% 的下载量。
推荐理由:Hugging Face 用 Hub 七个月数据拆解开源模型格局,下载与点赞的分野、Qwen 衍生生态和智能体流量变化都给出了可核对的数字。
微软研究院推出 MindTopo 基准,用于评估多模态大语言模型在连通性、分离、顺序、包围和绳结五类拓扑关系上的推理与规划能力。测试显示,当前模型在静态图像识别上明显强于交互式规划任务,失败多发生在规划阶段而非感知阶段,且图像与视频生成工具在跨多步动作中维持拓扑关系并不可靠。
Google Research 提出知识画像框架,用编码、知识、召回三个行为概念区分事实错误来自知识未编码还是已编码但无法访问,并发布包含 2,150 条 Wikipedia 事实、每条配 10 个问题的 WikiProfile 基准。
推荐理由:Google Research 用知识画像区分编码与召回失败,指出前沿模型的事实错误更多来自知识可访问性而非知识缺失。
Google Research 发布 AMIE (Video),基于 Gemini 和 Project Astra 构建,可在实时视频问诊中感知非语言线索、引导虚拟体格检查并同步完成诊断推理。
推荐理由:Google 用 300 场随机对照视频问诊给出 AMIE 与真人医生同级的评测结果,可看多智能体架构如何拆分实时对话与推理。
微软研究院推出研究模型 CARE-X,一个统一胸部 X 光视觉语言模型,可同时完成报告生成、疾病分类、定位与器械识别等任务,并支持生成式与双推理两种模式。该模型采用强化学习 DAPO 在多任务设置下奖励临床正确性,另有一项独立实验将 Qwen3-VL-4B-Instruct 与确定性测量工具结合,评估直接计算能否改善测量依赖型病症的表现。
Hugging Face 的 ALTK-Evolve 与 ACE 同为无需权重更新的智能体记忆方案,但前者按任务检索少量高支持度指南,而非每步注入完整 playbook。
Import AI 第 468 期收录了智库 IFP 提出的 23 条"低后悔"政策建议,分属 7 个类别,用于帮助政策制定者应对 AI 研发进一步自动化的风险。
Hugging Face 最新论文提出两项系统改动,让大语言模型知识蒸馏的显存开销大幅下降:一是离线缓存教师模型每位置的 top-100 logits,训练时无需同时加载教师模型;二是融合分块 KL 损失,避免生成完整的词表×序列长度矩阵。
本期 Import AI 汇总多项研究:多伦多大学、Vector Institute、剑桥大学与 ServiceNow 的研究者构建了自维持 AI 蠕虫原型,利用被攻陷机器的 GPU 运行开源权重 LLM 进行推理并自我复制,漏洞检测成功率约 80%、利用成功率约 53%、自我复制成功率 88%,整体攻击成功率约 37%。
Google Research 提出 Chain-of-Evidence(CoE)可验证性框架,并以此构建自主科研原型 Science One Framework,配套 CoE Audit 自动评估指标。
推荐理由:原文给出可验证性框架与审计指标,并对比多个自主科研系统的引用与代码对齐表现。
微软研究院提出 Echoverse,为 computer-use 智能体构建 12 个训练世界,包括 10 个深度领域世界和 2 个能力世界,强调行为保真、状态一致、工作流深度和基于数据库的验证。
推荐理由:微软研究院公开了合成环境工厂的构建流程与训练数据,读者可据此理解高保真环境如何影响 computer-use 智能体的训练效果。
Berkeley AI Research 与 IBM Research 将 K-Search 进化式内核搜索框架扩展到 MLX,新增结构化 CUDA-to-MLX 翻译层,让已有 CUDA 内核作为知识库适配 Apple Silicon。
推荐理由:读者可看到 CUDA 优化经验如何被结构化迁移到 Apple Silicon,以及翻译层对内核性能的具体贡献。
Epoch 与 METR 发布 MirrorCode 基准,用于测试 AI 系统在长周期编程任务上的表现,任务要求仅凭 CLI 访问、在没有源码和网络的情况下重新实现完整程序。
Berkeley AI Research 提出 ABBEL 框架,将 LLM 的摘要内容隔离为自然语言"信念状态"并加以监督,以替代完整交互历史作为智能体的工作上下文。在协作编程基准 CollabBench 上,基于重建的信念评分(rec-BG)将 ABBEL 与全上下文模型的性能差距缩小约 50%,训练步数从 100 步降至 50 步,峰值上下文 token 数也低于全上下文设置。
Google Research 发布研究论文 SymptomAI,用五个基于 Gemini Flash 2.0 的对话式智能体对 13917 名参与者进行端到端症状问诊与鉴别诊断(DDx)评估。
推荐理由:Google 用 13917 人随机对照研究比较 SymptomAI 与真实临床医生的鉴别诊断,并给出可穿戴生物信号佐证。
Google Research 在 Nature 发表论文,提出一种强化学习框架,让自主智能体从量子错误检测事件中学习,在计算过程中持续调节数千个控制参数以对抗漂移。
推荐理由:Google 用强化学习让量子纠错在计算过程中持续校准,读者可了解其 3.5 倍稳定性提升与规模化模拟结论。
DharmaOCR 在葡萄牙语 OCR 基准上以 0.925 分领先 Mistral OCR4 的 0.798 和 Unlimited-OCR 的 0.7587。该模型通过葡萄牙语监督微调加 DPO 两阶段训练,将全部参数集中于巴西葡萄牙语,从而在提取质量和稳定性上取得优势。
Google Research 在 ICLR 2026 论文中指出,扩散模型的创造力源于神经网络训练中的"分数平滑"效应:权重衰减等正则化使学到的分数函数变平滑,去噪过程因此生成落在训练数据点之间的插值样本,而非简单记忆。研究用一维两点实验验证,权重衰减越强、分数函数越平滑,粒子越易停在插值区。
Hume 发布 Real World VoiceEQ 基准,用于评估语音交互的人类质量,覆盖 40 多个专有与开源语音模型、15+ 评测维度和 60 多项指标,涵盖 ASR、TTS、S2S 和语音理解。
推荐理由:原文给出语音 AI 在 15+ 维度上的评测结果,读者可据此理解现有基准为何高估真实表现。
Google Research 发布 SensorFM,一个直接从无标注可穿戴数据学习的大型传感器基础模型,预训练语料超过一万亿分钟多模态信号,来自五百万名同意参与者。
推荐理由:Google 用一万亿分钟可穿戴数据预训练通用生理表征,读者可了解基础模型在健康领域的规模化路径。
Google Research 在 Nature Cities 发表研究,在 10 座美国城市用修改后的 Google Maps 算法将约 2% 的行程引导至耗时相近的替代路线,为期六个月。
Hugging Face 发布 ScarfBench(Self-Contained Application Refactoring Benchmark),用于评测 AI 智能体在 Spring、Jakarta EE、Quarkus 之间的跨框架迁移能力,包含 34 个应用、102 个框架实现、204 个迁移任务和 1331 个专家测试。
Dharma AI 撰文解读 Goldfeder、Wyder、LeCun 与 Shwartz-Ziv 的 2026 年论文《AI Must Embrace Specialization via Superhuman Adaptable Intelligence》。
Hugging Face 博客介绍 DiScoFormer(Density and Score Transformer),一个 Transformer 模型可在单次前向传播中同时估计数据分布的密度与 score,无需针对新分布重新训练。
NVIDIA 推出 ENPIRE 框架,让编码智能体驱动真实机械臂自主试错、改进策略并自动重置环境,在 PushT、整理插针等任务上达到 99% 成功率,测试硬件为双 YAM 机械臂加 RTX 5090 工作站。GPT-5.5 在 Codex 中与 Opus 4.7 在 Claude Code 中表现互有胜负,Kimi-2.6 落后,8 个智能体并行时得分更高。
Google Research 发布新架构,将多 Token 预测(MTP)头挂载到已冻结的 Gemini Nano v3 模型上,已在 Pixel 9 和 10 系列上线,作为开箱即用的加速方案。
推荐理由:Google 把 MTP 头挂到冻结的 Gemini Nano v3 上,读者可了解端侧推测解码如何省内存并提速。
Google Research 提出线性弹性缓存,将页面淘汰建模为滑雪租赁问题,用轻量机器学习动态调整缓存大小。在 Spanner 生产环境测试中,内存用量降低 15.5%,缓存未命中仅增加 5.5%,总拥有成本(TCO)降低约 5%,实际 I/O 成本影响仅 0.5%。该方案用浅层决策树预测页面 TTL,可翻译为几行 C++ 代码。
Google Research 在 COLM 2026 论文中揭示,让模型生成推理链能解锁原本无法召回的事实答案,即使问题只是单跳事实查询。研究用 Gemini-2.5(Flash 和 Pro)与 Qwen3-32B 在 SimpleQA Verified 和 EntityQuestions 上对比推理开关两种模式,发现两个机制:额外 token 充当计算缓冲,以及生成相关事实的"事实启动"效应。
牛津大学、英国 AI 安全研究所、斯坦福大学和伦敦政治经济学院的研究者通过四项实验、6,923 人参与的 18,978 场对话发现,AI 系统在文本说服上稳定强于人类专家,即使专家自选议题、提前研究、接受数小时结构化训练并获 1,000 英镑奖金激励。
Google Research 发布矢量化数据集,将 Farmscapes 2020 的高分辨率栅格地图转化为可操作的树篱、石墙和矮林清单,覆盖英国超 13 万平方公里。该框架基于在 3 亿多张全球卫星图像上预训练的 RSF Vision-Transformer 骨干微调,并用 Polsby–Popper 紧凑度评分(线性特征阈值低于 0.5)自动区分林地、树丛与树篱。