跳到正文

技术方向

数据与训练 最新动态

训练侧的门道:数据集构建、合成数据、预训练与后训练方法、算力与训练成本。

45 条精选近 30 天 22 条共收录 125 条

更新

精选归档 · 第 2 页

9月16日周三第 21–40 条
9月10日周四
9月8日周二
  1. Google DeepMind82

    Google DeepMind 发布 AlphaGenome Atlas,覆盖人类基因组 90 亿个单碱基变异预测

    Google DeepMind 发布 AlphaGenome Atlas,一个包含人类基因组 90 亿个单核苷酸变异效应预测的平台,规模达 1PB,是 AlphaFold Database 的 30 多倍,已通过免费网站门户向学术研究开放。

    推荐理由:AlphaGenome Atlas 把 90 亿个单碱基变异的预测结果做成可检索资源,读者可了解它对罕见病与复杂性状研究的实际用法。

9月4日周五
  1. Google Research62

    Google 与 HHMI Janelia 等发布完整雄性果蝇脑图谱

    Google 与 HHMI Janelia 及剑桥等合作者发布雄性果蝇脑和中枢神经系统的完整连接图谱,论文发表于 Cell,包含超过 166,000 个神经元和 1.25 亿个突触连接,是迄今按神经元数量计算最大的脑图谱。

    推荐理由:Google 与 HHMI Janelia 等合作发布迄今神经元数量最多的脑图谱,读者可了解 AI 在连接组学中的具体作用。

8月28日周五
  1. Google Research62

    Google 发布行星预测引擎 PPE,自动完成地理空间建模全流程

    Google 在 Google Earth AI 下推出实验性研究能力行星预测引擎(PPE),可依据自然语言查询自主完成地理空间数据发现、特征工程、模型训练与评估,将建模时间从数周缩短到数分钟。

    推荐理由:原文给出 PPE 在公共卫生、粮食安全与疫情预测上的量化提升,可了解自主智能体如何接管地理空间建模全流程。

8月25日周二
  1. Hugging Face Blog62

    Multiverse Computing 提出 Quantization-Aware Healing:4-bit 压缩模型在 7/9 基准上超过自身全精度版本

    Multiverse Computing 发布论文《Quantization-Aware Healing: A Practical Recipe for Recovering Compressed, 4-Bit LLMs》,提出 QAH 方法:在结构压缩并量化后,直接从压缩前的原始全精度模型蒸馏,而不是从恢复出的 bfloat16 checkpoint 蒸馏。

    推荐理由:论文给出压缩加量化后从原始模型蒸馏的修复方案,并附9项基准对比,可看方法差异与代价。

8月19日周三
  1. Hugging Face Blog62

    你的智能体到底需要多少记忆?ALTK-Evolve 在八模型上的剂量研究

    IBM Research 在 Hugging Face 博客发布 ALTK-Evolve 研究,用 AppWorld 的 585 个多步任务测试八款模型,发现智能体记忆不是开关而是需要按模型校准的剂量。

    推荐理由:八模型横评显示智能体记忆的合适剂量随模型能力分层,并给出检索式注入在准确率与 token 成本上的对比。

8月14日周五
  1. Hugging Face Blog62

    Hugging Face 发布 2026 夏季开源模型观察报告

    Hugging Face 发布 2026 年 1 月至 8 月的开源模型观察报告,基于 Hub 数据给出六项发现。报告显示公开模型仓库从 243 万增至 296 万,数据集从 71.1 万增至 100 万,Spaces 从 100 万增至 144 万,但 85.6% 的模型终身下载量不足 200 次,1.5% 的仓库占据 99.2% 的下载量。

    推荐理由:Hugging Face 用 Hub 七个月数据拆解开源模型格局,下载与点赞的分野、Qwen 衍生生态和智能体流量变化都给出了可核对的数字。

8月13日周四
  1. Hugging Face Blog70

    Hugging Face 复现 2200 余篇 ICML 论文:51% 至少一项结论被验证

    Hugging Face 在 7 月 15 日至 8 月 2 日的黑客松中,组织 1221 名社区成员用 Claude Code、Codex、Cursor 等编码智能体逐条复现 ICML 2026 论文,共发布 6816 份 Trackio logbook,覆盖 2226 篇论文,约占会议论文的 34%。

    推荐理由:Hugging Face 公开了 2200 余篇 ICML 论文的复现结果与判定数据,可据此了解智能体做科研复现的边界。

8月12日周三
  1. Google Research62

    Google Research:召回而非编码是 LLM 参数化事实性的瓶颈

    Google Research 提出知识画像框架,用编码、知识、召回三个行为概念区分事实错误来自知识未编码还是已编码但无法访问,并发布包含 2,150 条 Wikipedia 事实、每条配 10 个问题的 WikiProfile 基准。

    推荐理由:Google Research 用知识画像区分编码与召回失败,指出前沿模型的事实错误更多来自知识可访问性而非知识缺失。

8月6日周四
  1. Google DeepMind78

    Google DeepMind 发布 WeatherNext 气旋预报模型并开源

    Google DeepMind 在 Nature 发表论文,称 WeatherNext AI 模型在气旋路径、强度和风场结构预报上达到 SOTA,平均多出一天预报提前量,三天预报精度相当于此前模型的两天水平。

    推荐理由:原文给出气旋路径与强度预报的领先幅度和开源范围,读者可据此判断气象预报模型的进展与可用性。

7月31日周五
  1. Microsoft Research66

    微软研究院发布 Echoverse:面向 computer-use 智能体的深度演化环境

    微软研究院提出 Echoverse,为 computer-use 智能体构建 12 个训练世界,包括 10 个深度领域世界和 2 个能力世界,强调行为保真、状态一致、工作流深度和基于数据库的验证。

    推荐理由:微软研究院公开了合成环境工厂的构建流程与训练数据,读者可据此理解高保真环境如何影响 computer-use 智能体的训练效果。

7月9日周四
  1. Google Research60

    Google 发布 SensorFM:面向可穿戴健康数据的通用基础模型

    Google Research 发布 SensorFM,一个直接从无标注可穿戴数据学习的大型传感器基础模型,预训练语料超过一万亿分钟多模态信号,来自五百万名同意参与者。

    推荐理由:Google 用一万亿分钟可穿戴数据预训练通用生理表征,读者可了解基础模型在健康领域的规模化路径。

6月30日周二
  1. Google Research75

    Google 发布表格数据零样本基础模型 TabFM

    Google Research 发布面向表格数据分类与回归的基础模型 TabFM,将表格预测重构为上下文学习问题,无需手动训练、超参数调优和特征工程,单次前向传播即可对未见过的表格生成预测。

    推荐理由:Google 把零样本思路从时序预测搬到表格数据,读者可了解其架构设计与 TabArena 基准表现。

6月4日周四
5月27日周三
  1. Mistral AI60

    Mistral 推出物理 AI,将 Emmi AI 并入企业平台

    Mistral 宣布将 Emmi AI 并入公司,推出面向工业工程的物理 AI 能力,作为其企业平台的一部分。该能力从几何与边界条件直接预测物理场,单次前向推理在单块 GPU 上以秒级完成,用于加速产品设计、工装工艺设计和实时数字孪生,合作方包括 ASML、Airbus、Safran 和 Siemens Energy。

    推荐理由:Mistral 把物理仿真模型并入企业平台,读者可了解其与 ASML、Airbus 等合作方的落地场景。

5月23日周六
  1. Mistral AI60

    Mistral 收购 Physics AI 公司 Emmi AI

    Mistral AI 宣布已达成最终协议,收购 Physics AI 先驱 Emmi AI,以强化其面向工业企业的 AI 转型伙伴地位。Emmi AI 总部位于奥地利,专注物理 AI 与大型工程模型,可把多日计算替换为实时仿真并构建数字孪生;其联合创始人及 30 多名研究人员和工程师将于 5 月加入 Mistral 的 Science 与 Applied AI 团队。

    推荐理由:Mistral 通过收购 Emmi AI 补上物理仿真能力,读者可据此判断工业 AI 平台的整合方向。

5月20日周三
4月30日周四