跳到正文

技术方向

数据与训练 最新动态

训练侧的门道:数据集构建、合成数据、预训练与后训练方法、算力与训练成本。

45 条精选近 30 天 22 条共收录 125 条

更新

精选归档 · 第 3 页

4月22日周三第 41–45 条
3月18日周三
  1. Mistral AI62

    Mistral AI 推出 Forge,让企业用自有知识训练前沿模型

    Mistral AI 推出 Forge,一套让企业基于自有专有知识构建前沿级 AI 模型的系统,支持预训练、后训练和强化学习等阶段,并支持 dense 与 MoE 架构及多模态输入。

    推荐理由:原文给出企业用自有知识训练前沿模型的分阶段训练路径与智能体落地方式,可据此判断企业自建模型的门槛与形态。

3月17日周二
  1. Mistral AI62

    Mistral AI 与 NVIDIA 合作,成为 Nemotron Coalition 创始成员

    Mistral AI 宣布以创始成员身份加入 NVIDIA Nemotron Coalition,双方计划共同开发前沿开源模型,Mistral 提供模型架构、多模态能力与企业级微调工具,NVIDIA 提供算力、模型开发工具和合成数据生成管线。

    推荐理由:Mistral 以创始成员身份加入 NVIDIA Nemotron Coalition,读者可了解开源前沿模型的联合训练分工与后续 Nemotron 4 的开放计划。

3月12日周四
  1. Google Research62

    Google 推出 Groundsource,用 Gemini 把新闻报道转为洪水数据

    Google Research 推出 Groundsource,用 Gemini 从新闻报道中抽取结构化灾害数据,首个开放数据集包含 260 万条城市山洪记录,覆盖 150 多个国家、时间跨度从 2000 年至今。

    推荐理由:Google 用 Gemini 从 80 种语言新闻中抽取洪水事件,其 60% 定位与时间准确率可供评估 LLM 做数据抽取的可靠性。