跳到正文

技术方向

开源生态 最新动态

开源模型、框架与仓库动态:权重开放、社区项目爆火、开源与闭源的力量消长。

73 条精选近 30 天 22 条共收录 151 条

更新

开源生态的精选

10月8日周四第 1–20 条
  1. Microsoft Research71

    微软研究院开源 Agent Lightning v1.0:约 3500 行的轻量智能体 RL 框架

    微软研究院开源 Agent Lightning v1.0,一个约 3500 行代码的轻量智能体强化学习框架,围绕 Harnessed Agentic RL 范式重建,让部署时使用的同一套 agent harness 直接参与训练,无需在训练框架内重新实现智能体。

    推荐理由:微软研究院开源了约 3500 行的智能体 RL 框架,并给出 6000 样本提升 14.6 个百分点的完整训练管线。

10月7日周三
  1. Hugging Face Blog62

    Nemotron 微调后在 IOI 2026 与 IMO 2026 双双达到金牌水平

    英伟达团队基于 Nemotron 3 通过 SFT、RL 和生成-验证-精炼推理流程,在 IOI 2026 和 IMO 2026 双双达到金牌水平。IOI 2026 中 Nemotron-3-Ultra-CC 得 535.4/600,高于 361.12 的金牌线;IMO 2026 系统得 30/42,高于 29 的官方金牌线。

    推荐理由:原文公开了从 Nemotron 3 微调到 IOI、IMO 金牌级成绩的完整配方与数据集,可据此复现领域专家模型。

  2. Latent Space88

    OpenAI 发布内部模型产出的 722 篇数学论文,称解决 500 个公开难题中的 90 个

    OpenAI 在一个公开 GitHub 仓库中发布了内部前沿模型产出的数学成果,称这批 722 篇手稿分为 372 个相关结果族,来自约 4000 个研究问题的评估,平均每个结果消耗约三小时 ChatGPT Pro 的思考算力,模型本身尚未发布。

    推荐理由:OpenAI 用内部数学模型的 722 篇论文给出算力与验证方式,读者可据此判断 AI 做数学的当前边界。

10月6日周二
  1. Latent Space76

    Reflection 发布 Beam:501B-A23B 美国开源 MoE 模型

    Reflection 发布 Beam,一个面向编码、智能体与科研的纯文本 MoE 模型,总参数 501B、激活 23B,从零训练,Apache 2.0 全量权重预计本月放出。

    推荐理由:Reflection 从隐身状态发布 501B 开源权重模型,并给出预训练与 RL 的算力、数据细节,可对照同期中美开源模型格局。

  2. Mistral AI84

    Mistral 发布 Mistral Large 4 公开预览,1 万亿参数原生多模态

    Mistral AI 发布 Mistral Large 4 公开预览,可在 Mistral Studio 试用预览 API,权重将于本月底开放。该模型为 1 万亿参数、49B 激活参数的原生多模态模型,官方称其在编码、智能体工作流和多模态理解上表现突出,并在网络安全、金融、法律等企业场景中达到开源模型领先水平。

    推荐理由:官方给出 1 万亿参数、49B 激活与多项基准对比,可据此判断开源权重模型在编码与智能体任务上的位置。

  3. AWS Machine Learning Blog62

    GLM 5.3 上线 Amazon Bedrock

    Z.ai 的 GLM 5.3 现已在 Amazon Bedrock 上线,这是一个 753B 参数的 MoE 模型,面向编码和长周期智能体任务,通过全托管 API 提供跨区域推理、提示词缓存和服务层级,目前面向符合条件的企业客户开放。

    推荐理由:GLM 5.3 在 Bedrock 上线,文中给出提示词缓存与 Strix 安全测试的完整调用示例,可据此评估迁移成本。

10月2日周五
  1. Hugging Face Blog60

    Ai2 开源 AstaBrief 8B:Asta 中的快速报告生成模型

    Ai2 开源 AstaBrief 8B,一个把研究问题和检索到的文献片段转成带引用报告的模型,基于 Qwen3-8B 训练,已在 Asta 的 Generate a report 功能中作为 Fast 模式上线,与 Claude 驱动的 Thinking 模式并存。

    推荐理由:原文给出了从 Qwen3-8B 出发的 SFT 加 DPO 训练配方与数据过滤经验,可迁移到其他科学报告生成场景。

9月30日周三
  1. Google DeepMind66

    Google DeepMind 推出 SynthID Bio,为 AI 生成蛋白质嵌入可验证水印

    Google DeepMind 推出 SynthID Bio,把水印技术带入合成生物学,可在生物代码中嵌入不可感知的签名,并在合成出的实体蛋白质上验证,同时保持其生物功能。

    推荐理由:SynthID 水印从图像扩展到合成生物,读者可了解其在 DNA 合成筛查与数据库标注上的验证思路。

9月29日周二
  1. Hugging Face Blog62

    NVIDIA 发布开源表格基础模型 Kumo Tabular

    NVIDIA 发布开源表格基础模型 Kumo Tabular,属于 Kumo Structured 模型系列,已上线 Hugging Face,可在单次前向传播中完成分类与回归预测,无需训练、调参和特征工程。

    推荐理由:NVIDIA 开源表格基础模型,无需训练和特征工程即可单次前向预测,并给出四个基准的排名与效率对比。

  2. Latent Space78

    AINews:Opus 5.5 擅长生成解说视频

    AINews 汇总 9/24-9/25 的 AI 动态,指出 Opus 5.5 本周发布后社区反馈积极,尤其在用代码生成解说视频上表现突出。Opus 5.5 在 SimpleBench 上以 88.4% 领先,Terminal-Bench-Science 上从低推理档的 24% 升至 xhigh 档的 62%,但 max 档回落到 59%。

    推荐理由:汇总 Opus 5.5 在视频生成与 Agent 任务上的社区反馈,并给出 Jev、Photon 等基础设施的实测数字。

9月28日周一
  1. Hugging Face Blog66

    H 公司发布 Holo4 系列智能体模型,含 27B 稠密与 35B-A3B MoE 两个版本

    H 公司发布 Holo4 系列智能体模型,包含 27B 稠密版和 35B-A3B MoE 版,两者均已在 H Models API 上线,权重以 BF16、FP8、NVFP4 和 4-bit GGUF 格式开源在 Hugging Face。

    推荐理由:Holo4 同时覆盖 GUI、代码、MCP 与 API 四种接口,并公开全部评测轨迹,读者可据此判断通用计算机操作智能体的成本与能力边界。

9月25日周五
  1. GitHub Blog · AI & ML66

    GitHub Security Lab 发布 Fuzzing Taskflow 智能体,自动完成 C/C++ 模糊测试

    GitHub Security Lab 发布 Fuzzing Taskflow,一个面向 C/C++ 项目的自主模糊测试流水线,只需指向一个 GitHub 仓库,它就会自动识别入口点、分析构建系统、编写 harness、运行 AFL++、读取覆盖率报告并改进 harness,最后对每个崩溃做分诊并生成漏洞报告。

    推荐理由:GitHub Security Lab 把模糊测试的 harness 编写、覆盖率追踪与崩溃分诊交给 LLM 智能体,并公开了可复用的开源流水线。

9月24日周四
  1. NVIDIA Blog62

    NVIDIA 联合 Google DeepMind 等开放 2800 多种病毒的蛋白复合物结构数据集

    NVIDIA 加入由 Google DeepMind、EMBL-EBI 等组成的联盟,通过 AlphaFold Database 开放 2800 多种病毒的蛋白复合物预测 3D 结构,供全球科学家免费使用。

    推荐理由:NVIDIA 与 Google DeepMind 等联合开放 2800 多种病毒的蛋白复合物结构预测,并放出生成流程,读者可据此了解开放科学如何提前储备疫情应对知识。

  2. Microsoft Research62

    微软研究院:将物理 AI 推理卸载到边缘或云端可提升机器人性能与续航

    微软研究院对移动操作机器人工作负载做了系统性测量,发现把物理 AI 推理从机器人端侧 GPU 卸载到边缘或云端 GPU,可提升任务成功率、支持更大模型并延长续航。

    推荐理由:微软研究院系统测量了机器人端侧推理的瓶颈,并给出可复用的 Kubernetes 卸载方案与开源工具链。

9月22日周二