Liquid AI 发布 d1-3B 与 d1-omni-600M 端侧决策模型
Liquid AI 开源 d1 决策模型家族的两个模型 d1-3B 和 d1-omni-600M(实验性),二者不生成 token,而是在单次前向传播中给出答案。
推荐理由:Liquid AI 公开两个决策模型,给出端侧延迟与七项基准对比,可据此判断小模型做结构化决策的可行性。
Liquid AI 开源 d1 决策模型家族的两个模型 d1-3B 和 d1-omni-600M(实验性),二者不生成 token,而是在单次前向传播中给出答案。
推荐理由:Liquid AI 公开两个决策模型,给出端侧延迟与七项基准对比,可据此判断小模型做结构化决策的可行性。
Google DeepMind 发布 EmbeddingGemma 2,一个基于 Gemma 4 架构、740M 参数的开源多模态嵌入模型,采用 Apache 2.0 许可,可把文本、图像、音频和视频映射到统一嵌入空间。
推荐理由:官方给出 740M 参数、模块化编码器与端侧内存占用,可据此判断本地多模态检索的落地成本。
Z.ai 的 GLM 5.3 现已在 Amazon Bedrock 上线,这是一个 753B 参数的 MoE 模型,面向编码和长周期智能体任务,通过全托管 API 提供跨区域推理、提示词缓存和服务层级,目前面向符合条件的企业客户开放。
推荐理由:GLM 5.3 在 Bedrock 上线,文中给出提示词缓存与 Strix 安全测试的完整调用示例,可据此评估迁移成本。
Mistral AI 发布 Mistral Large 4 公开预览,可在 Mistral Studio 试用预览 API,权重将于本月底开放。该模型为 1 万亿参数、49B 激活参数的原生多模态模型,官方称其在编码、智能体工作流和多模态理解上表现突出,并在网络安全、金融、法律等企业场景中达到开源模型领先水平。
推荐理由:官方给出 1 万亿参数、49B 激活与多项基准对比,可据此判断开源权重模型在编码与智能体任务上的位置。
Google DeepMind 推出 SynthID Bio,把水印技术带入合成生物学,可在生物代码中嵌入不可感知的签名,并在合成出的实体蛋白质上验证,同时保持其生物功能。
推荐理由:SynthID 水印从图像扩展到合成生物,读者可了解其在 DNA 合成筛查与数据库标注上的验证思路。
NVIDIA 发布开源表格基础模型 Kumo Tabular,属于 Kumo Structured 模型系列,已上线 Hugging Face,可在单次前向传播中完成分类与回归预测,无需训练、调参和特征工程。
推荐理由:NVIDIA 开源表格基础模型,无需训练和特征工程即可单次前向预测,并给出四个基准的排名与效率对比。
H 公司发布 Holo4 系列智能体模型,包含 27B 稠密版和 35B-A3B MoE 版,两者均已在 H Models API 上线,权重以 BF16、FP8、NVFP4 和 4-bit GGUF 格式开源在 Hugging Face。
推荐理由:Holo4 同时覆盖 GUI、代码、MCP 与 API 四种接口,并公开全部评测轨迹,读者可据此判断通用计算机操作智能体的成本与能力边界。
Hugging Face Hub 新增 RL Environments 筛选,带 rl-environment 标签的数据集仓库会集中展示,无需新建仓库类型或注册表。
推荐理由:Hugging Face 把 RL 环境作为数据集标签纳入 Hub,读者可了解环境托管与跨框架复用的新做法。
GitHub Security Lab 发布 Fuzzing Taskflow,一个面向 C/C++ 项目的自主模糊测试流水线,只需指向一个 GitHub 仓库,它就会自动识别入口点、分析构建系统、编写 harness、运行 AFL++、读取覆盖率报告并改进 harness,最后对每个崩溃做分诊并生成漏洞报告。
推荐理由:GitHub Security Lab 把模糊测试的 harness 编写、覆盖率追踪与崩溃分诊交给 LLM 智能体,并公开了可复用的开源流水线。
微软研究院对移动操作机器人工作负载做了系统性测量,发现把物理 AI 推理从机器人端侧 GPU 卸载到边缘或云端 GPU,可提升任务成功率、支持更大模型并延长续航。
推荐理由:微软研究院系统测量了机器人端侧推理的瓶颈,并给出可复用的 Kubernetes 卸载方案与开源工具链。
Hugging Face 为 transformers 加入 GGUF 支持,用户可从 Hub 选取量化 checkpoint,通过 from_pretrained 传入 gguf_file 在本地生成,也可用 transformers serve 暴露 OpenAI 兼容 API。
推荐理由:Hugging Face 官方说明 transformers 接入 GGUF 的加载方式与性能对比,可据此判断本地推理工作流的变化。
IBM 研究团队在 ALTK-Evolve 中新增一致性指南(consistency guidelines)与 Consistency Analyzer,用于诊断并减少智能体在重复运行中的结果波动。
推荐理由:原文给出 Pass^k 与一致性差距的量化诊断方法,并展示把差距减半的实测结果,可迁移到智能体可靠性评估。
Google DeepMind 发布 AlphaGenome Atlas,一个包含人类基因组 90 亿个单核苷酸变异效应预测的平台,规模达 1PB,是 AlphaFold Database 的 30 多倍,已通过免费网站门户向学术研究开放。
推荐理由:AlphaGenome Atlas 把 90 亿个单碱基变异的预测结果做成可检索资源,读者可了解它对罕见病与复杂性状研究的实际用法。
Mistral 宣布完成 30 亿欧元 D 轮融资,投后估值超过 210 亿欧元,由三星电子领投,Scaleup Europe Fund 和 PSG Equity 共同领投。
推荐理由:Mistral 完成欧洲最大股权融资,读者可据此理解其主权 AI 全栈路线与开源权重定位。
Hugging Face 发布 @huggingface/kernels,一个从 Hugging Face Hub 加载并运行优化 WebGPU kernel 的 JavaScript 库,同时上线 207 个 kernel,均以独立仓库形式发布,采用 Apache-2.0 许可。
推荐理由:Hugging Face 发布 207 个 WebGPU kernel 及加载库,并给出与 ORT WebGPU 的实测对比数据,可供浏览器端推理选型参考。
Sentence Transformers v6.0 新增 MultiVectorEncoder 模型类型,支持 ColBERT 式后期交互检索,并配套完整训练流程。
推荐理由:原文给出多向量检索模型的完整微调配方与实测对比,读者可据此判断自建领域检索模型的成本与起点选择。
IBM Granite 团队发布 Granite 4.2,这是其首个稠密 decoder-only 推理模型家族,包含 3B、8B、30B 三个尺寸,均以 Apache 2.0 许可开源。
推荐理由:Granite 4.2 完整公开了预训练、SFT 与多阶段 RL 的配方和超参,可据此理解推理模型与智能体训练如何分阶段衔接。
Hugging Face 发布研究,提出共识分歧探针、掩蔽实体检索和拼写切换三项测试来量化语音识别中的基准优化现象。
推荐理由:通过三项探针量化语音模型对基准的过拟合,并给出可复用的检测脚本与榜单入口。
Liquid AI 为 LFM2.5 家族的 LFM2.5-1.2B-Instruct、LFM2.5-2.6B 和 LFM2.5-8B-A1B 发布 DSpark 草稿模型检查点,通过投机解码在不改变输出质量的前提下提升解码速度,GPU 上吞吐最高提升 3.18 倍,端侧最高提升 2.87 倍。
推荐理由:官方给出三个 LFM2.5 模型的 DSpark 草稿模型与实测加速数据,可据此判断端侧与 GPU 推理的提速幅度。
Sentence Transformers v6.0 新增第四种模型类型 MultiVectorEncoder,用于 ColBERT 式晚交互检索,PyLate 与 Stanford-NLP ColBERT 检查点可直接加载,colpali-engine 的视觉文档检索模型也能通过同一套 API 使用。
推荐理由:Sentence Transformers v6.0 新增多向量编码器,读者可据此判断晚交互检索的接入方式与索引成本。