OpenAI 发布模型失准报告框架并附六份行为报告
OpenAI 发布一套用于追踪、调查和披露模型失准(misalignment)的框架,同时公开六份关于模型意外或令人担忧行为的报告。
推荐理由:OpenAI 公开模型失准的追踪与披露框架,并附六份异常行为报告,可了解其安全披露机制。
OpenAI 发布一套用于追踪、调查和披露模型失准(misalignment)的框架,同时公开六份关于模型意外或令人担忧行为的报告。
推荐理由:OpenAI 公开模型失准的追踪与披露框架,并附六份异常行为报告,可了解其安全披露机制。
OpenAI 与 AARP 合作,在美国 10 座城市为 1,000 名老年人提供免费的 ChatGPT 实操工作坊,帮助他们安全地掌握实用 AI 技能。
NVIDIA 在 MLPerf Inference v6.1 首次提交 Vera Rubin NVL72 预览成绩,在 Qwen3-VL 上吞吐最高达 GB300 NVL72 的 3.7 倍,在 DeepSeek-R1 上最高达 2.5 倍。
推荐理由:MLPerf v6.1 成绩单给出 Vera Rubin 与 GB300 的吞吐、扩展效率和软件优化数据,可作为推理基础设施选型的参照。
Emerald AI、Google 和 NVIDIA 宣布成立 AI 能源管理联盟(AEMA),推动数据中心根据电网状况动态管理用电。该联盟采用技术中立、基于性能的要求,聚焦响应速度、持续时间和紧急情况下的行为等可衡量指标,并统一技术标准与运营数据共享。NVIDIA 与 Emerald AI 已在与能源和基础设施企业合作,建设可实时响应电网状况的 AI 工厂。
OpenAI 推出 AI 驱动的广告新体验,包括 Sponsored Agents 和面向营销人员的工具,并集成 HubSpot 与 Shopify。
OpenAI 介绍如何用 ChatGPT Work 和 Codex 的分析功能,帮助团队了解 AI 使用量与支出、识别培训需求,并把 AI 采用情况与业务成果关联起来。
Hex 借助 GPT-6 Astra 让数据智能体把分析答案转化为可交互的可视化结果,员工可直接分享这些报告。
Mistral 宣布与 Mozilla 达成合作,Firefox 的 AI 浏览助手 Smart Window(beta)现由 Mistral 模型驱动,先面向法国和北美用户,英国和德国预计今年晚些时候跟进。
OpenAI 经济研究显示,员工使用 AI 的方式已超出传统岗位职责,部分新活动正成为其工作中的常规环节。
曼彻斯特大学团队基于 NVIDIA Earth-2 的生成式模型 Earth-2 CorrDiff,在 Isambard-AI 超算单节点上仅用两天训练出覆盖全英、分辨率 2-3 平方公里的空气污染模型,并已加入 Earth-2 StormCast 支持依赖观测数据的时间相关预报。
Salesforce 在 Dreamforce 上发布其首个 CRM 推理模型 Koa,基于 NVIDIA Nemotron 3 Super 后训练而成,训练数据来自近三十年企业 CRM 部署的专有合成数据集。
推荐理由:Koa 基于 NVIDIA Nemotron 3 Super 后训练,并给出 CRM Bench 上错误率降低 3 倍的具体对比。
Google Research 提出 Retrieve-for-Train 框架,用离线强化学习发现奖励对齐的查询扇出并编译为监督信号,再蒸馏进一个 53.9M 参数的扩散检索器,实现推理时单次非自回归的查询扇出,无需消耗 CoT 推理 token。
Google DeepMind 发布两款实时语音对话模型 Gemini 3.8 Live 和 Gemini 3.8 Live Extended Thinking,前者面向规模化与成本效率,后者面向高复杂度任务与多步推理。
推荐理由:官方给出两款语音模型的基准成绩与开放渠道,可据此判断实时语音智能体的能力水位与接入方式。
NVIDIA 在 AI Infra Summit 上介绍 DSX 平台,聚焦电力管理与电网参与。Lambda 在五机架 19 节点的 HGX B200 集群上验证 DSX MaxLPS。
推荐理由:原文给出 DSX MaxLPS 在 Lambda 集群上的实测数字与 DSX Flex 的电网响应案例,可据此判断 AI 工厂每兆瓦产出如何被重新分配。
NVIDIA 在 AI Infra Summit 上公布 Vera Rubin 与 DSX 平台的多项进展,核心指标从峰值性能转向每兆瓦可验证的智能体 token 数。
推荐理由:NVIDIA 在 AI Infra Summit 上集中给出 Vera Rubin、DSX 与 NVLink 6 的多项实测数据,可据此判断 AI 工厂的能效与吞吐走向。
IBM 研究团队在 ALTK-Evolve 中新增一致性指南(consistency guidelines)与 Consistency Analyzer,用于诊断并减少智能体在重复运行中的结果波动。
推荐理由:原文给出 Pass^k 与一致性差距的量化诊断方法,并展示把差距减半的实测结果,可迁移到智能体可靠性评估。
费城儿童医院(CHOP)基于开源医学影像框架 MONAI 构建心脏建模服务,把原本需 4 小时的建模缩短到数秒,并已用于复杂心室间隔缺损手术规划。CHOP 正与 NVIDIA 及开源社区基于 Warp 和 Newton 物理引擎开发心脏器械仿真,把仿真时间从最长 4 小时压缩至近实时。全美已有 20 多家儿童医院开展心脏建模项目,波士顿儿童医院建模支持其每年约 500 例心脏手术。
Fyxer 基于 OpenAI 模型、微调与记忆能力,并结合真实用户反馈,打造出能整理收件箱、以用户本人语气起草邮件的 AI 行政助理。
Perplexity 采用 GPT-6 Astra 编写沟通内容、修改软件并监控生产系统,且相比早期模型,人工检查频率大幅降低。
GitHub 日本和韩国营销负责人把活动运营流程交给 GitHub Copilot,从单个 GitHub Issue 出发自动完成落地页复制、UTM 链接生成、报名名单清洗和会后 CRM 整理。
Cognition 借助 GPT-6 Astra 提升 Devin 测试软件并证明其可用的能力,目标是让工程师减少代码审查、加快交付。
OpenAI 将 Habitat 从 Python 库演进为全球分布式存储平台,支撑 10 亿 ChatGPT 用户、每秒 2200 万次请求。该平台用于应对 ChatGPT 在线存储的规模化需求。
Google Research 提出 ToolGrad,一种“先答案后问题”的工具调用数据生成范式:先生成真实工具调用链,再反推用户提示词,替代 ToolBench、ToolACE 等基于 DFS 试错搜索的查询优先方案。
GitHub Copilot 应用内置 diff、终端和浏览器三个面板,让开发者无需离开应用即可审查、运行并预览 AI 智能体生成的代码改动。diff 面板以绿色和红色高亮显示新增、删除或修改的行,支持接受改动、留言或让 Copilot 继续修改;终端面板可直接运行项目命令,浏览器面板则通过 Pick & Polish 工具选中页面元素并让智能体调整。
César de la Fuente 的实验室利用 Codex 和 ChatGPT,在现存与已灭绝生物的基因组中搜寻抗菌候选分子,以对抗耐药性感染。
OpenAI 在 ChatGPT Work 中推出 Data agent,用户可连接公司数据,用自然语言让 AI 挖掘洞察并构建交互式仪表盘。
推荐理由:OpenAI 在 ChatGPT Work 中上线 Data agent,读者可了解企业数据接入与自然语言建看板的新入口。
Mistral 与 Cloudera 宣布合作,将 Mistral 模型集成进 Cloudera 混合数据平台,企业可在私有云、公有云、本地及完全气隙环境中部署推理并保持完全控制。企业还能在受控环境中用专有数据训练自有模型,数据与模型所有权归企业所有。Cloudera 平台承载 30 exabytes 客户管理数据,双方瞄准金融、制造、电信等受监管行业的主权 AI 需求。
OpenAI 发布 ChatGPT for Financial Services,将内置金融数据与 GPT-6 Astra 结合,用于研究、建模和生成可直接交付客户的材料。
推荐理由:OpenAI 把内置金融数据与 GPT-6 Astra 打包进 ChatGPT,读者可据此判断金融研究流程会如何被改写。
OpenAI 与 GSA 合作,向符合条件的联邦、州、地方和部落政府提供 $0 许可费、50% 用量折扣以及扩展的网络防御支持。
OpenAI 在 API 中推出 GPT-Live-1,支持自然的全双工语音对话,并带来更强的指令遵循、自定义音色和电话通信支持。
推荐理由:OpenAI 把全双工语音对话能力开放到 API,开发者可据此评估语音应用的接入方式。
OpenAI 发布 Agents API,用于构建和上线云端智能体。该服务为托管式,由 Codex harness 提供编排、长时间运行会话和工具调用支持。
推荐理由:OpenAI 官方发布托管式 Agents API,读者可了解其编排、长会话与工具调用能力。
Hugging Face 团队用 Gradio Workflow 重建了 AUTOMATIC1111 的大部分功能,做成名为 Workflow1111 的画布,由 11 条媒体流水线和 73 个节点组成,覆盖文生图、高清修复、图生图、提示词矩阵、VLM 反推、检测生成 inpaint 掩码、ControlNet 风格标注器、背景移除、PNG Info 存储和图生视频。
推荐理由:原文用 73 个节点复刻 A1111 的十一条图像流水线,并说明输出如何变成 REST 端点和 MCP 工具。
TRL v1.14 的 AsyncGRPOTrainer 现已支持只训练并同步 LoRA adapter 到 vLLM,rank-1 adapter 仅几 MB,可通过挂载在多个 Hugging Face Jobs 上的 Storage Bucket 传递,无需 NCCL。
Paul Christiano 加入 OpenAI Foundation 董事会及其安全与安保委员会。他此前在 AI 对齐、安全与标准方面拥有相关经验。
OpenAI 的 Chris Lehane 主张,AI 能力越强,越需要更强的安全证据、共享标准与持久的政策行动,并强调政策窗口仍然敞开、应当立即行动。
Mistral 帮助一家欧洲能源运营商把 4 万行 Fortran 77 的油藏模拟器迁移到 C++,该代码库没有测试套件也没有集中文档。团队先搭建数值对齐测试框架,用状态快照校验迁移前后结果一致,再用 Vibe CLI 启动上百个智能体解析调用树并补写文档。迁移采用规划、编码、测试、审查多智能体加人工审核的流程,首个冲刺完成 30 万行中的 4 万行。
推荐理由:Mistral 公开了用智能体迁移 4 万行 Fortran 77 的完整流程,其中先建数值对齐测试再迁移的做法可迁移到其他遗留系统改造。
OpenAI 发布 GPT-6 Astra,称其为面向企业的最强模型,具备高级推理、计算机操作能力,并在写作与设计判断上更强。
推荐理由:OpenAI 公布 GPT-6 Astra 面向企业场景的能力定位,读者可据此了解其推理与计算机操作方向。
MIT 一名研究人员使用 GPT-5.6 Sol 配合 Codex,自主运行量子计算实验、分析结果并校准量子比特。该案例展示了 GPT-5.6 Sol 在量子计算实验流程中的自动化能力。
Google DeepMind 发布 AlphaGenome Atlas,一个包含人类基因组 90 亿个单核苷酸变异效应预测的平台,规模达 1PB,是 AlphaFold Database 的 30 多倍,已通过免费网站门户向学术研究开放。
推荐理由:AlphaGenome Atlas 把 90 亿个单碱基变异的预测结果做成可检索资源,读者可了解它对罕见病与复杂性状研究的实际用法。
OpenAI 发文探讨更强且更可负担的 AI 如何扩展个人与企业可完成的工作,并让增长更经济。文章未给出具体模型版本、参数规模或价格数字。