LegalOn 将 Codex 成本减半,同时保持开发速度
LegalOn 将 Codex 每日预估成本降低 65%,同时保持开发速度。其做法是按任务匹配 Astra、Sol 和 Luna,并对预算进行策略性管理。
LegalOn 将 Codex 每日预估成本降低 65%,同时保持开发速度。其做法是按任务匹配 Astra、Sol 和 Luna,并对预算进行策略性管理。
Oracle 在招聘、工程和运营场景中,用 ChatGPT Work 和 Codex 把专家知识转化为快速、可复用的工作流,将原本需要数天的工作缩短到几分钟。
GitHub 发布与 Microsoft Applied Sciences 联合微调的 ModernBERT 分类器,用上下文判断非结构化密钥,可在 2 毫秒内评估一批候选密钥,据称能把可拦截的密钥数量提升一倍以上。
推荐理由:GitHub 用九个季度数据说明密钥泄露与人工修复的失衡,并给出把检测前移到 push 环节的模型方案。
Mistral AI 发布 Mistral Large 4 公开预览,可在 Mistral Studio 试用预览 API,权重将于本月底开放。该模型为 1 万亿参数、49B 激活参数的原生多模态模型,官方称其在编码、智能体工作流和多模态理解上表现突出,并在网络安全、金融、法律等企业场景中达到开源模型领先水平。
推荐理由:官方给出 1 万亿参数、49B 激活与多项基准对比,可据此判断开源权重模型在编码与智能体任务上的位置。
Anthropic 的 Claude Opus 5.5、Claude Sonnet 5.5 和 Claude Sonnet 5 已上线 AWS GovCloud (US) 区域的 Amazon Bedrock,为 ITAR 等受监管工作负载提供 AI 辅助开发通道。
Z.ai 的 GLM 5.3 现已在 Amazon Bedrock 上线,这是一个 753B 参数的 MoE 模型,面向编码和长周期智能体任务,通过全托管 API 提供跨区域推理、提示词缓存和服务层级,目前面向符合条件的企业客户开放。
推荐理由:GLM 5.3 在 Bedrock 上线,文中给出提示词缓存与 Strix 安全测试的完整调用示例,可据此评估迁移成本。
GitHub 发布 ReviewBench,一个面向 AI 代码审查的开放离线基准,基于 1.039 亿个 GitHub pull request 的分布构建,包含 19 种语言、187 个开源仓库的 219 个 pull request。
推荐理由:GitHub 公开了代码审查基准的构建方法与离线信号,读者可据此判断评测结果与线上表现的关系。
GitHub 提出 AI 时代开发者需要强化三项技能:学会指挥 AI 而非只是使用它、不轻信 AI 的首次回答、用 AI 节省的时间去解决更大的问题。文中以 GitHub Copilot 内置的 Rubber Duck agent 为例,说明它用第二个模型对计划、代码和测试进行批判性审查,从而发现首个模型遗漏的问题。
Chatham Financial 借助 Codex 和 GPT-5.6 构建技术并重构工作流,将交易验证时间从 30 分钟压缩到 4 分钟以内。这家资本市场咨询公司借此扩展其资本市场专业能力。
Google DeepMind 发布新前沿模型 Gemini 4 Argon,先通过 Fairwind Program 向受信任的网络安全防御方开放,随后逐步扩展至开发者、企业和消费者,起步价每百万输入 token 2 美元、输出 token 10 美元,缓存输入按输入价 95% 折扣计费。
推荐理由:官方给出 Argon 在编码、企业知识与网络安全上的基准表现和分阶段开放路径,可据此判断前沿模型的能力边界与发布节奏。
AWS 宣布 Claude Sonnet 5.5 在 Amazon Bedrock 和 AWS 上的 Claude Platform 上线,定位为面向编码与知识工作的更高效 Sonnet 模型,多数任务单任务成本更低、速度更快。
推荐理由:原文给出 Sonnet 5.5 在 Bedrock 上的能力定位与调用方式,读者可据此判断它和 Opus 5.5 的分工。
GPT-6.1 Sol 现已在 Amazon Bedrock 正式可用,作为 GPT-6 Sol 的重大升级,面向智能体编码、计算机使用和专业工作负载提供更强的推理能力。
推荐理由:GPT-6.1 Sol 在 Bedrock 上线,读者可据此了解它在智能体编码与文档工作流上的能力定位和成本取舍。
OpenAI 发布 GPT-6.1 Sol,定位为面向编码、电脑操作和专业工作的接近 Astra 的智能水平,标准 API 输入与输出 token 价格均为 Astra 的五分之一。
推荐理由:OpenAI 发布 GPT-6.1 Sol,给出与 Astra 的价格对比和面向编码、电脑操作的能力定位。
OpenAI 发布 DevDay 2026 回顾,汇总了 20 多项发布,涵盖 GPT-6 Astra、ChatGPT、Codex、API、安全以及面向开发者的新工具。原文为摘要,未展开各项更新的具体细节。
推荐理由:OpenAI DevDay 2026 一次性放出 20 多项发布,可据此快速了解其模型、API 与开发者工具的整体更新方向。
至知创新研究院 IQuest Research 发布 IQuest-Q1 模型,采用 decoder-only Transformer 主干与稀疏 MoE 架构,总参数约 320B、激活参数约 15B。
Anthropic 发布 Claude Sonnet 5.5,在 Terminal-Bench 4.0 上从上一代 Sonnet 5 的 10.3% 提升到 70.6%,超过上周 Opus 5.5 的 66.4%。
推荐理由:Sonnet 5.5 在多项基准上逼近 Opus 5.5,同时价格只有一半,读者可据此判断中端模型的性价比变化。
xAI 的 Grok 4.7 已在 Amazon Bedrock 上线,提供 500K token 上下文窗口和 low、medium、high、xhigh 四档可配置推理强度,通过 bedrock-runtime 端点的跨区域推理配置文件提供服务,支持 Responses、Chat Completions 和 Converse API。
推荐理由:AWS 官方给出 Grok 4.7 在 Bedrock 上的接入方式与四档推理强度,可据此评估长任务智能体的成本与延迟取舍。
OpenAI 启动 Codex Originals 项目下一阶段,征集使用 Codex 的开发者、研究者与创作者的真实故事和项目。有意参与者可通过下方表单提交自己的经历与项目介绍。
Proaction 借助 Codex、GPT-Live-1 和 GPT-6 Astra,更快地构建、运营并销售现代车队管理方案,销售额提升 60%,节省 75+ 小时。
GitHub Podcast 最新一期拆解了五个 AI 热门观点:AI 生成的代码仍需阅读和负责,只是审查力度应按风险分级;Skills 与 MCP 解决不同问题,前者是打包的团队经验,后者是智能体连接工具与数据的标准,二者可组合使用;RAG 并未消亡,它让模型基于训练数据外的文档、内部知识或代码库上下文作答,能减少 token 浪费并降低答案不完整的概率。
GitHub 用 GitHub Copilot app 和 Copilot CLI 把 Copilot agent runtime 从 TypeScript 完全重写为超过 80 万行生产级 Rust,AI agent 写了大部分代码,分布在 128 个合入 main 的 PR 中并逐步发布,运行时性能提升数个数量级。
推荐理由:作者以亲历者身份给出把 Copilot 运行时从 TypeScript 迁到 Rust 的完整工程细节,可迁移到大规模 agent 协作开发。
Cognition 借助 GPT-6 Astra 提升 Devin 测试软件并证明其可用的能力,目标是让工程师减少代码审查、加快交付。
GitHub Copilot 应用内置 diff、终端和浏览器三个面板,让开发者无需离开应用即可审查、运行并预览 AI 智能体生成的代码改动。diff 面板以绿色和红色高亮显示新增、删除或修改的行,支持接受改动、留言或让 Copilot 继续修改;终端面板可直接运行项目命令,浏览器面板则通过 Pick & Polish 工具选中页面元素并让智能体调整。
César de la Fuente 的实验室利用 Codex 和 ChatGPT,在现存与已灭绝生物的基因组中搜寻抗菌候选分子,以对抗耐药性感染。
Mistral 帮助一家欧洲能源运营商把 4 万行 Fortran 77 的油藏模拟器迁移到 C++,该代码库没有测试套件也没有集中文档。团队先搭建数值对齐测试框架,用状态快照校验迁移前后结果一致,再用 Vibe CLI 启动上百个智能体解析调用树并补写文档。迁移采用规划、编码、测试、审查多智能体加人工审核的流程,首个冲刺完成 30 万行中的 4 万行。
推荐理由:Mistral 公开了用智能体迁移 4 万行 Fortran 77 的完整流程,其中先建数值对齐测试再迁移的做法可迁移到其他遗留系统改造。
MIT 一名研究人员使用 GPT-5.6 Sol 配合 Codex,自主运行量子计算实验、分析结果并校准量子比特。该案例展示了 GPT-5.6 Sol 在量子计算实验流程中的自动化能力。
1Password 的工程师使用 Codex 快速构建新功能和内部工具,在维持严格安全策略的同时达到生产可用状态,工程效率提升 21%。
OpenAI 披露内部数据,展示编码智能体正在重塑其 AI 研究流程。内容涵盖智能体使用情况、实验速度、任务复杂度与研究加速等早期观察。
GitHub 发布研究预览 Project HydraFusion,通过运行时多模型编排为 Copilot 提供前沿级智能,用户可在 GitHub Copilot CLI 中通过 /experimental 选择该模型。
推荐理由:GitHub 官方给出多模型编排的三种执行模式与三项基准的成本质量对比,可据此判断路由式编排在编码任务上的取舍。
GitHub Copilot 应用支持同时运行多个智能体会话,每个会话运行在独立的 Git worktree 上,互不干扰且各自保留上下文,可随时切换并从中断处继续。在示例仓库 tailspin-toys 中,可并行让 Copilot 构建 funded sort 功能、执行无障碍审查和运行测试,并在会话视图中跟踪进度、查看结果。
Google DeepMind 发布 Gemini 3.8 Flash 和 Gemini 3.8 Flash Cyber 两款模型,前者面向长时程编码与自主智能体,后者面向漏洞发现与自动修补。
推荐理由:官方给出两款 Flash 新模型的基准表现、定价与开放渠道,可据此判断长时程编码与网络安全任务的成本取舍。
Multiverse Computing 发布论文《Quantization-Aware Healing: A Practical Recipe for Recovering Compressed, 4-Bit LLMs》,提出 QAH 方法:在结构压缩并量化后,直接从压缩前的原始全精度模型蒸馏,而不是从恢复出的 bfloat16 checkpoint 蒸馏。
推荐理由:论文给出压缩加量化后从原始模型蒸馏的修复方案,并附9项基准对比,可看方法差异与代价。
Google DeepMind 发布 Gemini 3.7 Flash,称其为面向编码与智能体最强的工作主力模型,距 Gemini 3.6 Flash 发布仅三周。
推荐理由:官方给出与 3.6 Flash 的多项基准对比和半价定价,可据此判断编码与智能体场景的升级幅度。
Hugging Face 发布 ScarfBench(Self-Contained Application Refactoring Benchmark),用于评测 AI 智能体在 Spring、Jakarta EE、Quarkus 之间的跨框架迁移能力,包含 34 个应用、102 个框架实现、204 个迁移任务和 1331 个专家测试。
Mistral 在 AI Now Summit 2026 上发布面向工业工程的 AI 栈,与 Airbus、BMW、ASML 合作优化设计、仿真与生产,同时保持对专有数据和 IP 的控制。
推荐理由:Mistral 一次性给出工业 AI 栈、Vibe 智能体和自建推理数据中心三条产品线,可据此判断其企业级全栈布局。
Mistral 将 Le Chat 升级为统一 AI 智能体 Vibe,同时覆盖办公与编码场景,原有对话、设置和订阅方案全部保留。
推荐理由:Mistral 把 Le Chat 升级为统一智能体 Vibe,同时覆盖办公长任务与编码流程,读者可据此判断其与现有 Agent 产品的差异。
Mistral 发布 Mistral Medium 3.5,这是其首个合并指令遵循、推理与编码的 128B 稠密旗舰模型,采用修改版 MIT 许可开放权重,支持 256k 上下文窗口,最少四块 GPU 即可自托管,在 SWE-Bench Verified 上得分 77.6%,超过 Devstral 2 和 Qwen3.5 397B A17B。
推荐理由:Mistral 把编码智能体搬到云端并同步开源 128B 旗舰模型,读者可据此判断自托管与异步编码的可行边界。
Google DeepMind 发布 Gemini 3.5 模型系列,首发的 3.5 Flash 面向智能体与编码任务,在 Terminal-Bench 2.1 取得 76.2%、GDPval-AA 取得 1656 Elo、MCP Atlas 取得 83.6%,多模态理解在 CharXiv Reasoning 上为 84.2%,输出速度是其他前沿模型的 4 倍。
推荐理由:官方给出 3.5 Flash 在编码与智能体基准上的具体分数和速度对比,可据此判断其能力定位。
Google DeepMind 回顾 Gemini 驱动的编码智能体 AlphaEvolve 发布一年来的应用成果,称其已从试点成为 Google 基础设施的核心组件。
推荐理由:官方汇总 AlphaEvolve 一年间在基因组、电网、量子与 TPU 设计等领域的落地数据,可据此判断编码智能体的实际外溢范围。
Mistral 发布 Leanstral,称其为首个面向 Lean 4 的开源代码智能体,采用 6B 激活参数的稀疏架构,权重以 Apache 2.0 许可开放,并接入 Mistral Vibe 与免费 API 端点 labs-leanstral-2603。
推荐理由:官方给出 Leanstral 在 FLTEval 上的分数与成本对比,可据此判断形式化证明智能体的性价比路线。