跳到正文

技术方向

AI 编码 最新动态

AI 写代码的一切:编码助手、Vibe Coding、代码模型评测与开发工作流变革。

39 条精选近 30 天 22 条共收录 74 条

更新

精选归档 · 第 2 页

9月23日周三第 21–39 条
  1. Latent Space88

    Anthropic 发布 Claude Opus 5.5,OpenAI 同日推出 GPT-6 Sol 与 Luna 并降价 40-50%

    Anthropic 发布 Claude Opus 5.5,称其为新 Claude 5.5 系列首个模型,多数任务达到 Claude Fable 5.1 水平,运行成本比 Opus 5 低 40%,并成为 Claude Code 与 Claude 应用的默认模型。

    推荐理由:同一天两家实验室分别发布新模型并大幅下调 API 价格,读者可据此比较能力与成本取舍。

9月17日周四
  1. GitHub Blog · AI & ML77

    GitHub 用 Copilot 把 Copilot 运行时迁移到 Rust

    GitHub 用 GitHub Copilot app 和 Copilot CLI 把 Copilot agent runtime 从 TypeScript 完全重写为超过 80 万行生产级 Rust,AI agent 写了大部分代码,分布在 128 个合入 main 的 PR 中并逐步发布,运行时性能提升数个数量级。

    推荐理由:作者以亲历者身份给出把 Copilot 运行时从 TypeScript 迁到 Rust 的完整工程细节,可迁移到大规模 agent 协作开发。

9月9日周三
  1. Mistral AI60

    Mistral 用 AI 智能体迁移 4 万行 Fortran 77 遗留代码

    Mistral 帮助一家欧洲能源运营商把 4 万行 Fortran 77 的油藏模拟器迁移到 C++,该代码库没有测试套件也没有集中文档。团队先搭建数值对齐测试框架,用状态快照校验迁移前后结果一致,再用 Vibe CLI 启动上百个智能体解析调用树并补写文档。迁移采用规划、编码、测试、审查多智能体加人工审核的流程,首个冲刺完成 30 万行中的 4 万行。

    推荐理由:Mistral 公开了用智能体迁移 4 万行 Fortran 77 的完整流程,其中先建数值对齐测试再迁移的做法可迁移到其他遗留系统改造。

9月5日周六
  1. GitHub Blog · AI & ML71

    GitHub 推出 Project HydraFusion:多模型编排实现前沿级编码质量

    GitHub 发布研究预览 Project HydraFusion,通过运行时多模型编排为 Copilot 提供前沿级智能,用户可在 GitHub Copilot CLI 中通过 /experimental 选择该模型。

    推荐理由:GitHub 官方给出多模型编排的三种执行模式与三项基准的成本质量对比,可据此判断路由式编排在编码任务上的取舍。

9月3日周四
  1. Google DeepMind80

    Google DeepMind 发布 Gemini 3.8 Flash 与 3.8 Flash Cyber

    Google DeepMind 发布 Gemini 3.8 Flash 和 Gemini 3.8 Flash Cyber 两款模型,前者面向长时程编码与自主智能体,后者面向漏洞发现与自动修补。

    推荐理由:官方给出两款 Flash 新模型的基准表现、定价与开放渠道,可据此判断长时程编码与网络安全任务的成本取舍。

8月25日周二
  1. Hugging Face Blog62

    Multiverse Computing 提出 Quantization-Aware Healing:4-bit 压缩模型在 7/9 基准上超过自身全精度版本

    Multiverse Computing 发布论文《Quantization-Aware Healing: A Practical Recipe for Recovering Compressed, 4-Bit LLMs》,提出 QAH 方法:在结构压缩并量化后,直接从压缩前的原始全精度模型蒸馏,而不是从恢复出的 bfloat16 checkpoint 蒸馏。

    推荐理由:论文给出压缩加量化后从原始模型蒸馏的修复方案,并附9项基准对比,可看方法差异与代价。

8月14日周五
5月28日周四
5月22日周五
  1. Mistral AI82

    Mistral 发布 Mistral Medium 3.5 与 Vibe 云端远程智能体

    Mistral 发布 Mistral Medium 3.5,这是其首个合并指令遵循、推理与编码的 128B 稠密旗舰模型,采用修改版 MIT 许可开放权重,支持 256k 上下文窗口,最少四块 GPU 即可自托管,在 SWE-Bench Verified 上得分 77.6%,超过 Devstral 2 和 Qwen3.5 397B A17B。

    推荐理由:Mistral 把编码智能体搬到云端并同步开源 128B 旗舰模型,读者可据此判断自托管与异步编码的可行边界。

5月16日周六
  1. Google DeepMind87

    Google DeepMind 发布 Gemini 3.5 Flash,主打智能体与编码

    Google DeepMind 发布 Gemini 3.5 模型系列,首发的 3.5 Flash 面向智能体与编码任务,在 Terminal-Bench 2.1 取得 76.2%、GDPval-AA 取得 1656 Elo、MCP Atlas 取得 83.6%,多模态理解在 CharXiv Reasoning 上为 84.2%,输出速度是其他前沿模型的 4 倍。

    推荐理由:官方给出 3.5 Flash 在编码与智能体基准上的具体分数和速度对比,可据此判断其能力定位。

5月6日周三
  1. Google DeepMind74

    Google DeepMind 盘点 AlphaEvolve 一年成果:从基因组到 TPU 设计的多领域落地

    Google DeepMind 回顾 Gemini 驱动的编码智能体 AlphaEvolve 发布一年来的应用成果,称其已从试点成为 Google 基础设施的核心组件。

    推荐理由:官方汇总 AlphaEvolve 一年间在基因组、电网、量子与 TPU 设计等领域的落地数据,可据此判断编码智能体的实际外溢范围。

3月17日周二
  1. Mistral AI60

    Mistral 发布 Leanstral:面向 Lean 4 的开源代码智能体

    Mistral 发布 Leanstral,称其为首个面向 Lean 4 的开源代码智能体,采用 6B 激活参数的稀疏架构,权重以 Apache 2.0 许可开放,并接入 Mistral Vibe 与免费 API 端点 labs-leanstral-2603。

    推荐理由:官方给出 Leanstral 在 FLTEval 上的分数与成本对比,可据此判断形式化证明智能体的性价比路线。

3月11日周三
1月28日周三
  1. Mistral AI62

    Mistral 发布终端编码智能体 Mistral Vibe 2.0

    Mistral 发布终端原生编码智能体 Mistral Vibe 2.0,由 Devstral 2 模型家族驱动,新增自定义子智能体、多选项澄清、斜杠命令技能、统一智能体模式和自动更新。

    推荐理由:官方给出 Vibe 2.0 的自定义子智能体、斜杠命令技能等能力与订阅入口,可据此判断终端编码智能体的工作流变化。

12月9日周二
  1. Mistral AI82

    Mistral 发布 Devstral 2 编码模型与 Mistral Vibe CLI

    Mistral 发布下一代编码模型家族 Devstral 2,含 123B 的 Devstral 2 和 24B 的 Devstral Small 2,两者均为开源许可,Devstral 2 采用修改版 MIT、Small 2 采用 Apache 2.0。

    推荐理由:原文给出 Devstral 2 的 SWE-bench 成绩、开源许可与部署门槛,读者可据此判断开源编码模型与闭源模型的差距。

7月30日周三
  1. Mistral AI62

    Mistral 发布 Codestral 25.08 及企业级编码栈

    Mistral AI 发布 Codestral 25.08 代码模型,并推出覆盖补全、语义检索与智能体工作流的企业编码栈。Codestral 25.08 相比此前版本接受的补全增加 30%,建议后保留代码增加 10%,失控生成减少 50%。

    推荐理由:Mistral 把补全、代码检索和智能体工作流打包成可私有化部署的企业编码栈,读者可据此判断自托管 AI 编码方案的落地边界。

7月11日周五
5月21日周三
  1. Mistral AI78

    Mistral AI 与 All Hands AI 发布编码智能体模型 Devstral

    Mistral AI 与 All Hands AI 合作发布面向软件工程任务的智能体模型 Devstral,在 SWE-Bench Verified 上取得 46.8%,比此前开源 SoTA 高出 6 个百分点以上,并以 Apache 2.0 许可开源。

    推荐理由:官方给出 Devstral 在 SWE-Bench Verified 上的分数与开源许可,读者可据此判断开源编码智能体的当前水位。