跳到正文
今天10月10日周六1 条
10月9日周五
10月8日周四
  1. AWS Machine Learning Blog38

    Cornerstone OnDemand 如何用 Amazon Bedrock 将数据库诊断时间缩短 78%

    Cornerstone OnDemand 基于 Amazon Bedrock 和 Strands Agents 构建多智能体系统 Orion AI,将数据库诊断时间从 45 分钟降至 10 分钟,减少 78%。该系统还使手动生命周期步骤减少 70%、SRE 与数据团队报告延迟从 15 分钟降至实时、冗余告警中位数减少 65%,由三人团队在六个月内交付。

10月7日周三
10月6日周二
10月4日周日
  1. Hugging Face Blog66

    微软与 Hugging Face 发布 ThinkingBox:按数据库终态给 AI 智能体打分

    微软 Copilot Studio 团队与 Hugging Face 联合发布 ThinkingBox,通过隔离的 MCP 工具会话运行智能体,按终端后端状态和副作用而非生成文本判分,覆盖 507 个有状态业务流程、每个任务重复 20 次。

    推荐理由:微软与 Hugging Face 联合发布的智能体评测基准,用后端状态而非生成文本判分,并给出可复现的 OpenEnv 运行方式。

10月3日周六
  1. OpenAI News60

    OpenAI 发布 GPT-6 家族模型使用指南

    OpenAI 发布 GPT-6 家族模型指南,面向初创公司说明如何选择 GPT-6 模型、调整推理强度、改进提示词与技能、协调工具,并为生产环境准备工作流。

    推荐理由:OpenAI 官方给出 GPT-6 家族的选型与调优路径,可帮助团队把模型能力落到生产工作流。

10月2日周五
9月30日周三
  1. AWS Machine Learning Blog60

    在 Amazon Bedrock AgentCore Runtime Instances 上构建多智能体音乐制作流水线

    AWS 官方博客演示在 Amazon Bedrock AgentCore Runtime Instances 上部署三智能体音乐制作流水线:作曲智能体用 Claude Sonnet 4.6 生成音乐简报并在实例的 NVIDIA L4 上运行 ACE-Step 渲染音频,交付智能体读取共享文件做 DSP 处理,合规智能体独立复测并比对曲库。

    推荐理由:AWS 官方给出三智能体共享 GPU 实例的完整代码与实测数据,可迁移到其他长时多智能体工作流。

  2. AWS Machine Learning Blog22

    Amazon Quick 提示词工程基础指南

    Amazon Quick 的提示词工程决定其 AI 功能对自然语言请求的响应质量,涵盖自定义智能体、自动化流程和对话式分析等场景。文章给出通用原则与可复用框架:以具体性实现清晰、用业务上下文提升相关性、用示例代替描述,并介绍 CRISPE 框架,从上下文与约束、角色与职责、意图与输入、步骤与范围等维度组织复杂提示词。

9月29日周二
  1. Hugging Face Blog26

    ProvenanceGuard:面向 MCP 智能体的来源感知事实性验证

    Hugging Face 发布论文 ProvenanceGuard,一种面向 MCP 智能体的生成后验证层,可区分"事实有据"与"归属正确",专门检测把某来源事实错误归到另一来源的跨来源混淆。在医疗智能体 281 条真实 trace 上,专家判定应拦截的 139 条声明中它拦下 138 条,来源识别准确率约 86%,并在与四种支持性检查器的对比中得分最高。

  2. 量子位60

    腾讯元宝AI录音笔上线边录边拍,照片可定位回对应转写

    腾讯元宝APP的AI录音笔新增边录边拍功能,拍照不中断录音,拍下的PPT会插入到当时那段实时转写里,会后可点图片定位回对应语句。录音结束后可生成纪要、待办和知识总结,支持导出DOCX、PDF、TXT、Markdown,并一键传到WorkBuddy、腾讯文档继续处理。该功能还支持录制手机内置音频并做中英双语转写与实时翻译,作者称全部免费。

  3. 量子位74

    Manus 2.0 发布:新应用 Cue 给 Agent 配手机号和钱包,桌面端升级为 Studio

    Manus 发布恢复独立运营后的首个大版本 Manus 2.0,包含新的 Agent 底座、创作工作台和全新个人 Agent 应用 Cue。Cue 中每个 Agent 拥有独立邮箱、电话号码、钱包和电脑,可对外发消息、在预算内付款、执行任务并代接电话,多个助手还能拉进同一群聊分工协作,目前处于凭邀请码的抢先体验阶段。

9月28日周一
  1. 量子位40

    阿里瓴羊发布「AI员工7日上场计划」:AI要进Business层直接扛KPI

    阿里云瓴羊在2026云栖大会推出「AI员工7日上场计划」,企业出真实业务题,瓴羊FDE带AI员工进场,7天内完成场景诊断、方案设计和POC验证,并交付上岗前后效果对比,发布当天27家企业签署意向书。其AgentOne上的营销、销售、客服、运营四类AI员工已于7月底上岗,公式为Data+Agent+FDE=AI员工,验收标准是能干、能信、能打。

  2. Hugging Face Blog66

    H 公司发布 Holo4 系列智能体模型,含 27B 稠密与 35B-A3B MoE 两个版本

    H 公司发布 Holo4 系列智能体模型,包含 27B 稠密版和 35B-A3B MoE 版,两者均已在 H Models API 上线,权重以 BF16、FP8、NVFP4 和 4-bit GGUF 格式开源在 Hugging Face。

    推荐理由:Holo4 同时覆盖 GUI、代码、MCP 与 API 四种接口,并公开全部评测轨迹,读者可据此判断通用计算机操作智能体的成本与能力边界。

9月26日周六
  1. GitHub Blog · AI & ML38

    GitHub Copilot 新手教程:如何用 canvases 构建自定义工作流

    GitHub Copilot 应用中的 canvas 是一种可自定义的双向界面,用户只需在 agent 会话中输入 /create-canvas 并用自然语言描述需求,即可生成看板、发布清单或仪表盘等界面,无需编写代码。canvas 会保存为扩展,可随项目共享或作为个人扩展复用,社区已在 Awesome Copilot 分享现成模板。

9月25日周五
  1. GitHub Blog · AI & ML66

    GitHub Security Lab 发布 Fuzzing Taskflow 智能体,自动完成 C/C++ 模糊测试

    GitHub Security Lab 发布 Fuzzing Taskflow,一个面向 C/C++ 项目的自主模糊测试流水线,只需指向一个 GitHub 仓库,它就会自动识别入口点、分析构建系统、编写 harness、运行 AFL++、读取覆盖率报告并改进 harness,最后对每个崩溃做分诊并生成漏洞报告。

    推荐理由:GitHub Security Lab 把模糊测试的 harness 编写、覆盖率追踪与崩溃分诊交给 LLM 智能体,并公开了可复用的开源流水线。

9月18日周五
  1. GitHub Blog · AI & ML22

    GitHub Podcast 拆解 AI 热门观点:该不该读代码、RAG 已死、Skills 杀死 MCP?

    GitHub Podcast 最新一期拆解了五个 AI 热门观点:AI 生成的代码仍需阅读和负责,只是审查力度应按风险分级;Skills 与 MCP 解决不同问题,前者是打包的团队经验,后者是智能体连接工具与数据的标准,二者可组合使用;RAG 并未消亡,它让模型基于训练数据外的文档、内部知识或代码库上下文作答,能减少 token 浪费并降低答案不完整的概率。

9月12日周六
9月11日周五
9月10日周四
  1. OpenAI News62

    OpenAI 发布 Agents API

    OpenAI 发布 Agents API,用于构建和上线云端智能体。该服务为托管式,由 Codex harness 提供编排、长时间运行会话和工具调用支持。

    推荐理由:OpenAI 官方发布托管式 Agents API,读者可了解其编排、长会话与工具调用能力。

  2. Hugging Face Blog62

    用 Gradio Workflow 重建 AUTOMATIC1111:Workflow1111 的 73 节点画布

    Hugging Face 团队用 Gradio Workflow 重建了 AUTOMATIC1111 的大部分功能,做成名为 Workflow1111 的画布,由 11 条媒体流水线和 73 个节点组成,覆盖文生图、高清修复、图生图、提示词矩阵、VLM 反推、检测生成 inpaint 掩码、ControlNet 风格标注器、背景移除、PNG Info 存储和图生视频。

    推荐理由:原文用 73 个节点复刻 A1111 的十一条图像流水线,并说明输出如何变成 REST 端点和 MCP 工具。

9月3日周四
8月20日周四
  1. Mistral AI71

    Mistral 发布 Agentic Search 检索层,FinanceBench 正确率从 26.7% 升至 86%

    Mistral 发布 Agentic Search,一个让模型在多步检索循环中查找、检查和验证信息的检索层,通过 Mistral Search Toolkit 提供,并内置于 Studio 和 Vibe 的 Libraries 中。

    推荐理由:原文给出多步检索循环的工具设计与两组基准数字,可据此判断传统一次性 RAG 在长文档场景的边界。

7月9日周四
6月24日周三