跳到正文
今天10月10日周六1 条
10月9日周五
10月7日周三
  1. Simon Willison30

    Mistral Large 4

    Simon Willison 用同一提示词测试 Mistral Large 4 生成 SVG 的能力,与 Claude Opus 5.5、GPT-6.1-sol、Gemini 3.8 Flash 对比,提示词为"穿渔网袜的犰狳在火星乱穿马路"。各模型均使用默认推理等级。

9月30日周三
  1. AWS Machine Learning Blog22

    在 SageMaker AI 上用 vLLM-Omni 生成图像与视频(第二部分)

    AWS 发布教程,演示在 SageMaker AI 上从同一个 vLLM-Omni DLC 部署两个端点:实时端点运行 FLUX.2-klein-4B 生成图像,异步端点运行 Wan2.1-VACE-1.3B 生成图像条件视频。文本提示词先生成静态图,再连同运动提示词传给视频端点,生成的 MP4 存入 Amazon S3,示例提供命令行与 Streamlit 界面。

  2. Google Research38

    Google Research 提出 Diffusion Controller:统一并简化 AI 图像生成控制

    Google Research 提出 Diffusion Controller 框架,将扩散模型的去噪过程重构为连续控制问题,用一个轻量"转向阻尼器"网络在冻结基座模型的前提下动态调整生成轨迹。在 Stable Diffusion v1.4 上以 HPS-v2 评测,其完全解锁版本对基线模型取得 90% 胜率,并支持黑盒、灰盒模型的微调,无需改动底层权重。

9月29日周二
  1. 量子位52

    北航等团队提出 OmniHarness:视觉AI把成功流程收进方法库,图像策略可迁移到视频生成

    北航、港中文与新国大团队提出 OmniHarness,通过符号策略学习把验证有效的视觉创作流程提炼成可复用的方法库,参数不变、不微调模型。在 ComfyBench 创意任务上解决率达 95%,比最强对照 SymbOmni 高 27.5 个百分点;同用 GPT-4o 时总体解决率为 89.5%,高于 ComfyMind 的 83%。

9月10日周四
  1. Hugging Face Blog62

    用 Gradio Workflow 重建 AUTOMATIC1111:Workflow1111 的 73 节点画布

    Hugging Face 团队用 Gradio Workflow 重建了 AUTOMATIC1111 的大部分功能,做成名为 Workflow1111 的画布,由 11 条媒体流水线和 73 个节点组成,覆盖文生图、高清修复、图生图、提示词矩阵、VLM 反推、检测生成 inpaint 掩码、ControlNet 风格标注器、背景移除、PNG Info 存储和图生视频。

    推荐理由:原文用 73 个节点复刻 A1111 的十一条图像流水线,并说明输出如何变成 REST 端点和 MCP 工具。

9月8日周二
  1. OpenAI News62

    OpenAI 发布 ChatGPT Images 2.5

    OpenAI 发布 ChatGPT Images 2.5,可将想法、草图与参考照片转化为更个性化、更精致的图像,并更贴近用户原本的构想。

    推荐理由:官方给出 ChatGPT Images 2.5 的定位,读者可据此了解图像生成在个性化与成图质量上的变化方向。

7月23日周四
7月16日周四
  1. Google Research24

    Google Research 揭示扩散模型创造力来源:分数平滑如何带来插值效应

    Google Research 在 ICLR 2026 论文中指出,扩散模型的创造力源于神经网络训练中的"分数平滑"效应:权重衰减等正则化使学到的分数函数变平滑,去噪过程因此生成落在训练数据点之间的插值样本,而非简单记忆。研究用一维两点实验验证,权重衰减越强、分数函数越平滑,粒子越易停在插值区。

7月1日周三
4月23日周四
  1. Google Research60

    Google Photos 上线 Auto frame,用生成式 AI 重设照片机位

    Google Research 宣布在 Google Photos 的 Auto frame 功能中上线一种新方法,把照片理解为 3D 场景并自动调整相机位置与焦距,生成新的视角。该方法分两步:先用内部 3D 点图估计模型重建人体与面部并估算原相机焦距,再用生成式潜在扩散模型补全换视角后出现的空洞。该功能已面向含人物的照片自动提供重新构图版本,作为 Auto frame 候选中的第二个选项。

    推荐理由:Google Photos 把照片当作 3D 场景重设机位,读者可了解生成式补全如何改变后期修图流程。

1月10日周六
  1. Berkeley AI Research26

    伯克利提出基于信息量的成像系统设计框架,NeurIPS 2025 论文验证四大成像领域

    伯克利 AI 研究团队提出一种直接评估和优化成像系统信息量的框架,仅用含噪测量和噪声模型即可估计互信息,无需任务专用解码器。该信息指标在彩色摄影、射电天文、无镜头成像和显微镜四个领域均能预测解码器性能,优化后的设计可媲美端到端方法,且内存和算力需求更低。相关成果发表于 NeurIPS 2025。