Pollo AI 用 OpenAI 模型将创意转化为营销活动
Pollo AI 借助 GPT-5.6、GPT-6 Astra 和 GPT-Image-2.5,帮助创作者把创意转化为精细图像和电影级视频广告。
Pollo AI 借助 GPT-5.6、GPT-6 Astra 和 GPT-Image-2.5,帮助创作者把创意转化为精细图像和电影级视频广告。
AWS 发布教程,演示在 SageMaker AI 上从同一个 vLLM-Omni DLC 部署两个端点:实时端点运行 FLUX.2-klein-4B 生成图像,异步端点运行 Wan2.1-VACE-1.3B 生成图像条件视频。文本提示词先生成静态图,再连同运动提示词传给视频端点,生成的 MP4 存入 Amazon S3,示例提供命令行与 Streamlit 界面。
Google Research 提出 Diffusion Controller 框架,将扩散模型的去噪过程重构为连续控制问题,用一个轻量"转向阻尼器"网络在冻结基座模型的前提下动态调整生成轨迹。在 Stable Diffusion v1.4 上以 HPS-v2 评测,其完全解锁版本对基线模型取得 90% 胜率,并支持黑盒、灰盒模型的微调,无需改动底层权重。
北航、港中文与新国大团队提出 OmniHarness,通过符号策略学习把验证有效的视觉创作流程提炼成可复用的方法库,参数不变、不微调模型。在 ComfyBench 创意任务上解决率达 95%,比最强对照 SymbOmni 高 27.5 个百分点;同用 GPT-4o 时总体解决率为 89.5%,高于 ComfyMind 的 83%。
Hugging Face 团队用 Gradio Workflow 重建了 AUTOMATIC1111 的大部分功能,做成名为 Workflow1111 的画布,由 11 条媒体流水线和 73 个节点组成,覆盖文生图、高清修复、图生图、提示词矩阵、VLM 反推、检测生成 inpaint 掩码、ControlNet 风格标注器、背景移除、PNG Info 存储和图生视频。
推荐理由:原文用 73 个节点复刻 A1111 的十一条图像流水线,并说明输出如何变成 REST 端点和 MCP 工具。
OpenAI 发布 ChatGPT Images 2.5,可将想法、草图与参考照片转化为更个性化、更精致的图像,并更贴近用户原本的构想。
推荐理由:官方给出 ChatGPT Images 2.5 的定位,读者可据此了解图像生成在个性化与成图质量上的变化方向。
Hugging Face 在 Diffusers 中引入 Nunchaku Lite,可直接用 from_pretrained() 加载 Nunchaku 量化检查点,无需自定义 pipeline 或本地 CUDA 编译。
推荐理由:Diffusers 原生支持 Nunchaku 4-bit 推理,读者可据此了解消费级 GPU 跑扩散模型的内存与速度取舍。
Google Research 在 ICLR 2026 论文中指出,扩散模型的创造力源于神经网络训练中的"分数平滑"效应:权重衰减等正则化使学到的分数函数变平滑,去噪过程因此生成落在训练数据点之间的插值样本,而非简单记忆。研究用一维两点实验验证,权重衰减越强、分数函数越平滑,粒子越易停在插值区。
Google DeepMind 发布 Nano Banana 2 Lite(gemini-3.1-flash-lite-image)和 Gemini Omni Flash(gemini-omni-flash-preview)。
推荐理由:两款模型同时开放开发者入口,并给出延迟、单价与能力边界,便于判断图像与视频生成链路的成本取舍。
Google Research 宣布在 Google Photos 的 Auto frame 功能中上线一种新方法,把照片理解为 3D 场景并自动调整相机位置与焦距,生成新的视角。该方法分两步:先用内部 3D 点图估计模型重建人体与面部并估算原相机焦距,再用生成式潜在扩散模型补全换视角后出现的空洞。该功能已面向含人物的照片自动提供重新构图版本,作为 Auto frame 候选中的第二个选项。
推荐理由:Google Photos 把照片当作 3D 场景重设机位,读者可了解生成式补全如何改变后期修图流程。
伯克利 AI 研究团队提出一种直接评估和优化成像系统信息量的框架,仅用含噪测量和噪声模型即可估计互信息,无需任务专用解码器。该信息指标在彩色摄影、射电天文、无镜头成像和显微镜四个领域均能预测解码器性能,优化后的设计可媲美端到端方法,且内存和算力需求更低。相关成果发表于 NeurIPS 2025。