跳到正文
10月8日周四
  1. Hugging Face Blog42

    TII 推出 Falcon-ASR:1.6B 参数阿拉伯语语音识别模型

    阿布扎比技术创新研究院(TII)发布 Falcon-ASR,一款 1.6B 参数的语音识别模型,重点覆盖阿联酋方言,同时支持英语、法语、西班牙语和葡萄牙语。在六个阿拉伯语测试集上平均 WER 为 20.92%,优于其参考榜单快照中最佳公开结果 23.17%;内部阿联酋方言评测中 WER 22.73%、CER 10.19%,比次优的 Qwen3-Omni 低 4.07 个百分点。

  2. TechCrunch · AI78

    OpenAI 随 GPT-6 推出 Intelligent UI,ChatGPT 界面转向可视化

    OpenAI 推出名为 Intelligent UI 的新界面,随新 GPT-6 模型于周三开始推送,把可点击按钮、定制计算器、交互式图表和可编辑图形等可视化元素直接嵌入对话,目标是让学习复杂主题更容易。该功能面向 Pro、Plus、Business 和 Enterprise 用户全球上线,免费和低价 Go 档用户周四可用,用户也可以自行调低回复中的可视化程度。

    同一新闻,精选展示《OpenAI 全球上线 GPT-6,ChatGPT 引入 Intelligent UI》

10月7日周三
10月6日周二
  1. Mistral AI84

    Mistral 发布 Mistral Large 4 公开预览,1 万亿参数原生多模态

    Mistral AI 发布 Mistral Large 4 公开预览,可在 Mistral Studio 试用预览 API,权重将于本月底开放。该模型为 1 万亿参数、49B 激活参数的原生多模态模型,官方称其在编码、智能体工作流和多模态理解上表现突出,并在网络安全、金融、法律等企业场景中达到开源模型领先水平。

    推荐理由:官方给出 1 万亿参数、49B 激活与多项基准对比,可据此判断开源权重模型在编码与智能体任务上的位置。

9月30日周三
  1. TechCrunch · AI42

    Marissa Mayer 推出照片驱动 AI 助手 Dazzle,从相机胶卷读懂你

    前 Yahoo CEO Marissa Mayer 推出个人 AI 助手 Dazzle,去年 12 月完成 800 万美元种子轮融资,其上下文全部来自手机相机胶卷而非邮件和日历。Dazzle 可扫描近期照片完成即时任务(如从活动传单生成日程),也能基于照片库推荐度假地和生日礼物,并称会丢弃被标记为敏感的个人信息。

  2. 量子位62

    Meshy 不到两年 ARR 从 100 万美元增至 1 亿美元,GPT-6 Astra 带火 3D 生成讨论

    Meshy 披露其 ARR 从 100 万美元增长至 1 亿美元,用时不到两年,比 HeyGen 从 100 万美元到 1 亿美元所用的 29 个月更快。文章对比 GPT-6 Astra 与 Meshy 生成同一张金发剑士参考图的效果,指出通用模型擅长 CAD、参数化建模等可拆解为几何关系的任务,而角色发丝、斗篷褶皱等细节仍需专业 3D 模型。

  3. The Decoder80

    AMD 以 82 亿美元收购世界模型初创公司 World Labs

    AMD 宣布以约 82 亿美元全股票交易收购专注空间智能的初创公司 World Labs,交易预计在 2026 年底前完成,尚待监管批准。World Labs 创始人李飞飞将加入 AMD 领导团队,出任执行副总裁兼首席科学家,直接向 CEO 苏姿丰汇报并负责前沿研究。

    推荐理由:这笔全股票收购把世界模型团队并入芯片厂商,读者可据此观察硬件与模型整合的新路径。

9月29日周二
  1. AWS Machine Learning Blog22

    Condé Nast 如何用 Amazon Bedrock 构建多模态视频检索

    Condé Nast 联合 AWS 生成式 AI 创新中心,基于 Amazon Bedrock 和 Amazon OpenSearch Service 构建多模态视频检索方案,采用 TwelveLabs Marengo 嵌入模型联合编码画面、音频与转录文本。该方案将单次内容检索耗时从 250 分钟降至 2 分钟以内,覆盖超 14 万条视频库,支持自然语言意图搜索、以图搜图和精确时间戳定位。

  2. Microsoft Research60

    微软研究院发布 Quine:面向生物学复杂性的 AI 研究系统

    微软研究院发布 Quine,一个面向生物学复杂性的 AI 研究系统,由生物世界模型和连接模型、科学工具、文献与实验人员的交互式 harness 组成。该系统与 Broad Institute 合作用于胰腺导管腺癌研究,预测并优先排序数千种化合物,最高排名化合物在湿实验中产生了最大的经典态向基底态转变,从缩小化合物搜索空间到选出候选验证仅用一个周末。

    推荐理由:微软研究院公开 Quine 的多模态生物世界模型与实验闭环设计,并给出胰腺癌化合物筛选的湿实验验证结果。

  3. 量子位60

    腾讯元宝AI录音笔上线边录边拍,照片可定位回对应转写

    腾讯元宝APP的AI录音笔新增边录边拍功能,拍照不中断录音,拍下的PPT会插入到当时那段实时转写里,会后可点图片定位回对应语句。录音结束后可生成纪要、待办和知识总结,支持导出DOCX、PDF、TXT、Markdown,并一键传到WorkBuddy、腾讯文档继续处理。该功能还支持录制手机内置音频并做中英双语转写与实时翻译,作者称全部免费。

  4. 量子位52

    北航等团队提出 OmniHarness:视觉AI把成功流程收进方法库,图像策略可迁移到视频生成

    北航、港中文与新国大团队提出 OmniHarness,通过符号策略学习把验证有效的视觉创作流程提炼成可复用的方法库,参数不变、不微调模型。在 ComfyBench 创意任务上解决率达 95%,比最强对照 SymbOmni 高 27.5 个百分点;同用 GPT-4o 时总体解决率为 89.5%,高于 ComfyMind 的 83%。

  5. Latent Space78

    AINews:Opus 5.5 擅长生成解说视频

    AINews 汇总 9/24-9/25 的 AI 动态,指出 Opus 5.5 本周发布后社区反馈积极,尤其在用代码生成解说视频上表现突出。Opus 5.5 在 SimpleBench 上以 88.4% 领先,Terminal-Bench-Science 上从低推理档的 24% 升至 xhigh 档的 62%,但 max 档回落到 59%。

    推荐理由:汇总 Opus 5.5 在视频生成与 Agent 任务上的社区反馈,并给出 Jev、Photon 等基础设施的实测数字。

  6. 量子位84

    AMD 以 82 亿美元全股票收购李飞飞 World Labs

    AMD 宣布以 82 亿美元全股票收购李飞飞的 World Labs,交易预计 2026 年底前完成,仍须取得监管批准。交割后李飞飞将加入 AMD 担任执行副总裁兼首席科学家,直接向苏姿丰汇报,联合创始人 Justin Johnson 和 Ben Mildenhall 继续带领团队并入 AMD。

    推荐理由:交易金额、估值倍数与投资方回报结构都有具体数字,可据此观察芯片厂商布局世界模型的路径。

9月28日周一
9月26日周六
9月25日周五
9月24日周四
  1. Latent Space74

    Meta Connect 2026:Muse 智能体、AI 眼镜与 Charm 硬件

    Meta 在 Connect 2026 上把 Muse 个人智能体作为硬件加智能体战略的核心,发布眼镜等新硬件并预告但未发布新前沿模型。Muse 新增语音与实时视频能力,可后台执行任务,并接入邮箱、Mac 电脑操作和 1500 多个连接器应用;Muse Realtime Avatar 研究版称响应低于一秒且输出带水印。

9月23日周三
9月18日周五
9月3日周四
9月2日周三
8月28日周五
8月26日周三
8月17日周一
  1. Google Research60

    Google Research 发布 PhotoScan:用手机照片估算体成分并预测胰岛素抵抗

    Google Research 提出 PhotoScan,一个可从普通 2D 手机照片估算体脂率、Android-to-Gynoid 脂肪比(A/G)和内脏与皮下脂肪面积比(V/S)的深度学习框架,用于预测胰岛素抵抗。

    推荐理由:Google Research 用手机照片估算体成分并预测胰岛素抵抗,读者可了解其与 DXA、BIA 的精度对比。

8月13日周四