AI 早报 2026-08-03

原文:https://daily.juya.uk/issues/2026-08-03/

视频版哔哩哔哩YouTube

概览

要闻

  • MiniMax H3 多模态视频模型预计将于今日发布权重 #1

行业动态

  • FFmpeg感谢Cursor AI为多名开发者提供免费额度 #2
  • 前谷歌团队成员称谷歌在 ChatGPT 前已有类似产品 LMChat #3

技术与洞察

  • Andrej Karpathy 称不该再用鹈鹕骑自行车测 LLM #4

模型发布

  • Qwen 等联合发布原生 Computer Use agent Qwen-CUA #5

要闻

MiniMax H3 多模态视频模型预计将于今日发布权重 #1

MiniMax预计将于今日发布新一代多模态视频模型MiniMax-H3的模型权重,截至本期内容发出前,相关页面显示仍处于即将开源状态。

MiniMax即将开源其新一代开放通用多模态视频模型MiniMax-H3,相关页面显示,预计发布时间为2026年8月3日06:00(UTC+08:00),届时用户可在ModelScope魔搭社区获取模型权重。但截至本期内容发出前,相关页面显示仍处于即将开源状态。

相关链接:


行业动态

FFmpeg感谢Cursor AI为多名开发者提供免费额度 #2

FFmpeg官方账号发文,感谢Cursor为多名FFmpeg开发者提供免费额度。FFmpeg表示,这些额度将用于支持项目的持续开发和代码审查工作。

FFmpeg官方账号公开发文,感谢Cursor AI为多名FFmpeg开发者提供免费额度。据FFmpeg表示,这些额度将支持FFmpeg项目的持续工作,包括开发与代码审查。FFmpeg称非常感谢Cursor对FFmpeg及其社区的支持。

相关链接:


前谷歌团队成员称谷歌在 ChatGPT 前已有类似产品 LMChat #3

Codex 负责人 Tibo 近期在回复网友时表示,谷歌在 ChatGPT 发布约一年前已有类似产品 LMChat,他曾在相关团队工作,但该产品因担忧冲击搜索业务未推出。

Codex 负责人 Tibo 近期在回复网友时表示,谷歌在 ChatGPT 发布约一年前已开发出类似产品,他曾在相关团队工作,最初代号为 LMChat,后改用另一代号。Tibo 称谷歌因担忧该产品冲击搜索业务而未予发布,DeepMind 也被阻止推出可能颠覆谷歌的产品。此前有网友曾援引 Jeff Dean 采访称,谷歌在 ChatGPT 之前已有内部聊天机器人。

相关链接:


技术与洞察

Andrej Karpathy 称不该再用鹈鹕骑自行车测 LLM #4

Andrej Karpathy 近日发帖称不该再用鹈鹕骑自行车测试LLM,他用 Opus 5 进行了一项3D世界生成能力测试,向其输入《指环王》第一段文本,要求用 three.js 渲染故事。他表示结果”有些粗糙但很有趣”。

Andrej Karpathy 近日发帖称不该再用鹈鹕骑自行车测试LLM,他使用 Opus 5 进行了一项3D世界生成能力测试,向其输入《指环王》第一段文本、约100万token的预算(约$10),要求用 three.js 渲染故事。Opus 5 运行了约2小时,写了5500行代码,程序化渲染出了故事场景。Karpathy 表示结果虽然粗糙但可运行,LLM需要在三维坐标系中放置和编排多边形资产并编写动画代码。Karpathy同时指出当前LLM在世界和游戏领域存在弱点,无法高效原生感知视频或在游戏内玩游戏,需缓慢截图来检查工作。

相关链接:


模型发布

Qwen 等联合发布原生 Computer Use agent Qwen-CUA #5

Qwen 团队与 XLang Lab 联合发布了原生 Computer Use agent {Qwen-CUA|“Qwen-CUA”}。该 agent 仅通过截图感知界面,用键盘和鼠标操作计算机,目前已开放技术报告与参考 demo。

Qwen Team 与 XLang Lab 联合发布了 Qwen-CUA,一款基于 Qwen 的原生 Computer Use 模型和 agent。Qwen-CUA 仅通过截图感知界面状态,不依赖 DOM 树、辅助功能元数据或任务专用 API,而是通过原生键盘和鼠标事件在浏览器、桌面应用和专业软件中执行操作。该模型基于 397B-A17B 混合专家架构,在 OSWorld-Verified 基准上取得 86.2 分,更大版本 Qwen-CUA-Max 参数量超过一万亿,在同基准上达到 87.6 分。目前仅在 GitHub 提供了技术报告和参考 demo。

相关链接:


提示:内容由AI辅助创作,可能存在幻觉错误