MiniMax H3 多模态视频模型预计将于今日发布权重
MiniMax预计将于今日发布新一代多模态视频模型
MiniMax-H3的模型权重,截至本期内容发出前,相关页面显示仍处于即将开源状态。
MiniMax即将开源其新一代开放通用多模态视频模型 MiniMax-H3。
相关页面显示,预计发布时间为2026年8月3日06:00(UTC+08:00)。
届时用户可在ModelScope魔搭社区获取模型权重。
但截至本期内容发出前,相关页面显示仍处于即将开源状态。

相关链接:
Juya AI Daily · 橘鸦 AI 早报

MiniMax预计将于今日发布新一代多模态视频模型
MiniMax-H3的模型权重,截至本期内容发出前,相关页面显示仍处于即将开源状态。
MiniMax即将开源其新一代开放通用多模态视频模型 MiniMax-H3。
相关页面显示,预计发布时间为2026年8月3日06:00(UTC+08:00)。
届时用户可在ModelScope魔搭社区获取模型权重。
但截至本期内容发出前,相关页面显示仍处于即将开源状态。

相关链接:
Qwen 团队与 XLang Lab 联合发布了原生
Computer Use agentQwen-CUA。该agent仅通过截图感知界面,用键盘和鼠标操作计算机,目前已开放技术报告与参考demo。
Qwen Team 与 XLang Lab 联合发布了 Qwen-CUA,一款基于 Qwen 的原生 Computer Use 模型和 agent。
Qwen-CUA 仅通过截图感知界面状态,不依赖 DOM 树、辅助功能元数据或任务专用 API,而是通过原生键盘和鼠标事件在浏览器、桌面应用和专业软件中执行操作。
该模型基于 397B-A17B 混合专家架构,在 OSWorld-Verified 基准上取得 86.2 分,更大版本 Qwen-CUA-Max 参数量超过一万亿,在同基准上达到 87.6 分。
目前仅在 GitHub 提供了技术报告和参考 demo。


相关链接:
Andrej Karpathy 近日发帖称不该再用鹈鹕骑自行车测试
LLM,他用Opus 5进行了一项3D世界生成能力测试,向其输入 《指环王》 第一段文本,要求用three.js渲染故事。他表示结果有些粗糙但很有趣。
Andrej Karpathy 近日发帖称不该再用鹈鹑骑自行车测试 LLM。
他使用 Opus 5 进行了一项3D世界生成能力测试。
向其输入《指环王》第一段文本、约100万token的预算(约**$10**),要求用 three.js 渲染故事。
Opus 5 运行了约2小时,写了5500行代码,程序化渲染出了故事场景。
Karpathy 表示结果虽然粗糙但可运行,LLM需要在三维坐标系中放置和编排多边形资产并编写动画代码。
Karpathy同时指出当前 LLM 在世界和游戏领域存在弱点,无法高效原生感知视频或在游戏内玩游戏,需缓慢截图来检查工作。

相关链接:
FFmpeg官方账号发文,感谢Cursor为多名FFmpeg开发者提供免费额度。FFmpeg表示,这些额度将用于支持项目的持续开发和代码审查工作。
FFmpeg 官方账号公开发文,感谢 Cursor AI 为多名 FFmpeg 开发者提供免费额度。
据 FFmpeg 表示,这些额度将支持 FFmpeg 项目的持续工作,包括开发与代码审查。
FFmpeg称非常感谢 Cursor 对 FFmpeg 及其社区的支持。

相关链接:
Codex 负责人 Tibo 近期在回复网友时表示,谷歌 在
ChatGPT发布约一年前已有类似产品LMChat,他曾在相关团队工作,但该产品因担忧冲击搜索业务未推出。
Codex 负责人 Tibo 近期在回复网友时表示,谷歌在 ChatGPT 发布约一年前已开发出类似产品。
他曾在相关团队工作,最初代号为 LMChat,后改用另一代号。
Tibo 称,谷歌因担忧该产品冲击搜索业务而未予发布。
DeepMind 也被阻止推出可能颠覆 谷歌 的产品。
此前有网友曾援引 Jeff Dean 采访称,谷歌在 ChatGPT 之前已有内部聊天机器人。

相关链接:
提示:内容由AI辅助创作,可能存在幻觉和错误。