DECOHACK

Juya AI Daily · 橘鸦 AI 早报

AI 早报 2026-07-24

内容来自橘鸦 AI 早报,经作者同意转载阅读原文 ↗视频版哔哩哔哩YouTube
AI 早报 2026-07-24

要闻

1

ChatGPT 桌面应用推出 ChatGPT Voice,支持语音控制电脑并协调多个Agent

OpenAI在ChatGPT桌面应用中正式推出ChatGPT Voice功能,支持特定付费用户通过语音在Chat、Work和Codex中直接控制电脑并协调多个Agent。同时,iOS端也可通过配对远程访问在Codex中使用语音。语音对话使用独立的、按滚动五小时窗口计量的配额限制,配额取决于订阅方案。

OpenAI宣布,ChatGPT Voice功能已在 ChatGPT 桌面应用中上线。

该功能由GPT-Live驱动,目前已向ChatGPT Plus、Pro、Business、Edu和Enterprise订阅方案用户开放。

用户可在macOS和Windows桌面应用中开启语音对话,实现自然的多轮交流,并在对话中发布任务、检查进度或改变方向。

同时,iOS用户也可通过配对远程访问在Codex中使用语音,Android支持据称即将推出。

同一时间内,整个ChatGPT桌面应用只能有一个活跃的语音聊天。

语音对话使用独立的、按滚动五小时窗口计量的配额限制,配额取决于订阅方案。

相关链接:

开发生态

2

OpenAI 宣布 Codex 支持多文件夹配置项目及站点分析公测

OpenAI 开发者账号宣布,Codex 本地项目现已支持读取和写入多个文件夹的代码与文件,并保留一个主文件夹作为 Git 根目录。同时,用于查看 Codex 发布站点基本性能指标的 Sites Analytics 功能已进入公开测试。

OpenAI 开发者账号宣布对 Codex 进行两项功能更新。

首先,Codex 本地项目现已支持包含来自多个文件夹的相关代码、文档和参考文件,Codex 能够跨这些文件夹进行读取和写入。

在这一机制下,其中一个主文件夹将作为 Git 根目录,负责处理 Git 操作、审查、pull requests、AGENTS.md 以及技能发现。

其次,名为 Sites Analytics 的新功能现已进入公开测试阶段,为用户使用 Codex 发布的站点提供基本的性能指标。

相关链接:

3

Runway 推出 Runway Media Router,自动匹配生成式媒体模型

Runway 宣布推出 Runway Media Router。该功能是内置于 Runway Dev 平台的生成式媒体模型路由,可自动为视频、图像或音频请求选择最佳模型。

Runway 在 Runway Dev 平台推出并上线了 Runway Media Router。

作为官方所称的“世界首个”面向生成式媒体的偏好优化路由,它能根据用户设定的成本、延迟和质量偏好,自动为视频、图像或音频生成请求匹配合适的模型。

用户可以在平台门户中设置价格上限,并配置允许或拒绝的提供商与模型名单,系统会据此筛选并调用得分最高的模型。

该功能目前已面向 Runway Dev 用户开放,支持视频、图像和音频模型。

相关链接:

模型发布

4

Black Forest Labs 发布 FLUX 3 多模态模型

Black Forest Labs 发布多模态模型 FLUX 3,在统一架构下联合学习图像、视频和音频。根据官方初步评估数据,FLUX 3 在视频生成对比中,偏好率稍微领先于Gemini Omni Flash 和 Seedance 2.0。FLUX 3 Video 已开放抢先体验,FLUX 3 Image 计划在未来几周内进入抢先体验,FLUX 3 Dev 开放权重版本也在推出计划中。

Black Forest Labs 正式发布多模态基础模型 FLUX 3,该模型基于 Self-Flow 方法,在统一架构下联合学习图像、视频和音频,同时支持机器人动作预测。

FLUX 3 可单次生成最长 20 秒 带原生音频的视频,并具备图像合成与编辑能力。

根据官方初步评估数据,FLUX 3 在视频生成对比中分别以最高 69% 和 60% 的偏好率略微领先于 Gemini Omni Flash 和 Seedance 2.0。

目前 FLUX 3 Video 已开放抢先体验,FLUX 3 Image 计划在未来几周内进入抢先体验,FLUX 3 Dev 开放权重版本也在推出计划中。

相关链接:

5

Ant Ling 发布 Ling-3.0-flash 模型,多平台限时免费开放

蚂蚁百灵发布 Ling-3.0-flash。该模型总参数为 124B,激活参数 5.1B。官方称其多数基准测试表现达到或超越自家 1T 旗舰模型,目前该模型已在多个平台上线并开放 限时免费使用。

蚂蚁集团 百灵大模型团队发布了混合推理 MoE 模型 Ling-3.0-flash,专为生产级 Agent 工作负载设计。

该模型总参数为 124B,每 token 仅激活 5.1B。

官方称其在多数展示的基准测试中,表现达到或超越了该团队此前的 1T 旗舰模型。

模型原生支持 256K 上下文并可扩展至 1M。

目前已上线 OpenRouter、Vercel AI Gateway 等多个平台并开放限时免费使用。

相关链接:

6

inclusionAI 发布 LLaDA2.2-flash 面向 Agent 的扩散语言模型

inclusionAI 发布 LLaDA2.2-flash 扩散语言模型。该模型引入 Levenshtein Editing 机制,支持 128K 上下文,已在 Hugging Face 和 ModelScope 上线。

蚂蚁集团 inclusionAI 发布了 LLaDA2 系列中的 Agent 导向 MoE 扩散语言模型 LLaDA2.2-flash。

通过引入 Levenshtein Editing(含 DELETE 和 INSERT 控制标记)实现扩散解码过程中的序列结构编辑与纠错。

模型总非嵌入参数量为 100B,上下文窗口扩展至 128K。

引入 Block Routing 将 MoE 专家激活限制在扩散块级别,以支持高效长上下文 Agentic 工作负载。

模型已在 Hugging Face 和 ModelScope 上线,许可为 Apache License 2.0。

SGLang 部署支持即将推出。

相关链接:

7

KwaiKAT 发布 KAT-Coder-V2.5-Dev 开源权重

快手 KwaiKAT 团队发布 KAT-Coder-V2.5-Dev 模型权重,该模型基于 Qwen3.6‑35B‑A3B 后训练,在多个 Agentic Coding 基准测试上取得同参数量级的领先结果。

快手 KwaiKAT 已将 KAT‑Coder‑V2.5‑Dev 的模型权重在 Hugging Face 开源。

该模型基于 Qwen3.6‑35B‑A3B 进行后训练,总参数 350 亿、激活参数 30 亿。

在 SWE‑bench Verified、Multilingual、Pro 和 Terminal‑Bench 2.1 等 Agentic Coding 基准测试中均取得当前同参数量级的领先结果。

使用 Apache 2.0 许可。

仅包含语言模型权重,不包含视觉/多模态组件,支持通过 vLLM、SGLang 等框架部署。

相关链接:

8

SpaceXAI 宣布 Grok 4.5 模型全面上线多平台

SpaceXAI 官方宣布 Grok 4.5 模型目前已在 grok.com、X 以及 iOS 和 Android 应用中全面上线。

SpaceXAI 官方宣布 Grok 4.5 模型现已全面登陆 grok.com、X 及 iOS 和 Android 应用平台。

根据官方说明,Grok 4.5 是其目前最强大的模型,能更好地理解用户提问并跟踪更长对话。

此外,该模型提升了推理效率以更快给出答案,并能承担处理电子表格、转换幻灯片和提取长PDF要点等知识工作。

SpaceXAI 还指出,用户可通过 Microsoft 365 加载项在 Word、Excel 等软件中直接使用该模型。

相关链接:

产品应用

9

OpenAI 面向美国成年用户推出 ChatGPT Health 功能

OpenAI 宣布 ChatGPT 的 Health 功能目前已向 美国 18 岁及以上用户推出。用户可连接 Apple Health 和医疗记录,在对话中结合个人健康数据获取更个性化的参考。

OpenAI 正式向美国 18 岁及以上的 ChatGPT 用户推出 Health 功能,覆盖网页端和 iOS 端的 Free、Go、Plus 和 Pro 套餐。

该功能允许用户安全连接 Apple Health、部分美国医院系统及 One Medical 等支持的医疗记录,ChatGPT 将在获得用户许可后,结合这些数据回答健康问题、追踪指标变化并提供上下文参考。

根据官方说明,用户连接的医疗数据和生成的相关对话不会被用于训练 OpenAI 的基础模型或定向投放广告。

目前该功能尚不支持 Codex,且根据用户反馈,暂不支持直接连接 Google Health 或 Fitbit。

相关链接:

10

Google 向美国 Google AI Pro 订阅者推出 Gemini Spark

Google 正向美国 Google AI Pro 订阅用户推出 Gemini Spark。官方称 Gemini Spark 很快将扩展至更多国家的 AI Pro 订阅用户。

Google 目前正开始向美国境内的 Google AI Pro 订阅者推出个人 AI agent Gemini Spark,当前版本为英语。

官方称 Gemini Spark 是一款在后台全天候运行、按用户指示完成任务的助手,且用户可让其帮忙设置首项技能和任务。

此前,Gemini Spark 已向更多国家和语言的 Google AI Ultra 订阅者推出。

Google 表示,很快将把 Gemini Spark 带给更多国家的 AI Pro 订阅者。

相关链接:

行业动态

11

马斯克呼吁 AI 公司发布前沿模型前互相审查,政府干预应为最后手段

马斯克提议,领先 AI 公司发布前沿模型之前应互相审查。他建议竞争对手定期沟通安全问题以互相监督,将政府干预作为最后手段。

埃隆·马斯克在接受采访时提议,OpenAI、Anthropic 和 SpaceXAI 等前沿 AI 公司应在发布最先进模型前互相审查。

他表示政府缺乏足够的技术深度,因此政府干预应仅作为公司拒绝修复安全问题时才启用的最后手段。

马斯克强调此机制应立即实施,并愿意为此搁置与 OpenAI 首席执行官的个人分歧。

目前,这些公司虽通过前沿模型论坛共享漏洞信息,但并未共享未发布的模型。

相关链接:

12

AI芯片初创公司Etched完成3亿美元C轮融资 估值翻倍至103亿美元

专注加速 AI 推理的芯片初创公司 Etched 宣布完成 3 亿美元 C 轮融资,估值达 103 亿美元。公司称新资金将加速其定制芯片及推理系统的生产,目前系统仅供投资方与早期客户测试。

致力于研发加速 AI 推理系统的芯片初创公司 Etched 完成 3 亿美元 C 轮 融资。

由 Sequoia 领投。

估值达 103 亿美元。

公司称这是 Sequoia 领投的 C 轮 中估值最高的一次。

该轮融资将用于加速其推理集群的生产与交付。

Etched 从头设计了针对推理预填充阶段的 低压芯片 以及用于生成解码阶段的 集群级内存。

称其系统能运行包括 DeepSeek 在内的任何 AI 模型。

尽管公司已获 10 亿美元 订单。

但联合创始人承认硬件目前仅供投资者和早期客户测试使用。

距离大规模量产交付仍有距离。

相关链接:


提示:内容由AI辅助创作,可能存在幻觉和错误。