AI 日报 — 2026年7月10日
今日要点:GPT-5.6 三款模型全球全面开放,Codex 正式并入 ChatGPT 桌面应用;OpenAI 发布 GPT-Live 全双工语音模型,ChatGPT Voice 迎来重大升级;Meta 连发 Muse Spark 1.1 与 Muse Image 两款模型,扎克伯格时隔三年重返 X 平台宣布;SpaceXAI 推出 Grok 4.5 编程智能体;蚂蚁灵波开源全球首个具身视频基模;豆包与千问宣布 7 月 15 日关停智能体功能;Kimi K3 本月发布,2.5 万亿参数领跑国产多模态。
GPT-5.6 全面开放:Sol、Terra、Luna 三款模型全球上线
7 月 10 日,OpenAI 正式向全球用户开放 GPT-5.6 系列模型,结束了为期两周的有限预览期。该系列于 6 月 26 日首次发布,但受美国政府要求仅向约 20 家经审批的合作伙伴开放。经过美国商务部 AI 标准中心的安全审查后,OpenAI 获准向全球公众推出这一三模型产品线。
旗舰模型 GPT-5.6 Sol 定价 $5/百万输入 Token、$30/百万输出 Token,支持全新的「Max 推理模式」和「Ultra 模式」——后者可将复杂任务拆解后分发给多个并行子智能体协作完成。Sol 在 TerminalBench 2.1 上以 91.9% 的成绩登顶全球编程基准。
均衡模型 GPT-5.6 Terra 定位日常企业级工作负载,性能与 GPT-5.5 相近但成本降低 50%。轻量模型 GPT-5.6 Luna 面向高频低延迟场景,定价仅 $1/百万输入 Token,是 OpenAI 首款在网络安全和生物学领域同时获得 High 能力评级的非旗舰模型。
与此同时,OpenAI 宣布将 Codex 正式并入 ChatGPT 桌面应用,用户可在统一的界面中直接调用代码生成、调试和项目管理功能,无需单独启动 Codex 应用。
OpenAI 发布 GPT-Live 全双工语音模型
7 月 8 日,OpenAI 发布了 GPT-Live 系列语音模型,标志着 ChatGPT Voice 从半双工(对讲机式)架构向全双工架构的根本性跨越。GPT-Live-1(付费用户)和 GPT-Live-1 mini(免费用户)已在 iOS、Android 和 ChatGPT.com 上全面上线。
全双工架构意味着模型可以同时进行语音输入和输出——用户可以在 AI 说话时打断、插入或纠正,模型也能用「嗯哼」「明白」等语用词在说话过程中表示正在聆听。更关键的是,GPT-Live 将推理任务委托给后台的 GPT-5.5,实现了对话节奏与推理深度的解耦。
Meta 发布 Muse Spark 1.1,扎克伯格重返 X 平台
7 月 9 日,Meta 正式发布 Muse Spark 1.1,这是其超级智能实验室(MSL)自今年 4 月推出 Muse Spark 以来的首次重大升级。Meta CEO 马克·扎克伯格在 X 平台上发布了自 2023 年 7 月以来的首条帖文,称 Spark 是「一个强大的智能体和编程模型,价格极低」。
Spark 1.1 的最大亮点是支持 100 万 Token 上下文窗口和多智能体协调(Multi-Agent Orchestration)能力,可同时管理多个 AI 智能体协同完成复杂的企业级任务。定价为 $1.25/百万输入 Token、$4.25/百万输出 Token,与 OpenAI 的 Luna 和 Anthropic 的 Haiku 4.5 直接竞争。
Meta 同时开放了 Meta Model API 的公开预览,这是 Meta 首次向开发者提供付费 API 访问,标志着其从开源策略向商业化的关键转向。
SpaceXAI 发布 Grok 4.5 编程智能体模型
7 月 8 日,SpaceXAI 发布 Grok 4.5,这是其被 SpaceX 收购后推出的首个旗舰模型。Grok 4.5 专为编程和智能体工作流设计,与 Cursor 合作训练,现已在 Grok Build、Cursor 和 SpaceXAI API 控制台中可用。
Grok 4.5 拥有 50 万 Token 上下文窗口,定价 $2/百万输入 Token、$6/百万输出 Token。马斯克称其为「Opus 级别模型,但更快、更省 Token、成本更低」。值得注意的是,该模型在 Harvey 法律智能体基准测试中表现领先,显示出在专业领域的应用潜力。欧盟用户预计在 7 月中旬获得访问权限。
Meta 发布 Muse Image 图像模型,引入 Agent 自主优化
7 月 7 日,Meta 发布了首款自研图像生成模型 Muse Image(内部代号 Mango),这是 Meta 超级智能实验室在图像生成领域的首个成果。Muse Image 现已内置于 Meta AI 应用,并在 Instagram Stories 和 WhatsApp 中逐步推出。
Muse Image 的独特之处在于其与 Muse Spark 推理模型的深度协作:用户在提出图像生成请求后,Muse Spark 会先进行推理规划,包括从网络获取实时信息、融合多张参考照片,再交给 Muse Image 执行生成。模型支持自然语言描述生成、AI 修图、信息图生成和功能性二维码创建。Instagram 上首批上线了 30 多种 AI 特效。
蚂蚁灵波开源 LingBot-Video,具身智能视频生成新突破
7 月 9 日,蚂蚁灵波科技开源 LingBot-Video,这是全球首个基于 MoE(混合专家)架构、面向具身智能的开源视频生成基础模型。模型采用 DiT+MoE 设计,30B 总参数在生成时仅激活约 3B 参数,推理效率约为同等规模 Dense 架构的 3 倍。
在北京大学与字节跳动联合发布的 RBench 基准上,LingBot-Video 总分为 0.620,超越 Wan2.6(0.607)、Seedance 1.5 Pro(0.584)和 Cosmos3 Super(0.581)。模型构建了 7 万小时规模的具身数据引擎,覆盖灵巧操作、机器人移动和第一视角交互等场景,可用于机器人动作预测、仿真数据生成和世界模型研究。
豆包与千问 7 月 15 日关停智能体功能
7 月 4 日,字节跳动豆包与阿里通义千问同步宣布,将于 2026 年 7 月 15 日正式下线平台内全部用户自定义智能体功能。这一日期恰逢《人工智能拟人化互动服务管理暂行办法》正式施行之日。
两大平台统一设置了数据留存缓冲期:7 月 15 日至 10 月 15 日期间,用户可查看并导出智能体配置和历史对话;10 月 15 日后相关数据将被永久清除。字节跳动将把拟人化智能交互业务迁移至旗下猫箱 App,通义千问则计划将合规智能体业务剥离主站独立运营。此前,上海市委网信办已累计下架违规智能体 1.4 万余个。
Kimi K3 本月发布,2.5 万亿参数领跑国产多模态
月之暗面(Moonshot AI)确认新一代旗舰模型 Kimi K3 将于 7 月内发布。据多方信源,K3 采用 MoE 架构,参数规模高达 2.5 万亿,超越 DeepSeek V4 Pro 的 1.6 万亿和百度文心 5.0 的 2.4 万亿,成为国产大模型参数规模最大的基座模型。
K3 预计将支持 100 万 Token 超长上下文窗口和原生多模态融合(文本、图像、音频、视频统一理解)。月之暗面在商业化方面也表现出强劲势头:公司估值已攀升至 315 亿美元,年化经常性收入(ARR)在 6 月中旬突破 3 亿美元,较年初增长 5 倍。
今日快评
2026 年 7 月第二周,AI 行业呈现出几个值得关注的趋势。其一,政府安全审查成为前沿模型发布的「新常态」。GPT-5.6 和 Claude Fable 5 均经历了政府审查,这正在重塑大模型公司的发布节奏和产品策略。其二,全双工语音交互的技术壁垒正在被打破。GPT-Live 的全双工架构将语音交互从「轮次式」推向「持续流」,这可能是下一代人机交互范式的起点。其三,AI 行业的监管趋严与商业化加速并行。中国《人工智能拟人化互动服务管理暂行办法》的施行直接推动了豆包、千问的智能体功能下线,而 Kimi K3 的 315 亿美元估值则显示出资本市场对优秀 AI 产品的高度认可。
对于关注 AI 技术发展的读者,我们推荐持续关注 通肯智能(TOKEN 导航),获取更多前沿 AI 模型评测与行业深度分析。
参考来源
- OpenAI — Previewing GPT-5.6 Sol
- OpenAI — Introducing GPT-Live
- TechCrunch — Meta enters the crowded AI coding battle with Muse Spark 1.1
- Meta — Introducing Muse Image
- SRN News — SpaceXAI launches Grok 4.5
- 量子位 — 蚂蚁灵波开源LingBot-Video
- 第一财经 — 豆包、千问将于7月15日下线智能体功能
- AITNT — Kimi K3确认本月发布,2.5万亿参数
37020202001687