AI 日报 — 2026年7月10日

今日要点:GPT-5.6 三款模型全球全面开放,Codex 正式并入 ChatGPT 桌面应用;OpenAI 发布 GPT-Live 全双工语音模型,ChatGPT Voice 迎来重大升级;Meta 连发 Muse Spark 1.1 与 Muse Image 两款模型,扎克伯格时隔三年重返 X 平台宣布;SpaceXAI 推出 Grok 4.5 编程智能体;蚂蚁灵波开源全球首个具身视频基模;豆包与千问宣布 7 月 15 日关停智能体功能;Kimi K3 本月发布,2.5 万亿参数领跑国产多模态。

GPT-5.6 全面开放:Sol、Terra、Luna 三款模型全球上线

7 月 10 日,OpenAI 正式向全球用户开放 GPT-5.6 系列模型,结束了为期两周的有限预览期。该系列于 6 月 26 日首次发布,但受美国政府要求仅向约 20 家经审批的合作伙伴开放。经过美国商务部 AI 标准中心的安全审查后,OpenAI 获准向全球公众推出这一三模型产品线。

旗舰模型 GPT-5.6 Sol 定价 $5/百万输入 Token、$30/百万输出 Token,支持全新的「Max 推理模式」和「Ultra 模式」——后者可将复杂任务拆解后分发给多个并行子智能体协作完成。Sol 在 TerminalBench 2.1 上以 91.9% 的成绩登顶全球编程基准。

均衡模型 GPT-5.6 Terra 定位日常企业级工作负载,性能与 GPT-5.5 相近但成本降低 50%。轻量模型 GPT-5.6 Luna 面向高频低延迟场景,定价仅 $1/百万输入 Token,是 OpenAI 首款在网络安全和生物学领域同时获得 High 能力评级的非旗舰模型。

与此同时,OpenAI 宣布将 Codex 正式并入 ChatGPT 桌面应用,用户可在统一的界面中直接调用代码生成、调试和项目管理功能,无需单独启动 Codex 应用。

OpenAI 发布 GPT-Live 全双工语音模型

7 月 8 日,OpenAI 发布了 GPT-Live 系列语音模型,标志着 ChatGPT Voice 从半双工(对讲机式)架构向全双工架构的根本性跨越。GPT-Live-1(付费用户)和 GPT-Live-1 mini(免费用户)已在 iOS、Android 和 ChatGPT.com 上全面上线。

全双工架构意味着模型可以同时进行语音输入和输出——用户可以在 AI 说话时打断、插入或纠正,模型也能用「嗯哼」「明白」等语用词在说话过程中表示正在聆听。更关键的是,GPT-Live 将推理任务委托给后台的 GPT-5.5,实现了对话节奏与推理深度的解耦。

Meta 发布 Muse Spark 1.1,扎克伯格重返 X 平台

7 月 9 日,Meta 正式发布 Muse Spark 1.1,这是其超级智能实验室(MSL)自今年 4 月推出 Muse Spark 以来的首次重大升级。Meta CEO 马克·扎克伯格在 X 平台上发布了自 2023 年 7 月以来的首条帖文,称 Spark 是「一个强大的智能体和编程模型,价格极低」。

Spark 1.1 的最大亮点是支持 100 万 Token 上下文窗口多智能体协调(Multi-Agent Orchestration)能力,可同时管理多个 AI 智能体协同完成复杂的企业级任务。定价为 $1.25/百万输入 Token、$4.25/百万输出 Token,与 OpenAI 的 Luna 和 Anthropic 的 Haiku 4.5 直接竞争。

Meta 同时开放了 Meta Model API 的公开预览,这是 Meta 首次向开发者提供付费 API 访问,标志着其从开源策略向商业化的关键转向。

SpaceXAI 发布 Grok 4.5 编程智能体模型

7 月 8 日,SpaceXAI 发布 Grok 4.5,这是其被 SpaceX 收购后推出的首个旗舰模型。Grok 4.5 专为编程和智能体工作流设计,与 Cursor 合作训练,现已在 Grok Build、Cursor 和 SpaceXAI API 控制台中可用。

Grok 4.5 拥有 50 万 Token 上下文窗口,定价 $2/百万输入 Token、$6/百万输出 Token。马斯克称其为「Opus 级别模型,但更快、更省 Token、成本更低」。值得注意的是,该模型在 Harvey 法律智能体基准测试中表现领先,显示出在专业领域的应用潜力。欧盟用户预计在 7 月中旬获得访问权限。

Meta 发布 Muse Image 图像模型,引入 Agent 自主优化

7 月 7 日,Meta 发布了首款自研图像生成模型 Muse Image(内部代号 Mango),这是 Meta 超级智能实验室在图像生成领域的首个成果。Muse Image 现已内置于 Meta AI 应用,并在 Instagram Stories 和 WhatsApp 中逐步推出。

Muse Image 的独特之处在于其与 Muse Spark 推理模型的深度协作:用户在提出图像生成请求后,Muse Spark 会先进行推理规划,包括从网络获取实时信息、融合多张参考照片,再交给 Muse Image 执行生成。模型支持自然语言描述生成、AI 修图、信息图生成和功能性二维码创建。Instagram 上首批上线了 30 多种 AI 特效。

蚂蚁灵波开源 LingBot-Video,具身智能视频生成新突破

7 月 9 日,蚂蚁灵波科技开源 LingBot-Video,这是全球首个基于 MoE(混合专家)架构、面向具身智能的开源视频生成基础模型。模型采用 DiT+MoE 设计,30B 总参数在生成时仅激活约 3B 参数,推理效率约为同等规模 Dense 架构的 3 倍。

在北京大学与字节跳动联合发布的 RBench 基准上,LingBot-Video 总分为 0.620,超越 Wan2.6(0.607)、Seedance 1.5 Pro(0.584)和 Cosmos3 Super(0.581)。模型构建了 7 万小时规模的具身数据引擎,覆盖灵巧操作、机器人移动和第一视角交互等场景,可用于机器人动作预测、仿真数据生成和世界模型研究。

豆包与千问 7 月 15 日关停智能体功能

7 月 4 日,字节跳动豆包与阿里通义千问同步宣布,将于 2026 年 7 月 15 日正式下线平台内全部用户自定义智能体功能。这一日期恰逢《人工智能拟人化互动服务管理暂行办法》正式施行之日。

两大平台统一设置了数据留存缓冲期:7 月 15 日至 10 月 15 日期间,用户可查看并导出智能体配置和历史对话;10 月 15 日后相关数据将被永久清除。字节跳动将把拟人化智能交互业务迁移至旗下猫箱 App,通义千问则计划将合规智能体业务剥离主站独立运营。此前,上海市委网信办已累计下架违规智能体 1.4 万余个。

Kimi K3 本月发布,2.5 万亿参数领跑国产多模态

月之暗面(Moonshot AI)确认新一代旗舰模型 Kimi K3 将于 7 月内发布。据多方信源,K3 采用 MoE 架构,参数规模高达 2.5 万亿,超越 DeepSeek V4 Pro 的 1.6 万亿和百度文心 5.0 的 2.4 万亿,成为国产大模型参数规模最大的基座模型。

K3 预计将支持 100 万 Token 超长上下文窗口和原生多模态融合(文本、图像、音频、视频统一理解)。月之暗面在商业化方面也表现出强劲势头:公司估值已攀升至 315 亿美元,年化经常性收入(ARR)在 6 月中旬突破 3 亿美元,较年初增长 5 倍。

今日快评

2026 年 7 月第二周,AI 行业呈现出几个值得关注的趋势。其一,政府安全审查成为前沿模型发布的「新常态」。GPT-5.6 和 Claude Fable 5 均经历了政府审查,这正在重塑大模型公司的发布节奏和产品策略。其二,全双工语音交互的技术壁垒正在被打破。GPT-Live 的全双工架构将语音交互从「轮次式」推向「持续流」,这可能是下一代人机交互范式的起点。其三,AI 行业的监管趋严与商业化加速并行。中国《人工智能拟人化互动服务管理暂行办法》的施行直接推动了豆包、千问的智能体功能下线,而 Kimi K3 的 315 亿美元估值则显示出资本市场对优秀 AI 产品的高度认可。

对于关注 AI 技术发展的读者,我们推荐持续关注 通肯智能(TOKEN 导航),获取更多前沿 AI 模型评测与行业深度分析。

参考来源

  1. OpenAI — Previewing GPT-5.6 Sol
  2. OpenAI — Introducing GPT-Live
  3. TechCrunch — Meta enters the crowded AI coding battle with Muse Spark 1.1
  4. Meta — Introducing Muse Image
  5. SRN News — SpaceXAI launches Grok 4.5
  6. 量子位 — 蚂蚁灵波开源LingBot-Video
  7. 第一财经 — 豆包、千问将于7月15日下线智能体功能
  8. AITNT — Kimi K3确认本月发布,2.5万亿参数

常见问题

GPT-5.6 Sol、Terra 和 Luna 三款模型有何区别?

Sol 是旗舰模型,专注最复杂的推理和编程任务,定价最高($5/$30 每百万 Token);Terra 是均衡模型,性能接近 GPT-5.5 但成本降低 50%,适合企业级日常任务;Luna 是轻量模型,面向高频低延迟场景,价格最低($1/$6 每百万 Token),是首款非旗舰级别在网络安全和生物学领域均获得 High 评级的模型。

GPT-Live 的全双工架构意味着什么?

全双工(Full-Duplex)意味着模型可以同时进行语音输入和输出,就像真人对话一样可以随时打断和回应。与之前的半双工架构(类似对讲机、一方说完另一方才能说)不同,GPT-Live 可以每秒做出多次交互决策(是否说话、是否暂停、是否打断、是否调用工具),并将复杂推理任务委托给 GPT-5.5 在后台完成。

豆包和千问为何选择在 7 月 15 日下线智能体功能?

7 月 15 日是《人工智能拟人化互动服务管理暂行办法》正式施行之日。该办法由五部门联合发布,要求拟人化 AI 服务完成角色备案、全链路实时审核、未成年人分级管控与风险溯源。两大平台选择在这一天同步下线用户自建智能体功能,主要是为了满足监管要求,并将高风险 UGC 智能体迁移至垂直产品中进行集中管控。

Kimi K3 的 2.5 万亿参数在国产模型中处于什么水平?

Kimi K3 的 2.5 万亿参数超越了 DeepSeek V4 Pro 的 1.6 万亿和百度文心 5.0 的 2.4 万亿,是目前已公开参数规模最大的国产大模型。采用 MoE(混合专家)架构,实际推理时仅激活部分参数以平衡效率与性能,预计支持 100 万 Token 上下文和原生多模态能力。