AI 日报 — 2026年7月11日
AI 日报 — 2026年7月11日
本期导读:本周AI行业上演了一场”冰火两重天”。OpenAI在一周内同时交出了惊艳与翻车两份答卷:GPT-5.6 Sol Ultra在一小时内攻克了困扰数学界50年的图论猜想,而ChatGPT Work的发布却因界面混乱、配额耗尽过快而遭到用户猛烈批评。与此同时,苹果以商业秘密窃取为由起诉OpenAI,OpenAI的7300亿美元IPO计划持续升温。在大洋彼岸,蚂蚁集团连发多款具身智能模型,高盛发布重磅报告拆解中国AI大模型竞争格局,揭示中国模型以美国同行10%—25%的定价实现接近的性能表现。本日报将深度解读上述事件,帮助读者把握这一周AI行业最核心的脉动。
一、GPT-5.6 Sol Ultra 证明50年数学猜想:AI科研的里程碑时刻
7月10日,OpenAI研究员Ethan Knight在社交平台宣布,GPT-5.6 Sol Ultra在”Ultra模式”下,使用64个并行子智能体(subagent),不到一小时即完成了”环双重覆盖猜想”(Cycle Double Cover Conjecture)的完整证明。该猜想由Szekeres和Seymour在1970年代独立提出,核心问题是:在任意无桥图中,是否总能找到一组环,使得每条边恰好被覆盖两次?这一问题在图论中具有基础性地位,50年来仅得到部分特殊情况的解决,从未有一般性证明。OpenAI将三页证明论文和完整提示词(prompt)均托管在其CDN上公开发布,并在论文中明确声明”本证明完全由GPT-5.6 Sol Ultra完成,Codex辅助写作”。
曼彻斯特大学数学家Thomas Bloom审阅后称其为”非常漂亮的证明”,并指出解法简洁、初等,”本可以在1980年代被发现”——不需要任何新数学理论,而是巧妙组合了已知工具。Bloom猜测人类之所以错过这一证明,关键在于一个反直觉的推理转折:人类尝试自然路径失败后会认为问题更难,而AI不会气馁,会持续尝试微小变体直到找到可行方案。然而Bloom也提出了尖锐批评:OpenAI的论文完全没有引用其证明所依赖的先前工作——特别是1983年Bermond、Jackson和Jaeger的论文。他怀疑AI并非完全独立想到了解法,因为AI解题的”第一本能”通常是搜索所有相关论文并阅读。这场争议重新点燃了关于推理模型究竟是在重组现有知识还是产生真正创新的辩论。
值得注意的是,提示词工程在这一成果中扮演了关键角色。人类精心设计的提示词要求模型假设完整证明存在(排除了”猜想仍未解决”的简单回答),禁止网络搜索问题是否已被解决,并指示64个智能体独立工作。Bloom认为,如果用传统自然路径,人类”会在第一步就止步”。这一案例既是AI能力的惊人展示,也凸显了人机协作在前沿科研中的新范式——模型负责探索空间,而人类负责定义问题与约束边界。
二、苹果起诉OpenAI:400多名前员工涉嫌系统性窃取商业机密
7月10日,苹果在北加州联邦法院正式起诉OpenAI及其两名前员工,指控其存在”协调一致的商业秘密窃取行为”。诉讼文件显示,超过400名苹果前雇员目前在OpenAI任职,苹果声称其中部分人员系统性地获取并带走了苹果尚未发布的硬件机密信息。两名被告尤为引人注目:一位是唐坦(Tang Tan),曾任iPhone副总裁,现为OpenAI首席硬件官;另一位是刘姓前员工(Liu),被指控在离职后仍然访问苹果的机密文件和信息。
苹果在诉讼中表示,公司内部调查发现了一种”系统性盗窃模式”——前员工在跳槽至OpenAI后,访问了与其新职位无关的苹果商业机密。这一案件发生在OpenAI正积极推进硬件布局、构建自有算力基础设施的关键时期。OpenAI此前已通过Stargate项目与软银、甲骨文合作投入5000亿美元建设AI数据中心,并持续拓展其在芯片和终端硬件领域的野心。苹果作为全球最大的消费电子和芯片设计公司之一,其硬件设计、供应链和制造工艺的机密信息具有极高的商业价值。这起诉讼不仅是两大科技巨头之间的法律较量,更反映出AI行业对硬件人才和知识产权争夺的白热化程度。
三、OpenAI 7300亿美元IPO计划:史上最大科技上市蓄势待发
OpenAI已于6月8日向美国证券交易委员会(SEC)提交了机密S-1文件,由高盛和摩根士丹利担任主承销商,目标最早于2026年9月实现公开上市。私募市场对OpenAI的估值为7300亿至8500亿美元,若上市首日市值突破万亿美元,将成为美国历史上最大的科技IPO之一。这一数字远超Meta 2012年上市时约1040亿美元的市值,仅次于沙特阿美。
OpenAI的财务数据令人瞩目:2025年全年实际收入约131亿美元,年化收入率在2025年底已突破200亿美元,CFO Sarah Friar确认目前月度收入约20亿美元。但烧钱速度同样惊人——公司预计2026年亏损约140亿美元,盈利目标定在2030年。值得注意的是,OpenAI还提出了一项前所未有的提案:向美国联邦政府提供5%的股权,效仿阿拉斯加永久基金模式,使华盛顿成为OpenAI的财务利益相关方。这一提议在监管环境中颇具策略意义——欧盟AI法案正在加强执行,美国国会对前沿AI实验室的审查也在加剧,政府持股可能成为获得监管”许可证”的关键一步。Anthropic此前已于6月1日提交了自己的机密IPO文件,两家AI巨头在同一个上市窗口竞争,2026年Q3—Q4正成为前沿AI估值的首个公开市场检验期。
四、Meta Muse Spark 1.1:扎克伯格重返X平台,Meta首款付费API模型登场
7月9日,Meta超级智能实验室(Meta Superintelligence Labs)发布了Muse Spark 1.1,这是Meta迄今最强大的多模态推理模型,也是Meta历史上首次对其前沿AI模型收费。新模型在工具使用(MCP Atlas得分88.1,超越Claude Opus 4.8和GPT-5.5)、计算机操控、代码编写和多模态理解等方面均有大幅提升,支持100万token上下文窗口,并能作为主智能体或子智能体运行。Meta Model API同时开启公开预览,定价为每百万输入token 1.25美元、输出token 4.25美元,约为竞品价格的四分之一。新用户可获得20美元免费额度。
马克·扎克伯格时隔三年重返X平台宣布了这一消息,凸显Meta对AI领域竞争的高度重视。Muse Spark 1.1在多个智能体基准测试中领先:在JobBench(专业工具使用)上得分54.7,大幅超过Claude Opus 4.8的48.4和GPT-5.5的38.3;在”人类终极考试”(Humanity’s Last Exam)带工具版上得分62.1,也高于Opus 4.8的57.9。Meta的定价策略明确指向OpenAI和Anthropic的核心收入来源——API业务。值得注意的是,这是Muse系列首个闭源前沿模型,与Meta此前以开源著称的Llama路线形成鲜明对比。Meta表示有计划在未来版本中回归开源,但眼下收费模型标志着商业化转型的开始。
五、中国具身智能双雄:BAAI”悟界”Orca世界模型与蚂蚁LingBot-VA 2.0
本周中国在具身智能领域交出了两份亮眼答卷。北京智源人工智能研究院(BAAI)发布了”悟界”RoboBrain Orca世界基础模型,其核心创新在于打破现有范式——不再预测”下一个token””下一个视频帧”或”下一个动作”,而是预测”下一个世界状态”。该模型在统一的潜在空间中学习世界状态的表示,然后从这一内部模拟器中解码出文本、未来图像和动作。Orca使用12.5万小时无标签视频进行”无意识学习”,辅以1.6亿条事件标注进行”有意识学习”,在H100 GPU上达到每GPU每秒2.91个训练样本的效率,是StarVLA的约4.4倍。在真实机器人分布外测试中,Orca达到36.6%的成功率,而专门针对机器人动作标注训练的π₀.5仅为27.6%——且Orca在预训练阶段从未见过任何动作标签。
同日,蚂蚁集团旗下灵波科技(Robbyant)发布了LingBot-VA 2.0视频-动作基础模型。这是一款”具身原生”模型——整个栈从头为具身智能预训练,而非在视频生成模型上微调。该模型采用因果DiT架构与稀疏MoE视频流,在单块GPU上实现150Hz推理频率,双臂操作任务成功率达93.6%。此前一周,灵波还发布了LingBot-Depth 2.0空间感知模型和LingBot-Depth 2.0视觉基础模型,在16项深度补全基准中12项排名第一,成功解决玻璃、镜面和透明物体的感知难题。蚂蚁集团正在构建从感知(LingBot-Depth/Vision)到动作(LingBot-VA/VLA)再到世界模拟(LingBot-World)的完整具身智能技术栈。
六、ChatGPT Work发布翻车:OpenAI承认”没把一切都做对”
7月9日,OpenAI发布ChatGPT Work——一个面向复杂工作任务的AI智能体,同时推出全新桌面应用,将Chat、Work和Codex三大功能合并为一体。然而发布后24小时内,用户反馈如潮水般涌来:桌面应用界面大改后令人困惑,熟悉的功能(如对话历史和项目管理)被藏得更深;GPT-5.6 Sol最高推理模式下消耗配额的速度远超前代模型;多个插件出现故障;Codex用户甚至一度以为编码工具将被废弃。OpenAI产品负责人Thibault Sottiaux随即发表声明承认”我们没把一切都做对”,并在同一天内两次重置ChatGPT Work和Codex的使用配额,以确保用户能够继续体验。
Sottiaux指出了四个核心问题:最高算力设置过于容易触发且对用量影响不够透明;桌面应用改版过于激进,破坏了用户习惯;部分多智能体工作流出现退化;沟通上对Codex的未来定位造成误解。他表示下周将推出更大规模的更新,恢复侧边栏功能、改善用量指标可见度。分析师指出,ChatGPT Work原本旨在挑战微软Copilot和Google Gemini的企业AI市场,但糟糕的发布可能削弱企业客户对OpenAI的信任——尤其是在与Salesforce和摩根士丹利等早期合作伙伴的关键时期。近10亿用户基数的OpenAI,在从消费者产品向工作平台转型的过程中,正面临”用户量越大,失误代价越高”的挑战。
七、中国AI蒸馏攻防战:Alibaba被指制造2.88亿次Claude交互
Anthropic在致美国白宫和参议员的信中披露,与阿里巴巴旗下通义千问(Qwen)AI实验室相关的运营者,在2026年4月22日至6月5日的六周内,通过约2.5万个虚假账号与Claude系统产生了2880万次交互,是已知最大规模的AI蒸馏攻击。OpenAI也发出类似警告,称中国实验室正利用数万个假账号复制其模型能力。蒸馏攻击的核心逻辑是:通过大量精心设计的提示词获取前沿模型的输出,然后用这些输出数据训练竞品模型,从而在远低于自主研发成本的情况下缩小性能差距。
Anthropic表示这些交互高度集中于推理、编码和工具使用等高价值领域,明显不是正常使用模式。该公司已致函参议员Elizabeth Warren和Tim Scott,呼吁加强AI芯片出口管制和API层面的反蒸馏立法。此前,Anthropic已于2月公开披露DeepSeek、Moonshot和MiniMax使用超过2.4万个账号产生了1600万次交互。阿里巴巴尚未就此次指控发表详细技术反驳。这一系列事件凸显了AI行业面临的新型安全威胁——当模型输出本身成为战略资产,现有的服务条款和出口管制框架都存在盲区。对于正在筹备IPO的Anthropic而言,这一事件的政策影响可能比商业损失更为深远。
八、Gemini 3.5 Pro延期至7月17日:Google DeepMind从头重建旗舰模型
Google DeepMind的下一代旗舰模型Gemini 3.5 Pro已从原定的6月发布推迟至7月17日,原因是对现有Gemini 2.5 Pro架构的性能不满,决定从头重新预训练。这一”推倒重来”的决定在AI行业引起广泛关注——Google CEO Pichai在I/O 2026上曾以”给我们下个月时间”承诺交付该模型,但随后面临内部人员流失和性能退化等问题。新模型将配备200万token上下文窗口(目前所有生产级前沿模型中最大)和内置的Deep Think推理层,重点加强数学推理、SVG场景生成和图像质量。
Gemini 3.5 Pro的延迟发布将与OpenAI的GPT-5.6 Sol和Anthropic的Fable 5形成直接竞争的时间窗口。在基准测试方面,虽然尚未有官方数据,但非验证报告显示新模型在SWE-Bench Verified上可能比上一代提升10-15个百分点,编程能力接近GPT-5.5的82.7%。在定价方面,市场预期Pro版约为每百万token 15/60美元,若属实将成为最贵的前沿模型之一。这一系列延迟折射出前沿AI竞争的深层困境:在追赶速度与保证质量之间,任何一步妥协都可能被竞争对手抓住机会。对于Google而言,如果7月17日的发布再次出现问题,其在AI前沿的公信力将面临严重考验。
九、高盛重磅报告:中国AI大模型的”性价比攻势”与万亿市场格局
高盛分析师龚懿(Ronald Keung)团队近日发布了一份长达50页的深度报告,系统拆解了中国AI大模型的竞争格局。报告核心发现包括:中国高端模型(如智谱GLM5.2和阿里Qwen3.7 Max)定价约每百万token 1美元,仅为美国顶级模型(4—8美元)的10%—25%,但凭借更低的参数激活比(稀疏MoE架构下仅激活3%—5%参数),仍能维持10%—20%的推理毛利率。低端面向智能体任务的模型定价低至每百万token 0.06—0.2美元。DeepSeek宣布7月中旬对V4系列引入峰谷定价机制,混合定价约0.35美元(V4 Pro)和0.12美元(V4 Flash)。
高盛预测中国AI模型的API和订阅收入将从2026年估计的350亿元人民币增长至2030年的8790亿元,日均token消费从350万亿增长至4600万亿,增幅约25倍。在竞争定位方面,高盛引入了”定价能力×成本优势×财务实力”的三维评估框架,认为智谱(首次覆盖)和DeepSeek在基础文本模型中占据最有利位置,字节跳动在多模态领域领先。报告同时指出一个巨大的错配:中国AI相关企业总市值约4万亿美元,贡献全球AI相关收入约16%,但截至2026年1月,全球共同基金在中国的科技配置仅约1.2%。高盛建议”做多中国AI价值链”,涵盖电力、半导体、AI基础设施、模型和应用五层。
今日快评
回顾本周AI行业的核心事件,我们可以清晰地看到三股力量正在同时塑造行业走向。
第一股力量是”能力突破与落地困境的矛盾”。GPT-5.6 Sol Ultra攻克50年数学难题,展示了AI推理能力正在接近人类专家水平——Thomas Bloom的评价非常精准:”解法短小、初等,本可以在1980年代被发现。”但同一周,OpenAI的ChatGPT Work发布却暴露了一个尴尬现实:模型能力的飞跃并不自动转化为产品体验的提升。当近10亿用户需要的不是数学证明而是流畅的工作工具时,界面设计、配额管理和沟通清晰度可能比推理能力更决定用户留存。Meta Muse Spark 1.1的发布同样验证了这一点——它在智能体任务上领先,但真正的差异化来自定价策略:每百万token 1.25美元的输入价,仅为竞品的四分之一。
第二股力量是”AI治理与知识产权的灰色地带”。苹果起诉OpenAI的案件暴露了AI行业人才争夺中法律边界模糊的问题——400多名前员工的集体跳槽,究竟是正常的人才流动还是系统性的商业秘密窃取,法院的判决将为整个行业树立先例。而阿里巴巴被指制造2880万次Claude交互的蒸馏攻击,则揭示了另一层面的法律困境:当模型输出通过API被大量获取用于训练竞品,现有的出口管制和服务条款是否足以应对?正如Anthropic所警告的,”通过蒸馏训练的模型不太可能保留安全防护层”,这意味着前沿AI能力可能在缺乏安全约束的情况下扩散。
第三股力量是”中国AI的结构性崛起”。从BAAI的Orca世界模型(在零动作标签预训练下超越专用模型),到蚂蚁集团LingBot系列构建的完整具身智能技术栈,再到高盛报告揭示的”10%—25%定价实现接近性能”的结构性成本优势,中国AI正在从”追赶者”转向”差异化竞争者”。Orca的”下一个世界状态”预测范式和蚂蚁LingBot-VA 2.0的”具身原生”架构,都不是对西方模型的简单模仿,而是针对机器人和物理世界场景的原创技术路线。高盛报告中”全球基金仅1.2%配置中国科技”这一数字,暗示市场可能严重低估了这一趋势的投资意义。
站在2026年7月中旬的时间节点,AI行业正在经历从”模型能力竞赛”到”系统整合能力竞赛”的范式转换。无论是OpenAI的产品化阵痛、苹果与OpenAI的法律对峙,还是中国在具身智能和成本效率上的突破,都指向同一个结论:下一个阶段的赢家,未必是做出最强模型的公司,而是最能把模型能力转化为可信赖、可负担、可规模化的系统方案的参与者。在这个过程中,通肯智能(TOKEN 导航)所关注的技术落地与产业价值转化的视角,将变得越来越不可或缺——因为它提醒我们,AI的终极竞争不在于谁的论文更漂亮,而在于谁的方案真正走进了生产环境。
参考来源
- The Decoder — OpenAI GPT-5.6 Sol Ultra proves Cycle Double Cover Conjecture
- Kingy AI — OpenAI’s 64-Subagent Cycle Double Cover Proof Claim (Proof Audit)
- AP News — Apple files lawsuit accusing OpenAI of stealing trade secrets
- NYT — Apple Sues OpenAI, Accusing It of Stealing Company Secrets
- TheTrendsWire — OpenAI Files for IPO at $850B, Targeting September 2026
- FourWeekMBA — OpenAI’s $730B IPO and the 5% Government Stake
- Meta AI Blog — Introducing Muse Spark 1.1
- OfficeChai — Meta Announces Muse Spark 1.1 Benchmarks
- The Decoder — BAAI Orca World Model
- MarkTechPost — Ant Group’s LingBot-VA 2.0
- The Decoder — OpenAI admits ChatGPT Work launch issues
- Crypto Briefing — OpenAI and Anthropic warn Chinese AI distillation
- Anthropic Blog — Detecting and preventing distillation attacks
- Geeky Gadgets — Gemini 3.5 Pro leaks, July 17 launch
- PANews — Goldman Sachs Report on China AI Large Models
- Macrostream — Goldman Sachs Deep Dive: China AI LLM Race
- CNBC — Chinese AI models gain ground with US companies as costs surge
37020202001687