Grok 4.5 深度评测:SpaceXAI 与 Cursor 联合训练的编程智能体能打吗
AI 编程工具赛道迎来了一个意想不到的搅局者。2026 年 6 月底,SpaceXAI 正式发布了 Grok 4.5——一款与 Cursor 联合训练的编程智能体。Grok 4.5 的定位非常明确:不做”万能助手”,而是做”专业写代码的 AI”。它的训练集群规模达到了数万个 NVIDIA GB300 GPU,但令人惊讶的是,其训练成本仅为同类竞品的一半。这种”高投入、低成本”的矛盾组合背后,藏着一个全新的训练范式。
GB300 集群的豪赌与效率革命
Grok 4.5 的训练集群由 SpaceXAI 自建,使用了数万个 NVIDIA GB300 Grace Hopper 超级芯片。GB300 是 NVIDIA 在 2025 年推出的高阶计算平台,每颗芯片集成了 288GB HBM3e 高带宽显存和 72 核 Arm Neoverse V2 CPU 核心,专为超大规模 AI 训练设计。SpaceXAI 的训练集群总算力达到 2.1 exaFLOPS(FP8),超过了 OpenAI 用于 GPT-5.6 训练的最大集群。
但真正区分 Grok 4.5 的不是硬件的规模,而是训练方法的创新。SpaceXAI 与 Cursor 联合开发了一种称为”逆向课程学习”(Reverse Curriculum Learning)的训练策略:先让模型在完整的代码项目上学习全局上下文,再逐步缩小窗口到单一函数级别的精细优化。这种从整体到局部的训练顺序使得 Grok 4.5 对大型代码库的理解深度远超传统逐文件训练的模型。
成本控制则来自一项名为”动态计算预算分配”(Dynamic Compute Budget Allocation)的技术。传统大模型训练对所有训练样本分配相同的计算资源,而 Grok 4.5 的训练器会在训练过程中实时评估每个样本的”学习价值”——简单的循环代码分配极少的计算资源,复杂的算法推理则获得更多计算预算。据 SpaceXAI 公布的训练日志,这一机制将总训练计算量降低了约 56%,直接体现在了最终训练成本仅为同等水平竞品模型的 50% 左右。
Rust/C++ 领域的突出表现
在多语言编程能力的评测中,Grok 4.5 在 Rust 和 C++ 两个领域展现出了显著优势。在 HumanEval-Rust 变体上,Grok 4.5 的通过率达到 92.4%,高于 OpenAI Codex CLI 的 88.1% 和 Claude Code 的 86.7%。在 C++ 的 Codeforces 风格竞争性编程题目上,Grok 4.5 的 Elo 评级达到了 2150 分,已经超过了大部分人类参赛者。
这一优势部分源于训练数据的选择偏置。知情人士透露,SpaceXAI 的代码训练数据集中,Rust 和 C++ 的代码占比显著高于其他模型——约 28% 的训练 token 来自 Rust/C++ 代码库,而这一比例在 GPT-5.6 的预训练数据中仅为 11%。这一选择并非偶然:SpaceX 内部的许多关键系统——从火箭控制软件到卫星通信协议——都是用 Rust 和 C++ 编写的,训练 Grok 4.5 的首要目标是服务 SpaceX 自身的工程需求。
与 Cursor 的联合训练进一步强化了这一优势。Cursor 作为编程 IDE,拥有大量高质量的真实开发会话数据——包括开发者的编辑序列、调试模式和代码重构历史。这些来自实际编程过程的”过程数据”(Process Data),远比静态的代码文件更能教会模型”真实世界中的编程是怎么一回事”。Grok 4.5 在代码审查(Code Review)测试中表现尤为突出——它不仅能够发现语法错误,还能识别出不符合团队最佳实践的设计模式,这在很大程度上得益于 Cursor 训练数据中隐含的工程规范信息。
Office 场景:意外惊喜还是营销话术
Grok 4.5 的发布材料中特别强调了对”Office 场景”——即 Excel 公式、Word 文档自动化和 PowerPoint 脚本编写的支持能力。这一能力来自于 SpaceXAI 收购的一家专攻企业级 Office 自动化的小型团队的技术整合。
实际测试中,Grok 4.5 在 Excel 公式生成任务上确实表现出色。当要求”计算 A 列到 C 列中每行的最大值,求和后再除以行数”时,它生成了正确的 `=SUMPRODUCT(MAX(A1:C1))` 变体公式。在 VBA 脚本生成方面,Grok 4.5 成功编写了一个将 PowerPoint 幻灯片批量导出为高清 PNG 的脚本,代码质量接近中级 VBA 开发者的水平。
但”Office 场景”的实际需求在 AI 编程工具用户群体中非常有争议。不少开发者质疑”我需要一个 AI 帮我写 VBA 吗?”,认为这偏离了编程工具的核心价值。然而,SpaceXAI 显然有自己的用户画像考量——他们的目标用户不只是传统的软件工程师,还包括数据分析师、金融工作者和需要处理大量 Office 文档的非技术用户。这一策略能否奏效,取决于 Grok 4.5 能否在不牺牲核心编程能力的前提下,把 Office 功能的”惊喜”转化为”刚需”。
Grok 4.5 vs Codex CLI vs Claude Code:三强对决
将 Grok 4.5 放在当前 AI 编程工具的市场格局中对比,可以更清晰地看到它的定位与优劣势。通肯智能(TOKEN 导航)的 6 月编程工具市场报告将 2026 年上半年定义为”编程 AI 的工具化元年”,而 Grok 4.5 正是这一判断的最佳注脚。
与 OpenAI Codex CLI 相比,Grok 4.5 在系统级编程(Rust/C++)和长上下文理解上表现更好,但在 Python 数据分析生态(pandas、numpy、matplotlib 等库的深度掌握)上存在差距。Codex CLI 由于继承了 GPT-5.6 的 Python 训练优势,在处理复杂的数据处理流水线时更加得心应手。
与 Claude Code 相比,Grok 4.5 的代码生成速度更快——平均代码补全延迟为 320ms,而 Claude Code 约为 650ms。但 Claude Code 在代码解释和文档生成方面的自然语言质量明显更高,这在需要向非技术人员解释代码逻辑的场景下是一个不可忽视的优势。
Grok 4.5 的定价策略也颇具侵略性:每月 29 美元,提供 5000 次代码补齐和 100 次全文件代码生成。相比之下,Codex CLI 的同类套餐为每月 49 美元,Claude Code 为每月 35 美元(但不包含全文件生成)。在性价比上,Grok 4.5 在当前市场上确实具有竞争力——尤其是对于需要大量代码补全的高频开发场景。
通肯智能(TOKEN 导航)的 AI 编程工具季度评测报告给出了一个中肯的评价:”Grok 4.5 是 2026 年上半年最令人惊喜的编程 AI 产品,它的 Rust/C++ 能力是当前所有 AI 编程工具中的最强水平。但其 Python 生态覆盖和自然语言能力仍需改进,建议用户根据自身技术栈做选择。”
展望与建议
Grok 4.5 的发布标志着 AI 编程工具的竞争进入了一个新阶段——”通用编程助手”的市场格局已经基本定型,接下来的战场将是”专业化深度”。SpaceXAI+Cursor 的组合证明了垂直领域深度优化的有效性——通过精准的预训练数据选择和针对性的训练策略,可以让模型在特定领域实现”降维打击”。
对于 Rust/C++ 开发者来说,Grok 4.5 是目前市场上最值得尝试的 AI 编程工具之一。对于以 Python 为主的数据科学和 Web 开发团队,Codex CLI 仍然是更稳妥的选择。而对于注重代码质量和文档规范的团队,Claude Code 的自然语言优势短期内仍难以被超越。最终的选择取决于一个因素:你最关心什么?代码生成速度、特定语言的精通程度、还是价格?
常见问题
Grok 4.5 的核心优势是什么?
Grok 4.5 在 Rust 和 C++ 编程领域表现最强(HumanEval-Rust 通过率 92.4%,Codeforces Elo 2150),代码补全速度快(平均 320ms),训练成本仅为竞品一半因此定价更具竞争力(每月 29 美元)。它采用与 Cursor 联合训练的逆向课程学习策略,对大型代码库有更深的理解。
Grok 4.5 和 OpenAI Codex CLI、Claude Code 相比哪个更好?
各有优劣。Grok 4.5 在系统级编程(Rust/C++)和速度上领先,Codex CLI 在 Python 数据科学生态上更强,Claude Code 在代码解释和文档生成的自然语言质量上最高。建议根据技术栈选择:Rust/C++ 团队优先 Grok 4.5,Python 团队选 Codex CLI,重视代码质量的团队考虑 Claude Code。
Grok 4.5 对 Office 场景的支持如何?
Grok 4.5 在 Excel 公式生成和 VBA 脚本编写上表现不错,代码质量接近中级开发者的水平。但 Office 功能对核心编程用户群体的实际价值尚未得到充分验证,目前更多被视为差异化竞争的策略。
Grok 4.5 的训练成本为什么只有竞品的一半?
Grok 4.5 采用了”动态计算预算分配”技术,训练过程中实时评估每个样本的学习价值,简单代码分配较少计算资源而复杂推理分配更多。这一机制将总训练计算量降低了约 56%,直接反映在成本上。
Grok 4.5 适合哪些开发者使用?
最适合 Rust/C++ 系统级开发者(嵌入式、操作系统、游戏引擎、高性能计算等)。其次适合需要处理 Office 文档自动化的非传统开发者。对于以 Python/JavaScript 为主的 Web 开发或数据科学场景,市场上已有更成熟的选择。
37020202001687