Grok 4.6 – SpaceXAI发布的最新一代旗舰大语言模型

Grok 4.6 是SpaceXAI发布的最新一代旗舰大语言模型。该模型沿用Grok 4.5的1.5万亿参数V9基础架构,基础模型结构不做改动,全部能力提升来自监督微调(SFT)与强化学习(RL)的后训练优化。Grok 4.6的核心定位是面向长时运行智能体(Agentic AI)的专用模型,重点强化长时间自主执行多步骤复杂任务的能力,以及处理复杂交互式、视觉化和知识工作任务的能力。在Artificial Analysis Intelligence Index综合评测中,Grok 4.6获得61分,与OpenAI的GPT-5.6 Sol Max持平,重新进入前沿模型第一梯队;在GDPVal-AA v2智能体综合评测中以1753 Elo超越GPT-5.6 Sol Max(1728)和Claude Fable 5 Max(1741),位列第一。

Grok 4.6 - SpaceXAI发布的最新一代旗舰大语言模型

Grok 4.6核心特点

  • 长时智能体专用设计:与传统的单轮问答模型不同,Grok 4.6专为长时间运行的多步骤任务而训练,能够自主完成”理解需求→调研分析→编写代码→运行测试→发现问题→修改代码→自我校验”的完整闭环,无需每一步等待用户下达新指令。
  • 前沿性能+极致性价比:AA Intelligence Index得分61分追平GPT-5.6 Sol Max,但API定价仅为输入2美元/百万Token、输出6美元/百万Token,比Claude Opus 5($5/$25)和GPT-5.6 Sol($5/$30)低60%以上,每任务成本约0.84美元,被Artificial Analysis评为”综合能力与每任务成本的最优模型”。
  • 500K上下文窗口:支持50万Token上下文,可容纳中型代码库或长文档,但需注意超过20万Token后输入输出价格翻倍($4/$12)。
  • 图文多模态输入:支持文本和图片输入,在视觉和交互式项目中能更快形成较为完整的第一版成果。
  • 自主测试与验证行为:在更长的任务轨迹中,模型开始表现出自我校验能力——在继续执行之前主动检查已完成的工作,减少错误累积。
  • Cursor数据加持:SpaceX于2026年6月以600亿美元收购Cursor后,将数万亿Token的Cursor真实开发数据引入训练,涵盖代码库修改、工具调用、开发者与AI协同工作等真实软件工程流程。
  • 高速版本可选:提供标准版和速度更快的低延迟版本(价格为标准版2倍),适配不同场景的响应速度需求。

Grok 4.6技术原理

  • 1.5T参数V9架构复用:Grok 4.6完全复用Grok 4.5的1.5万亿参数V9基础架构,不做结构改动,所有能力提升均来自后训练阶段的优化,体现了”不扩参数,只磨后训练”的技术路线。
  • 更长周期增量训练:相比Grok 4.5进行了更长时间的补充训练,训练素材包含三类核心数据——经筛选的模型生成推理数据(覆盖不同推理强度)、前沿技术文献与高级技术概念数据、高质量工程案例数据,配合改进后的优化器和训练方案。
  • SFT轨迹重新生成:利用Grok 4.5重新生成监督微调(SFT)轨迹,覆盖不同推理强度、各类智能体运行框架,以及理工科(STEM)、软件开发、知识研究等多个场景领域,并通过基于模型的自检机制剔除存在缺陷的训练轨迹。
  • 广泛智能体强化学习(RL):在SFT基础上进行大规模智能体强化学习训练,任务覆盖知识处理、通用编程、系统内核优化、网页开发、计算机辅助设计(CAD)等多个领域,使模型学会在真实任务环境中自主规划、执行和修正。
  • 可配置推理深度:支持可配置的推理模式,允许开发者根据任务复杂度调整模型的推理深度,在速度与质量之间灵活取舍。

Grok 4.6主要功能

  • 长流程多步骤任务执行:能够持续处理包含大量步骤的复杂任务,包括资料研究、海量信息研判、大型代码库处理,以及将抽象产品构想转化为完整可运行的应用程序。
  • 复杂编程与代码工程:在DeepSWE v1.1上从54%跃升至65.9%,CursorBench v3.2达到69.9%,FrontierCode v1.1达到61.3%,跨代码库改动和自主调试能力显著增强。
  • 知识工作与专业分析:在GDPVal-AA v2上以1753 Elo排名第一,覆盖44个职业和9个主要行业的真实世界专业任务,在Harvey LAB(法律)上从12.9%提升至15.8%。
  • 视觉与交互式项目生成:面对明确的产品构想时,可一次建立应用的基本结构和视觉语言,第一版成果较Grok 4.5有显著提升。
  • 智能体工具调用:支持在智能体环境中使用Shell和网页浏览等工具完成任务,原生支持Tool Calling,适配主流Agent框架。
  • Grok Bot协同:配套Grok Bot产品(8月11日早期测试版),每个Bot拥有自己的云电脑,能登录用户的工具和应用,跨应用独立执行多步工作,仅在需要审批时才回来找用户。

Grok 4.6应用场景

  • 软件工程全流程:从需求理解、架构设计、代码编写、测试运行到Bug修复的端到端开发,覆盖内核优化、网页开发、CAD设计等复杂工程任务,已在Cursor中原生集成。
  • 产品原型快速构建:将模糊的产品想法转化为可运行的初版应用,自主完成领域调研、结构设计、核心交互实现和多轮反馈迭代。
  • 研究分析与知识工作:在陌生领域进行深度调研、信息分析和综合研判,适合咨询、法律、金融等知识密集型行业。
  • 企业级智能体系统:作为长时运行Agent的底层模型,驱动跨系统数据查询、报告生成、流程自动化等复杂多步骤企业任务。
  • STEM与学术研究:在数学、科学、工程等STEM领域提供推理支持,适合科研辅助、论文分析和实验设计。
  • SpaceX内部工程应用:马斯克规划将Grok深度融入SpaceX体系,延伸至工程研发、软件开发及其他业务场景,利用SpaceX的计算基础设施和工程场景形成闭环。

Grok 4.6定价与接入方式

表格

项目标准版高速版
输入价格$2/百万Token$4/百万Token
输出价格$6/百万Token$12/百万Token
缓存命中$0.50/百万Token
上下文窗口500K Token500K Token
超200K上下文价格翻倍价格翻倍

接入渠道:

表格

渠道说明
Cursor原生集成,首周2倍用量
Grok BuildSpaceXAI官方开发平台,首周2倍用量
Grok BotAI队友产品,拥有独立云电脑
API(OpenAI兼容)model参数设为grok-4.6
OpenRouter / Vercel / Cloudflare第三方平台同步接入

与竞品横向对比

表格

基准测试Grok 4.6GPT-5.6 Sol MaxFable 5 Max
AA Intelligence Index616162
GDPVal-AA v2 (Elo)175317281741
DeepSWE v1.165.9%73%70%
CursorBench v3.269.9%67.2%70.5%
APEX-Agents57.5%56.7%59.2%
Terminal-Bench v3.026%34.6%34.1%
Harvey LAB15.8%2.5%11.3%
输入价格 ( $ /M)$2$5$15
输出价格 ( $ /M)$6$30$25

Grok 4.6在GDPVal-AA v2、Harvey LAB等智能体和知识工作测试中领先,但在DeepSWE和Terminal-Bench等纯代码工程和终端操作测试中仍落后于GPT-5.6 Sol和Fable 5。其核心竞争力在于以不到竞品1/3的价格提供前沿级别的综合能力,尤其在长时智能体任务的成本效率上具有显著优势。


路线图展望

表格

时间版本关键变化
2026年7月Grok 4.51.5T参数,主打代码与Agent,引入Cursor数据
2026年8月Grok 4.6复用V9架构,SFT+RL后训练升级,AA指数61分
预计3-4周后Grok 4.7参数增至2.1T,各方面进一步提升,推理速度略慢
2026年内Grok 5首次纳入SpaceX 25年全量工程数据,规模未公布
© 版权声明
为这篇文章评分
10.0/ 10
1 人评价
点击⭐️进行评分

相关文章

暂无评论

none
暂无评论...