Grok 4.6 是SpaceXAI发布的最新一代旗舰大语言模型。该模型沿用Grok 4.5的1.5万亿参数V9基础架构,基础模型结构不做改动,全部能力提升来自监督微调(SFT)与强化学习(RL)的后训练优化。Grok 4.6的核心定位是面向长时运行智能体(Agentic AI)的专用模型,重点强化长时间自主执行多步骤复杂任务的能力,以及处理复杂交互式、视觉化和知识工作任务的能力。在Artificial Analysis Intelligence Index综合评测中,Grok 4.6获得61分,与OpenAI的GPT-5.6 Sol Max持平,重新进入前沿模型第一梯队;在GDPVal-AA v2智能体综合评测中以1753 Elo超越GPT-5.6 Sol Max(1728)和Claude Fable 5 Max(1741),位列第一。

Grok 4.6核心特点
- 长时智能体专用设计:与传统的单轮问答模型不同,Grok 4.6专为长时间运行的多步骤任务而训练,能够自主完成”理解需求→调研分析→编写代码→运行测试→发现问题→修改代码→自我校验”的完整闭环,无需每一步等待用户下达新指令。
- 前沿性能+极致性价比:AA Intelligence Index得分61分追平GPT-5.6 Sol Max,但API定价仅为输入2美元/百万Token、输出6美元/百万Token,比Claude Opus 5($5/$25)和GPT-5.6 Sol($5/$30)低60%以上,每任务成本约0.84美元,被Artificial Analysis评为”综合能力与每任务成本的最优模型”。
- 500K上下文窗口:支持50万Token上下文,可容纳中型代码库或长文档,但需注意超过20万Token后输入输出价格翻倍($4/$12)。
- 图文多模态输入:支持文本和图片输入,在视觉和交互式项目中能更快形成较为完整的第一版成果。
- 自主测试与验证行为:在更长的任务轨迹中,模型开始表现出自我校验能力——在继续执行之前主动检查已完成的工作,减少错误累积。
- Cursor数据加持:SpaceX于2026年6月以600亿美元收购Cursor后,将数万亿Token的Cursor真实开发数据引入训练,涵盖代码库修改、工具调用、开发者与AI协同工作等真实软件工程流程。
- 高速版本可选:提供标准版和速度更快的低延迟版本(价格为标准版2倍),适配不同场景的响应速度需求。
Grok 4.6技术原理
- 1.5T参数V9架构复用:Grok 4.6完全复用Grok 4.5的1.5万亿参数V9基础架构,不做结构改动,所有能力提升均来自后训练阶段的优化,体现了”不扩参数,只磨后训练”的技术路线。
- 更长周期增量训练:相比Grok 4.5进行了更长时间的补充训练,训练素材包含三类核心数据——经筛选的模型生成推理数据(覆盖不同推理强度)、前沿技术文献与高级技术概念数据、高质量工程案例数据,配合改进后的优化器和训练方案。
- SFT轨迹重新生成:利用Grok 4.5重新生成监督微调(SFT)轨迹,覆盖不同推理强度、各类智能体运行框架,以及理工科(STEM)、软件开发、知识研究等多个场景领域,并通过基于模型的自检机制剔除存在缺陷的训练轨迹。
- 广泛智能体强化学习(RL):在SFT基础上进行大规模智能体强化学习训练,任务覆盖知识处理、通用编程、系统内核优化、网页开发、计算机辅助设计(CAD)等多个领域,使模型学会在真实任务环境中自主规划、执行和修正。
- 可配置推理深度:支持可配置的推理模式,允许开发者根据任务复杂度调整模型的推理深度,在速度与质量之间灵活取舍。
Grok 4.6主要功能
- 长流程多步骤任务执行:能够持续处理包含大量步骤的复杂任务,包括资料研究、海量信息研判、大型代码库处理,以及将抽象产品构想转化为完整可运行的应用程序。
- 复杂编程与代码工程:在DeepSWE v1.1上从54%跃升至65.9%,CursorBench v3.2达到69.9%,FrontierCode v1.1达到61.3%,跨代码库改动和自主调试能力显著增强。
- 知识工作与专业分析:在GDPVal-AA v2上以1753 Elo排名第一,覆盖44个职业和9个主要行业的真实世界专业任务,在Harvey LAB(法律)上从12.9%提升至15.8%。
- 视觉与交互式项目生成:面对明确的产品构想时,可一次建立应用的基本结构和视觉语言,第一版成果较Grok 4.5有显著提升。
- 智能体工具调用:支持在智能体环境中使用Shell和网页浏览等工具完成任务,原生支持Tool Calling,适配主流Agent框架。
- Grok Bot协同:配套Grok Bot产品(8月11日早期测试版),每个Bot拥有自己的云电脑,能登录用户的工具和应用,跨应用独立执行多步工作,仅在需要审批时才回来找用户。
Grok 4.6应用场景
- 软件工程全流程:从需求理解、架构设计、代码编写、测试运行到Bug修复的端到端开发,覆盖内核优化、网页开发、CAD设计等复杂工程任务,已在Cursor中原生集成。
- 产品原型快速构建:将模糊的产品想法转化为可运行的初版应用,自主完成领域调研、结构设计、核心交互实现和多轮反馈迭代。
- 研究分析与知识工作:在陌生领域进行深度调研、信息分析和综合研判,适合咨询、法律、金融等知识密集型行业。
- 企业级智能体系统:作为长时运行Agent的底层模型,驱动跨系统数据查询、报告生成、流程自动化等复杂多步骤企业任务。
- STEM与学术研究:在数学、科学、工程等STEM领域提供推理支持,适合科研辅助、论文分析和实验设计。
- SpaceX内部工程应用:马斯克规划将Grok深度融入SpaceX体系,延伸至工程研发、软件开发及其他业务场景,利用SpaceX的计算基础设施和工程场景形成闭环。
Grok 4.6定价与接入方式
表格
| 项目 | 标准版 | 高速版 |
|---|---|---|
| 输入价格 | $2/百万Token | $4/百万Token |
| 输出价格 | $6/百万Token | $12/百万Token |
| 缓存命中 | $0.50/百万Token | — |
| 上下文窗口 | 500K Token | 500K Token |
| 超200K上下文 | 价格翻倍 | 价格翻倍 |
接入渠道:
表格
| 渠道 | 说明 |
|---|---|
| Cursor | 原生集成,首周2倍用量 |
| Grok Build | SpaceXAI官方开发平台,首周2倍用量 |
| Grok Bot | AI队友产品,拥有独立云电脑 |
| API(OpenAI兼容) | model参数设为grok-4.6 |
| OpenRouter / Vercel / Cloudflare | 第三方平台同步接入 |
与竞品横向对比
表格
| 基准测试 | Grok 4.6 | GPT-5.6 Sol Max | Fable 5 Max |
|---|---|---|---|
| AA Intelligence Index | 61 | 61 | 62 |
| GDPVal-AA v2 (Elo) | 1753 | 1728 | 1741 |
| DeepSWE v1.1 | 65.9% | 73% | 70% |
| CursorBench v3.2 | 69.9% | 67.2% | 70.5% |
| APEX-Agents | 57.5% | 56.7% | 59.2% |
| Terminal-Bench v3.0 | 26% | 34.6% | 34.1% |
| Harvey LAB | 15.8% | 2.5% | 11.3% |
| 输入价格 ( $ /M) | $2 | $5 | $15 |
| 输出价格 ( $ /M) | $6 | $30 | $25 |
Grok 4.6在GDPVal-AA v2、Harvey LAB等智能体和知识工作测试中领先,但在DeepSWE和Terminal-Bench等纯代码工程和终端操作测试中仍落后于GPT-5.6 Sol和Fable 5。其核心竞争力在于以不到竞品1/3的价格提供前沿级别的综合能力,尤其在长时智能体任务的成本效率上具有显著优势。
路线图展望
表格
| 时间 | 版本 | 关键变化 |
|---|---|---|
| 2026年7月 | Grok 4.5 | 1.5T参数,主打代码与Agent,引入Cursor数据 |
| 2026年8月 | Grok 4.6 | 复用V9架构,SFT+RL后训练升级,AA指数61分 |
| 预计3-4周后 | Grok 4.7 | 参数增至2.1T,各方面进一步提升,推理速度略慢 |
| 2026年内 | Grok 5 | 首次纳入SpaceX 25年全量工程数据,规模未公布 |
© 版权声明
文章版权归作者所有,未经允许请勿转载。
相关文章
暂无评论...



