Muse Code 是 Meta(前 Facebook)正式推出的首款 AI 编程智能体(Coding Agent),目前处于公开测试阶段(Beta)。该产品由 Meta 超级智能实验室负责人 Alexandr Wang(汪滔)主导开发,底层搭载 Meta 最新发布的编程专用模型 Muse Spark 1.2。
Meta CEO 扎克伯格亲自宣布了这一消息,称 Muse Code 能够”在大型代码库中完成完整的软件工程任务”,涵盖规划变更、编写代码、验证结果全流程。这标志着 Meta 正式进入由 Anthropic(Claude Code)和 OpenAI(Codex)主导的 AI 编程智能体赛道。

Muse Code核心特点
1. 终端原生,而非网页聊天
Muse Code 是一款运行在终端(Terminal)中的编程智能体,而非网页端的聊天式代码助手。开发者通过一条命令即可在 macOS 或 Linux 上完成安装,随后直接在命令行中与智能体交互。
2. 完整软件工程任务覆盖
不同于仅能生成代码片段的工具,Muse Code 定位为”AI 软件工程师”,能够承担从需求理解到代码交付的完整流程:
- 理解代码库:自动索引整个项目结构、依赖关系和代码规范
- 规划变更:制定修改方案并提交审批
- 编写代码:跨文件、跨模块实施修改
- 验证结果:自动运行测试,根据结果继续调整
3. 多智能体并行协作
面对大型任务时,Muse Code 会自动生成多个异步后台智能体,在隔离的 Git 工作树中并行处理不同子任务,互不干扰。扎克伯格表示:”在测试中,我们让它同时为一个游戏构建六个功能,没有出现任何冲突。”
4. 持久化上下文与崩溃恢复
后台智能体在整个会话期间持续运行,随时间积累上下文,而非每次任务都从头开始。更关键的是,所有模型调用、工具运行、审批和编辑都会被追加到本地事件日志中。如果智能体在运行 20 小时后崩溃,它能从停止的位置精确恢复,不会丢失工作。
5. 内置技能系统
Muse Code 默认提供多项内置技能:
/plan:将任务拆解为一份需要审批后才能执行的计划/grill:对计划进行反复压力测试,直到方案足够可靠/goal:围绕指定目标持续推进,直至任务成功完成
Muse Code技术原理
底层模型:Muse Spark 1.2
Muse Code 的核心驱动力是 Muse Spark 1.2——Meta 超级智能实验室专为编程任务优化的大语言模型。
与前代 Muse Spark 1.1 的关键区别在于:
- 协同开发与训练:Muse Spark 1.2 与 Muse Code 是同步开发和训练的,而非先有模型再适配工具,这种深度耦合显著提升了整体编程性能
- 大幅增加编程训练算力:在代码生成、复杂调试、代码库理解等方面投入了更多训练资源
- 扩展训练环境多样性:覆盖更多编程语言、框架和项目类型
代码库级上下文理解
传统 AI 编程工具通常只能处理单个文件或有限代码片段。Muse Code 的核心创新在于其代码库级上下文理解能力——能够对整个代码仓库建立索引,理解项目架构、模块间依赖关系和代码规范的一致性。
多智能体协同架构
Muse Code 采用主智能体 + 异步后台智能体群的架构:
文本
1用户指令
2 ↓
3主智能体(理解任务、制定计划)
4 ↓
5┌──────────┬──────────┬──────────┐
6│ 子智能体1 │ 子智能体2 │ 子智能体3 │ ...
7│ 独立工作树│ 独立工作树│ 独立工作树│
8└──────────┴──────────┴──────────┘
9 ↓
10结果汇总 → 验证 → 输出
每个子智能体在独立的 Git 工作树中运行,确保开发者的工作副本永远不会被修改。后台智能体持续运行、自主推进,仅在需要时向主智能体反馈结果,大幅降低延迟和人工干预需求。
可审计运行时设计
Muse Code 的运行时采用本地事件日志作为唯一可信数据源。每一次模型调用、工具运行、审批操作和代码修改都会被依次记录。这套日志机制带来两个关键能力:
- 精确重放:可以完整回放整个执行过程
- 安全重启:崩溃后从中断位置继续,无需重新提示
基准测试表现
在多项编程基准测试中,Muse Spark 1.2 的表现如下:
表格
| 基准测试 | Muse Spark 1.2 | 第一名 | 差距 |
|---|---|---|---|
| Terminal-Bench 2.1 | 82.9% | Opus 5(86.7%) | -3.8% |
| DeepSWE 1.1 | 59.3% | Opus 5(65.0%) | -5.7% |
| Meta Internal Coding Bench | 70.6% | Opus 5(79.4%) | -8.8% |
| MCP Atlas(工具调用) | 登顶榜首 | — | — |
整体成绩仅次于 Anthropic 的 Opus 5,强于GPT-5.6 Terra、Grok 4.5 和 Gemini 3.6 Flash。相比前代 Muse Spark 1.1,在 Terminal-Bench 上提升 6.7 个百分点,在 DeepSWE 上提升 6.3 个百分点。
Muse Code项目地址
- 项目官网:https://research.meta.ai/blog/introducing-muse-code-and-muse-spark-1-2
Muse Code核心优势
1. 极致低价策略
这是 Muse Code 最核心的差异化武器。Meta 明确以价格而非尖端能力作为竞争方向:
表格
| 层级 | 输入价格(/百万Token) | 输出价格(/百万Token) | 条件 |
|---|---|---|---|
| 标准按量付费 | $1.25 | $4.25 | 数据不用于训练 |
| 贡献者层级 | $0.10 | $0.20 | 需同意提供反馈数据 |
对比竞品:
- Anthropic Sonnet 5:输入 $3 / 输出 $15(每百万Token)
- OpenAI Codex:约 $20/月订阅制
贡献者层级的价格仅为竞品的 5%~10%,对于日耗数百万 Token 的团队而言,年成本差距可达百万美元级。
2. 数据隐私保障
- 标准层级:承诺提示词和生成内容不会用于模型训练
- 零数据留存申请:企业用户可申请确保数据完全不被保留
- 贡献者层级:需授权 Meta 使用数据优化模型,换取极低价格
3. 长周期任务处理能力
得益于崩溃恢复机制和持久化上下文,Muse Code 可以处理运行时间极长的任务。Meta 展示了一个案例:让 Muse Spark 1.2 在 NVIDIA Hopper GPU 上运行长达 24 小时、超千次工具调用,进行 GPU 内核优化,最终在 KDA 和 MLA 内核上取得了实质性性能改进。
4. 与 Meta 生态协同
Muse Code 与 Muse Spark 模型协同开发和训练,搭配使用可获得最佳性能。同时,Muse Spark 1.2 也将上线 OpenRouter 平台,开发者可灵活选择模型。
5. 安装简便
macOS 或 Linux 上一条命令即可安装:
文本
1curl -fsS dev.meta.ai/install.sh | bash
Muse Code应用场景
1. 大型项目跨模块开发
面对百万行级别的代码库,Muse Code 能理解整体架构,完成跨文件、跨语言、跨模块的功能开发、Bug 修复和代码重构。
2. 并行多任务开发
当一个需求涉及多个独立功能时,Muse Code 自动拆分并分配给多个子智能体并行处理,大幅提升开发效率。
3. 长时间运行的优化任务
如 GPU 内核优化、性能调优等需要数百上千次迭代的任务,Muse Code 可在后台持续运行数十小时,自动探索优化空间。
4. 中小团队与独立开发者
极低的定价门槛让过去只有头部公司才能负担的”AI 结对编程”能力,下沉到中小团队和个人开发者。
5. 企业级安全开发
零数据留存选项满足金融、医疗、政府等对数据安全有严格要求的行业需求。
6. 代码审查与重构
对遗留代码库进行现代化重构、安全漏洞修复、代码规范统一等系统性工程。
Muse Code与竞品对比
表格
| 维度 | Muse Code | Claude Code | OpenAI Codex |
|---|---|---|---|
| 发布时间 | 2026年8月 | 2025年12月 | 2026年 |
| 底层模型 | Muse Spark 1.2 | Opus 5 / Sonnet 5 | GPT-5.6 系列 |
| 定价策略 | 极致低价($0.20起) | 订阅制+按量 | 订阅制+按量 |
| 核心卖点 | 价格 | 性能领先 | 生态整合 |
| 多智能体 | 支持并行子智能体 | 支持 | 支持 |
| 崩溃恢复 | 支持(事件日志) | 部分支持 | 部分支持 |
| 开源情况 | 闭源(暗示未来可能开源) | 闭源 | 闭源 |
| 数据隐私 | 零数据留存可选 | 可选 | 可选 |
最后想说
Muse Code 是 Meta 在 AI 编程智能体赛道上的首次正式亮相。它不以”最强性能”为卖点,而是以极致低价 + 可靠工程能力作为差异化策略,试图用”开源养商用、低价抢份额”的打法,在 Claude Code 和 Codex 已占据的市场中撕开缺口。
对于开发者而言,Muse Code 提供了一个极具性价比的选择——尤其是贡献者层级 $0.20/百万输出Token 的定价,将 AI 编程的门槛降低了一个数量级。虽然性能上暂时无法超越 Opus 5,但对于大量日常开发工作流而言,已经是一个足够好用的工具。
© 版权声明
文章版权归作者所有,未经允许请勿转载。
相关文章
暂无评论...



