Meta 发布 Muse Code 编程 Agent:从“生成代码”走向多 Agent 协作
Meta 于 2026 年推出 Muse Code(Beta),这是一个基于 Muse Spark 1.2 的终端式编程 Agent,支持多子 Agent 并行、隔离工作树与本地事件日志,用于处理跨文件、长流程的软件工程任务。Meta 强调模型与运行时、权限与验证机制的整体设计,但其性能和稳定性仍需第三方评测与实际使用反馈验证。
Meta 于 2026 年推出 Muse Code(Beta),这是一个基于 Muse Spark 1.2 的终端式编程 Agent,支持多子 Agent 并行、隔离工作树与本地事件日志,用于处理跨文件、长流程的软件工程任务。Meta 强调模型与运行时、权限与验证机制的整体设计,但其性能和稳定性仍需第三方评测与实际使用反馈验证。
Meta 于 2026 年 8 月 5 日发布 Muse Code,一款目前以 Beta 版本提供的终端式编程 Agent。Meta 表示,这款工具面向大型代码仓库,能够协助完成变更规划、代码编写和结果验证,并可在单个任务中协调多个持续运行的子 Agent。
Muse Code 由 Meta 的 Muse Spark 1.2 模型驱动。Meta 这次发布的重点并不只是又推出一个代码生成模型,而是把模型、终端运行时和多 Agent 编排机制组合成一个面向完整软件工程任务的产品。
Meta AI Research 的官方发布说明称,Muse Code 可在 macOS 和 Linux 上通过一条命令安装:curl -fsSL https://dev.meta.ai/install.sh | bash。不过,Beta 版本的实际可用范围、区域限制和服务条款仍应以 Meta 的开发者页面为准。
Meta 把编程 Agent 的竞争带到终端
Muse Code 的工作方式接近目前已经形成市场认知的终端式编程 Agent:用户提出工程目标,系统读取代码库并制定计划,然后通过工具修改文件、运行测试,再根据结果继续迭代。
Meta 称,Muse Code 使用一个主 Agent 循环,同时配备异步后台 Agent。这些后台 Agent 不会只为某一个短任务临时启动,而是可以在整个会话中持续工作,负责信息搜集、后续步骤和部分并行任务。Meta 的说法是,这种设计可以减少重复检索,并降低用户在长任务中持续介入的需要。
对于规模较大的任务,Meta CEO 马克·扎克伯格在社交平台上介绍称,Muse Code 可以把工作拆分给多个子 Agent,让它们在相互隔离的工作树中并行处理。Meta 还表示,在内部测试中,系统曾同时为一款游戏构建六项功能,并避免不同任务之间发生代码冲突。
这一点与传统的代码补全工具有明显区别。后者通常围绕单个文件、函数或局部修改展开,而 Muse Code 试图处理的是跨文件、跨模块、需要持续验证的长流程任务。不过,上述并行能力和测试结果主要来自 Meta 官方及管理层的介绍,并不等同于独立第三方评测。
本地事件日志是 Meta 强调的另一项设计
Meta 介绍,Muse Code 会把模型调用、工具运行、用户批准和文件编辑追加写入本地事件日志。该日志被设计成运行时的单一事实来源,使系统能够在发生崩溃后从中断位置恢复,并尽可能重放此前的操作过程。
这类设计解决的是编程 Agent 从“短对话”走向“长任务”后出现的新问题:任务可能运行数小时,期间会经历多轮代码修改、编译、测试和人工批准。如果中途失败,用户需要知道系统已经做了什么、哪些步骤获得了授权,以及恢复时是否会重复执行有副作用的操作。
Muse Code 还内置了 /plan、/grill 和 /goal 等技能。Meta 将它们分别描述为需要批准的计划生成、对计划进行压力测试,以及围绕既定目标持续推进。它们反映出一个趋势:编程 Agent 的竞争正在从单纯比较模型能力,转向比较模型与运行时、权限、审批和验证机制的整体组合。
Muse Spark 1.2 与 Muse Code 被共同训练
Meta 表示,Muse Spark 1.2 是 Muse Spark 1.1 的编程方向更新,重点改进代码生成、复杂调试、代码库理解和端到端开发工作流。Meta 还称,公司扩大了编码任务上的训练计算量,并增加了训练环境的多样性。
与此前“模型先发布、工具后适配”的路径不同,Meta 称 Muse Spark 1.2 与 Muse Code 进行了共同训练。训练过程包括基于 Agent harness 的轨迹筛选,以及围绕目标保持、上下文压缩和子 Agent 的训练配方优化。Meta 的目标,是让模型在自己的工具链中发挥更稳定的效果。
Meta 官方还展示了一项 GPU 内核优化案例。按照其发布说明,模型在最多超过 1,000 次工具调用、最长约 24 小时的任务中,持续完成代码编写、编译、性能分析和优化,测试对象包括面向 NVIDIA Hopper GPU 的 KDA 和 MLA 内核。Meta 称,模型相对于给定基线取得了“明显改进”,但官方页面没有在发布说明正文中给出足以独立复现全部结果的完整实验数据。
这也是理解此次发布时需要保留的限制:Meta 公布的是产品设计和公司内部测试叙述,而不是一份已经由第三方统一环境验证的性能结论。Meta 将更详细的评测放在配套方法说明中,外部开发者仍需观察实际使用中的稳定性、错误率、成本和代码质量。
价格优势与数据保留问题
CNBC 报道称,开发者可以按量付费使用 Muse Code。Meta AI 负责人亚历山大·王表示,产品还提供价格显著更低的“Contributor”层级,用户需要选择允许 Meta 使用提示和完成结果来改进模型。CNBC 还报道称,Meta 开始接受零数据保留请求,以满足部分企业客户的要求。
报道给出的标准价格与 Muse Spark 1.1 的 API 价格相近,即每百万输入 Token 1.25 美元、每百万输出 Token 4.25 美元;不过,具体计费项目、Contributor 层级的条件、零数据保留的适用范围以及企业服务条款,应以 Meta Model API 和 Muse Code 开发者页面的最新信息为准,而不应只依据媒体报道中的价格摘要。
这套定价方式把两个问题放在了一起。对个人开发者和小团队来说,更低的 Token 成本可能降低尝试长任务和多 Agent 并行的门槛;对企业用户来说,代码、提示和工具调用是否被保留、是否用于训练,以及管理员能否设置权限,则可能比单价更重要。
从大规模重写到验证,真正的瓶颈仍然存在
大型代码仓库并不只是一个更大的文本文件。它通常包含历史包袱、隐含依赖、不完整测试、部署脚本和只有少数工程师掌握的业务规则。Agent 能够快速生成补丁,并不意味着这些补丁已经满足兼容性、安全性和长期维护要求。
AIFlux 此前报道的 Anthropic 将更多代码审查交给 AI、Bun 在 11 天内完成大规模 Rust 迁移显示,AI 可以参与大型重写和并行开发,但工程团队仍需要把大量注意力放到规划、审查、编译和测试上。对于 Muse Code 而言,能否将这些环节稳定地串联起来,可能比一次演示中能写出多少代码更能决定其实际价值。
验证也关系到权限边界。AIFlux 对 AI 编程 Agent 误操作生产数据库事件的梳理表明,一旦 Agent 被直接连接到生产系统,错误就可能从代码层面的缺陷升级为真实数据损失。Muse Code 强调隔离工作树、本地事件日志和审批式计划,正是对这类长任务风险的回应,但这些机制是否足以覆盖真实企业环境,还需要更多公开案例和独立评测。
类似的验证压力也出现在科研软件和大型工程迁移中。正如 OpenAI 对 Agent 编程工作流的总结所指出的,当代码生成变得更便宜之后,证明代码“确实正确”的成本可能成为新的瓶颈。对 Muse Code 来说,测试覆盖率、人工批准、回滚能力和长期维护责任,最终都会影响它能否从预览工具进入生产系统。
Meta 需要证明的,不只是模型能不能写代码
Muse Code 让 Meta 正面进入了由 OpenAI Codex、Anthropic Claude Code 等产品推动的编程 Agent 竞争。Meta 的差异化路径包括 Muse Spark 1.2、持续运行的后台 Agent、隔离工作树、可恢复的事件日志和较低的价格选项。
但这场竞争的评价标准也正在变化。用户关心的已经不只是模型是否能生成一段看起来合理的代码,而是它能否理解整个代码库、在长任务中保持目标、在并行修改时避免冲突、在测试失败后正确修复,并在接触真实资源时遵守权限和审批边界。
Muse Code 目前仍是 Beta。Meta 已经展示了从规划、执行到验证的产品方向,但它能否在不同语言、不同构建系统和不同规模的企业代码库中稳定工作,仍有待公开使用反馈和第三方测试回答。对开发者而言,最稳妥的做法仍是把它视为受控环境中的实验性工程工具,而不是无需审查的自动化程序员。
来源
不错过任何一条 AI 大事
订阅 AIFlux 早报,每天 3 分钟看懂产业动态。

