应用与产品

Meta 发布 Muse Spark 1.3,强化长任务 Agent 与编程能力

Meta 于 2026 年 9 月发布 Muse Spark 1.3,强调在长流程 Agent 任务和编程工作中的改进,并已接入 Muse Code 与 Meta Model API。新版本强化长期任务跟踪、工具调用管理和安全判断,最高推理模式因安全测试暂缓开放。

Meta 发布 Muse Spark 1.3,强化长任务 Agent 与编程能力

Meta 于 2026 年 9 月发布 Muse Spark 1.3,强调在长流程 Agent 任务和编程工作中的改进,并已接入 Muse Code 与 Meta Model API。新版本强化长期任务跟踪、工具调用管理和安全判断,最高推理模式因安全测试暂缓开放。

Meta AI Research 于 9 月 2 日发布 Muse Spark 1.3,称新模型在长流程 Agent 任务和编程工作中取得改进,并已当天接入 Muse Code 与 Meta Model API。Meta 表示,现有推理模式已经上线,计算量更高的 max reasoning 模式则要等额外安全测试完成后提供。

这次更新的重点不只是模型分数,而是模型在较长时间内如何保持任务方向、处理冲突信息,并在需要时与用户协作。Meta 正在把 Muse Spark 放进一个越来越接近软件工程和个人助理的产品环境中:模型需要调用工具、追踪先前结果、修改计划,并在可能产生后果的操作前停下来确认。

从一次回答转向持续推进的任务

根据 Meta AI Research 的发布说明,Muse Spark 1.3 被训练用于在同一条长对话线程中处理多个工作流。面对开放式目标,模型可以借助工具从混乱或相互冲突的资料中建立上下文,主动补足计划中的缺口,并跟踪已经完成的内容,最后形成交付结果。

Meta 还称,新版本更倾向于在提示不清楚时提出澄清问题,在遇到困难时请求用户帮助,并在执行重要或不可逆的操作前取得确认。模型也会根据用户偏好调整工作方式:有时频繁汇报进度,有时则在后台安静地完成较长任务。

这类能力并不等于 Agent 已经能够完全自主工作。它更准确地说明了模型训练目标的变化——系统不仅要给出一个看似合理的答案,还要在多轮行动中保持约束、识别不确定性,并知道何时应该暂停。Meta 特别强调了对自身能力边界的判断,称模型在遇到困难时更不容易虚构已经完成的结果。

Muse Spark 1.3 也强化了多任务处理。在一个包含多个请求、用户插话或前后冲突信息的长线程中,模型被设计为更准确地判断新提示对应哪一项工作。这是个人 Agent 能否长期运行的关键问题之一:如果系统无法区分当前任务与历史任务,增加上下文反而可能带来更多错误。

编程效率成为发布重点

在编程方面,Meta 表示,Muse Spark 1.3 接受了更多长流程软件工程任务训练,并相较 Muse Spark 1.2 减少不必要的交互轮次,输出也更简洁。在 Meta 工程师的内部对比中,新模型完成常见编码任务时使用的工具调用减少约 20%,输出 Token 减少约 25%。

这些数字是 Meta 自测结果,并非独立第三方基准,不能直接等同于所有开发者都会获得相同幅度的成本或速度改善。Agent 的实际效率还会受到代码库规模、测试覆盖率、工具设计和失败重试次数影响。

Meta 此前已通过 Muse Code 编程 Agent 将模型放进终端式开发环境。该产品强调多 Agent 协作、隔离工作树和可追踪的本地事件日志,试图让系统从生成局部代码,扩展到规划变更、修改多个文件、运行测试和验证结果。Muse Spark 1.3 的更新,实际上是在提高这一组合处理长任务时的稳定性和可用性。

Meta 的开发者模型页面还将 Muse Spark 1.3 描述为面向 Agent 工作流、竞争性编程和原生多模态感知的模型,支持文本、图像、视频和文档相关任务。独立评测机构 Artificial Analysis 则报告称,可用的 xhigh 版本保留了 100 万 Token 上下文窗口,API 价格维持在每百万输入 Token 1.25 美元、每百万输出 Token 4.25 美元,缓存输入价格为每百万 Token 0.15 美元。该机构的数字属于独立评测和整理结果,具体型号、计费项目及可用范围仍应以 Meta 的开发者平台为准。

安全改进与“最高推理模式”暂缓

Meta 称,Muse Spark 1.3 在对抗性输入和提示注入防护方面有所改进,并在复杂 Agent 任务中更好地判断哪些行动具有不可逆的后果。公司将这些变化与更谨慎的工具调用、用户确认和长任务决策联系在一起。

不过,发布并不是所有能力同时开放。Meta 明确表示,原有推理模式已随模型上线,max reasoning 模式将在额外安全测试结束后推出。这一安排说明,随着模型被允许执行更长、更复杂的任务,安全测试不再只是发布前的一次性门槛,而会直接影响模型能力的开放节奏。

Axios 在 相关报道 中援引 Meta AI 负责人 Alexandr Wang 的话说,Muse Spark 1.3 的能力已经“非常接近前沿模型”。Wang 同时表示,Meta 正在增加对安全和对齐工作的投入,并将这次更新与公司未来发展个人 Agent 的计划联系起来。

这里仍需区分公司愿景和已经验证的产品能力。Meta 的发布材料展示了模型如何处理工程报告、音频编辑、演示文稿和行政摘要等长流程任务,但演示中的输出并不构成现实环境下的成功率证明。尤其在涉及生产代码、敏感文件、外部账户或支付等资源时,模型是否真正遵守权限边界,仍需要持续的日志、审批、回滚和第三方测试。

这种关注点正在整个行业扩散。Cloudflare 对“Agent 开发生命周期 ”的讨论也把测试、部署、追踪、审批和回滚放在 Agent 工具链的中心。换句话说,模型能够做更多事情之后,软件团队面对的难题不再只是“能否生成代码”,还包括“能否证明它在正确的环境中做了正确的事情”。

Meta 仍在追赶个人 Agent 竞争

Muse Spark 1.3 的发布发生在模型厂商密集更新的一周。Meta 需要面对 Anthropic、OpenAI 和 Google 在编码、工具调用和个人 Agent 方向的竞争。对 Meta 而言,Muse Code 和 Meta Model API 提供了比社交产品更直接的开发者入口,也让公司能够从真实工作流中收集关于模型可用性的反馈。

Meta 还在发布说明中预告了更大模型、Muse Spark 开放权重版本等后续计划,但没有给出明确时间表。因此,现阶段不能把“计划发布开放权重”理解为模型已经开源,也不能据此推断未来版本的授权、规模或性能。

从产品策略看,Muse Spark 1.3 的重要性在于它把效率、长上下文、工具调用和安全判断放到了同一条发布主线上。对于开发者,减少工具调用和输出 Token 可能意味着更低的任务成本;对于企业,真正决定是否采用的因素仍会是代码和数据如何处理、操作能否审计、失败后能否回滚,以及用户能否在关键节点接管。

Meta 希望用 Muse Spark 1.3 证明,Agent 不必只停留在一次性的问答或代码补全阶段,而可以成为持续推进工作的执行者。但这一转变的最终标准,仍不是演示中任务完成得多快,而是模型在长时间运行、信息不完整和权限受限的现实环境中,能否保持可靠、可解释并且可控。

来源:

不错过任何一条 AI 大事

订阅 AIFlux 早报,每天 3 分钟看懂产业动态。

相关阅读