专栏 AI 管理编年史 第 259/303 讲 查看课程目录

Meta 发布 Muse Spark 1.3:agentic 与编程任务强化,价格不变、开放权重仍无期

02/09/2026 314
4:13
Meta 发布 Muse Spark 1.3:agentic 与编程任务强化,价格不变、开放权重仍无期
图/Photo by Arian Darvishi on Unsplash

2026 年 9 月 2 日 Meta 发布 Muse Spark 1.3,主打真实可用性:长时程跨工作流任务、主动澄清、提示注入抗性提升;对照 1.2 工具调用少约 20%、token 少约 25%。定价与 1.2 持平,Muse Code 与 Meta Model API 即日可用;max 推理待安全测试,开放权重承诺仍无日期。

2026 年 9 月 2 日,Meta 在 research.meta.ai 博客发布 Muse Spark 1.3,定位为「强化 agentic 与编程任务、主打真实可用性」的迭代版本。官方列出的重点如下:

  • 在单一对话内可持续跨多个工作流的长时程工作
  • 更主动的协作行为:会问澄清问题、卡住时会明说
  • 更清楚自身能力边界
  • 对抗性稳健性与提示注入抗性提升

即日起 Muse Code(macOS/Linux)与 Meta Model API 可用,OpenRouter 同步上架。依 Meta 内部对照 Muse Spark 1.2 的说法,1.3 完成同类任务时工具调用少约 20%、token 消耗少约 25%,产出的代码更干净、所需人机交互更少。扎克伯格的说法是「以低成本交付前沿性能」。

基准数据:对照 GPT-5.6 Sol 与 Opus 5

官方基准卡以 Muse Spark 1.2、OpenAI GPT-5.6 Sol(max)与 Anthropic Opus 5(max)为对照组。依 Axios 与 Bloomberg 转述(媒体转述,非本站实测),Muse Spark 1.3 成绩如下:

  • MRCR 256K–512K 长文本检索:98.5
  • MRCR 512K–1M 长文本检索:98.1
  • DeepSWE v1.1 软件工程:75.4
  • SWEAtlas CodeBase QnA:59.4
  • Terminal-Bench 2.1 终端任务:88.8

在 1M token 上下文下长文本检索得分维持在 98 以上,agentic 工程任务亦有 75–88 的成绩,是「长时程跨工作流」宣称的主要支撑。

定价持平,max 推理待安全测试

developer.meta.com 定价页显示 1.3 与 1.2 定价相同:输入每百万 token $1.25、输出 $4.25、缓存输入 $0.15;另有 contributor 版(输入 $0.10/输出 $0.20),代价是数据会用于改进产品,企业用户需留意数据治理。既有推理模式即刻可用,max 推理模式待安全测试完成后才开放。值得注意的是,对照组竞品是以 max 模式计分,而 1.3 的 max 推理尚未开放,对比条件是否对等仍待官方说明。

与 1.2 的差距:效率修正,开放权重仍无期

Muse Spark 1.2 于 8 月 5 日发布(含 Muse Code beta),1.3 相隔不到一个月,属于效率与行为层面的修正版:工具调用与 token 减少直接压低单次任务成本,「卡住会明说」则回应业界对 agent 乱跑、乱猜的批评。官方路线图再次提到「更大模型」与「Muse Spark 开放权重发布」,但仍没有日期——1.2 的开放权重自 7 月 23 日承诺「soon」至今未兑现,Meta 目前真正发布开放权重的只有 8 月 10 日的 Muse Glimmer(Apache 2.0)。Muse Spark 1.3 是封闭 API 模型,不应误解为已开源。

对管理者的意义

同价格下工具调用少约 20%、token 少约 25%,切换到 1.3 后既有自动化流程的成本有望下降;「会问澄清问题」则意味着交办时给的背景信息会被更主动确认。适合先在既有 Muse Code 或 API 工作流中切换模型,比对成本与完成率再决定是否迁移;等待开放权重自建部署的团队,这次仍需继续等。

测验检核:验证你的理解
5 篇 · 答对 80% 通过,通过后计入学习履历 登录后即可测验
问 AI:这篇文章怎么用在我的管理上?
内容由 AI 根据本文辅助生成,仅供参考,请自行判断准确性。

大家怎么说 · 4 条留言

雅
雅雯客服经理
會主動問澄清問題這點對客服太重要了。現在 chatbot 常自作聰明,這個版本要真改善了就值得一試。
17/09/2026 10:05
救
救火队员采购经理
哈哈 👍
17/09/2026 11:54
周
周末加班狗财会主管
token 少 25% 算下來單次成本確實便宜點,但 max 推理一直沒開放,真正吃香的任務我們還用不上。
12/09/2026 16:37
春
春梅生管专员
我們採購試過上一代,跑得跟沒頭蒼蠅似的,token 花得兇還經常出錯。
14/09/2026 01:29
下一讲・AI 管理编年史 OpenAI 发布 GPT-6 Astra:主打电脑操作智能体、首列网络安全 Critical 级,同日投入 10 亿美元补贴一线防御者

相关文章

我们使用必要 Cookie 维持登录与语言设置,并记录使用行为以改善服务。你可以只保留必要项目。 隐私权政策