專欄 AI 管理編年史 第 222/303 講 查看課程目錄

Meta 推出 Muse Code 終端機編碼代理:連跑 24 小時、逾千次工具呼叫,傳貢獻者層以程式碼換九成折扣

28/08/2026 292
5:38
Meta 推出 Muse Code 終端機編碼代理:連跑 24 小時、逾千次工具呼叫,傳貢獻者層以程式碼換九成折扣
圖/Photo by Shahadat Rahman on Unsplash

2026 年 8 月 5 日,Meta 在官方研究部落格發表終端機編碼代理 Muse Code(beta,僅支援 macOS 與 Linux),同日發表共同訓練的編碼模型 Muse Spark 1.2。官方展示單次執行逾 1,000 次工具呼叫、連續運行 24 小時優化 NVIDIA Hopper GPU kernel,但未公布任何 benchmark 分數。第三方報導提及的「貢獻者層」定價,讓管理者必須正面回答一個問題:要不要用自家程式碼換取九成以上的折扣。

2026 年 8 月 5 日,Meta 在官方研究部落格發表兩項產品:終端機編碼代理 Muse Code(目前為 beta,僅支援 macOS 與 Linux),以及與之共同訓練的編碼模型 Muse Spark 1.2。這是 Meta 首度把自家編碼模型包成可在終端機自主執行的代理,定位直接對打 Anthropic 的 Claude Code 與 OpenAI 的編碼代理。多家國際科技媒體同日跟進報導。

官方公布了什麼、沒公布什麼

依官方說明,Muse Code 能在大型程式碼庫(repo)中規劃變更、實際寫碼並驗證結果,功能重點包括:

  • 常駐非同步背景子代理:主代理工作的同時,子代理可在背景持續處理其他任務。
  • 本地 event log:所有動作記錄於本機事件日誌,使程式崩潰後可 replay-exact(精確重放)、restart-safe(重啟不失憶)。
  • 三項內建 skill:/plan(產出需人工核准的計畫)、/grill(對成果做壓力測試)、/goal(設定目標)。

官方展示的規模值得注意:單次執行超過 1,000 次 tool call,並連續運行達 24 小時,用於優化 NVIDIA Hopper 架構的 GPU kernel。這代表 Meta 主打的不是「幫你補完一行程式」,而是「交辦一件跨檔案、跨天的工程任務」。

同樣重要的是官方沒有公布的部分。部落格僅列出 Terminal-Bench 2.1、DeepSWE 1.1 與 Meta 內部編碼 benchmark 三個名稱,未公開任何分數,也未揭露 Muse Spark 1.2 的參數量與上下文長度。任何流傳的「勝率」「分數」目前都缺乏一手依據,採購評估時不宜採信。

貢獻者層:折扣的代價是資料

另據第三方科技媒體報導(此定價數字未載於官方部落格頁,請留意來源侷限),Muse Spark 1.2 的 API 定價為每百萬輸入 token 1.25 美元、每百萬輸出 token 4.25 美元;另有一個 muse-spark-1.2-contributor「貢獻者層」,降至每百萬輸入 0.10 美元、輸出 0.20 美元——等於價格降為原價的約 1/12.5(輸入,約 8%)與約 1/21.25(輸出,約 4.7%)。

折扣不是白給的。貢獻者層的條件是:允許 Meta 以使用者的 prompt 與 completion 訓練未來模型。換句話說,企業省下的是雲端帳單,付出的是自家程式碼、架構設計、內部命名與商業邏輯的可見度。對純學習或開源專案,這可能是划算的交換;對握有製程演算法、訂價模型、客戶資料處理邏輯的公司,這條線就踩在營業秘密上。

從 Muse 系列看 Meta 的節奏

把時間軸拉開:4 月 8 日 Muse Spark 初代發表、同時宣告轉向閉源;7 月 7 日 Muse Image;7 月 9 日 Muse Spark 1.1 升級代理與多模態能力、並推出付費 API;到 8 月 5 日的 Muse Code 與 Spark 1.2——四個月內四度出手,其中近一個月就佔了三次。Meta 顯然把「編碼代理」視為模型能力的展示場——軟體工程有明確可驗證的結果,比對話品質更容易證明模型真的能長時間自主工作。而 event log 帶來的 replay-exact 與 restart-safe,正是把代理從「示範」推向「可放進 CI 流程」的關鍵工程細節。

對管理者的意義

這則新聞對管理者的重點不在技術參數,而在三個決策:

  • 導入時程:Muse Code 目前是 beta 且僅支援 macOS 與 Linux,以 Windows 為主的內部團隊短期無法全面採用,可先讓小組試點而非排入正式時程。
  • 資料治理:在有人按下「貢獻者層」以前,先明訂哪些 repo 絕對不得送進任何外部模型,並把這條規則寫進開發規範,而非依賴工程師自律。
  • 評估標準:官方未公布分數,別用外界傳言做採購決策;用自家真實任務跑一週,比對修改正確率與人工回修時間,數據才屬於你。

真正的分水嶺不是模型多強,而是在工程師按下「貢獻者層」之前,公司有沒有先把「哪些程式碼不得外送」寫成白紙黑字。技術規格每季都會被刷新,資料治理的那條線,卻只能由管理者自己先畫下來。

測驗檢核:驗證你的理解
5 篇 · 答對 80% 通過,通過後計入學習履歷 登入後即可測驗
問 AI:這篇文章怎麼用在我的管理上?
內容由 AI 根據本文輔助生成,僅供參考,請自行判斷準確性。
下一講・AI 管理編年史 OpenAI 更新 ChatGPT 的 GPT-5.6 Sol:免費用戶改用 Luna、文字對話無上限,推理強度交給使用者自己調

相關文章

我們使用必要 Cookie 維持登入與語言設定,並記錄使用行為以改善服務。你可以只保留必要項目。 隱私權政策