專欄 AI 管理編年史 第 178/217 講 查看課程目錄

Anthropic發表Claude Opus 4.7:CursorBench從58%躍升至70%,長時間程式任務能力大增

16/04/2026 148
3:09
Anthropic發表Claude Opus 4.7:CursorBench從58%躍升至70%,長時間程式任務能力大增

Anthropic於2026年4月16日發表Claude Opus 4.7,強化軟體工程與長時間程式任務處理能力,視覺解析度同步提升,CursorBench測試分數由前代4.6的58%大幅拉高至70%。

Anthropic於2026年4月16日正式發表新一代模型Claude Opus 4.7。這次更新的重點放在軟體工程能力與「長時間程式任務」(long-horizon coding tasks)的處理表現,同時也強化了模型的視覺解析度。官方公布的關鍵數據是:在業界常用的CursorBench程式能力測試中,Opus 4.7拿下70%的成績,較前代Claude Opus 4.6的58%大幅提升12個百分點。

CursorBench分數為何是重要指標

CursorBench是評估AI模型在真實開發情境中完成程式任務的測試集,涵蓋跨檔案修改、除錯、長流程指令執行等情境,與單純「寫一段函式」的簡單測試不同,更接近工程師日常面對的複雜任務。分數從58%跳升到70%,代表模型在需要記住多步驟上下文、跨多個檔案協調修改的任務上,可靠度明顯提升,不再只是「寫得出程式碼」,而是「能完成一整段工作流程」。

與前代相比的技術意義

「長時間程式任務能力」是本次更新特別強調的方向,意味著模型在處理需要持續多輪、跨越較長時間跨度的開發工作時,出錯率與偏題率降低。視覺解析度的提升則有助於模型更精準地理解截圖、UI介面或圖表類輸入,這對需要「看圖除錯」或處理前端介面調整的情境有直接幫助。整體而言,這次更新延續了Anthropic近期版本一貫的方向:不追求單次對話的驚豔表現,而是強化模型在真實、複雜、需要耐心的工作情境中的穩定產出。

業界反應與脈絡

這是Anthropic繼4月7日之後在同一個月內的第二次模型發表,顯示其產品迭代節奏明顯加快,也反映AI模型廠商之間在「程式能力」這個賽道上的競爭正在白熱化——CursorBench之類的測試分數,正逐漸成為企業選擇AI開發工具時的重要參考依據。

對管理者的意義

對於帶技術團隊或管理數位轉型專案的主管而言,這類長時間任務處理能力的提升,意味著AI工具能承接的工作範圍正從「輔助寫程式碼片段」逐步擴展到「獨立完成一段完整開發流程」,值得評估是否調整團隊的AI工具導入策略與工作分派方式。

適用產業: 電商社群銷售
測驗檢核:驗證你的理解
5 篇 · 答對 80% 通過,通過後計入學習履歷 登入後即可測驗
問 AI:這篇文章怎麼用在我的管理上?
內容由 AI 根據本文輔助生成,僅供參考,請自行判斷準確性。
下一講・AI 管理編年史 xAI 發表 Grok 4.3 Beta:新增原生影片輸入與對話內生成簡報

相關文章

我們使用必要 Cookie 維持登入與語言設定,並記錄使用行為以改善服務。你可以只保留必要項目。 隱私權政策