🗾ITmedia AI+ (日本)•最新收集於 57m
Meta 發布 Muse Spark 1.3,強化程式編寫能力
#ai-agents#coding-benchmarks#open-weights#long-running-tasksmuse-spark-1.3metamuse spark 1.3deepswezuckerberg
💡新款程式編寫與代理模型宣稱實現重大飛躍,並在 DeepSWE 達到前沿模型級表現。
⚡ 30-Second TL;DR
有什麼變化
提升程式編寫效能與 AI 代理能力。
為什麼重要
此發布可能提高業界對模型長時間自主執行複雜程式開發流程的期待。API 的提供與開放權重發布計畫,將同時為開發者帶來正式整合與彈性實驗的選項。
下一步行動
透過 Muse Spark 1.3 的 API,在長時間程式開發流程上進行評估,並以類似 DeepSWE 的任務比較其完成品質與目前使用的模型。
誰應關注:Developers & AI Engineers
關鍵要點
- •提升程式編寫效能與 AI 代理能力。
- •改善對模糊指令的理解,並能維持長時間任務的進度。
- •在包括 DeepSWE 的基準測試中超越其他前沿模型。
- •將透過 API 等管道提供,前一代模型也計畫以開放權重形式發布。
🧠 深度解析
背景與延伸:來自公開資料,非原文內容。引用 11 個來源。
🔑 增強重點摘要
- •Muse Spark 1.3 在 Artificial Analysis Intelligence Index 基準測試中獲得 61 分,與 GPT-5.6 Sol、Grok 4.6 及 Claude Opus 5 並列領先。
- •該模型展現了顯著的成本優勢,單一任務執行成本為 0.55 美元,較 GPT-5.6 Sol 的 0.95 美元降低了約 42%。
- •Meta 維持了與前代一致的定價策略,標準 API 存取費用維持在每百萬輸入 Token 1.25 美元。
- •模型安全性獲得提升,特別是在識別「不可逆操作」的判斷力以及對抗提示詞注入攻擊的堅固性方面。
- •Meta 推出了「Contributor」階層,允許開發者透過提供數據來換取 API 使用費用的折扣。
📊 競品分析▸ Show
| 模型名稱 | 基準測試分數 | 任務執行成本 (美元) | 備註 |
|---|---|---|---|
| Muse Spark 1.3 | 61 | 0.55 | 高性價比,具備強大代理能力 |
| GPT-5.6 Sol | 61 | 0.95 | 市場領先者,成本較高 |
| Grok 4.6 | 61 | 0.94 | 與頂尖模型並列 |
| Claude Opus 5 | 61 | 未提供 | 效能指標持平 |
🛠️ 技術深入
- 由 Meta Superintelligence Labs 開發,專注於提升自律軟體開發能力。
- 作為終端機基礎編碼代理「Muse Code」的核心引擎運作。
- 針對複雜代理任務進行了架構優化,強化了對長時間任務進度的管理與狀態維持。
- 具備增強的決策邏輯,能有效區分並防範系統內的不可逆操作。
🔮 前景展望AI analysis grounded in cited sources
AI 代理開發成本將因 Meta 的定價策略而面臨下行壓力。
Muse Spark 1.3 以顯著較低的任務執行成本提供頂尖效能,將迫使其他模型供應商重新評估其定價結構。
開源與閉源模型的界線將進一步模糊。
Meta 透過開放前一代模型權重並提供數據貢獻折扣,正在建立一個更具黏著性的開發者生態系統。
⏳ 時間線
2026-04
Muse Spark 系列模型正式發布。
2026-09
Meta 發布 Muse Spark 1.3,強化編碼與代理效能。
📎 來源 (11)
Factual claims are grounded in the sources below. Forward-looking analysis is AI-generated interpretation.
📰
AI 週報
閱讀本週精選 AI 大事摘要 →
👉相關動態
AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: ITmedia AI+ (日本) ↗
每週 AI 簡報
每週一封,可隨時退訂。


