
Claude Opus 4.7 基準測試領先程式碼表現
Anthropic 推出 Claude Opus 4.7,其最強通用模型在 SWE-bench Pro 達 64.3%(優於 GPT-5.4 的 57.7%),支援長時程多代理協調、3 倍影像解析度,以及代理推理提升 14% 並減少工具錯誤。定價:每百萬 token 輸入 $5/輸出 $25。
Tag: #agentic16 results

Anthropic 推出 Claude Opus 4.7,其最強通用模型在 SWE-bench Pro 達 64.3%(優於 GPT-5.4 的 57.7%),支援長時程多代理協調、3 倍影像解析度,以及代理推理提升 14% 並減少工具錯誤。定價:每百萬 token 輸入 $5/輸出 $25。

Gemma 4 31B 在 FoodTruck Bench 上達到 100% 存活率與 +1,144% 中位 ROI,超越 GPT-5.2、Gemini 3 Pro 及所有測試的中國開源模型。只有 Opus 4.6 勝過它,但成本高 180 倍,為每次 0.20 美元。在 22 個測試模型中具最佳成本效能比。
2025 年低谷後,Kimi 於 2025 年 7 月推出 K2 代理模型,2026 年推 K2.5 2.5T 多模態。「注意力殘差」論文挑戰 Transformer 基礎,獲 Karpathy 讚譽。被 Cursor(醜聞)、Perplexity、Cloudflare 採用。
Mistral Small 4 在 transformers 的 PR 將 Instruct、Reasoning 與 Devstral 統一為單一混合模型。具備 119B MoE、多模態輸入與可配置推理。以 Apache 2.0 開源,提供代理功能。

使用者指示 Qwen3.6-35B 使用 MCP 截圖建構塔防遊戲,它成功實作並測試升級功能。模型自行偵測並修復畫布渲染與波次完成錯誤。對即將推出的 Qwen Coder 模型充滿期待。

Liquid AI 發布 LFM2.5-350M,一款 350M 參數模型,優化用於資料提取、工具使用及代理工作流程。在 28T 權重訓練搭配 RL,勝過 Qwen3.5-0.8B,量化後 <500MB。可在 CPU/GPU/行動裝置運行,提供可靠輸出。

Cursor 推出全新 AI 編碼評測基準,超越 SWE-Bench。它專門評估 Cursor 中不同模型的「智能體」能力。Claude 在此基準上表現不佳,難以應對。

使用者分享使用 Qwen 3.6 35B 實現「瀏覽器 OS」,稱其為最佳本地模型結果。貼文連結細節但內容簡短。

阿里巴巴發布 CoPaw-Flash-9B,為 Qwen3.5 9B 的官方代理微調版。在某些基準測試中與 Qwen3.5-Plus 相當。於 Hugging Face 上提供。
自主管線從文字提示使用 LLM 生成可玩 Godot 遊戲。透過分層參考、代理式延遲載入及多階段驗證克服 GDScript 稀缺,包括截圖。開源程式碼可重現。