
DeepSeek 預覽接近前沿模型
DeepSeek 預覽新型 AI 模型,在效率與效能超越 V3.2。架構改進使推理基準接近前沿模型。挑戰開放與封閉領先模型。
Tag: #benchmarks166 results

DeepSeek 預覽新型 AI 模型,在效率與效能超越 V3.2。架構改進使推理基準接近前沿模型。挑戰開放與封閉領先模型。

Anthropic 揭露三項 harness 變更導致 Claude 近期效能退化:預設推理努力度降低、冗長提示調整,以及 v2.1.116 的快取錯誤。他們已復原推理努力度和冗長提示,並修復錯誤。基準測試顯示 Claude Opus 4.6 準確率從 83.3% 降至 68.3%。

Kimi K2.6 在 3D 設計任務基準中名列第一。被形容為最佳模型評估基準之一。
基準測試比較 Nvidia RTX 3090 和 Intel Arc Pro B70,使用 llama.cpp 在 Vulkan 和 SYCL 後端測試多個 GGUF 模型。Arc Pro B70 的提示處理平均慢 71%,令牌生成慢 53%。SYCL 後端在某些 Arc 結果優於 Vulkan。
個人評測比較 Gemma 4 26B MoE 以 Q8 量化、Qwen 3.5 27B 密集模型及 Gemma 4 31B 密集模型在程式碼代理任務上的表現。Qwen 3.5 27B 及 Gemma 4 31B 皆修復 100% 測試且無回歸,優於其他模型。詳細指標涵蓋修復數、令牌、工具呼叫及效率。

DAP 是一個代理框架,使用 LLM 搭配自我反思來發現定理答案,然後在 Lean 4 的硬模式下進行形式證明。它發布了專家重新標註的 MiniF2F-Hard 和 FIMO-Hard 基準測試。DAP 達到 SOTA,在 CombiBench 解決 10 題,並首次形式證明 36 個 PutnamBench 定理。
相同 Qwen3.5-9B 模型在標準 Aider 基準得 19.1%,但作者 little-coder 適配後達 45.6%。變更聚焦有限推理、寫入守衛、工作區發現及每輪注入。顯示支架-模型契合對亞 10B 本地模型程式碼代理至關重要。
使用 24GB VRAM 和 128GB RAM 及 llama.cpp,在 MMLU 資料集基準測試多款 GGUF 量化模型。Qwen3.5-27B 系列以 87%+ 領先。分享結果徵求社群回饋。

高德在短短三個月內於具身智能領域取得15項世界第一。公司即將發布首款四足機器人。

推出 HORIZON 基準測試,用以系統診斷 LLM 代理在跨領域長視野任務的失敗。評估 GPT-5 變體與 Claude 等 SOTA 模型,涵蓋 3100+ 軌跡,揭示退化模式。發布排行榜與經人類註解驗證(κ=0.84)的 LLM-as-a-Judge 流程。