
MiniMax M2.7 GGUF 修復 NaN 並基準測試
Unsloth 調查 MiniMax-M2.7 GGUF 量化中 21-38% 的 NaN,歸因於 llama.cpp 特定區塊溢位。修復其 UD-Q4_K_S 等量化於 unsloth/MiniMax-M2.7-GGUF。基準確認良好 PPL/KLD;註記 CUDA 13.2 問題。
Tag: #benchmarks166 results

Unsloth 調查 MiniMax-M2.7 GGUF 量化中 21-38% 的 NaN,歸因於 llama.cpp 特定區塊溢位。修復其 UD-Q4_K_S 等量化於 unsloth/MiniMax-M2.7-GGUF。基準確認良好 PPL/KLD;註記 CUDA 13.2 問題。

Databricks 研究顯示,多步代理在 STaRK 和 KARLBench 等基準測試中超越單輪 RAG 20%以上,適用於橫跨資料庫與文件任務。Supervisor Agent 拆解查詢、路由至結構化/非結構化來源並整合結果,解決 RAG 在混合資料的架構限制。此差距為結構性問題,而非模型品質問題。

字節擊敗Sora視頻生成。Sora無法顛覆抖音,豆包能顛覆微信嗎?騰訊可能樂見此局。

DFlash 推測解碼的原生 MLX 實作,在 M5 Max 上為 Qwen3.5-9B 帶來 3.3 倍加速。基準測試顯示各模型大小與量化皆有顯著提升。開發者分享優化技巧與未來計畫,包括開源。

阿里正式認領屠榜的神秘 AI 模型「歡樂馬」(Happy Horse)。該模型由 ATH 團隊領袖鄭波打造。報導澄清是「快樂大馬」,非「快樂小馬」。
Qwen3.5-122B NVFP4 在 2x RTX PRO 6000 Blackwell 上達 198 tok/s,經 SGLang 驗證。公開資料含至 150K 令牌上下文擴展,解碼無減速。關鍵:PCIe 交換器低延遲 MoE。

OpenAI的Sora據傳燒掉54億後失敗,被宣告「死了」。匿名中國模型僅用38秒生成影片,主宰排行榜。影片生成戰爭從模型能力轉向算力經濟與合規壁壘。
使用 llama-bench 以 Q4_K_M 量化,在 MacBook Air M5 32GB 上全面基準測試 37 款 LLM。強調 MoE 模型如 Qwen 3.5 35B-A3B 達 31 tok/s 為頂尖效能。分享開源工具供社群硬體基準測試。
中國模型佔OpenRouter前十六席,小米MiMo-V2-Pro以4.82萬億Token領先;自2026年2月起超越美國模型。價格差距10-60倍推動高Token代理應用如OpenClaw採用。SWE-Bench基準性能逼近美國對手。

用戶在 AMD Strix Halo 上基準測試 19 款本地 LLM,用於家用實驗室任務如郵件分類、餐食規劃與 Home Assistant YAML。Gemma 4 26B-A4B 修復 bug 後排名第一,在結構化輸出與可靠性上出色。自訂 45 項測試由 Claude Opus 評分。