Gemma 4 在本地測試勝過 Qwen
Gemma 4 26b 在 Mac Studio M1 Ultra 上速度匹配 Qwen3.5 35b,於思考鏈連貫性、視覺理解及多語言任務大幅超越。使用者指出 KV 快取龐大及審查風險,但整體表現獲讚。使用 Q4_K_XL 量化測試。
Tag: #benchmark195 results
Gemma 4 26b 在 Mac Studio M1 Ultra 上速度匹配 Qwen3.5 35b,於思考鏈連貫性、視覺理解及多語言任務大幅超越。使用者指出 KV 快取龐大及審查風險,但整體表現獲讚。使用 Q4_K_XL 量化測試。

研究人員推出Connections,一款即興文字遊戲,作為評估AI代理社交智能的基準。它測試知識檢索、摘要化和對其他代理認知狀態的覺察,超越單一推理。遊戲強調受限多代理環境中的合作與社交覺察。

研究人員引入一個包含 516 個證明狀態的基準,用於評估命題邏輯輔導中的 LLM 反饋。他們發現驗證可將錯誤傾向反饋提升 85%,但所有管道在複雜度 4-5 以上均失效。這挑戰了驗證器普遍改善輔導的假設。
在雙 3090 上 16k 上下文基準測試,TurboQuant 只用 1.8GB VRAM,對比 LM Studio 的 5.4GB。在回憶任務上 TurboQuant 幾乎持平(79/85 對 85/85),但 tok/s 稍慢。對 VRAM 受限環境是絕佳折衷。
程式工具Cursor發布自研編碼模型Composer 2,在評測中超過Claude Opus 4.6並主打性价比。開發者發現其基於Kimi K2.5微調。馬斯克在社群發文確認:「是的,這就是Kimi K2.5。」

Qwen3.5-27B 在 Aider 基準測試中比較 BF16/FP8 權重與 KV 快取,10 次運行無統計顯著差異。平均任務使用 13k 權杖。FP8 在代理編碼中與 BF16 表現相當,無明顯損失。

用戶讚揚 Z.AI 私有模型 GLM-5-Turbo,在 OpenRouter 測試速度極快、智慧達 Gemini 3.2 Flash 水平或更佳。尚未上 Hugging Face。盼望未來開源。

文章預覽2026 Claw基準測試,對比大廠專有「龍蝦」模型與開源「澳龍」。這是大模型效能關鍵評測。附帶中國企業全球化平台介紹。

llama.cpp 第 8294 版在具 Apple A18 Pro 晶片與 8GB RAM 的 500 美元 MacBook Neo 上運行 Qwen3.5-9B Q3_K_M,提示速度達 7.8 個令牌/秒,生成功率 3.9 個令牌/秒。基準測試顯示 9B 模型可達 5 t/s,4B 模型達 10 t/s 配置。使用 Metal GPU 加速與特定超參數。