Search

Tag: #benchmark195 results

Qwen 3.6 27B 量化品質基準測試

Qwen 3.6 27B 量化品質基準測試

使用者以自訂國際象棋 PGN 轉 SVG 任務基準測試 Qwen 3.6 27B 從 BF16 到 IQ3_XXS 的量化版本,以找出適合 16GB VRAM 的最佳選擇。高量化如 Q6_K 在棋盤狀態追蹤及 SVG 渲染表現出色;Gemma 4 和 Qwen 3.5 等其他模型大多失敗。測試使用 llama.cpp 固定取樣參數。

Reddit r/LocalLLaMACommunityMay 6#quantization#benchmark#local-inference
🤖

政治基準測試揭露 LLM 拒答偏見

新開源基準使用 98 題跨 14 政策領域,將 LLM 映射至 2D 政治羅盤,將拒答計為保守立場。GPT-5.3 有選擇退出時 100% 拒答,轉為右威權;Claude 象限翻轉;KIMI K2 維持左自由主義,儘管台灣題被阻。揭示沉默即政治立場。

Reddit r/MachineLearningCommunityApr 16#benchmark#political-bias#llm-eval
Page 15 of 20