
Qwen 3.6 27B 量化品質基準測試
使用者以自訂國際象棋 PGN 轉 SVG 任務基準測試 Qwen 3.6 27B 從 BF16 到 IQ3_XXS 的量化版本,以找出適合 16GB VRAM 的最佳選擇。高量化如 Q6_K 在棋盤狀態追蹤及 SVG 渲染表現出色;Gemma 4 和 Qwen 3.5 等其他模型大多失敗。測試使用 llama.cpp 固定取樣參數。
Tag: #benchmark195 results

使用者以自訂國際象棋 PGN 轉 SVG 任務基準測試 Qwen 3.6 27B 從 BF16 到 IQ3_XXS 的量化版本,以找出適合 16GB VRAM 的最佳選擇。高量化如 Q6_K 在棋盤狀態追蹤及 SVG 渲染表現出色;Gemma 4 和 Qwen 3.5 等其他模型大多失敗。測試使用 llama.cpp 固定取樣參數。
Hugging Face 宣布將 Benchmaxxer Repellant 新增至 Open ASR 排行榜。此更新引入防範基準最大化器的保障措施,用於自動語音辨識評估。它提升了平台上模型比較的可靠性。

xAI 悄然推出 Grok 4.3,作為更便宜、更快、更實用的助手升級。跑分顯示其在硬推理、穩定性和可信度上落後 GPT-5.5 與 Claude Opus 4.7。馬斯克視為過渡版本,未大肆宣傳。
Qwen3.6-27B 與 35B-A3B、Qwen3.5-27B、Gemma4 在 20k 權杖架構文件合成任務實測。Qwen3.6-27B 勝出整體實用性和平衡。Gemma4 領先清晰/紀律;35B 擅長完整性。

推出 NARS-Reasoning-v0.1 基準,將自然語言配對 FOL、Narsese 及推理標籤。開發經 OpenNARS 驗證的 FOL 至 Narsese 管道。發布 Phi-2 LoRA 適配器用於三標籤分類。

MineBench 基準測試顯示 Kimi K2.6 在 3D Minecraft 結構建構上優於 K2.5,細節更豐富,雖有些不一致。總成本 2.35 美元,被視為效能最划算模型。提供基準儲存庫與先前比較連結。
一具紅色人形機器人於北京郊區完成半馬拉松,用時 50 分鐘 26 秒。此成績比男子世界紀錄快約 7 分鐘,展現機器人領域 AI 進展迅猛。

ATEC2026發起專屬具身智能的「圖靈測試」。此挑戰聚焦真實世界考驗,旨在判定哪些AI系統能超越模擬環境,真正應對實際情境。

基準測試顯示 Qwen3.6 UD_Q_4_K_M 在 16GB VRAM + 32GB RAM 上以 50+ 令牌/秒運行,支援 200k 上下文視窗。由 ik_llama 推理驅動。於 r/LocalLLaMA 分享。
新開源基準使用 98 題跨 14 政策領域,將 LLM 映射至 2D 政治羅盤,將拒答計為保守立場。GPT-5.3 有選擇退出時 100% 拒答,轉為右威權;Claude 象限翻轉;KIMI K2 維持左自由主義,儘管台灣題被阻。揭示沉默即政治立場。