Savant Commander 48B:12個蒸餾MOE模型
Savant Commander 48B是基於Qwen3的自訂4x12B MOE,融合Claude、Gemini、OpenAI、DeepSeek等頂尖蒸餾模型,並具手寫路由。使用者可透過提示控制啟動並輕鬆測試差異。Hugging Face上有GGUF常規版與Heretic無審查版。
Tag: #gguf30 results
Savant Commander 48B是基於Qwen3的自訂4x12B MOE,融合Claude、Gemini、OpenAI、DeepSeek等頂尖蒸餾模型,並具手寫路由。使用者可透過提示控制啟動並輕鬆測試差異。Hugging Face上有GGUF常規版與Heretic無審查版。
OmniCoder-9B 被譽為8GB顯示卡上最聰明的程式碼與工具呼叫模型。它從簡單請求生成完整工具組。Hugging Face 上提供 GGUF 格式,可搭配 llama-server 和 VSCode 使用。
Minimax M2.5 的 GGUF 量化版本 (Q4 至 Q1) 嚴重落後原模型,不像 Qwen 3.5 量化版穩健。在 H200 上每個模型評估需 10-20 小時,因生成無意義文字。關鍵教訓:量化穩健性因模型而異。
使用者詢問 llama.cpp 搭配 llama-server 是否能針對特定請求停用推理,預設則保持啟用。使用 unsloth/gemma-4-26B-A4B-it-GGUF 模型。目的是讓聊天機器人回應更快。

Reddit 用戶報告,Claude-4.6-Opus 對本地模型如 Qwen 3.5 的微調,在智慧與推理上持續不如基礎模型。問題橫跨 llama.cpp 設定中的各種量化。軼事證據建議避免此類模型。
用戶分享 Gemma-4-26B-A4B 等 GGUF 模型量化詳細配方,需要 500GB 儲存空間及架構特定設定。感謝 unsloth、bartowski 等量化者;Hugging Face 上提供完整 REPRODUCE.md。
使用者測試顯示 Qwen3.5-27B (Q6_K_XL) 在開發任務匹敵 Nemotron-120B、Qwen3.5-122B 及 GPT-5.4。在 2x RTX 3090 上達 803pp/25tg,256k 上下文。可取代 API 訂閱用於日常編碼。
Reddit 用戶詢問最佳 Qwen3.5-27B 量化模型(Q4-Q5,20-24GB),專為編碼任務優化。提及 Unsloth、bartowski 和 mradermacher 等候選。尋求正確比較方法建議。

Unsloth 發布 Qwen3.5-4B 的 GGUF 格式,針對低階硬體最佳化。此 4B 模型擁有 32 層、閘控 DeltaNet/注意力機制,上下文長度達 100 萬 token。包含視覺編碼器與多步驟訓練。

Jan 團隊發布 Jan-Code-4B,一個基於 Jan-v3-4B-base-instruct 的 4B 程式碼微調模型,用於本地程式碼生成、編輯、除錯等任務。它在程式碼基準上優於基線,並可作為 Claude Code 中的 Haiku 替代,透過 Jan Desktop 使用。HuggingFace 上提供模型連結及推薦參數。