
Sabomako發佈Qwen3.5-122B-A10B-heretic-GGUF於Hugging Face
Sabomako在Hugging Face發佈Qwen3.5-122B-A10B-heretic的GGUF版本。實現巨型模型的高效本地推理。在r/LocalLLaMA社群分享。
Tag: #quantization201 results

Sabomako在Hugging Face發佈Qwen3.5-122B-A10B-heretic的GGUF版本。實現巨型模型的高效本地推理。在r/LocalLLaMA社群分享。

使用者使用 vLLM 在 2x RTX 3090 GPU 上優化 Qwen3.5 27B 密集模型,達成 100+ t/s 解碼、1500 t/s 預填充,以及 8 個請求的 585 t/s 吞吐量。主要調整包括張量並行、5 個 token 的 MTP、特定 int4 量化,以及自訂 vLLM 編譯。分享腳本和修復分支的儲存庫以供複製。
開發者使用 Qualcomm AI Hub 在真實 Snapdragon 硬體上建置邊緣 ML 模型自動化品質閘門,捕捉如前處理變更導致的 40% 延遲跳升等問題。FP32/INT8 視覺模型通過,但 ResNet50 在推論時間與記憶體上失敗。包含簽名證據包以確保可靠部署。

Unsloth 發布 Dynamic 2.0 GGUFs,具備智能選擇性層級量化。此更新實現更廣泛且更智能的本地 LLM 推論壓縮。由 u/paranoidray 發佈於 r/LocalLLaMA。
Minimax M2.5 的 GGUF 量化版本 (Q4 至 Q1) 嚴重落後原模型,不像 Qwen 3.5 量化版穩健。在 H200 上每個模型評估需 10-20 小時,因生成無意義文字。關鍵教訓:量化穩健性因模型而異。
Feather 使用自訂 Triton 核心與位元打包,在 RTX 3050 等 Ampere GPU 上模擬 FP8 推論,TinyLlama 相較 FP32 達 1.5 倍加速且精度損失極小。聚焦記憶體頻寬最佳化,無需原生硬體支援。未來計畫涵蓋 CUDA Graphs、區塊量化及 Llama 支援;獲 PyTorch 歐洲大會 2026 接受。

Qwen3.5 122B 在 72GB VRAM(3x3090)上以 Q3_K 達 25 tok/s,被譽為最佳模型,支援 120k 上下文。分享最佳設定修復迴圈:Temp 0.6、Top P 0.8、Repeat 1.3。在佔用與速度平衡勝出。

中國 GPU 製造商摩爾線程已在其旗艦 MTT S5000 處理器上完成 Alibaba 最新開源 Qwen3.5 LLM 的完整適配。相容性涵蓋整個流程,包括訓練、推理和量化部署。支援多種精度格式,如 FP16、BF16 和 INT4。
相同 INT8 ONNX 模型在 5 款 Snapdragon 晶片組測試,準確率從 93%(8 Gen 3)到 71%(4 Gen 2),雲端為 94%。原因:NPU INT8 捨入差異、運算子融合變異、低階晶片 CPU 回退。強調裝置端硬體特定測試需求。

Reddit 貼文強調 Georgi Gerganov 對 llama.cpp 與本地 LLM 生態系的奠基性貢獻。這場討論主要是在表達對專案重要性的感謝,而非宣布新的技術版本。