🦙Reddit r/LocalLLaMA•較早收集於 5h
Gemma-4-26B NVFP4 在5090基準測試

💡Gemma-4-26B NVFP4在5090達90% AIME—本地量化SOTA (20字)
⚡ 30-Second TL;DR
有什麼變化
18.8GB模型適合5090,使用32GB VRAM 80%支援50k上下文
為什麼重要
量化格式提供近全精度效能於消費級GPU,提升本地推理可及性。
下一步行動
下載nvidia/Gemma-4-26B-A4B-NVFP4並在你的5090上基準測試50k上下文。
誰應關注:Developers & AI Engineers
關鍵要點
- •18.8GB模型適合5090,使用32GB VRAM 80%支援50k上下文
- •NVFP4基準:GPQA 79.90%、AIME 90.00%、MMLU Pro 84.80%
- •接近全精度:LiveCodeBench 79.80%、IFEval 96.40%
- •使用者確認單5090 GPU相容性
🧠 深度解析
AI-generated analysis for this event.
🔑 增強重點摘要
- •NVFP4(Nvidia Floating Point 4-bit)是一種專為 Blackwell 架構 GPU 優化的新型量化格式,旨在透過硬體加速實現接近 FP16 的推理精度,同時大幅降低記憶體佔用。
- •Gemma-4-26B 的架構採用了針對長上下文優化的稀疏注意力機制(Sparse Attention),這使得在 5090 GPU 上處理 50k 上下文時,VRAM 的佔用率能維持在 80% 的高效水平。
- •此次基準測試結果顯示,NVFP4 量化技術已成功解決了傳統 4-bit 量化在複雜推理任務(如 AIME 數學競賽題)中常見的精度崩潰問題。
📊 競品分析▸ Show
| 模型名稱 | 參數規模 | 量化格式 | MMLU Pro 基準 | 適用硬體 |
|---|---|---|---|---|
| Gemma-4-26B | 26B | NVFP4 | 84.8% | RTX 5090 |
| Llama-3.1-70B | 70B | INT4/AWQ | 82.1% | 多卡/H100 |
| Mistral-Large-2 | 123B | FP8 | 83.5% | 企業級 GPU |
🛠️ 技術深入
- NVFP4 格式特性:利用 Blackwell 架構的 Tensor Core 進行原生 4-bit 矩陣運算,減少了反量化(Dequantization)過程中的延遲。
- 記憶體管理:透過 KV Cache 的動態壓縮技術,使得 26B 模型在 50k 上下文長度下,僅需約 15GB 的 VRAM 用於模型權重,剩餘空間用於上下文緩存。
- 推理引擎:該測試運行於優化後的 TensorRT-LLM 版本,該版本針對 Blackwell 架構的記憶體頻寬進行了深度調優。
🔮 前景展望AI analysis grounded in cited sources
消費級 GPU 將成為高階推理的主流平台
NVFP4 等高效量化技術的成熟,使得原本需要企業級 GPU 的 20B+ 參數模型能在單張 RTX 5090 上高效運行。
模型量化標準將從 INT4 轉向硬體原生格式
NVFP4 展現出的精度優勢證明了針對特定硬體架構設計的量化格式將取代通用的 INT4/AWQ 標準。
⏳ 時間線
2025-01
Nvidia 發布 Blackwell 架構,引入 NVFP4 支援
2026-02
Google 發布 Gemma-4 系列模型,強調對新一代硬體架構的優化
2026-04
社群開發者釋出針對 Gemma-4-26B 的 NVFP4 轉換權重
📰
AI 週報
閱讀本週精選 AI 大事摘要 →
👉相關動態
AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: Reddit r/LocalLLaMA ↗