🦙Reddit r/LocalLLaMA•較早收集於 2h
Mistral 119B NVFP4 在 RTX Pro 6000 上的基準測試
#inference-benchmark#blackwell-gpu#long-contextmistral-small-4-119b-2603-nvfp4mistral-small-4-119b-2603nvfp4rtx-pro-6000sglangvllm
💡119B Mistral 在 Blackwell GPU 上至 256K 上下文精確推論基準(131→64 t/s)
⚡ 30-Second TL;DR
有什麼變化
1K 上下文、1 使用者生成速度 131.3 tok/s
為什麼重要
突顯 RTX Pro 6000 在大型模型高並發推論潛力,但長上下文 TTFT 成瓶頸。快取可大幅提升多使用者效能。
下一步行動
使用 SGLang 在你的 RTX Pro 6000 上對 Mistral NVFP4 執行自訂工作負載基準測試。
誰應關注:Developers & AI Engineers
關鍵要點
- •1K 上下文、1 使用者生成速度 131.3 tok/s
- •256K 上下文、1 使用者 64.2 tok/s;TTFT 66.8s
- •8K 短聊天機器人最高並發 19 使用者
- •SGLang 使用全精度 KV 快取,無推測解碼
- •vLLM 測試但在此硬體上解碼較慢
🧠 深度解析
背景與延伸:來自公開資料,非原文內容。引用 8 個來源。
🔑 增強重點摘要
- •Mistral Small 4 採用 MoE 架構,擁有 128 個專家,每次 token 僅激活 6.5B 參數[1][2][3]。
- •模型支援多模態輸入,可處理文字與影像,並具備可切換的推理模式與原生函數呼叫[1][3]。
- •相較 Mistral Small 3,在延遲優化設定下端到端完成時間減少 40%,吞吐量優化下每秒處理 3 倍請求[1][2][3]。
- •於 AA LCR 基準測試中得分 0.72,輸出僅 1.6K 字元,即優於需 5.8-6.1K 字元的 Qwen 模型[2][3]。
- •於 2026 年 3 月 16 日 NVIDIA GTC 期間發布,Apache 2.0 授權,整合 NVFP4 量化版優化 NVIDIA 硬體[4]。
📊 競品分析▸ Show
| 模型 | 參數 | 架構 | 基準優勢 | 硬體優化 |
|---|---|---|---|---|
| Mistral Small 4 | 119B (6.5B 活躍) | MoE (128 專家, 4 活躍) | AA LCR 0.72 (1.6K 輸出), 優於 GPT-OSS 120B 及 Qwen | NVFP4 for NVIDIA Ampere/Blackwell/Hopper |
| GPT-OSS 120B | 120B | Transformer | LiveCodeBench 落後 Mistral Small 4 (輸出多 20%) | 未指定 |
| Qwen (相關模型) | 未指定 | 未指定 | AA LCR 需 3.5-4x 更多輸出達同等分數 | 未指定 |
| Llama 3.3 70B | 70B | 未指定 | Mistral Small 3 已具 3x 速度優勢,小 4 增多模態 | 未指定 |
🛠️ 技術深入
- •架構類型:Transformer 混合專家 (MoE),128 專家、4 個活躍專家[1][2][3]。
- •總參數 119B,每次 token 激活 6.5B 參數,上下文長度 256k[1][2][3]。
- •多模態:接受文字與影像輸入,輸出文字;支援推理模式切換、函數呼叫、多語言及系統提示[1][3]。
- •效率優化:支援推測解碼 (eagle head)、NVFP4 4-bit float 量化;推理引擎 vLLM (張量並行、工具呼叫)、Hugging Face Transformers[2][3]。
- •支援硬體:NVIDIA Ampere (A100)、Blackwell (B100/B200/GB200)、Hopper (H100/H200)[2]。
🔮 前景展望AI analysis grounded in cited sources
⏳ 時間線
2026-03
Mistral Small 4 119B 發布,於 NVIDIA GTC 推出 NVFP4 量化版整合多模態與推理功能
2026-03-16
模型上架 Hugging Face,提供 MoE 架構與 256k 上下文支援
2026-03-17
Reddit r/LocalLLaMA 發布 RTX Pro 6000 基準測試,展示 SGLang 效能
📎 來源 (8)
Factual claims are grounded in the sources below. Forward-looking analysis is AI-generated interpretation.
- Hugging Face — Mistral Small 4 119b 2603 Nvfp4
- build.nvidia.com — Modelcard
- Hugging Face — Mistral Small 4 119b 2603
- topaiproduct.com — Mistral Small 4 Packs 119b Parameters Into 6b Active and It Does Everything
- llm-stats.com — Mistral Large 3 675b Instruct 2512 Nvfp4 vs O4 Mini
- zeniteq.com — Mistral Small 4 Packs Four AI Models Into One
- millstoneai.com — Inference Benchmark
- GitHub — LLM Model Comparison 2026
📰
AI 週報
閱讀本週精選 AI 大事摘要 →
👉相關動態
AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: Reddit r/LocalLLaMA ↗
每週 AI 簡報
每週一封,可隨時退訂。
