🦙較早收集於 2h

Mistral 119B NVFP4 在 RTX Pro 6000 上的基準測試

PostLinkedIn
🦙閱讀原文: Reddit r/LocalLLaMA
#inference-benchmark#blackwell-gpu#long-contextmistral-small-4-119b-2603-nvfp4mistral-small-4-119b-2603nvfp4rtx-pro-6000sglangvllm

💡119B Mistral 在 Blackwell GPU 上至 256K 上下文精確推論基準(131→64 t/s)

⚡ 30-Second TL;DR

有什麼變化

1K 上下文、1 使用者生成速度 131.3 tok/s

為什麼重要

突顯 RTX Pro 6000 在大型模型高並發推論潛力,但長上下文 TTFT 成瓶頸。快取可大幅提升多使用者效能。

下一步行動

使用 SGLang 在你的 RTX Pro 6000 上對 Mistral NVFP4 執行自訂工作負載基準測試。

誰應關注:Developers & AI Engineers

關鍵要點

  • 1K 上下文、1 使用者生成速度 131.3 tok/s
  • 256K 上下文、1 使用者 64.2 tok/s;TTFT 66.8s
  • 8K 短聊天機器人最高並發 19 使用者
  • SGLang 使用全精度 KV 快取,無推測解碼
  • vLLM 測試但在此硬體上解碼較慢

🧠 深度解析

背景與延伸:來自公開資料,非原文內容。引用 8 個來源。

🔑 增強重點摘要

  • Mistral Small 4 採用 MoE 架構,擁有 128 個專家,每次 token 僅激活 6.5B 參數[1][2][3]
  • 模型支援多模態輸入,可處理文字與影像,並具備可切換的推理模式與原生函數呼叫[1][3]
  • 相較 Mistral Small 3,在延遲優化設定下端到端完成時間減少 40%,吞吐量優化下每秒處理 3 倍請求[1][2][3]
  • 於 AA LCR 基準測試中得分 0.72,輸出僅 1.6K 字元,即優於需 5.8-6.1K 字元的 Qwen 模型[2][3]
  • 於 2026 年 3 月 16 日 NVIDIA GTC 期間發布,Apache 2.0 授權,整合 NVFP4 量化版優化 NVIDIA 硬體[4]
📊 競品分析▸ Show
模型參數架構基準優勢硬體優化
Mistral Small 4119B (6.5B 活躍)MoE (128 專家, 4 活躍)AA LCR 0.72 (1.6K 輸出), 優於 GPT-OSS 120B 及 QwenNVFP4 for NVIDIA Ampere/Blackwell/Hopper
GPT-OSS 120B120BTransformerLiveCodeBench 落後 Mistral Small 4 (輸出多 20%)未指定
Qwen (相關模型)未指定未指定AA LCR 需 3.5-4x 更多輸出達同等分數未指定
Llama 3.3 70B70B未指定Mistral Small 3 已具 3x 速度優勢,小 4 增多模態未指定

🛠️ 技術深入

  • 架構類型:Transformer 混合專家 (MoE),128 專家、4 個活躍專家[1][2][3]
  • 總參數 119B,每次 token 激活 6.5B 參數,上下文長度 256k[1][2][3]
  • 多模態:接受文字與影像輸入,輸出文字;支援推理模式切換、函數呼叫、多語言及系統提示[1][3]
  • 效率優化:支援推測解碼 (eagle head)、NVFP4 4-bit float 量化;推理引擎 vLLM (張量並行、工具呼叫)、Hugging Face Transformers[2][3]
  • 支援硬體:NVIDIA Ampere (A100)、Blackwell (B100/B200/GB200)、Hopper (H100/H200)[2]

🔮 前景展望AI analysis grounded in cited sources

NVFP4 量化將推動更多消費級/專業級 NVIDIA GPU 部署大型 MoE 模型
RTX Pro 6000 等硬體基準顯示單卡可支援 119B 模型高並發,社區反饋預期優化持續改善記憶體效率[4]
單一模型整合多功能將減少企業部署複雜度
Mistral Small 4 合併指令、推理、視覺、編碼能力,相較前代 Small 3 提升 3x 吞吐量,簡化基礎設施[1][4]
開放原始碼 MoE 模型將在推理基準中持續挑戰封閉模型
以較短輸出超越 GPT-OSS 120B 及 Qwen,結合 Apache 2.0 授權有利商業採用[2][3][4]

時間線

2026-03
Mistral Small 4 119B 發布,於 NVIDIA GTC 推出 NVFP4 量化版整合多模態與推理功能
2026-03-16
模型上架 Hugging Face,提供 MoE 架構與 256k 上下文支援
2026-03-17
Reddit r/LocalLLaMA 發布 RTX Pro 6000 基準測試,展示 SGLang 效能
📰

AI 週報

閱讀本週精選 AI 大事摘要 →

👉相關動態

AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: Reddit r/LocalLLaMA

這是摘要,不是原文。去看原站,或訂閱每週簡報。

每週 AI 簡報

每週一封,可隨時退訂。