🦙較早收集於 72m

Mistral Small 4 圖像辨識表現糟糕

PostLinkedIn
🦙閱讀原文: Reddit r/LocalLLaMA
#vision-model#benchmark#failure-analysismistral-small-4mistral-small-4qwen3.5llama.cppgguf

💡Mistral Small 4 圖像任務失敗—部署視覺應用前先測試(28字元)

⚡ 30-Second TL;DR

有什麼變化

官方 API 將音樂節舞台幻覺成體育場

為什麼重要

凸顯 Mistral 視覺能力限制,敦促從業人員在多模態任務中選擇 Qwen 等替代方案。

下一步行動

使用官方 API 基準測試 Mistral Small 4 與 Qwen3.5 在您的圖像提示上的表現。

誰應關注:Developers & AI Engineers

關鍵要點

  • 官方 API 將音樂節舞台幻覺成體育場
  • 錯過前景音樂家,無跑道或座位
  • Qwen3.5 35B A3B 以 1/4 參數提供準確描述
  • 非量化、GGUF 或 llama.cpp 問題所致

🧠 深度解析

背景與延伸:來自公開資料,非原文內容。引用 9 個來源。

🔑 增強重點摘要

  • Mistral Small 4 採用混合專家 (MoE) 架構,擁有 128 個專家,每 token 僅啟用 4 個,總參數 119B,活躍參數約 6B,提供高效多模態處理。[2]
  • 模型支援 256k 上下文視窗,並具可配置推理努力參數,可切換快速回應與深度分析,端到端延遲降低 40%,吞吐量提升 3 倍相較 Mistral Small 3。[2]
  • 官方宣稱 Mistral Small 4 整合 Magistral 推理、Pixtral 多模態及 Devstral 代理編碼能力,Apache 2.0 開源許可允許微調與自訂應用。[2]
📊 競品分析▸ Show
模型參數規模多模態支援上下文視窗基準表現
Mistral Small 4119B (6B 活躍)文字+圖像256k官方強調高效,但 Reddit 報告圖像辨識差;速度 165 t/s [1][2][4]
Pixtral Large124B文字+圖像128k優於 GPT-4o 在 MathVista、DocVQA、VQAv2 [1]
Qwen3.5 35B35B未指定未指定Reddit 指圖像描述優於 Small 4 [原文]

🛠️ 技術深入

  • 混合專家 (MoE) 架構:128 個專家,每 token 啟用 4 個,總參數 119B,活躍參數 6B (含嵌入與輸出層 8B),支援高效擴展與專門化。[2]
  • 原生多模態:接受文字與圖像輸入,適用文件解析與視覺分析;256k 上下文視窗支援長對話與文件分析。[2]
  • 可配置推理努力:參數切換輕量快速回應與深度推理輸出;相較 Mistral Small 3,延遲減 40%,每秒請求增 3 倍。[2]
  • 開源 Apache 2.0 許可,整合 Transformers、vLLM、llama.cpp 等框架;單 RTX 4090 或 32GB MacBook 可部署量化版本。[1]

🔮 前景展望AI analysis grounded in cited sources

Mistral Small 4 多模態效能將透過社區微調快速改善
開源許可與高效 MoE 架構吸引開發者貢獻,類似 Mistral 早期模型透過社群優化超越初始基準。[1][2]
混合模型趨勢將主導高效 AI 部署
Small 4 統一推理、多模態與代理功能,證明單一模型可取代多專用模型,提升產業效率。[2]

時間線

2023-09
發布 Mistral 7B,開源小模型匹敵 Llama 2
2023-12
推出 Mistral Medium,超越 GPT-3.5 基準
2024-02
發布 Mistral Large,競爭 GPT-4 效能
2024-07
升級 Mistral Large,提升效能
2024-11
再次升級 Mistral Large,強化表現
2026-03
宣布 Mistral Small 4,首個統一多模態與推理混合模型
📰

AI 週報

閱讀本週精選 AI 大事摘要 →

👉相關動態

AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: Reddit r/LocalLLaMA

這是摘要,不是原文。去看原站,或訂閱每週簡報。

每週 AI 簡報

每週一封,可隨時退訂。