🦙Reddit r/LocalLLaMA•最新收集於 2h
Muse Spark 領先 LLM 熱量估算基準測試
#nutrition-ai#local-inferencellm-calorie-estimation-benchmarkmuse spark 1.3muse glimmer 30bdeepseek v4 flash visionqwen 3.8
💡這項小型測試顯示,針對任務的評估可能顛覆以模型大小為基礎的 LLM 排名。
⚡ 30-Second TL;DR
有什麼變化
Muse Spark 1.3 準確度最高,有 48% 的餐點估算誤差低於 20%。
為什麼重要
結果顯示,實務開發者應針對實際多模態任務進行模型測試,而不是只依據參數量或整體聲譽選型。不過,由於樣本數偏少,這些排名應視為方向性參考,而非定論。
下一步行動
在選擇用於熱量估算的本地視覺語言模型前,使用至少 100 份 Nutrition5k 餐點及目標菜系重新測試。
誰應關注:Researchers & Academics
關鍵要點
- •Muse Spark 1.3 準確度最高,有 48% 的餐點估算誤差低於 20%。
- •DeepSeek v4 Flash Vision 有 40% 的結果符合誤差目標,而 Qwen 3.8 27b 僅有 16%。
- •儘管消費級硬體需求相近,Muse Glimmer 30b 仍勝過 Qwen 3.8 27b。
- •測試使用 25 份隨機選取的 Nutrition5k 餐點,以及 USDA FoodData Central 和 MEXT 的營養資料。
📰
AI 週報
閱讀本週精選 AI 大事摘要 →
👉相關動態
AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: Reddit r/LocalLLaMA ↗
每週 AI 簡報
每週一封,可隨時退訂。
