🦙最新收集於 2h

Muse Spark 領先 LLM 熱量估算基準測試

PostLinkedIn
🦙閱讀原文: Reddit r/LocalLLaMA
#nutrition-ai#local-inferencellm-calorie-estimation-benchmarkmuse spark 1.3muse glimmer 30bdeepseek v4 flash visionqwen 3.8

💡這項小型測試顯示,針對任務的評估可能顛覆以模型大小為基礎的 LLM 排名。

⚡ 30-Second TL;DR

有什麼變化

Muse Spark 1.3 準確度最高,有 48% 的餐點估算誤差低於 20%。

為什麼重要

結果顯示,實務開發者應針對實際多模態任務進行模型測試,而不是只依據參數量或整體聲譽選型。不過,由於樣本數偏少,這些排名應視為方向性參考,而非定論。

下一步行動

在選擇用於熱量估算的本地視覺語言模型前,使用至少 100 份 Nutrition5k 餐點及目標菜系重新測試。

誰應關注:Researchers & Academics

關鍵要點

  • Muse Spark 1.3 準確度最高,有 48% 的餐點估算誤差低於 20%。
  • DeepSeek v4 Flash Vision 有 40% 的結果符合誤差目標,而 Qwen 3.8 27b 僅有 16%。
  • 儘管消費級硬體需求相近,Muse Glimmer 30b 仍勝過 Qwen 3.8 27b。
  • 測試使用 25 份隨機選取的 Nutrition5k 餐點,以及 USDA FoodData Central 和 MEXT 的營養資料。
📰

AI 週報

閱讀本週精選 AI 大事摘要 →

👉相關動態

AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: Reddit r/LocalLLaMA

這是摘要,不是原文。去看原站,或訂閱每週簡報。

每週 AI 簡報

每週一封,可隨時退訂。