🦙最新收集於 6h

Qwen3.8-Flash-Next 在 48GB Mac 上運行

Qwen3.8-Flash-Next 在 48GB Mac 上運行
PostLinkedIn
🦙閱讀原文: Reddit r/LocalLLaMA
#local-inference#macos#memory-offloading#tok-per-secondqwen3.8-flash-nextqwen3.8-flash-nextqwenmac

💡實測 104GB Qwen 模型如何在 48GB Mac 上以可用速度運行。

⚡ 30-Second TL;DR

有什麼變化

據報模型大小為 104GB。

為什麼重要

這項報告顯示,本地開發者或許能在實體記憶體不足的機器上實驗更大型的模型。實際可用性仍取決於量化方式、記憶體管理策略、提示長度與工作負載。

下一步行動

使用偏好的 Mac 推理執行環境重現此配置,並記錄記憶體用量、量化格式、上下文長度與持續 tok/s。

誰應關注:Developers & AI Engineers

關鍵要點

  • 據報模型大小為 104GB。
  • 主機是一台配備 48GB 記憶體的 Mac。
  • 據報生成速度約為每秒 12 個 token。
  • 這是社群使用展示,而非正式基準測試。
📰

AI 週報

閱讀本週精選 AI 大事摘要 →

👉相關動態

AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: Reddit r/LocalLLaMA

這是摘要,不是原文。去看原站,或訂閱每週簡報。

每週 AI 簡報

每週一封,可隨時退訂。