
DGX Spark 用於 vLLM 本地推論設定
一位使用者拆箱 NVIDIA DGX Spark,用於教育應用程式的本地 LLM 推論,搭配 vLLM、PyTorch 和 Hugging Face 模型。他們尋求最佳模型、統一記憶體 vLLM 調校建議,以及實際吞吐量表現。這是從雲端 GPU 轉向本地設定的首次嘗試。
Tag: #local-inference188 results

一位使用者拆箱 NVIDIA DGX Spark,用於教育應用程式的本地 LLM 推論,搭配 vLLM、PyTorch 和 Hugging Face 模型。他們尋求最佳模型、統一記憶體 vLLM 調校建議,以及實際吞吐量表現。這是從雲端 GPU 轉向本地設定的首次嘗試。

Reddit 用戶批評最新 Opus 4.6 更新「被閹割」,聲稱它在 RTX 5070 TI GPU 的「carwash test」中甚至輸給高度量化的 Gemma 4 31B UD IQ3 XXS 模型。這突顯了近期模型調整的潛在退化。
Reddit 討論串徵求 M5 Max 128GB 擁有者對運行本地模型的真實意見。使用者分享偏好模型、失望、驚喜及理想應用情境。承認無法匹敵兆參數前沿模型。
llama.cpp 中的 Gemma 4 31B 在大提示下耗盡系統 RAM(高達 63GB+),儘管 VRAM 仍有餘裕,導致 OOM 中斷。最新 llama.cpp 在多台機器上皆出現,即使使用 Q4/Q5 量化及 100k 上下文。降低上下文大小可緩解但限制可用性。
Intel Arc Pro B70 32GB 顯示卡現於 Newegg 上架,售價 $949,一週內送達。於 r/LocalLLaMA 分享,適合本地 LLM 使用者。

llama.cpp 主分支已合併 Gemma 4 分詞器修復。本地 LLM 愛好者可透過簡單的 git pull 更新。此修復解決運行 Gemma 4 模型的相容性問題。

使用者回報 Gemma 4 在本地使用 Unsloth 量化版本與 llama.cpp 時,產生無意義輸出,無法正確偵測錯字任務,即使參數正確。此問題影響 26B MoE、31B 模型及 UD-Q8_K_XL 等多種量化。在 Google AI Studio 中作為對照則表現良好。

Gemma 4 26b a4b 模型在 MacBook Pro M5 MAX 上平均達到 81 令牌/秒。峰值功耗為 114 瓦,因回應快速僅短暫爆發。此展示 Apple 矽晶高效本地推論。

Reddit 用戶對 Qwen 3.6B 的 Q2 至 Q8 量化版本進行基準測試。本地 LLM 愛好者可查看結果。由 /u/PraxisOG 發佈於 r/LocalLLaMA。
Reddit 用戶質疑為何不選擇兩張 RTX 5060 16GB 卡(1100 美元獲 32GB VRAM)而非昂貴的 RTX 5090。尋求本地 LLM 設定的效能測試。r/LocalLLaMA 討論強調成本節省潛力。