⚙️
Kimi K2.5 在無 GPU 伺服器上達 1 令牌/秒
使用者在 IBM X3650 M4 伺服器(768GB RAM)上測試 unsloth 4-bit 量化 Kimi K2.5(約 620GB),無 GPU 達 1 令牌/秒。計劃跨多台乙太網路連結伺服器分割,以提升頻寬與核心數。伺服器使用 DDR3 RAM,低功耗運行涼爽。
Tag: #cpu-inference13 results
使用者在 IBM X3650 M4 伺服器(768GB RAM)上測試 unsloth 4-bit 量化 Kimi K2.5(約 620GB),無 GPU 達 1 令牌/秒。計劃跨多台乙太網路連結伺服器分割,以提升頻寬與核心數。伺服器使用 DDR3 RAM,低功耗運行涼爽。
LoRA 微調 Qwen2-0.5B(GGUF Q4_K_M,300MB)處理如「copy logs to backup」的自然語言任務,生成 CLI 計劃,全本地 CPU 執行。i3/i5 上推論 3-10 秒。GitHub 開源,徵求 v0.2 回饋。
Project NORD 正大幅重建為 NORD 5.5 — Flash,採用以 CPU 為優先、嚴格因果的推論設計,並減少人為設定的內部時間步驟。這個實驗性架構結合脈衝動態、循環記憶、因果 token 混合與 top-1 稀疏 MoE,下一步將進行訓練與基準測試。