Search

直接匹配不多,已補上最新動態。

Tag: #cuda-optimization2 results

Luce DFlash:在 RTX 3090 上 Qwen3.6 速度翻倍

Luce DFlash:在 RTX 3090 上 Qwen3.6 速度翻倍

Luce DFlash 是 DFlash 推測解碼的 GGUF 移植版,針對 Qwen3.6-27B,在單張 RTX 3090 上實現高達 2 倍吞吐量,使用基於 ggml 的獨立 C++/CUDA 堆疊。支援 256K 上下文,具 KV 快取壓縮與滑動視窗注意力,在程式碼/數學任務上基準測試達 1.98 倍平均加速。部署簡單,只需 CMake 建置與 Hugging Face 下載,並提供 OpenAI 相容伺服。

Reddit r/LocalLLaMACommunityApr 27#speculative-decoding#local-llm#cuda-optimization
Ox Alpha:神秘模型公開亮相

Ox Alpha:神秘模型公開亮相

Ox Alpha 是一款透過 OpenRouter 與 OpenCode 提供的匿名模型,具備 100 萬 token 上下文、圖片與影片輸入、工具呼叫及免費使用等能力。早期測試顯示其推理與程式設計表現強勁,但開發者、參數量、訓練資料與正式基準排名仍未獲確認。