Search

Tag: #inference-speed24 results

APEX:MoE 推理加速 33% 發布

APEX:MoE 推理加速 33% 發布

全新 APEX MoE 模型量化技術,在準確度上優於 Unsloth Dynamic 2.0 且體積減半,以 Qwen3.5-35B-A3B 為基準。提供從 12GB VRAM 的 GPU 等級,兼容標準 llama.cpp,並透過 TurboQuant 提示處理加速 14%。開源,模型在 Hugging Face。

Reddit r/LocalLLaMACommunityApr 1#moe#quantization#inference-speed
Page 2 of 3