Search

Tag: #moe72 results

APEX:MoE 推理加速 33% 發布

APEX:MoE 推理加速 33% 發布

全新 APEX MoE 模型量化技術,在準確度上優於 Unsloth Dynamic 2.0 且體積減半,以 Qwen3.5-35B-A3B 為基準。提供從 12GB VRAM 的 GPU 等級,兼容標準 llama.cpp,並透過 TurboQuant 提示處理加速 14%。開源,模型在 Hugging Face。

Reddit r/LocalLLaMACommunityApr 1#moe#quantization#inference-speed
NVIDIA Puzzle 優化 88B LLM

NVIDIA Puzzle 優化 88B LLM

NVIDIA 的 gpt-oss-puzzle-88B 經 Puzzle NAS 從 gpt-oss-120b 衍生,參數減至 88B,在 8x H100 長上下文下吞吐量提升 1.63 倍。它匹配母模型準確度,透過 MoE 架構調整優化 H100 推論。專為推理工作負載設計。

Reddit r/LocalLLaMACommunityMar 26#moe#nas#h100
Page 5 of 8