
Zyphra 推出高效 ZAYA1-8B MoE 模型
Zyphra 發布 ZAYA1-8B,這是一個開放的 8B 參數混合專家推理模型,在 AMD Instinct MI300 GPU 上訓練,在基準測試中與 GPT-5-High 和 DeepSeek-V3.2 競爭。Apache 2.0 授權可在 Hugging Face 免費下載並自訂。它具備創新的 MoE++ 架構,提供優異效率。
Tag: #amd-gpu12 results

Zyphra 發布 ZAYA1-8B,這是一個開放的 8B 參數混合專家推理模型,在 AMD Instinct MI300 GPU 上訓練,在基準測試中與 GPT-5-High 和 DeepSeek-V3.2 競爭。Apache 2.0 授權可在 Hugging Face 免費下載並自訂。它具備創新的 MoE++ 架構,提供優異效率。
kernel-anvil 在 AMD GPU 上剖析 GGUF 模型形狀,並產生最適 llama.cpp 核心配置,無需重新編譯即可實現解碼速度提升 2 倍。它針對 RDNA3 GPU 如 7900 XTX,在 Qwen3.5-27B Q4_K_M 上達到 27 tok/s。使用方式為快速剖析並套用小型 llama.cpp 修補。
ZINC 是用 Zig 撰寫的新 LLM 推理引擎,可在 $550 AMD GPU 上運行 35B 模型,透過 Vulkan。它載入 GGUF 模型,在 RDNA4 上達 7.1 tok/s,解決 AMD 消費級 GPU 缺口。儲存庫:github.com/zolotukhin/zinc。

一位使用者為不受支援的 AMD MI50 GPU(gfx906)開發 PyTorch 基於分塊注意力的 flash-attention 替代方案,避免視訊生成時 OOM。受 llama.cpp 啟發,使用查詢分塊、softmax 後備機制,以及 BF16 轉 FP16 等優化。純 PyTorch,無需自訂核心。
基準測試顯示雙 AMD RX 7900 XTX GPU 使用 llama.cpp Vulkan 後端,在 Qwen3.5-35B-A3B Q4_K_M 上達成 123 tok/s 令牌生成及最高 3,829 tok/s 提示處理。它優於單一 7900 XTX 並與高階 NVIDIA 卡匹敵。ROCm 上的 vLLM 表現差勁且有錯誤。
Hugging Face 部落格介紹 MachinaCheck,一個專為 CNC 可製造性檢查設計的多代理系統。此專案利用 AMD MI300X 加速器實現先進的 AI 驅動製造分析。它展示多代理 AI 在工業流程中的實際應用。
Hugging Face 部落格展示在 AMD ROCm 平台上微調 MedQA,這是醫療問答的臨床 AI 模型。此方法無需 NVIDIA 的 CUDA,可在 AMD GPU 上進行訓練。強調 AI 開發的開源替代方案。
Hipfire是專為所有AMD GPU設計的新推理引擎,採用mq4量化。創作者在Hugging Face分享量化模型。Localmaxxing基準測試顯示RDNA3及舊卡大幅加速。

教學讓Qwen3.5-397B-A13B經vLLM在8x AMD R9700 GPU上運行,使用MXFP4量化。單請求達30 t/s,批次高達100 t/s。包含Dockerfile修補與啟動腳本以達高吞吐。

最新 AMD GPU 韌體與 llama.cpp 建置大幅提升 Strix Halo 的 Vulkan 效能。在 Debian Linux 上測試 Qwen3.5-35B-A3B-Q8_0,使用 ROCm 7.12。提示處理速度遠超先前基準。