🦙最新收集於 8h

Hy4-preview 壓縮 87%,效能幾乎不減

Hy4-preview 壓縮 87%,效能幾乎不減
PostLinkedIn
🦙閱讀原文: Reddit r/LocalLLaMA
#model-compression#quantization#local-inferencetencent-hy4-previewtencenthy4-previewgguf

💡1.5 TB 模型據稱可壓縮成 200 GB GGUF,同時保留 98% 效能。

⚡ 30-Second TL;DR

有什麼變化

模型大小從約 1.5 TB 降至約 200 GB。

為什麼重要

如果獨立基準測試也能驗證這些數據,這項成果可能大幅降低超大型模型的儲存、傳輸與部署門檻。不過,實務團隊仍應先在自身工作負載上驗證品質,再將其視為近乎無損的壓縮方案。

下一步行動

下載壓縮版 Hy4-preview GGUF,並在目標提示詞上與原版進行基準測試,測量品質、RAM 使用量與載入時間。

誰應關注:Developers & AI Engineers

關鍵要點

  • 模型大小從約 1.5 TB 降至約 200 GB。
  • 壓縮後的 GGUF 據稱保留約 98% 的效能。
  • 更小的模型檔案可能提升本地與混合式部署的可行性。

🧠 深度解析

背景與延伸:來自公開資料,非原文內容。引用 9 個來源。

🔑 增強重點摘要

  • Hy4-preview 採用混合專家模型(MoE)架構,總參數規模高達 7700 億,但單次推論僅激活 490 億參數。
  • 該模型具備 100 萬 token 的超長上下文窗口,專為軟體工程與複雜文件分析等長序列任務設計。
  • 模型內建 100 億參數的多 Token 預測(MTP)層,旨在加速推論過程中的投機解碼(Speculative Decoding)。
  • Tencent 開發了專屬壓縮工具 AngelSlim,並同步釋出 FP8 量化版本以優化邊緣運算部署。
  • Hy4-preview 採用 Apache 2.0 開源授權,並已整合至 vLLM 與 SGLang 等主流推論框架中。
📊 競品分析▸ Show
特性Hy4-previewGLM 5.3Kimi K3
參數規模770B (MoE)未公開未公開
激活參數49B未公開未公開
上下文窗口1M tokens視版本而定視版本而定
授權方式Apache 2.0專有/商業專有/商業

🛠️ 技術深入

  • 架構類型:混合專家模型(MoE),具備 163 個專家模組。
  • 注意力機制:採用門控 DeepSeek 稀疏注意力(Gated DeepSeek Sparse Attention, DSA)。
  • 推論模式:支援深度思維鏈(Chain-of-Thought)推理模式與低延遲的 no_think 模式。
  • 效能優化:透過 MTP 層實現原生投機解碼,提升生成速度。
  • 部署支援:提供 Docker 映像檔,並支援 Hugging Face、ModelScope 與 GitCode 平台。

🔮 前景展望AI analysis grounded in cited sources

本地端部署超大型模型將成為企業標準
透過 87% 的壓縮率與 MoE 架構,企業能在消費級或邊緣硬體上運行具備 770B 知識容量的模型。
投機解碼技術將縮短 MoE 模型的首字延遲
內建 10B MTP 層的架構設計能顯著提升模型在長文本生成任務中的吞吐量。

時間線

2026-08
Tencent 正式發布 Hy4-preview 模型,並同步釋出 AngelSlim 壓縮工具。

📎 來源 (9)

Factual claims are grounded in the sources below. Forward-looking analysis is AI-generated interpretation.

  1. tencent.ai
  2. shattered.io
  3. mindstudio.ai
  4. medium.com
  5. tencent.ai
  6. tencent.com
  7. vllm.ai
  8. medium.com
  9. huggingface.co
📰

AI 週報

閱讀本週精選 AI 大事摘要 →

👉相關動態

AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: Reddit r/LocalLLaMA

這是摘要,不是原文。去看原站,或訂閱每週簡報。

每週 AI 簡報

每週一封,可隨時退訂。