
層複製登頂 Open LLM Leaderboard
使用者在 Qwen2-72B 中複製 7 個中間層,未修改權重即登頂 Open LLM Leaderboard。技術在 2 張 RTX 4090 GPU 上開發;完整部落格文章可閱。即将發布 Qwen3.5 變體及程式碼。
Tag: #consumer-gpu6 results

使用者在 Qwen2-72B 中複製 7 個中間層,未修改權重即登頂 Open LLM Leaderboard。技術在 2 張 RTX 4090 GPU 上開發;完整部落格文章可閱。即将發布 Qwen3.5 變體及程式碼。

阿里開源三款新 Qwen3.5 模型:Qwen3.5-35B-A3B、Qwen3.5-122B-A10B 及 Qwen3.5-27B,在多榜單超越更大前代及 GPT-5 mini。這些 MoE 與密集模型可在消費級顯卡運行,Qwen3.5-Flash 上線阿里雲,每百萬輸入 Token 僅 0.2 元。擅長 Agent 任務、程式設計、數學及多模態推理。

Nvidia的Gemma-4-26B-A4B-NVFP4 (18.8GB) 在5090 GPU上運行50k上下文,使用80% VRAM。基準測試幾乎匹配全精度:GPQA 79.9%、AIME 90%、MMLU Pro 84.8%。使用者確認可運作。
最佳化 llama.cpp 設定讓 Qwen3.5-35B-A3B-UD-Q4_K_L 在 RTX 4060 Ti 16GB 於 64k 脈絡達 40-60 tok/s。分享 models.ini 預設及 llama-server 指令。實際速度即使背景應用執行仍維持。

據博板堂最新消息,NVIDIA RTX 3060 12GB系列晶片将于今年6月恢復生產,相關晶片即將陸續到貨。此批晶片主要分配給各AIC品牌廠商,預計7月各大品牌啟動顯卡量產並推向市場。
用戶成功在 Ryzen 5、48GB RAM、RTX 3060 12GB 和 1TB NVMe 上運行量化 Qwen 3.5 397B,達 1.4 權杖/秒。質疑本地運行 397B 模型是否值得。徵求社群意見。