🤖
Qwen 3.8 或改採 27B Dense 架構
社群推測 Qwen 3.8 可能以 27B dense 模型推出,而非 35B-A3B MoE 模型。對依賴 GPU offloading 的使用者而言,這可能讓本機推論速度大幅下降。
Tag: #model-architecture24 results
社群推測 Qwen 3.8 可能以 27B dense 模型推出,而非 35B-A3B MoE 模型。對依賴 GPU offloading 的使用者而言,這可能讓本機推論速度大幅下降。

在獨家對談中,星源智劉東表示,本體與模型最終一定會解耦。這場討論凸顯公司相信,未來只有少數企業會持續投入自研 AI 大腦。
本文認為像 Anthropic 和 OpenAI 這樣的頂尖 AI 實驗室並沒有所謂的「秘密配方」,其優勢主要來自於大規模的參數擴展。文中指出,近期出現的 5T 至 10T 參數模型已成為效能表現的新基準。
Reddit 上的討論探討了 Hugging Face Transformers 儲存庫中的原始碼究竟是完整的生產實作,還是僅供實驗的骨架。社群正針對開源模型架構的公開性與真實性進行討論。