
NVFP4 低精度訓練提升吞吐量不損精度
隨著 AI 模型和資料集規模擴大,僅依賴 BF16 訓練已不足以應對吞吐量、記憶體和成本挑戰。NVFP4 低精度訓練透過降低數值精度解決這些問題。它能在不損失精度的情況下,以更高吞吐量擴展 Transformer 模型。
Tag: #model-scaling25 results

隨著 AI 模型和資料集規模擴大,僅依賴 BF16 訓練已不足以應對吞吐量、記憶體和成本挑戰。NVFP4 低精度訓練透過降低數值精度解決這些問題。它能在不損失精度的情況下,以更高吞吐量擴展 Transformer 模型。

Tencent 表示,其 Hy3 模型從預覽版轉為正式版本後,週使用量增加超過 68 倍。公司計畫近期推出參數規模更大的 Hy4 模型,但尚未公布發布日期或技術規格。

Pathway 的 BDH 被描述為一種後 Transformer 架構,據報在 1,000 萬至 10 億參數的模型範圍內,達到 GPT-2 級別的擴展表現。這些模型從頭訓練,並據稱可在一般 GPU 上執行。

據報 ByteDance 正在訓練一個規模可能接近 Anthropic 先進 Mythos 系統的 AI 模型。這項消息凸顯中國企業持續縮小與美國頂尖 AI 實驗室之間的差距。

Anthropic 正在應對「RSI 時鐘」挑戰,這可能與模型擴展或計算效率的限制有關。此外,該更新也強調了利用 Perplexity 進行商業構想壓力測試的新能力。

Meta大量燒錢卻堆不出頂級AI模型,讓小扎再度慌張。本質上是缺乏兌現AI故事的第二曲線。
Moonshot 的 Kimi K2.6 預計 10-15 天內發布,帶來小幅改進。K3 正在開發中,目標以巨量參數匹敵美國模型。這顯示中國 LLM 的積極擴展。
Hugging Face 部落格探討 Transformer 模型中的專家混合 (MoEs) 架構。介紹 MoEs 如何透過每個 token 只啟動選定專家來實現高效擴展。對於理解如 Mixtral 等稀疏模型至關重要。

文章探討10萬億參數大模型可能具備的能力與風險。文章認為,這類系統可能帶來超出人類預期的正面與負面影響,因此需要嚴格治理與約束。

中國 AI 產業正日益面臨高品質中文訓練資料短缺的問題。專家警告,資料不足可能成為與美國限制先進運算晶片同樣嚴重的發展約束。