
Orthrus 擴散頭模型即將發布
Orthrus 團隊宣布即將發布針對 Qwen 3.5/3.6 與 Gemma 4 訓練的擴散頭模型。他們將同時開源完整的端到端訓練與評估程式碼。
Tag: #model-training40 results

Orthrus 團隊宣布即將發布針對 Qwen 3.5/3.6 與 Gemma 4 訓練的擴散頭模型。他們將同時開源完整的端到端訓練與評估程式碼。

Google DeepMind 研究人員展示了一種透過結合合成文件預訓練與對話式 SFT,將特定價值觀植入 Gemini 3 Flash 的方法。此方法旨在提升模型對齊能力與穩健性,即使在處理分佈外(OOD)情境時亦然。

Anthropic 撤回了一項具爭議性的政策,該政策原先會隱蔽地限制 AI 研究人員使用 Claude 來開發競爭模型。在面臨研究社群的強烈反彈後,該公司決定改變方針。
DeepSpeed 已正式整合對 Muon 優化器的支援,這是一種在頂尖 AI 實驗室中備受關注的高效能優化演算法。此更新讓開發者能在成熟的 DeepSpeed 生態系統中運用 Muon 的優勢。
Elon Musk 旗下的 xAI 已暫停招募負責訓練 Grok 聊天機器人的專家。此舉顯示該公司在開發 AI 技術的策略上可能出現轉變。

有報導指出蘋果正利用 Google 的 AI 基礎設施來訓練其內部模型。同時,隨著 ChatGPT 面臨日益激烈的競爭,AI 市場正進入「三足鼎立」的新格局。

國產 AI 成功實現自我進化,透過 AI 創造 AI,為全球首例。此突破顯示其訓練速度較 Nvidia 的 Megatron 框架提升了 10%。

舊金山新創 Goodfire 推出 Silico,一款機械可解釋性工具,可窺探 AI 模型內部。研究人員和工程師能在訓練期間調整參數。這提供以往認為不可能的模型行為精細控制。

威斯康星大學麥迪遜分校與史丹佛大學研究人員推出 Train-to-Test (T2) 縮放法,共同優化模型參數、訓練資料與推理樣本。建議訓練比 Chinchilla 規定小得多但資料量大得多的模型,將節省運算用於多重測試時樣本。此法提升複雜任務效能,同時控制企業應用推理成本。
馬斯克表示,xAI的Colossus 2目前有6個模型正在訓練中。此更新凸顯xAI持續的大規模運算努力。