
訓練 AI 代理來自動化訓練其他 AI 模型
研究人員使用 Qwen3.6 構建了一個代理,能自動編寫訓練任務、管理 GPU 叢集並優化小型模型的超參數。該代理透過外層強化學習迴圈,成功學會了提升模型效能。
Tag: #llm-training33 results

研究人員使用 Qwen3.6 構建了一個代理,能自動編寫訓練任務、管理 GPU 叢集並優化小型模型的超參數。該代理透過外層強化學習迴圈,成功學會了提升模型效能。

Google 正在啟動一項機密試點計畫,向 Android 開發者支付費用以換取其應用程式原始碼的存取權。該計畫引發了關於 AI 模型訓練數據獲取的疑慮。

USTC 研究人員發布了一種新型代理驅動的訓練範式,使 30B 參數模型能達到 Alibaba 235B Qwen3 模型的性能。此突破顯著提升了長文本語言模型的訓練效率。

斯坦福頂尖團隊新研究打破RAG神話。合成數據訓練效果超越RAG。合成混合訓練首次超越RAG,成本大幅降低。

Google 更新了政策,預設將圖片、影片及語音搜尋用於訓練其大型語言模型(LLM)。若使用者希望避免數據被用於此類用途,必須手動選擇退出。

本文探討了在 LLM 訓練期間克服 GPU 高頻寬記憶體 (HBM) 限制的策略。文中介紹了透過主機卸載 (host offloading) 技術來更有效地管理模型權重、梯度與優化器狀態。

Reddit 正在部署自家的 AI 工具,以對抗品牌植入的隱形行銷與虛假評論。隨著行銷人員從 SEO 轉向 GEO(生成式引擎優化),此舉旨在維護社群的真實性。
Picotron 是一個 LLM 訓練框架的全新重構版本,移除了強制性的硬體特定依賴,使其能在 T4 或 V100 等舊款 GPU 上運行。它預設使用標準 PyTorch SDPA,同時保留了對 FlashAttention-2 的選用支援。

本文探討了 NVIDIA NeMo AutoModel 如何簡化 Transformer 模型微調的過程。文中強調了提高訓練效率以及降低特定任務模型適配複雜度的技術。
FeynRL 是一個新的開源框架,旨在使 LLM 和 VLM 的強化學習後訓練過程透明且易於修改。它透過提供用於 rollout 生成、獎勵計算和優化的明確端到端流程,解決了隱藏系統帶來的複雜性。