🐼較早收集於 44m

USTC 開源高效長文本訓練範式

USTC 開源高效長文本訓練範式
PostLinkedIn
🐼閱讀原文: Pandaily
#llm-training#efficiency#long-contextagent-driven-long-context-training-paradigmustcqwen3alibaba

💡了解 30B 模型如何達到 235B 的性能,這可能大幅削減您的 LLM 訓練成本。

⚡ 30-Second TL;DR

有什麼變化

引入用於長文本模型訓練的代理驅動範式

為什麼重要

這項研究可能大幅降低訓練高性能長文本模型所需的計算成本,使更多開發者能獲取頂尖模型能力。

下一步行動

查看 USTC 的開源儲存庫,將其訓練範式整合到您的下一個微調流程中。

誰應關注:Researchers & Academics

關鍵要點

  • 引入用於長文本模型訓練的代理驅動範式
  • 以僅 30B 參數實現 235B 規模的性能
  • 開源發布促進高效 LLM 開發的廣泛採用

🧠 深度解析

Web-grounded analysis with 14 cited sources.

🔑 增強重點摘要

  • USTC 提出的「代理驅動訓練範式」透過整合規劃、工具調用和回饋循環,將複雜任務分解為可管理的子任務,顯著提升了大型語言模型處理長文本的能力和效率。
  • 此範式實現了僅 30B 參數模型達到 235B 規模性能的突破,暗示其可能採用了如「測試時訓練 (Test-Time Training, TTT)」或「邊讀邊學」等先進技術,在推理時動態更新模型權重,而非依賴龐大的靜態參數,以優化參數利用率。
  • 該方法旨在解決傳統 Transformer 架構在處理長文本時面臨的二次方級計算成本和記憶體瓶頸問題,透過更高效的訓練策略來降低資源消耗。
  • USTC 的研究可能包含類似「代理上下文編譯 (Agent Context Compilation, ACC)」的方法,將多輪智能體互動軌跡轉化為高品質的長上下文問答對,從而無需額外標註即可增強模型的長程推理能力。
📊 競品分析▸ Show
特性/指標USTC 新範式 (30B)Alibaba Qwen3-235B-A22B
總參數量30B235B (MoE 架構,22B 活躍參數)
性能對標達到 235B 規模模型性能頂級基準測試中表現具競爭力,如編碼、數學、通用能力等
上下文窗口針對高效長文本訓練原生 32K tokens,可透過 YaRN 擴展至 131K tokens (Qwen3-235B-A22B);Qwen3-235B-A22B-Instruct-2507 原生 262K tokens,可擴展至 1,010,000 tokens
訓練範式代理驅動 (Agent-driven)混合專家 (MoE) 架構,四階段訓練流程,包含思維鏈冷啟動、基於推理的強化學習等
主要優勢顯著提升訓練效率,以更少參數實現高性能多語言支援 (119 種語言和方言),支援「思維模式」與「非思維模式」切換,強化推理與工具調用能力
成本/定價開源發布,促進廣泛採用Qwen3-235B-A22B-Instruct-2507 在 OpenRouter 上輸入每百萬 tokens $0.071,輸出每百萬 tokens $0.10
基準評測 (部分)達到 235B 規模性能人工智慧指數 25.0,編碼指數 22.1,智能體指數 22.8 (Artificial Analysis);長上下文推理評估 31.2%
開源狀態開源發布模型在 Hugging Face 等平台開源

🛠️ 技術深入

  • 代理驅動範式 (Agent-driven Paradigm):此範式將大型語言模型與規劃、工具調用和回饋循環等組件結合,使其能夠感知環境、進行推理並採取行動以實現特定目標。它能將複雜任務分解為多個可管理步驟,並利用外部工具和數據源。
  • 測試時訓練 (Test-Time Training, TTT) / 邊讀邊學:一種可能的實現機制是讓已部署的模型在推理過程中直接更新其多層感知器 (MLP) 層權重,從而獲得「邊讀邊學」的能力,無需重新訓練即可適應長上下文。
  • 分塊更新策略 (Chunk-wise Updates):為確保因果性並有效管理記憶體,模型可能將輸入序列切分為固定大小的塊 (chunk),在每個塊內計算輸出,然後累積梯度並一次性更新權重。這種策略與上下文並行 (Context Parallelism) 相容,有助於在多 GPU 環境下高效運行。
  • 代理上下文編譯 (Agent Context Compilation, ACC):此方法將多輪智能體互動軌跡轉化為長上下文問答對,以低成本方式構建高品質的長上下文訓練數據,從而解決遠距離依賴建模的難題,並顯著提升模型的長程推理能力。
  • 長文本處理挑戰:傳統 Transformer 模型在處理長文本時,自注意力機制的計算複雜度呈二次方級增長,導致顯存佔用和推理延遲急劇增加。USTC 的新範式旨在克服這些瓶頸。

🔮 前景展望AI analysis grounded in cited sources

加速高效 LLM 的普及與開發
USTC 開源的範式以更少的參數實現高性能,將降低開發和部署長文本 LLM 的硬體門檻和成本,促進更廣泛的創新和應用。
推動智能體 AI 系統的發展
代理驅動的訓練範式將 LLM 的語言理解與規劃、工具使用和回饋機制結合,為構建更強大、自主的 AI 智能體系統奠定基礎。
提升長文本處理的實用性
透過解決長文本處理的效率和記憶體限制,該範式將使 LLM 能夠更有效地處理法律文件、學術論文和長篇小說等超長內容,擴展其應用場景。

時間線

2026-04-26
中國科學技術大學張凱教授研究團隊專注於大語言模型方法及應用,探討如何有效訓練大模型。
2026-05-30
中國科學技術大學研究人員提出「代理上下文編譯 (ACC)」方法,將多輪智能體軌跡轉化為長上下文問答對,以增強模型長程推理能力。
2026-06-03
中國科學技術大學「詞元計劃」啟動,面向師生提供標準化人工智能詞元服務,累計處理詞元突破 1000 億,支持超過 4000 名師生開展 AI 智能體創新實踐。
2026-06-04
USTC 研究人員發布新型代理驅動的高效長文本訓練範式,使 30B 參數模型達到 Alibaba 235B Qwen3 模型的性能,並開源發布。

📎 來源 (14)

Factual claims are grounded in the sources below. Forward-looking analysis is AI-generated interpretation.

  1. plainenglish.io
  2. auxiliobits.com
  3. techwalker.com
  4. csdn.net
  5. csdn.net
  6. nvidia.cn
  7. csdn.net
  8. medium.com
  9. openrouter.ai
  10. huggingface.co
  11. huggingface.co
  12. qwen.ai
  13. ustc.edu.cn
  14. ustc.edu.cn
📰

AI 週報

閱讀本週精選 AI 大事摘要 →

👉相關動態

AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: Pandaily