📄較早收集於 40m

DIVE:擴展代理任務合成多樣性以提升工具使用泛化

DIVE:擴展代理任務合成多樣性以提升工具使用泛化
PostLinkedIn
📄閱讀原文: ArXiv AI
#agentic-tasks#tool-use#ood-generalizationdivearxivqwen3-8bdive

💡多樣性勝數量:4倍少資料下OOD工具使用基準+22分

⚡ 30-Second TL;DR

有什麼變化

顛倒合成順序:先執行工具,從軌跡推導任務

為什麼重要

DIVE透過優先多樣性解決代理LLM脆性,以更少資料實現穩健工具使用泛化。此轉變訓練範式由數量轉向品質,有利可擴展代理開發。

下一步行動

從arXiv:2603.11076下載DIVE資料集,微調您的工具使用LLM以獲OOD提升。

誰應關注:Researchers & Academics

關鍵要點

  • 顛倒合成順序:先執行工具,從軌跡推導任務
  • 透過證據-任務迴圈擴展373工具五領域多樣性
  • Qwen3-8B於9 OOD基準獲+22分(48k SFT + 3.2k RL)
  • 多樣性擴展優於數量擴展,即使資料僅1/4

🧠 深度解析

背景與延伸:來自公開資料,非原文內容。引用 7 個來源。

🔑 增強重點摘要

  • Qwen3-8B 是 Alibaba Qwen3 系列的 8.2B 參數稠密因果語言模型,支持 32K 原生上下文窗口,可透過 YaRN 擴展至 131K 令牌,並支援 100 多種語言。[1]
  • Qwen3-8B 在未微調前於 12 個小型語言模型的 8 項任務基準中展現最佳基礎性能,平均排名 1.75,且變異數最低,顯示高度一致性。[2]
  • Qwen3-8B 在推理任務中 Artificial Analysis 智能指數得分 13,低於同級模型平均 15,生成速度 71 tokens/s 低於平均,且輸出較冗長。[3]
  • Qwen3-8B 在不同量化版本下速度表現優異,如 SGLang BF16 於 30720 輸入長度達 832.67 tokens/s,AWQ-INT4 達 770.44 tokens/s。[4]

🛠️ 技術深入

  • Qwen3-8B 支持思考模式(用於數學、編碼、邏輯推理)與非思考模式(一般對話)無縫切換,經指令遵循微調,適用代理整合與多語言任務。[1]
  • 速度基準:Transformers BF16 版本於 30720 輸入長度生成速度 208.98 tokens/s,GPU 記憶體 20267 MB;AWQ-INT4 達 438.62 tokens/s,記憶體 11001 MB。[4]
  • Qwen3 系列稠密基礎模型性能匹敵更大 Qwen2.5 模型,如 Qwen3-8B 相當於 Qwen2.5-14B,尤其在 STEM、編碼與推理基準優於前代。[5]

🔮 前景展望AI analysis grounded in cited sources

DIVE 訓練後 Qwen3-8B 將在更多 OOD 代理基準超越現有 SOTA 模型
其 +22 分提升顯示多樣性合成方法有效提升工具泛化,結合 Qwen3-8B 強大基礎性能,可進一步擴展至複雜真實世界任務。
Qwen3-8B 量化版本將廣泛部署於邊緣設備代理應用
AWQ-INT4 等量化達高達 770+ tokens/s 速度與低記憶體需求,使其適合資源受限環境的工具使用代理。

時間線

2025-05
Qwen3 系列發布,包含 Qwen3-8B 基礎模型,於多基準展現 SOTA 性能
2026-03
DIVE 方法論文發布於 ArXiv,利用 Qwen3-8B 於 OOD 基準獲顯著提升
📰

AI 週報

閱讀本週精選 AI 大事摘要 →

👉相關動態

AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: ArXiv AI

這是摘要,不是原文。去看原站,或訂閱每週簡報。

每週 AI 簡報

每週一封,可隨時退訂。