📄ArXiv AI•較早收集於 40m
DIVE:擴展代理任務合成多樣性以提升工具使用泛化

#agentic-tasks#tool-use#ood-generalizationdivearxivqwen3-8bdive
💡多樣性勝數量:4倍少資料下OOD工具使用基準+22分
⚡ 30-Second TL;DR
有什麼變化
顛倒合成順序:先執行工具,從軌跡推導任務
為什麼重要
DIVE透過優先多樣性解決代理LLM脆性,以更少資料實現穩健工具使用泛化。此轉變訓練範式由數量轉向品質,有利可擴展代理開發。
下一步行動
從arXiv:2603.11076下載DIVE資料集,微調您的工具使用LLM以獲OOD提升。
誰應關注:Researchers & Academics
關鍵要點
- •顛倒合成順序:先執行工具,從軌跡推導任務
- •透過證據-任務迴圈擴展373工具五領域多樣性
- •Qwen3-8B於9 OOD基準獲+22分(48k SFT + 3.2k RL)
- •多樣性擴展優於數量擴展,即使資料僅1/4
🧠 深度解析
背景與延伸:來自公開資料,非原文內容。引用 7 個來源。
🔑 增強重點摘要
- •Qwen3-8B 是 Alibaba Qwen3 系列的 8.2B 參數稠密因果語言模型,支持 32K 原生上下文窗口,可透過 YaRN 擴展至 131K 令牌,並支援 100 多種語言。[1]
- •Qwen3-8B 在未微調前於 12 個小型語言模型的 8 項任務基準中展現最佳基礎性能,平均排名 1.75,且變異數最低,顯示高度一致性。[2]
- •Qwen3-8B 在推理任務中 Artificial Analysis 智能指數得分 13,低於同級模型平均 15,生成速度 71 tokens/s 低於平均,且輸出較冗長。[3]
- •Qwen3-8B 在不同量化版本下速度表現優異,如 SGLang BF16 於 30720 輸入長度達 832.67 tokens/s,AWQ-INT4 達 770.44 tokens/s。[4]
🛠️ 技術深入
🔮 前景展望AI analysis grounded in cited sources
DIVE 訓練後 Qwen3-8B 將在更多 OOD 代理基準超越現有 SOTA 模型
其 +22 分提升顯示多樣性合成方法有效提升工具泛化,結合 Qwen3-8B 強大基礎性能,可進一步擴展至複雜真實世界任務。
Qwen3-8B 量化版本將廣泛部署於邊緣設備代理應用
AWQ-INT4 等量化達高達 770+ tokens/s 速度與低記憶體需求,使其適合資源受限環境的工具使用代理。
⏳ 時間線
2025-05
Qwen3 系列發布,包含 Qwen3-8B 基礎模型,於多基準展現 SOTA 性能
2026-03
DIVE 方法論文發布於 ArXiv,利用 Qwen3-8B 於 OOD 基準獲顯著提升
📎 來源 (7)
Factual claims are grounded in the sources below. Forward-looking analysis is AI-generated interpretation.
- openrouter.ai — Performance
- distillabs.ai — We Benchmarked 12 Small Language Models Across 8 Tasks to Find the Best Base Model for Fine Tuning
- artificialanalysis.ai — Qwen3 8b Instruct Reasoning
- qwen.readthedocs.io — Speed Benchmark
- arXiv — 2505
- dev.to — Qwen 3 Benchmarks Comparisons Model Specifications and More 4hoa
- qwenlm.github.io — Qwen3
📰
AI 週報
閱讀本週精選 AI 大事摘要 →
👉相關動態
AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: ArXiv AI ↗
每週 AI 簡報
每週一封,可隨時退訂。