
Alibaba Qwen 3.7 Max 完成 35 小時自主任務運行
Alibaba 的 Qwen 3.7 Max 展示了驚人的耐力,完成了長達 35 小時的自主任務運行。該模型成功執行了 1,158 次工具調用,展現了其在長時間 AI 工作流中的可靠性。
Tag: #tool-use32 results

Alibaba 的 Qwen 3.7 Max 展示了驚人的耐力,完成了長達 35 小時的自主任務運行。該模型成功執行了 1,158 次工具調用,展現了其在長時間 AI 工作流中的可靠性。

這項研究發現 LLM 在判斷工具必要性與實際執行工具呼叫之間存在顯著落差。研究指出,模型往往無法將其對工具需求的「認知」轉化為實際的「行動」。

在語義干擾下,LLM代理的工具增強推理並不總是優於原生思維鏈(CoT)。分解干預框架揭示提示格式化和工具調用協議的「工具使用稅」往往超過工具收益。G-STEP作為輕量級推理時閘門,部分緩解協議誘發錯誤。

AgentFloor 是全新 30 項任務基準測試,涵蓋六階代理工作流程,從指令遵循到長程規劃。小型開源模型(0.27B-32B)足以處理常規工具使用,總體匹配 GPT-5 且更便宜。先進模型在複雜規劃中表現優異,並釋出基準與結果。

推出 SLATE,一個大型電子商務基準測試,用於評估工具增強 LLM 代理,暴露自我修正與搜尋效率問題。提出熵引導分支 (EGB),一種不確定性感知演算法,優先高熵決策分支。在 SLATE 上實現更高成功率與計算效率。

狀態空間模型 (SSMs) 在長上下文建模上高效,但理論上無法解決真正長形式生成問題,因記憶體固定大小。Apple 研究人員正式證明此限制,並顯示透過授予 SSMs 互動外部工具存取即可克服。此方法實現長度泛化,恢復 SSMs 相對於 Transformers 的競爭優勢。

Amazon Bedrock 推出 Claude 工具使用功能,加速自訂實體辨識。它利用大型語言模型實現動態、可適應的 NER,無需大量設定或訓練。這簡化了建置進階 NLP 應用程式。
DiffMem 團隊以單一唯讀 shell 命令工具取代複雜檢索管道,利用 LLM 訓練資料中內建的 Git 專業知識。代理使用 git log、grep 進行高效、精簡脈絡查詢,能發現關鍵字無法觸及的時間洞察。真實範例透過提交歷史將生日訊息連結至工作記憶。

DIVE 顛倒任務合成順序,先執行多樣真實工具並從軌跡反推嚴格蘊涵的任務,以確保多樣性有根基。它透過證據收集-任務推導迴圈,擴展工具池覆蓋與每任務工具集多樣性,涵蓋五領域373工具。於DIVE資料訓練Qwen3-8B,在9個OOD基準上平均提升+22分,優於基線,且多樣性擴展勝過數量擴展,即使資料僅1/4。

Qwen 3.5 Plus 現已在 Vercel 的 AI Gateway 上線,具備 1M 上下文視窗與內建自適應工具使用功能。它在代理工作流程、程式碼撰寫、網頁開發及多模態任務中表現出色,超越 Qwen 3 VL 在科學問題解決與視覺推理的效能。開發者可透過 AI SDK 設定模型為 alibaba/qwen3.5-plus 來使用。