Search

Tag: #tool-calling51 results

🤖

Qwen3.5-35B 攻克多代理工作流程

Qwen3.5-35B 是首個可靠完成多代理工作流程的亞100B模型,能總結10個轉錄本,而 qwen3-coder-next 和 glm-4.7-flash 等模型因工具錯誤或無限迴圈失敗。超過100B的大型模型一致成功,gpt-oss-20b 在高推理努力下也能完成。測試儲存庫可輕鬆在本機複製。

Reddit r/LocalLLaMACommunityFeb 28#multi-agent#benchmark#tool-calling
Speculative Decoding 進入工具呼叫

Speculative Decoding 進入工具呼叫

一篇新分享的論文探討如何將 Speculative Decoding 應用於工具呼叫工作流程。這項方法可能降低語言模型產生結構化工具互動時的延遲,但貼文提供的實作細節有限。

Reddit r/LocalLLaMACommunityAug 9#tool-calling#ai-agents
LLM 踏入自主拳擊擂台

LLM 踏入自主拳擊擂台

一名開發者建立自主拳擊基準測試,用於評估 LLM 在即時壓力下的決策速度、適應力、策略、視覺能力與工具呼叫可靠性。初步使用 Gemini Flash Live 的測試顯示,速度快且具備視覺能力的模型能夠閃避及反擊,而較慢的本地模型可能需要時間縮放機制。

Reddit r/MachineLearningCommunityAug 3#embodied-agents#real-time-inference#agent-benchmarking
🤖

本地工具呼叫仍不穩定

使用者回報 Qwen3.5/3.6 27B/35B、Gemma4 26B、GPS-OSS 20B 等本地模型工具呼叫不可靠,使用 Open WebUI 及 LM Studio。即使用 Unsloth 參數,仍有幻覺、不存在檔案、空輸出及執行迴圈問題。質疑是否模型限制或設定錯誤。

Reddit r/LocalLLaMACommunityApr 18#tool-calling#hallucinations#local-setup
Page 5 of 6