LM Studio 解析器錯誤破壞 Qwen3.5 工具
LM Studio 的解析器會在 <think> 區塊中掃描工具模式,靜默破壞 Qwen3.5 的工具呼叫與推理,導致無限迴圈。註冊第二個 MCP 伺服器也會破壞第一個的解析。此錯誤已報告一年多仍未修復,可透過停用推理來規避。
Tag: #tool-calling51 results
LM Studio 的解析器會在 <think> 區塊中掃描工具模式,靜默破壞 Qwen3.5 的工具呼叫與推理,導致無限迴圈。註冊第二個 MCP 伺服器也會破壞第一個的解析。此錯誤已報告一年多仍未修復,可透過停用推理來規避。
Qwen3.5-35B 是首個可靠完成多代理工作流程的亞100B模型,能總結10個轉錄本,而 qwen3-coder-next 和 glm-4.7-flash 等模型因工具錯誤或無限迴圈失敗。超過100B的大型模型一致成功,gpt-oss-20b 在高推理努力下也能完成。測試儲存庫可輕鬆在本機複製。

一篇新分享的論文探討如何將 Speculative Decoding 應用於工具呼叫工作流程。這項方法可能降低語言模型產生結構化工具互動時的延遲,但貼文提供的實作細節有限。

一名開發者建立自主拳擊基準測試,用於評估 LLM 在即時壓力下的決策速度、適應力、策略、視覺能力與工具呼叫可靠性。初步使用 Gemini Flash Live 的測試顯示,速度快且具備視覺能力的模型能夠閃避及反擊,而較慢的本地模型可能需要時間縮放機制。
使用者回報 Qwen3.6-27B 在工具呼叫時會陷入無限迴圈。儘管調整了 temperature 和 top-k 參數,模型仍持續出現重複呼叫的問題。
使用者回報 Qwen3.5/3.6 27B/35B、Gemma4 26B、GPS-OSS 20B 等本地模型工具呼叫不可靠,使用 Open WebUI 及 LM Studio。即使用 Unsloth 參數,仍有幻覺、不存在檔案、空輸出及執行迴圈問題。質疑是否模型限制或設定錯誤。

一項改善 Gemma 4 工具呼叫與對話遵循性的 PR 已合併。建議使用者更新 Jinja 模板以獲得更好效果。附有預覽圖示範變更。

桌面代理包裝本地 Ollama,浮動 Clippy 風格吉祥物直接接收指令。支援檔案操作、網頁瀏覽、發信,使用 Llama3 或 Mistral 等模型。徵求工具呼叫模型推薦。

LocalLLaMA 討論串提到 NousResearch 持續推進 Hermes 代理,包括 0.20 版本以及約在三月中旬推出更完整專案的說法。發文者並質疑 Hermes 是否有機會接近 GPT Omni 或 PersonaPlex 等端到端全方位模型。

GLM-5 demonstrated exceptional endurance by autonomously running code for over 24 hours. It handled 700 tool calls and 800 context switches seamlessly. This performance surpassed earlier hype.