Unsloth 修復 Qwen3.5-35B 工具呼叫
Unsloth 更新了 Qwen3.5-35B-A3B 的 GGUF 量化版本,修復工具呼叫問題。使用者讚揚其研究任務表現優異,超越 Gemini、ChatGPT 等模型,能有效總結選項並給出建議。在 ROCm 上透過 llama.cpp 運行,支援 262k 上下文。
Tag: #tool-calling51 results
Unsloth 更新了 Qwen3.5-35B-A3B 的 GGUF 量化版本,修復工具呼叫問題。使用者讚揚其研究任務表現優異,超越 Gemini、ChatGPT 等模型,能有效總結選項並給出建議。在 ROCm 上透過 llama.cpp 運行,支援 262k 上下文。

ContextCache 引入基於內容雜湊定址的持久 KV 快取,用於工具 schema,消除工具呼叫 LLM 中的重複預填充。於 50 個工具下實現 29 倍 TTFT 加速,延遲恆定且無品質損失。開源程式碼與論文均可取得。

Distil Labs 推出 VoiceTeller 銀行語音助理,用微調 Qwen3-0.6B 取代雲端 LLM,工具呼叫準確率達 90.9%,勝過 120B 教師模型的 87.5%。腦部階段延遲降至 40ms,整體管線約 315ms,在 Apple Silicon 上本地運行。開源程式碼、訓練資料與 GGUF 模型。
代理狀態評估提出 LLM 驅動的模擬框架,用於基準測試多輪工具呼叫代理,避免昂貴的確定性後端。它使用情境定義目標和狀態,LLM 追蹤器從互動軌跡推斷代理狀態進行驗證。此方法產生穩定排名、人 LLM 評判一致率超過 90%,並提供可轉移訓練資料。
一個由社群維護的 Jinja 聊天模板,修正官方模板在 Qwen 3.5、3.6 與 3.8 中出現的推理、對話歷史、工具呼叫與代理迴圈問題。它加入推理強度控制、恢復關閉思考功能,並支援多種本機推理執行環境。

文章指出,AI 代理可能執行技術上正確、卻未獲企業授權的行動。作者提出「Agent Authority Contract」,用以定義代理可執行的事項、需經批准的事項、只能提出建議的事項,以及絕對不可接觸的範圍。
AI Agent 正將身分驗證、授權、意圖與執行壓縮成單一自動化流程。文章指出,有效的身分與權限並不代表某個具體操作是正確的,因此高風險行動需要一個明確的執行邊界,就像開鎖前必須轉動鑰匙。
中國首批人工智慧終端智能化分級測試共有 11 款行動終端達到 L3,包括 9 部手機與 2 台平板。這套自願性的指導標準評估的是終端端到端能力,而不只是模型品質;L3 代表輔助式任務執行,L4 的要求則仍未確定。

本文聚焦 Data Agent 如何從基礎工具呼叫,發展為可在生產環境運作的系統。核心議題包括上下文管理、工具協作與治理閉環,目標是提升資料代理的可靠性與可控性。
Qwen Code v0.21.5 新增更安全的工具呼叫復原、執行結果追蹤,以及防止 Goal 模式無限重試的機制。此版本也加入 macOS 遷移至 Tauri shell 的橋接工具、Web Shell 結構化審查結果,以及 Qwen 3.8 reasoning effort 支援。