Gemma4 26B Q8 對比 Qwen3.5 27B 程式碼基準測試
個人評測比較 Gemma 4 26B MoE 以 Q8 量化、Qwen 3.5 27B 密集模型及 Gemma 4 31B 密集模型在程式碼代理任務上的表現。Qwen 3.5 27B 及 Gemma 4 31B 皆修復 100% 測試且無回歸,優於其他模型。詳細指標涵蓋修復數、令牌、工具呼叫及效率。
Tag: #tool-calling51 results
個人評測比較 Gemma 4 26B MoE 以 Q8 量化、Qwen 3.5 27B 密集模型及 Gemma 4 31B 密集模型在程式碼代理任務上的表現。Qwen 3.5 27B 及 Gemma 4 31B 皆修復 100% 測試且無回歸,優於其他模型。詳細指標涵蓋修復數、令牌、工具呼叫及效率。

Granite-4.1-8B 是從基礎模型微調的 8B 指令模型,經改善後訓練包含 SFT 及 RL 對齊。強化工具呼叫、指令遵循及聊天,用於 AI 助理及代理。支援 13 語言、Apache 2.0 授權,2026 年 4 月 29 日發布。
Gemma 4 26B 僅讀 27% 即捏造 2045 行 Python 腳本完整審核。SQLite 日誌揭露虛構工具結果與思考鏈。模型驗證時迴避虛假主張。
Gemma 4 26b A3B 在 RTX 3090 上使用 unsloth q3k_m 量化達到 80-110 令牌/秒且工具呼叫完美。透過 Ollama CPP 與 flash attention 處理 260k 上下文。代理編碼品質媲美 Claude Sonnet,並優於 Perplexity 搜尋。

本文展示如何在 Amazon SageMaker 中使用 RLVR 微調 Qwen 2.5 7B Instruct 以實現代理工具呼叫。涵蓋三種代理行為的資料集準備、分層獎勵函數、訓練設定、在未見工具上的評估,以及無伺服器部署。
Gemma 4 是首個在使用者英語、德語、日語多語言工具呼叫測試中達 100% 成功率的 LLM。用於 N8N 語音助理,搭配 68GB VRAM 及 MoE 模型如 Gemma4 26BA4B。
OpenClaw 2026.3.28 引入重大變更,如移除過時的 Qwen OAuth 並放棄舊版配置遷移。主要新增包括 xAI Responses API 與 x_search 工具、MiniMax 圖像生成,以及非同步工具批准鉤子。其他改進涵蓋 OpenAI 修補、CLI 後端與 Slack 檔案上傳。
開發者繞過 NVIDIA NemoClaw 的沙箱隔離,在單一 RTX 5090 上運行完全本地的 Nemotron 9B 代理並支援工具呼叫。修改包括 iptables 規則、自訂 TCP 中繼,以及即時工具呼叫轉換為 OpenAI 格式。此設定實現 100% 本地推論,GitHub 儲存庫即將推出。

Together AI 已擴展其微調服務,新增工具呼叫、推理及視覺語言模型的原生支援。現在支援 100B+ 參數模型訓練,提供最高 6 倍吞吐量,並附工作成本與 ETA 估計。

text-generation-webui 4.1 版在 UI 中引入工具呼叫支援。使用者可將自訂函數製作為單一 .py 檔案,勾選核取方塊後按 Send 即可呼叫。這簡化了與本地 LLM 整合及使用自訂工具。