本地LLM代理評估軌跡勝過輸出
本地LLM代理最終正確但內部可能有錯誤工具、迴圈或多餘步驟等缺陷。作者主張評估軌跡:工具選擇、步驟、迴圈、推理品質。分享GitHub rubric-eval,使用Ollama進行局部檢查。
Tag: #local-llm172 results
本地LLM代理最終正確但內部可能有錯誤工具、迴圈或多餘步驟等缺陷。作者主張評估軌跡:工具選擇、步驟、迴圈、推理品質。分享GitHub rubric-eval,使用Ollama進行局部檢查。

Intel 推出 Arc Pro B70($949)與 B65 GPU,配備 32GB GDDR6 記憶體,用於專業工作負載。針對如 AI 推論的高記憶體任務。詳見 VideoCardz 與圖片。

微信以插件形式整合 OpenClaw,使用者可掃碼快速與本地/雲端 AI 代理(「蝦」)聊天。支援多種模型但禁用群聊、流式輸出與多 Bot 以確保安全。作者視為優雅基礎設施動作,未降低養代理的核心門檻。

Qwen3.5-27B 在 Aider 基準測試中比較 BF16/FP8 權重與 KV 快取,10 次運行無統計顯著差異。平均任務使用 13k 權杖。FP8 在代理編碼中與 BF16 表現相當,無明顯損失。

Unsloth 宣布推出 Unsloth Studio,這是一個相容 Llama.cpp 的 Apache 授權執行器。針對 GGUF 生態系統的高階使用者,可能成為 LMStudio 的遊戲規則改變者競爭對手。這可能多樣化本地 LLM 部署選項。

Reddit 用戶針對如 GPT120b 的 LLM 推理,基準測試 NVIDIA RTX 6000 96GB 對單 AMD W7800 48GB。令牌/秒比率 (0.49) 與 VRAM 頻寬比率 (0.48) 高度吻合,證明速度主導。多 GPU 設定性能趨向平均,建議優先頻寬而非僅容量。
Qwen 3 32B 在 11 項盲測中以 9.63 平均分勝過所有 Qwen 3.5 模型。高效 3B 活躍參數的 Qwen 3.5 35B-A3B 贏得 4 項評測,適合本地硬體。Coder Next 落後通用模型。
OmniCoder-9B 被譽為8GB顯示卡上最聰明的程式碼與工具呼叫模型。它從簡單請求生成完整工具組。Hugging Face 上提供 GGUF 格式,可搭配 llama-server 和 VSCode 使用。
社群創作者發布全無審查的 9B Qwen 模型,將 HauhauCS 的無審查張量與 Jackrong 的 Claude Opus 推理蒸餾版合併。消除拒絕回應,提升角色扮演與圖像提示的創造力,透過自訂聊天模板停用思考功能。GGUF 版本針對 RTX 3060 在 LM Studio 優化。

Qwen 3.5 4B 從單一提示生成完整功能網頁 OS,包括 2 款遊戲、文字編輯器、音頻播放器、檔案瀏覽器、可變壁紙及鋼琴鍵盤功能。模型僅需少許修正即完成任務,展現強大編碼能力。現場示範 WebOS 1.0 已上線。