Search

Tag: #benchmark195 results

🤖

Qwen3.5-35B 攻克多代理工作流程

Qwen3.5-35B 是首個可靠完成多代理工作流程的亞100B模型,能總結10個轉錄本,而 qwen3-coder-next 和 glm-4.7-flash 等模型因工具錯誤或無限迴圈失敗。超過100B的大型模型一致成功,gpt-oss-20b 在高推理努力下也能完成。測試儲存庫可輕鬆在本機複製。

Reddit r/LocalLLaMACommunityFeb 28#multi-agent#benchmark#tool-calling
Gemma 4 在 Pac-Man 程式設計勝過 Qwen

Gemma 4 在 Pac-Man 程式設計勝過 Qwen

Gemma 4 31B 在 MacBook Pro M5 Max 上製作完整 Pac-Man 遊戲,勝過 Qwen 3.6 27B。Gemma 在 3 分 51 秒內提供更快、更邏輯化的遊戲,機制更順暢;Qwen 較慢但更具創意。此測試突顯本地 LLM 的速度與品質權衡。

Reddit r/LocalLLaMACommunityMay 1#benchmark#local-llm#gamedev
Page 18 of 20