Qwen3.5-35B 攻克多代理工作流程
Qwen3.5-35B 是首個可靠完成多代理工作流程的亞100B模型,能總結10個轉錄本,而 qwen3-coder-next 和 glm-4.7-flash 等模型因工具錯誤或無限迴圈失敗。超過100B的大型模型一致成功,gpt-oss-20b 在高推理努力下也能完成。測試儲存庫可輕鬆在本機複製。
Tag: #benchmark195 results
Qwen3.5-35B 是首個可靠完成多代理工作流程的亞100B模型,能總結10個轉錄本,而 qwen3-coder-next 和 glm-4.7-flash 等模型因工具錯誤或無限迴圈失敗。超過100B的大型模型一致成功,gpt-oss-20b 在高推理努力下也能完成。測試儲存庫可輕鬆在本機複製。
OpenAI 與太平洋西北國家實驗室合作推出 DraftNEPABench,這是用於評估 AI 編碼代理在聯邦許可程序中的基準測試。它顯示可將 NEPA 起草時間縮短高達 15%。此工具旨在現代化基礎設施審查流程。

Geekbench 7 資料庫出現兩組 NVIDIA RTX Spark N1X 配置的跑分。20 核心滿血版在多核心測試中獲得 23,126 分,約領先 AMD Ryzen AI Max+ 395 12%,但仍比 Apple M5 Max 低約 35%。

一篇 Reddit 貼文指出,Qwen 3.8 Max 在 Artificial Analysis 的代理式指數中超越 Opus 5,成為整體排名最高的模型。貼文未提供評估方法或分數細節,因此仍應進一步獨立驗證排名。

根據 Artificial Analysis 榜單,Alibaba 的 Qwen3.8Agentic 據稱在代理能力方面取得全球最高分。提供的節錄未包含具體分數、評測方法或比較模型。

ComputerBase 盲測顯示,玩家在 7 款 3A 大作中偏好英偉達 DLSS 4.5 的畫質,勝出 6 款。AMD FSR 4.1 較 4.0 版進步但通常居次。DLSS 4.5 利用 Transformer 模型提供更佳銳化、降噪及運動清晰度。

Gemma 4 31B 在 MacBook Pro M5 Max 上製作完整 Pac-Man 遊戲,勝過 Qwen 3.6 27B。Gemma 在 3 分 51 秒內提供更快、更邏輯化的遊戲,機制更順暢;Qwen 較慢但更具創意。此測試突顯本地 LLM 的速度與品質權衡。

使用者基準測試 Qwen 3.6 35B A3B 在 RTX 5090 32GB 上以 Q5 K S 量化達 187 權杖/秒。使用 120K 脈絡大小、關閉思考模式及溫度 0.1。在新 NVIDIA 硬體上展現高本地推理速度。

HappyHorse-1.0 已上線 LMSYS Chatbot Arena 供公眾評估。該模型預計兩週後正式發布。此發展突顯於鈦媒體晨報。
作者在相同 10 項任務上比較 ChatGPT Plus 與 Gemini Pro,以決定哪個更優。分析評估是否值得從 ChatGPT Plus 轉換。