
Qwen3.8-27B 將前沿級程式設計帶到本地端
Alibaba 以 Apache 2.0 授權發布 Qwen3.8-27B,提供可下載權重,並具備多模態理解、程式設計、推理與代理工作流程能力。其 4-bit 版本約需 17GB 記憶體,第三方評測顯示其表現可媲美部分專有前沿模型。
Tag: #model-benchmark7 results

Alibaba 以 Apache 2.0 授權發布 Qwen3.8-27B,提供可下載權重,並具備多模態理解、程式設計、推理與代理工作流程能力。其 4-bit 版本約需 17GB 記憶體,第三方評測顯示其表現可媲美部分專有前沿模型。
在北京亦莊AI未來大會上,智譜推出GLM-5.1,為首個支援8小時持續運作的開源模型,在SWE-bench Pro基準測試中超越Opus 4.6。亦莊揭幕OPC社群培育1萬AI開發者及5000P算力平台。人形機器人馬拉松及太空算力中心同步公布。

LinkedIn 的 Crosscheck 讓美國 Premium 用戶無 token 限制盲測 OpenAI、Anthropic、Google 等 AI 模型。用戶比較回應、投票後揭曉模型,並有產業排行榜。預計很快擴及更多國家與免費用戶。

本地 Qwen 3.6 27B 偵測 GPT-5.5 與 Claude Opus 4.7 忽略的嚴重錯誤。先進模型頑固否認,直至呈現 Qwen 詳細證據。Qwen 長時間思考帶來優越推理。

新研究顯示 Google 的 Gemini 在模仿人類寫作方面優於 ChatGPT 等競爭對手。ChatGPT 輸出屢次被 AI 偵測器標記。此研究突顯 AI 內容偵測工具的可靠性日益降低。

快速測試比較 unsloth 的 Gemma4-31B 和 Qwen3.5-27B Q4 量化版。Gemma 4 在創意寫作、冷門語言翻譯、函數呼叫、編碼及 SVG 創作表現出色。徵詢 Qwen3.5 勝出的領域。

Claude Fable 5 在物理 AI 基準測試中獲得最高評價,並在比較中勝過 GPT-5.6。然而,文章指出,企業選擇模型時,還必須考量純效能以外的因素。