
Qwen3.5-9B 在文件基準測試勝過前沿模型
Qwen3.5 模型(0.8B 至 9B)在開放文件 AI 基準測試中評估,涵蓋 9,000 多份真實文件。9B 和 4B 變體在 OCR 文字提取、VQA 和 KIE 任務中勝過 Gemini 3.1 Pro 和 GPT-5.4 等前沿模型。但在表格提取和手寫 OCR 上明顯落後。
Tag: #benchmarks166 results

Qwen3.5 模型(0.8B 至 9B)在開放文件 AI 基準測試中評估,涵蓋 9,000 多份真實文件。9B 和 4B 變體在 OCR 文字提取、VQA 和 KIE 任務中勝過 Gemini 3.1 Pro 和 GPT-5.4 等前沿模型。但在表格提取和手寫 OCR 上明顯落後。

Cedars-Sinai 的 EchoPrime AI 能分析心臟超音波並自動產生報告。它在 23 項心臟基準測試中超越特定任務 AI 及先前基礎模型。此模型開源,提供程式碼、權重及示範。

微調 Qwen3 模型(0.6B-8B)在 9 項任務中 6 項勝過 GPT-5、Gemini、Claude 等前沿 LLM,使用開放權重教師模型。單一 H100 上低成本高準確率。開源程式碼、模型及基準測試。

OpenAI 的新 GPT-5.4 在內部測試的專業級任務中超越人類 83%。相較 GPT-5.2,它錯誤減少 18%,虛假陳述減少 33%,可靠性更佳。

Google 推出 Gemini 3.1 Flash-Lite,為 Gemini 3 系列中最具成本效益的模型,價格僅 Gemini 3.1 Pro 的八分之一。它比 Gemini 2.5 Flash 提供 2.5 倍更快的首 token 時間及 45% 更高的輸出速度(每秒 363 token)。新增思考等級功能,可動態調整推理強度以平衡速度與深度。

阿里巴巴的 Qwen 團隊推出 Qwen3.5 小型模型系列,包括 0.8B、2B、4B 和 9B 模型,針對邊緣設備和筆電優化。9B 模型在多語言和推理基準測試中超越 OpenAI 13.5 倍更大的 gpt-oss-120B。所有模型均以 Apache 2.0 授權在 Hugging Face 和 ModelScope 上開放原始碼。

Gemini 3.1 Pro 推出,強化思考力並大幅提升代理執行能力,以處理複雜任務。它從「思考 AI」轉變為「工作 AI」,具基準測試進展與功能升級。開發者觀點解析此進化方向。

Krasis 是 MoE 模型的新混合 CPU/GPU 運行時,使用 GPU 快速預填充、CPU 解碼。在單 RTX 5080 上,Qwen3-Coder-Next (80B Q4) 達 3,324 tok/s 預填充。透過高 RAM 使用支援超出 VRAM 的巨型模型。

Anthropic 推出 Claude Sonnet 4.6,效能逼近 Opus 4.6 但維持 Sonnet 定價。本文整理主要基準測試與新功能,並探討大型上下文在實際任務中的應用,將 AI 定位為實用工作夥伴。
千問3.5在全球開源大模型排行榜上奪得前四名。它僅用10分鐘就完成了中級程式員5小時的程式設計任務。此模型累計下載量超過10億,衍生模型超過20萬個。