智譜GLM-5-Turbo登ClawBench全球榜首
ClawBench發布最新大模型榜單,智譜、字節、小米共4款模型闖入全球前十。智譜GLM-5-Turbo以93.9分領先,字節Doubao-Seed-2.0-lite居第二、使用成本最低,小米MiMo-V2-Omni第9、速度最快。
Tag: #benchmark195 results
ClawBench發布最新大模型榜單,智譜、字節、小米共4款模型闖入全球前十。智譜GLM-5-Turbo以93.9分領先,字節Doubao-Seed-2.0-lite居第二、使用成本最低,小米MiMo-V2-Omni第9、速度最快。
使用 vLLM v0.18.0 在 12 節點 96 個 B200 GPU 上達 1,103,941 tok/s。優化包括 DP=8 優於 TP=8、4K 上下文、FP8 KV 快取及 MTP-1 推測解碼提升使用率。無自訂核心下達 96.5% 擴展效率。

ARC-AGI-3 是 AGI 基準測試的最新版本,已重置前沿 AI 模型的排行榜。此更新以新穎任務挑戰系統的抽象與推理能力。另有附註提及用於公司 Slack 建立品牌反應 GIF 的工具。

阿里巴巴的 Qwen3.5-Max-Preview 在 LMArena 亮相,登頂全球 AI 模型排行榜。它超越國際領先者和國內競爭對手,顯示出強大性能提升。
CRYSTAL 是擁有 6,372 個視覺問題的新基準,包含驗證的逐步推理,用以評估多模態模型超越最終答案的表現。對 20 個模型測試顯示準確率高但推理步驟恢復差,例如 GPT-5 準確率 58% 但僅恢復 48% 步驟。CPR Curriculum 訓練在特定 VLM 上將推理提升高達 93%。
State Flow Machine (SFM) 是一種非 Transformer 架構,使用明確記憶槽與閘控進行狀態追蹤,在 4 倍訓練長度保留 62% 準確率,而 Transformer 降至 2%。於合成程式狀態追蹤基準測試至 32 倍長度。執行於單一 Huawei Ascend 910 ProA NPU。
ColQwen3.5-v2 4.5B 是基於 Qwen3.5-4B 的全新視覺文件檢索模型,在 ViDoRe V3 nDCG@10 達到 0.6177 的頂尖成績。採用簡化 2 階段訓練配方,整合硬負樣本與領域數據。在 Hugging Face 上以 Apache 2.0 釋出。

NVIDIA Blackwell 平臺在金融交易的 LLM 推論方面創下 STAC-AI 新紀錄。它能精細分析新聞、社群媒體和財報等非結構化資料,產生交易洞見。此進展推動投資策略的 AI 自動化。

清華陳建宇與斯坦福 Chelsea Finn 團隊的 Ctrl-World 世界模型在 WorldArena 評測中具身任務能力奪全球第一,領先主體一致性、軌跡精度等四大核心指標。視頻生成質量排名全球第二,超越 Google Veo 3.1 與 Nvidia Cosmos-Predict 2.5。它成為視頻真實度與具身任務可用性雙頂尖的世界模型。

谷歌 DeepMind 的 Aletheia,由 Gemini 3 Deep Think 驅動,在首屆 FirstProof 挑戰中自主解決 10 道高難研究問題中的 6 道,創最佳紀錄。團隊負責人 Thang Luong 稱其超越 AI IMO 金牌。問題來自真實未公開證明,由專家如論文審稿般審核。