Search

Tag: #benchmark195 results

ARC-AGI-3 重置前沿 AI 計分板

ARC-AGI-3 重置前沿 AI 計分板

ARC-AGI-3 是 AGI 基準測試的最新版本,已重置前沿 AI 模型的排行榜。此更新以新穎任務挑戰系統的抽象與推理能力。另有附註提及用於公司 Slack 建立品牌反應 GIF 的工具。

The NeuronMediaMar 26#benchmark#agi#reasoning
🔬

CRYSTAL基準揭露VLM推理缺失

CRYSTAL 是擁有 6,372 個視覺問題的新基準,包含驗證的逐步推理,用以評估多模態模型超越最終答案的表現。對 20 個模型測試顯示準確率高但推理步驟恢復差,例如 GPT-5 準確率 58% 但僅恢復 48% 步驟。CPR Curriculum 訓練在特定 VLM 上將推理提升高達 93%。

Reddit r/MachineLearningCommunityMar 18#multimodal-reasoning#vlm-evaluation#benchmark
🔬

SFM 在長序列超越 Transformer

State Flow Machine (SFM) 是一種非 Transformer 架構,使用明確記憶槽與閘控進行狀態追蹤,在 4 倍訓練長度保留 62% 準確率,而 Transformer 降至 2%。於合成程式狀態追蹤基準測試至 32 倍長度。執行於單一 Huawei Ascend 910 ProA NPU。

Reddit r/LocalLLaMACommunityMar 16#non-transformer#long-sequence#state-slots
Ctrl-World 具身能力登頂全球 WorldArena

Ctrl-World 具身能力登頂全球 WorldArena

清華陳建宇與斯坦福 Chelsea Finn 團隊的 Ctrl-World 世界模型在 WorldArena 評測中具身任務能力奪全球第一,領先主體一致性、軌跡精度等四大核心指標。視頻生成質量排名全球第二,超越 Google Veo 3.1 與 Nvidia Cosmos-Predict 2.5。它成為視頻真實度與具身任務可用性雙頂尖的世界模型。

机器之心MediaFeb 26#embodied-ai#world-model#video-gen
Page 3 of 20