Search

Tag: #benchmark195 results

TokenArena:AI推論基準測試發布

TokenArena:AI推論基準測試發布

TokenArena 推出一個連續基準測試,針對端點層級評估 AI 推論的輸出速度、價格、能量、上下文與品質。它分析 78 個端點來自 12 個模型家族,顯示準確度差異高達 12.5 點,以及每正確答案能量差異達 6.2 倍。框架、架構與排行榜以 CC BY 4.0 開放發布。

ArXiv AIResearchMay 5#benchmark#inference#endpoints
WorldArena 基準具身世界模型

WorldArena 基準具身世界模型

清華的 WorldArena 推出具身世界模型的統一基準,不僅評估視頻品質,還檢視機器人任務的功能實用性。它同時評估感知能力,以及作為數據生成器、互動模擬器和動作規劃器的角色。這解決了視覺逼真預測與實際代理支持之間的差距。

ML 研究破壞偵測基準

ML 研究破壞偵測基準

研究人員推出審計破壞基準,測試 9 個 ML 程式碼庫中的破壞偵測。頂尖 LLM 如 Gemini 3.1 Pro 僅達 0.77 AUROC;LLM 輔助人類表現相似。凸顯誤對齊 AI 破壞安全研究的風險。

AI Alignment ForumCommunityApr 30#ai-safety#sabotage#auditing
⚙️

Qwen3.6 35B-A3B 在 780M iGPU 上運行迅捷

Qwen3.6 35B-A3B MoE 模型透過 llama.cpp Vulkan 在 AMD Radeon 780M iGPU 上展現優異效能。基準測試顯示 ThinkPad T14 Gen 5(64GB RAM)達 282 pp/s 與 20 tg/s。使用者讚揚 Qwen 團隊,經核心調整後 Q6_K 順暢運行。

Reddit r/LocalLLaMACommunityApr 24#moe#igpu#benchmark
Page 7 of 20