
TokenArena:AI推論基準測試發布
TokenArena 推出一個連續基準測試,針對端點層級評估 AI 推論的輸出速度、價格、能量、上下文與品質。它分析 78 個端點來自 12 個模型家族,顯示準確度差異高達 12.5 點,以及每正確答案能量差異達 6.2 倍。框架、架構與排行榜以 CC BY 4.0 開放發布。
Tag: #benchmark195 results

TokenArena 推出一個連續基準測試,針對端點層級評估 AI 推論的輸出速度、價格、能量、上下文與品質。它分析 78 個端點來自 12 個模型家族,顯示準確度差異高達 12.5 點,以及每正確答案能量差異達 6.2 倍。框架、架構與排行榜以 CC BY 4.0 開放發布。

DeepSeek V4 發布一周,連續三次降價並推出視覺大模型,完成本代布局。但不如前代 R1 技術領先,AI 榜單落後美國公司模型。美國研究員公布結果:落後全球最強 AI 約 7 個月,如 GPT-5.5、Opus 4.7 及 Gemini 3.1 Pro。

清華的 WorldArena 推出具身世界模型的統一基準,不僅評估視頻品質,還檢視機器人任務的功能實用性。它同時評估感知能力,以及作為數據生成器、互動模擬器和動作規劃器的角色。這解決了視覺逼真預測與實際代理支持之間的差距。
研究人員推出審計破壞基準,測試 9 個 ML 程式碼庫中的破壞偵測。頂尖 LLM 如 Gemini 3.1 Pro 僅達 0.77 AUROC;LLM 輔助人類表現相似。凸顯誤對齊 AI 破壞安全研究的風險。

SWE-bench,這款用於 LLM 和代理的著名程式碼基準,現確認為「基準飽和」。這表示頂尖模型已達滿分,限制其區分能力。
Qwen3.6 35B-A3B MoE 模型透過 llama.cpp Vulkan 在 AMD Radeon 780M iGPU 上展現優異效能。基準測試顯示 ThinkPad T14 Gen 5(64GB RAM)達 282 pp/s 與 20 tg/s。使用者讚揚 Qwen 團隊,經核心調整後 Q6_K 順暢運行。

Deep FinResearch Bench 是金融投資研究中深度研究 (DR) 代理的全新評估框架。它透過自動化評分,評估質性嚴謹度、量化預測/估值準確性,以及主張可信度。AI 生成報告不如專業人士,強調需開發金融專屬 DR 代理。
對 18 款 LLM 在 OCR 上進行基準測試,使用 42 份文件共 7,560 次呼叫,發現廉價及舊模型常以較低成本匹配高端準確度。發布開源數據集、框架、排行榜及免費測試工具。追蹤可靠性、每成功成本、延遲及關鍵欄位準確度。
一名使用者在翻譯中國小說時發現,本地 Gemma 4 31B 勝過退化中的雲端模型如 GPT-5.3 和 Gemini,能維持角色名稱一致性且無審查。封閉模型在更新後出現錯誤與過濾,而 Gemma 提供自然且快速的結果。

Hugging Face 推出 QIMMA,這是一個專注於以品質指標評估阿拉伯語大型語言模型的新排行榜。它旨在以標準化方式突顯表現最佳的阿拉伯語 LLM。此工具支援阿拉伯語 NLP 研究與開發的進展。