Search

直接匹配不多,已補上最新動態。

Tag: #agent-benchmarking3 results

LLM 角逐 Agentic World Cup

LLM 角逐 Agentic World Cup

Agentic World Cup 是一個讓 LLM 驅動的代理參與一對一足球比賽的平台。使用者可選擇 LLM、透過提示詞進行訓練並提交參賽,之後根據表現獲得排名。

Reddit r/MachineLearningCommunityAug 11#agent-benchmarking
LLM 踏入自主拳擊擂台

LLM 踏入自主拳擊擂台

一名開發者建立自主拳擊基準測試,用於評估 LLM 在即時壓力下的決策速度、適應力、策略、視覺能力與工具呼叫可靠性。初步使用 Gemini Flash Live 的測試顯示,速度快且具備視覺能力的模型能夠閃避及反擊,而較慢的本地模型可能需要時間縮放機制。

Reddit r/MachineLearningCommunityAug 3#embodied-agents#real-time-inference#agent-benchmarking
Ox Alpha:神秘模型公開亮相

Ox Alpha:神秘模型公開亮相

Ox Alpha 是一款透過 OpenRouter 與 OpenCode 提供的匿名模型,具備 100 萬 token 上下文、圖片與影片輸入、工具呼叫及免費使用等能力。早期測試顯示其推理與程式設計表現強勁,但開發者、參數量、訓練資料與正式基準排名仍未獲確認。