
Ora 在真實網站上評測 AI Agent
Ora 讓 Claude Code、ChatGPT、Gemini、Hermes、OpenClaw 與 Vercel 的 eve Agent framework 執行真實網站工作流程,以衡量它們完成任務的能力。初步比較顯示,eve 所需步驟少 7%、原生完成率達兩倍,並多找到 9% 可實際呼叫的有效端點。
Tag: #benchmarking171 results

Ora 讓 Claude Code、ChatGPT、Gemini、Hermes、OpenClaw 與 Vercel 的 eve Agent framework 執行真實網站工作流程,以衡量它們完成任務的能力。初步比較顯示,eve 所需步驟少 7%、原生完成率達兩倍,並多找到 9% 可實際呼叫的有效端點。

一名獨立開發者以約 250 美元,使用 50 億個去污染化 token 預訓練出 10.2 億參數的 Kimi-K3 複製模型。該模型在 HellaSwag 上達到 33.4%,高於 GPT-2 124M 據報的 28%,且完全未經指令微調。

本文提出 Transition Complexity Profile(TCP),一套可重現的框架,用於衡量特定介面下遊戲世界轉移預測的難度。TCP 評估分支程度、互動導致的不確定性、對手影響,以及時間或空間依賴性,藉此改善遊戲建模與強化學習基準之間的比較。
Hugging Face 探討基準測試最佳化如何影響語音辨識系統的評估。文章聚焦於衡量基準表現是否反映模型的真正進步,或只是對評估流程的適應。

Hugging Face 強調 LFM2.5-DSpark 的推理速度最高可提升 3.2 倍。提供的文章內容未包含基準測試條件、硬體細節或實作指南。

文章探討在 AI 時代,傳統超級電腦排名是否仍能反映真正的運算領先地位。包括 GWDG 高效能運算副主管在內的專家指出,私人持有的運算叢集,以及對 HPL 的重視,可能使排名無法充分代表現代 AI 基礎設施。

Qualcomm在發布原始宣稱近一週後,更新了Snapdragon C的功耗效率簡報。修訂後的投影片移除了閒置應用程式與網頁瀏覽的測試結果。

社群專案 J-Space Cognition Suite 宣稱,在不修改模型權重的情況下,透過推理時 Agent Harness 提升 DeepSeek V4-Pro-0813 的表現。其在多項基準測試中的提升尚未獲得獨立團隊重現,且該專案與 Anthropic 的內部 J-space 可解釋性研究無關。

Unitree 發表名為 Superman 的新型人形機器人,宣稱其最高速度可達每秒 12.66 公尺,並能從站立姿勢跳躍 2 公尺。該公司尚未公布涵蓋負載、地面條件或可重複性的詳細測試規範。

RubricForge 從少量具備真實結果標註的代理軌跡中,自動生成可讀的人類評分規範,之後可在不存取環境的情況下套用固定規範。在 tau-bench 與 WebShop 上,它大幅降低失敗軌跡被誤判為通過的比例,並改善分級結果排序;但整體一致性並未顯著優於 G-Eval。