
Auto Research時代,47個沒有標準答案的任務成了Agent能力必測榜
在 Auto Research 時代,47 個沒有標準答案的任務成為了評測 AI Agent 能力的必測榜。此榜單標誌著正式進入「迭代優化」時代,強調 Agent 處理非結構化問題的能力。
直接匹配不多,已補上最新動態。
Tag: #agent-eval3 results

在 Auto Research 時代,47 個沒有標準答案的任務成為了評測 AI Agent 能力的必測榜。此榜單標誌著正式進入「迭代優化」時代,強調 Agent 處理非結構化問題的能力。

MiniMax 推出 M2.7,在 PinchBench 獲得 86.2%(50 模型中第 5,接近 Claude Opus),Kilo Bench 47%(第 2 名)。相較 M2.5 提升 3.7 點,並獨家解決如 SPARQL 推理等任務。模型互補,組合神諭可達 Kilo Bench 67%。
本地LLM代理最終正確但內部可能有錯誤工具、迴圈或多餘步驟等缺陷。作者主張評估軌跡:工具選擇、步驟、迴圈、推理品質。分享GitHub rubric-eval,使用Ollama進行局部檢查。

美國當局警告,威脅行為者正鎖定用於供水系統及其他關鍵基礎設施的 Siemens S7 PLC。相關機構表示,攻擊者可能使用 AI 工具產生漏洞利用腳本,並敦促營運者更新系統,且在可行時讓系統與網際網路隔離。

Kling AI 是快手疲弱第二季業績中唯一的亮點,營收超過人民幣 8.5 億元,年增逾 200%,全球用戶數突破 1 億。產品推出原生 4K 影片輸出,並從消費者訂閱模式拓展至影視與廣告等專業工作流程,但高昂算力成本及 Seedance 的競爭仍是重大挑戰。

受元件成本高漲影響,桌上型 CPU 出貨量下滑 20%,市場環境日益艱困。Intel 提高資料中心與筆記型電腦處理器產量,但 AMD 成長速度超越 Intel,並創下歷史最高市占率。

Eon 使用漏積分放電(LIF)模型,將果蠅大腦重建為數位系統。中國團隊據稱進一步採用精細神經元建模,以及支援跨身體遷移的平台,推進具身智慧研究。

據報導,UBTECH 已在 WRC 內以 1:1 比例重建客戶產線。此舉為具身智慧提供更實際的驗證與部署路徑,強調產線效能與系統整合,而非機器人出貨量。

Outer Biosciences 脫離隱身模式,開發出一套能讓手術切除的人類皮膚存活最長一個月的方法。該新創將組織產生的資料輸入 AI 模型,以預測可能有用的化合物,目前已籌得約 2,300 萬美元。

中國汽車製造商表示,受 AI 資料中心需求推動,印刷電路板與多層陶瓷電容器在全球短缺 20% 至 30%,價格已超過去年的三倍。汽車記憶體價格也在短短三個月內上漲約 180%。