
全新基準測試評估大型語言模型的互動推理能力
研究人員推出了一項包含 474 款可執行遊戲的層級基準測試,旨在評估大型語言模型在互動環境中獲取證據與更新信念的能力。研究顯示,模型在互動效率上存在顯著差異,且對情境擾動表現出明顯的脆弱性。
Tag: #agentic-ai513 results

研究人員推出了一項包含 474 款可執行遊戲的層級基準測試,旨在評估大型語言模型在互動環境中獲取證據與更新信念的能力。研究顯示,模型在互動效率上存在顯著差異,且對情境擾動表現出明顯的脆弱性。

AWS 為 Amazon Bedrock AgentCore 閘道引入了 Policy 與 Lambda 攔截器以增強安全性。這些工具能為 AI 代理實現確定性的存取控制與動態驗證。
Qwen-code v0.17.0 透過 MCP 引入了零配置的電腦使用功能,並新增了 Feishu (Lark) 通道適配器。此次更新還包含核心架構重構以優化記憶體管理,並改進了遙測處理機制。

Stepfun 發布了 Step 3.7 Flash,這是一款擁有 196B 參數的稀疏 MoE 模型,專為 AI Agent 工作流程進行了優化。該模型具備每秒 400 token 的高速推理能力與原生工具調用功能。

Anthropic 已於 Amazon Bedrock 上發布 Claude Opus 4.8。此更新為 AI 工程師提供了更佳的效能,並針對將該模型整合至代理系統與生產工作負載提供了實作指南。

AWS 與 Works Human Intelligence 合作,利用 Amazon Bedrock AgentCore 開發用於業務支援的 AI 代理。該專案成功將營運成本降低了 97%,同時提升了整體效率。

AWS 推出了 AgentCore,旨在解決企業銷售組織中專業 AI 代理碎片化的問題。它提供了一個協調層,透過無縫管理多個領域專用代理來減輕使用者的認知負擔。

Artificial Analysis 與 IBM 發布了 ITBench-AA,這是首個專為評估企業 IT 環境中代理 AI(Agentic AI)性能而設計的基準測試。結果顯示,目前的前沿模型表現不佳,所有模型的準確率均低於 50%。

AWS 推出了 Agentic Shopping Assistant,讓外部零售商能夠整合 Amazon 所使用的 AI 購物技術。此工具旨在複製 Alexa for Shopping 的成功經驗,該技術去年為 Amazon 帶來了顯著的增量銷售。

本研究介紹了 DeepTS 與 DeepScribe 兩種代理 AI 框架,旨在自動化科學數據整理與複雜講座分析。透過混合式「本地主體/遠端大腦」架構,這些系統提升了高能物理與時間序列研究的推理能力。