OpenAI 因重大網路風險暫停 Astra 部分開發
OpenAI 表示,其下一代旗艦模型 Astra 的網路能力可能達到安全框架中的最高「Critical」等級。公司已暫停不符合要求的部分活動,並將強化即時監控與思考過程評估,同時與政府機構及外部組織合作進行驗證與安全防護。
Tag: #model-evaluation95 results
OpenAI 表示,其下一代旗艦模型 Astra 的網路能力可能達到安全框架中的最高「Critical」等級。公司已暫停不符合要求的部分活動,並將強化即時監控與思考過程評估,同時與政府機構及外部組織合作進行驗證與安全防護。

BrainBench 是一套統一基準,用於評估大型語言模型是否能遵循指令、分析 EEG 與生理訊號,並產出具科學依據的報告。它涵蓋四個評估領域與 17 個資料集,並透過 CodeAct 和 BrainAgent 進行超過 100,000 次模型執行評測。

消息人士表示,白宮不打算公開其最新的先進 AI 模型評估框架。這套自願性框架的細節將僅提供給參與制定的企業,限制其他企業、研究人員、政策制定者及海外盟友的了解程度。
據報導,OpenAI 下一代模型 Astra 已解決數學與理論計算機科學領域 10 道長期未解難題。相關成果來自內測版本,估計 token 成本約為 2,000 美元。

一項針對 R-Judge、InjecAgent、AgentHarm 與 AgentDojo 的有效性審查發現,這些基準可能以截然不同的方式排列相同模型,並混淆安全性與能力。研究指出,安全性主張必須明確說明基準、評估指標、目標行為及受測模型群組。

研究人員引入了「干預式基礎審計」(interventional grounding audits),用於測試 LLM 在思維鏈推理過程中是否真正依賴於既定前提。透過將謂詞替換為新符號,該方法能識別出模型即便推理過程存在缺陷或邏輯斷層,仍能得出正確答案的情況。

Amazon AGI 總監 Bryan Silverthorn 指出,企業 AI 試點與生產環境之間的落差源於可靠性不足,而非模型能力問題。他提出了一套包含一致性、穩健性、可預測性和安全性四個維度的框架,以更好地管理自主 AI 代理。

研究人員引入了格式敏感度指數 (FSI),用於衡量 Prompt 格式變化如何顯著改變 LLM 的效能評分。研究顯示,排行榜排名往往因模型遵循指令失敗而非模型本身智力差異,導致統計上的脆弱性。

Prism 是一個基於 Claude Code 和 Inspect 構建的新框架,旨在自動化 AI 模型的科學評估。它利用多代理架構進行受控擾動實驗,協助研究人員識別模型評估指標中的缺陷。

這項研究提出了一種評估超越人類能力 AI 模型的新範式,透過相對衡量而非靜態基準來進行評估。該框架利用模型生成的挑戰,建立了一套能隨代理能力同步擴展的對抗性心理測量評分系統。