
Multilingual Reasoning Gym:14 種語言推理環境
Apple 的 Multilingual Reasoning Gym 擴展原 Reasoning Gym,能在 14 種語言生成可驗證推理問題。它包含 94 項任務的翻譯模板,由母語人士在 10 種語言驗證,並調整以確保語言自然性。此健身房保留程序化生成無限實例與可調難度,適合強化學習。
Tag: #benchmark195 results

Apple 的 Multilingual Reasoning Gym 擴展原 Reasoning Gym,能在 14 種語言生成可驗證推理問題。它包含 94 項任務的翻譯模板,由母語人士在 10 種語言驗證,並調整以確保語言自然性。此健身房保留程序化生成無限實例與可調難度,適合強化學習。
對 Qwen3.5-397B NVFP4 在 4x RTX PRO 6000 上花 8 小時基準測試 MoE 後端,使用 Marlin TP=4 達 50.5 tok/s。NVIDIA CUTLASS 核心在 SM120 初始化失敗,迫使 FP16 回退。MTP 效能倒退 22%。

Qwen3.5-9B 的 46 種 GGUF 量化全面比較,使用 KLD 與 PPL 對 BF16 基準。頂級選擇:bartowski IQ4_XS (VRAM 受限最低 KLD)、Q4_K_S,以及 unsloth UD-Q3_K_XL 效率最佳。揭示 bartowski 與 unsloth Q4_K_M 等量化器差異。

Google 推出新基準,幫助 Android 開發者評估 AI 模型的編碼表現。它解決了選擇未針對 Android 工作流程優化的模型難題。此工具評估模型在真實 Android 任務上的效能。

《自然·醫學》最新研究發現,OpenAI的ChatGPT Health在病例分級時常低估醫療急症嚴重度。以60個真實案例測試,與三名臨床醫師判斷相比近半數不符。此暴露AI醫療決策支援風險。

LifeBench 推出全新基準,用於評估 AI 代理的長期記憶,整合宣告式與非宣告式記憶類型,來自多樣數位痕跡。它利用社群調查與地圖 API 等真實世界先驗確保資料品質,並透過認知科學啟發的事件階層實現可擴展性。頂尖記憶系統僅達 55.2% 準確率,凸顯長視野擷取挑戰。

AgentSelect 推出用於基於敘事查詢推薦 LLM 代理配置的基準,解決缺乏查詢條件監督的問題。它彙總來自 40 多個來源的 111,179 個查詢、107,721 個代理和 251,103 個互動記錄,轉換為統一資料。分析顯示從密集頭重用轉向長尾監督,並強調內容感知能力匹配的必要性。

EmCoop 是一個用於研究基於 LLM 的具身多代理系統合作的新框架與基準。它將高層認知協調與低層具身互動分離,以分析隨時間推移的合作動態。該框架包含程序級指標,並在支援多樣代理數量與通訊拓撲的可擴展環境中實例化。

HumanMCP 是第一個大規模、多樣化的人類般使用者查詢資料集,用於評估 MCP 伺服器的工具檢索效能。它涵蓋 308 個伺服器的 2800 個工具,基於 MCP Zero 建置,每個工具有多個獨特使用者角色,捕捉從精確到模糊的意圖。這解決了現有基準測試缺乏真實使用者互動的缺口。
國產安全AI在漏洞檢測上超越Anthropic的Claude,以13比3的成績勝出。它不僅重現已知漏洞,還額外發掘10個零日漏洞。