
SCALAR:批判迴圈提升AI物理推理
SCALAR 引入演員-批判者-評判者管道,用於量子場論與弦論的 AI 輔助推理。多輪對話優於單次嘗試,改善效果依賴演員-批判者配對與回饋策略。它提供測試平台,評估 AI 驅動科學發現的互動結構。
Tag: #agentic-reasoning5 results

SCALAR 引入演員-批判者-評判者管道,用於量子場論與弦論的 AI 輔助推理。多輪對話優於單次嘗試,改善效果依賴演員-批判者配對與回饋策略。它提供測試平台,評估 AI 驅動科學發現的互動結構。

Meta 的半形式推理提示要求 LLM 填寫邏輯證書,陳述前提、追蹤執行路徑並推導結論,實現無執行程式碼分析。在程式碼審核、錯誤定位和 QA 任務達 93% 準確率。此舉降低大型儲存庫代理程式碼推理的基礎設施成本。

GEARS 將大規模排序重新定義為程式化實驗環境中的代理式發現過程,解決工程瓶頸而非僅限模型技術。它將專家知識封裝成可重用代理技能,支持高階意圖導向,並整合驗證鉤子確保統計穩健與穩定政策。跨產品表面的實驗顯示其找出優越近帕雷托有效策略。

Apple 推出 AMUSE,一個針對代理式多說話者對話情境的多模態 LLM 基準。GPT-4o 和 Qwen3-Omni 等模型感知強但難以追蹤說話者、角色及跨音視頻事件的推理。適用於對話視訊助理與會議分析等應用。

SideQuest 利用大型推理模型 (LRM) 本身,透過推理上下文 token 的有用性來壓縮 KV 快取,適用於長上下文代理任務。它將壓縮視為平行輔助任務執行,避免汙染主要推理上下文。僅用 215 個樣本訓練的模型評估顯示,峰值 token 使用量減少 65%,準確度損失極小,優於啟發式方法。