
透過判斷預測任務進行 AI 基準測試
本文探討使用「判斷預測任務」(即 AI 預測特定專家對主觀問題的回答)作為基準測試概念推理能力的方法。文中強調了在主觀領域中,相較於客觀基準數據集,判斷預測面臨著雜訊與意見分歧的挑戰。
Tag: #reasoning112 results

本文探討使用「判斷預測任務」(即 AI 預測特定專家對主觀問題的回答)作為基準測試概念推理能力的方法。文中強調了在主觀領域中,相較於客觀基準數據集,判斷預測面臨著雜訊與意見分歧的挑戰。
本文探討若 AI 僅接受 1905 年前的知識訓練,是否能推導出相對論。結論指出,儘管 AI 擅長模式匹配,但缺乏人類挑戰基礎科學範式的能力。

Apple 研究人員探討如何透過優化上下文互動程式的選擇,來提升遞迴語言模型 (RLMs) 的效能。該研究旨在解決語言模型在長文本場景中,難以可靠地提取與推理資訊的核心挑戰。

頂尖 AI 研究員 Yann LeCun 正致力於一家新創公司,專注於開發更靈活且具備更強能力的 AI 系統。此舉旨在解決當前 AI 在智慧與推理能力上的侷限性。

Seed2.0 是一個旨在解決複雜、長跨度任務的新型模型系列,專注於長尾知識與指令遵循。它引入了一套基於真實用戶需求的可靠評估系統,以縮小基準測試與實際應用之間的差距。

本研究探討受法庭程序啟發的多代理協商 (MAD) 框架,旨在增強大型語言模型 (LLM) 的法律推理能力。研究顯示,透過多視角批判性思考,這些框架能解決單一模型無法處理的複雜法律案件。

本文指出,儘管技術加速(Kurzweil 的論點)提升了基礎設施能力,但仍無法解決科學發現的核心挑戰。作者提出了「科學質性引擎」(QES),旨在彌合定量 AI 能力與人類概念推理能力之間的差距。

CrowdMath 是一個包含 164 個經專家標註的協作數學研究討論鏈的新數據集。它旨在彌補解決明確定義問題與開放式問題解決過程中複雜、迭代過程之間的差距。

各大 AI 模型正接受 2026 年全國高考作文題目的測試,包含北京卷與上海卷。評估重點在於這些模型如何處理科技發展與社會進步等複雜議題。

本研究探討將視覺圖表心智圖作為大型語言模型(LLM)內部推理支架的應用。研究發現,在多跳推理任務中,視覺圖表引導的效果顯著優於將結構扁平化為文字的處理方式。