
Narration-of-Thought:提升大型語言模型的道德推理能力
Narration-of-Thought (NoT) 是一種新的推理時支架技術,將大型語言模型的推理過程結構化為五個部分,以減少利益相關者遺漏和不確定性壓制。該方法無需微調或額外參數,即可顯著提升各類模型在道德決策上的表現。
Tag: #reasoning112 results

Narration-of-Thought (NoT) 是一種新的推理時支架技術,將大型語言模型的推理過程結構化為五個部分,以減少利益相關者遺漏和不確定性壓制。該方法無需微調或額外參數,即可顯著提升各類模型在道德決策上的表現。

VeryTrace 引入了一種零樣本框架,將自然語言推理轉換為結構化、可編譯的表示形式,以檢測並修復邏輯錯誤。透過結合確定性檢查與目標導向的 LLM 審核,它在數學與機器人等複雜領域中提升了準確性,且無需額外訓練。

研究人員提出了 ACTION-RATING,這是一種將尋求協助直接整合至代理行動空間的方法。此機制使代理能夠自主判斷何時需要澄清,從而顯著提升在複雜階層式任務中的導航準確度。

VAMPS 是一個包含 1,168 個問題的多模態基準測試,旨在評估大型語言模型是否能有效利用視覺化工具解決複雜的代數與微積分問題。研究顯示,目前的模型在整合工具生成的圖表時表現不佳,直接進行分析推理的效果往往更好。

這項研究引入了一種強化學習框架,透過解耦感知與推理步驟,解決了視覺語言模型(VLM)中的「蹺蹺板效應」。利用感知驗證與結構化口頭驗證,模型能精確地將錯誤歸因於視覺感知或邏輯推理。

VegAS 是一個全新的推理階段框架,透過採樣多個候選動作並利用生成式驗證器選擇最可靠的動作,來提升基於 MLLM 的具身智能體效能。此方法在 Habitat 和 ALFRED 環境的複雜長程任務中,實現了高達 36% 的效能提升。

CHAL 是一個創新的多代理框架,旨在透過將辯論視為結構化的信念優化,提升 LLM 在可廢止領域(defeasible domains)中的推理能力。它利用貝葉斯啟發的信念架構和可配置的後設認知價值系統,確保推理過程的透明度與對齊。

xAI 推出 Grok 4.3,API 價格減半,並發布快速語音克隆套件。具備永久推理與 1M 權杖脈絡,但基準落後頂尖模型。可透過 xAI API 及 OpenRouter 使用。

DeepSeek 預覽新型 AI 模型,在效率與效能超越 V3.2。架構改進使推理基準接近前沿模型。挑戰開放與封閉領先模型。

OpenAI 宣布推出 ChatGPT Images 2.0,這是一款先進的圖像生成模型,AI 會逐步推理後再產生視覺內容。它比前版大幅提升日文文字渲染的準確度。