📄最新收集於 15h

測量 LLM 將推理算力花在哪裡

測量 LLM 將推理算力花在哪裡
PostLinkedIn
📄閱讀原文: ArXiv AI

💡新方法揭示 CoT 哪些步驟最耗費推理能量,以及錯誤推理從何處開始。

⚡ 30-Second TL;DR

有什麼變化

SARE 透過比較相鄰 Transformer 層的隱藏狀態 Gram 矩陣之 Centered Kernel Alignment(CKA),估算單一步驟的推理能量。

為什麼重要

SARE 有望改善推理模型的步驟級錯誤偵測、信心估計與可解釋性。這項研究也顯示,內部表徵動態可能提供超越最終答案或 token 機率的實用訊號。

下一步行動

在一個開放權重推理模型上重現 SARE:記錄相鄰層的隱藏狀態,並測試低能量步驟是否能在你的評估集上預測答案錯誤。

誰應關注:Researchers & Academics

關鍵要點

  • SARE 透過比較相鄰 Transformer 層的隱藏狀態 Gram 矩陣之 Centered Kernel Alignment(CKA),估算單一步驟的推理能量。
  • 推理努力高度不均勻,並呈現整段軌跡指標無法揭示的階段性轉換。
  • 錯誤推理路徑在關鍵推理節點呈現較低的能量。
  • 在多數測試情境中,SARE 特徵可媲美或超越輸出信心基準。

🧠 深度解析

AI-generated analysis for this event.

🔑 增強重點摘要

  • SARE 框架的核心機制利用了 Transformer 模型內部層級的表徵相似性,這為理解 LLM 在處理複雜邏輯時的『思考深度』提供了比單純 Token 生成機率更細緻的量化指標。
  • 研究指出,SARE 能夠識別出模型在處理推理任務時的『計算瓶頸』,即模型在某些特定步驟會投入顯著更多的計算資源,這與人類在解決難題時的認知努力分配具有相似性。
  • 該方法不僅適用於標準的 Chain-of-Thought(CoT),還能應用於多模態推理模型,用以分析模型在處理視覺與文字對齊時的計算分配差異。
  • SARE 的研究結果挑戰了傳統觀點,即認為 LLM 的推理能力僅與參數規模或訓練數據量相關,證明了推理過程中的動態計算分配對最終準確性有決定性影響。
  • 此框架為模型可解釋性(Interpretability)研究提供了新方向,透過監控 CKA 數值變化,開發者可以即時偵測模型是否在推理過程中進入了『無效計算』或『幻覺生成』的狀態。
📊 競品分析▸ Show
特性SARE (Step-level)傳統信心分數 (Logprobs)探針技術 (Probing)
測量維度步驟級別 (Step-level)Token 級別層級表徵分析
計算成本中等 (需計算 CKA)極低高 (需訓練額外分類器)
解釋性高 (針對推理過程)低 (僅反映機率)中 (依賴探針準確度)
基準測試專注於推理路徑廣泛應用專注於特徵提取

🛠️ 技術深入

  • SARE 核心演算法:基於 Centered Kernel Alignment (CKA) 計算相鄰 Transformer 層隱藏狀態(Hidden States)的相似度矩陣。
  • 數學定義:透過計算 $CKA(X, Y) = \frac{||Y^T X||_F^2}{||X^T X||_F ||Y^T Y||_F}$ 來量化層間表徵的變化,其中 $X$ 與 $Y$ 為相鄰層的激活矩陣。
  • 推理能量定義:將推理步驟的能量定義為該步驟中各層 CKA 數值的加權總和,數值越低代表該步驟對模型內部表徵的改變越大,即投入的計算努力越多。
  • 適用架構:目前已驗證適用於主流 Decoder-only Transformer 架構,如 Llama 3、Mistral 等開放權重模型。

🔮 前景展望AI analysis grounded in cited sources

SARE 將成為下一代 LLM 推理優化與節能技術的標準評估指標。
透過識別低效推理步驟,開發者可以針對性地進行模型剪枝或動態計算分配,從而降低推理成本。
基於 SARE 的即時監控系統將能有效降低 LLM 的幻覺率。
由於錯誤推理路徑在關鍵節點表現出異常的能量特徵,系統可在推理過程中即時偵測並觸發重新生成或修正機制。

時間線

2026-02
SARE 框架初步研究成果於 ArXiv 發布,提出步驟級別推理測量概念。
2026-05
研究團隊擴展 SARE 應用範圍,涵蓋多種開放權重 LLM 並完成基準測試驗證。
📰

AI 週報

閱讀本週精選 AI 大事摘要 →

👉相關動態

AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: ArXiv AI