📄較早收集於 5h

量化大型語言模型推理鏈中的冗餘現象

量化大型語言模型推理鏈中的冗餘現象
PostLinkedIn
📄閱讀原文: ArXiv AI

💡了解為何您 LLM 高達 90% 的「思考」可能是浪費的運算資源,以及如何優化您的推理管線。

⚡ 30-Second TL;DR

有什麼變化

前沿模型的推理冗餘度介於 61% 到 93% 之間。

為什麼重要

這一發現表明當前的推理時間計算策略效率極低。開發者未來或許能透過在推理鏈中實作提早退出機制,來優化延遲與成本。

下一步行動

在您的推理管線中實作提早退出策略,以截斷不必要的思考步驟並降低推理延遲。

誰應關注:Researchers & Academics

關鍵要點

  • 前沿模型的推理冗餘度介於 61% 到 93% 之間。
  • 大多數模型僅需單一分割步驟即可得出正確答案。
  • 過度思考是基於結果獎勵訓練的結構性副產品,而非模型錯誤。
  • 即使在最困難的數學問題集中,冗餘現象依然存在。

🧠 深度解析

Web-grounded analysis with 20 cited sources.

🔑 增強重點摘要

  • 冗餘現象可透過「步驟熵」(step entropy)進行量化,其中低熵步驟被認為是高度冗餘的,並且可以在不顯著降低準確性的情況下修剪高達80%的這些步驟。
  • 「過度思考」(overthinking)被定義為大型語言模型過度依賴內部推理,而忽略從環境中獲取或整合關鍵回饋的傾向,這可能導致錯誤的累積和決策能力的下降。
  • 有研究提出了「PUMA」框架,利用一個輕量級的「冗餘探測器」(例如,透過LoRA微調的Qwen3-Embedding-0.6B)來分析連續推理步驟語義向量之間的餘弦相似度,當相似度超過特定閾值(如0.35)時,該步驟即被標記為冗餘,此方法能在答案通過率僅下降不到1.5個百分點的情況下,減少18%到19%的token消耗。
  • 冗餘現象不僅存在於推理步驟中,也存在於多模態大型語言模型(MLLM)的訓練過程。透過「階段感知稀疏性」技術,可以在模態對齊階段減少冗餘視覺token,並在指令微調階段動態跳過冗餘解碼器層,從而顯著降低訓練FLOPs。

🛠️ 技術深入

  • 步驟熵 (Step Entropy):引入作為量化思維鏈中每個步驟資訊貢獻的指標。低熵步驟被認為是冗餘的,可修剪高達80%而不會顯著降低準確性。
  • 兩階段訓練策略:結合監督式微調 (SFT) 和群體相對策略優化 (GRPO) 強化學習,使大型語言模型能學習生成高效壓縮的思維鏈,透過策略性地引入 [SKIP] 標記來提高推理效率。
  • PUMA框架冗餘探測器:使用輕量級模型(例如,經LoRA微調的Qwen3-Embedding-0.6B)提取當前和前一個推理步驟的語義向量,並計算其餘弦相似度。若相似度超過預設閾值(如0.35),則該步驟被視為冗餘。
  • 圖形化思維鏈修剪 (Graph-based CoT Pruning):透過構建有向無環圖 (DAG) 來恢復推理步驟之間的依賴關係,識別「不加區別的反射」(檢查瑣碎步驟)和「重複反射」(重複檢查已驗證結論)兩種冗餘形式,並修剪貢獻較小或出現在推理後期(深度級冗餘)的節點。
  • 多模態大型語言模型 (MLLM) 的階段感知稀疏性:在模態對齊階段使用視覺Token壓縮器 (VTC) 減少冗餘視覺token,並在指令微調階段使用層動態跳過器 (LDS) 動態跳過冗餘解碼器層,以提高訓練效率。

🔮 前景展望AI analysis grounded in cited sources

大型語言模型(LLM)的推理成本將顯著降低,使其在資源受限環境中更具可行性。
減少冗餘推理步驟和優化訓練過程將直接降低計算資源消耗和延遲,從而降低部署和運營成本。
未來的LLM將具備更強的「按需思考」能力,減少不必要的「過度思考」。
透過引入冗餘檢測、步驟熵量化或強化學習等技術,模型將能自主判斷何時進行深度思考以及思考的程度,從而提升推理的針對性和效率。
LLM的推理過程將變得更具可解釋性和透明度。
量化和識別冗餘步驟的技術,例如步驟熵或圖形化分析,將提供對模型內部推理機制更細緻的洞察,有助於理解其決策過程。

時間線

2022-01
Google研究人員首次提出「思維鏈提示」(Chain-of-Thought, CoT) 技術,透過引導模型生成中間推理步驟來顯著提升其在複雜任務上的表現。
2022-11
Program-of-Thoughts (PoT) 提出,結合自然語言推理與可執行程式碼,以解決CoT在複雜計算上的限制。
2024-04
研究開始探討大型語言模型層級的冗餘現象,提出移除不重要層以提高模型效率。
2025-01
論文探討大型語言模型的「過度推理」和冗餘計算,指出模型在不必要時仍會生成冗長且不必要的計算。
2025-05
中國科學院自動化研究所等機構提出AutoThink策略,透過提示詞和多階段強化學習,使大模型能自主決定思考深度,避免無差別的持續思考。
2025-11
OckBench基準測試被提出,首次同時衡量大型語言模型在推理和編碼任務中的準確性和解碼token效率,強調效率作為模型性能的關鍵維度。
📰

AI 週報

閱讀本週精選 AI 大事摘要 →

👉相關動態

AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: ArXiv AI