來源較早收集於 2h

BDH 以97.4%碾壓極限數獨基準

PostLinkedIn
🤖閱讀原文: Reddit r/MachineLearning
#sudoku-benchmark#reasoning-limitsbdh-architecturepathwayo3-minideepseek-r1claude-3.7

💡BDH 以97-0 擊敗 LLM 在純約束基準—揭露 transformer 推理缺陷(68字元)

⚡ 30 秒速覽

有什麼變化

250,000 個「Sudoku Extreme」困難實例作為基準

為什麼重要

挑戰對 CoT 擴展推理的過度依賴;推動內部搜尋架構。可能轉移 AI 研究焦點,從語言化到原生約束求解。

下一步行動

閱讀 Reddit 評論中 Pathway 部落格與論文,在數獨上複製 BDH。

誰應關注:Researchers & Academics

關鍵要點

  • 250,000 個「Sudoku Extreme」困難實例作為基準
  • LLM(如 O3-mini、DeepSeek R1、Claude 3.7)準確率 0%
  • BDH 原生達 97.4%,無 CoT/工具/回溯
  • 批判 transformer 不適合搜尋密集任務

🧠 深度解析

背景與延伸:來自公開資料,非原文內容。引用 9 個來源。

🔑 增強重點摘要

  • Pathway 的 BDH 架構於 2025 年 9 月首次在科學論文中提出,標誌著後 transformer 架構的理論基礎[1]
  • BDH 模型透過內在推理空間(latent reasoning space)和內在記憶機制實現連續學習,無需依賴鏈式思考(chain-of-thought)的 GPU 密集型逐步推理[1]
  • Pathway 聲稱 BDH 在 2026 年 3 月 16 日達成「Sudoku Extreme」97.4% 準確率的同時,保留了 transformer 在語言理解和生成上的優勢,實現跨域原生推理[1][6]

🛠️ 技術深入

  • BDH(Dragon Hatchling)架構保留 transformer 在語言理解和生成的核心能力,同時添加解決非語言問題的能力[1]
  • 內在推理空間(latent reasoning space)提供更大的內部推理容量,支持在使用過程中進行學習和適應[1]
  • BDH 採用內在化推理而非強制語言輸出,避免了鏈式思考推理對 GPU 的消耗,降低了計算成本[1]
  • 該架構能在單一模型中同時擅長語言任務和邏輯推理任務,而非專門化的遊戲或文本模型[1]

🔮 前景展望基於引用來源的 AI 分析

記憶和在線學習能力將成為超越 transformer 的關鍵瓶頸
Pathway 認為記憶和動態學習是當前 transformer 模型的最大限制,暗示未來 AI 系統的競爭力將取決於適應性而非單純的參數規模[1]
原生推理架構將重新定義 AI 基準測試的設計
BDH 在約束滿足問題上的優異表現挑戰了語言模型基準的有效性,可能促使業界開發更多評估邏輯推理而非語言流暢性的評估方法[1]

時間線

2025-09
Pathway 在科學論文中首次發表 BDH(Dragon Hatchling)後 transformer 架構
2026-03-16
Pathway 宣布 BDH 在 Sudoku Extreme 基準上達成 97.4% 準確率,而主流 LLM 準確率為 0%
📰

AI 週報

閱讀本週精選 AI 大事摘要 →

👉相關動態

AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: Reddit r/MachineLearning

這是摘要,不是原文。去看原站,或訂閱每週簡報。

每週電子報

每週一封,可隨時退訂。