來源Reddit r/MachineLearning•較早收集於 2h
BDH 以97.4%碾壓極限數獨基準
#sudoku-benchmark#reasoning-limitsbdh-architecturepathwayo3-minideepseek-r1claude-3.7
💡BDH 以97-0 擊敗 LLM 在純約束基準—揭露 transformer 推理缺陷(68字元)
⚡ 30 秒速覽
有什麼變化
250,000 個「Sudoku Extreme」困難實例作為基準
為什麼重要
挑戰對 CoT 擴展推理的過度依賴;推動內部搜尋架構。可能轉移 AI 研究焦點,從語言化到原生約束求解。
下一步行動
閱讀 Reddit 評論中 Pathway 部落格與論文,在數獨上複製 BDH。
誰應關注:Researchers & Academics
關鍵要點
- •250,000 個「Sudoku Extreme」困難實例作為基準
- •LLM(如 O3-mini、DeepSeek R1、Claude 3.7)準確率 0%
- •BDH 原生達 97.4%,無 CoT/工具/回溯
- •批判 transformer 不適合搜尋密集任務
🧠 深度解析
背景與延伸:來自公開資料,非原文內容。引用 9 個來源。
🔑 增強重點摘要
🛠️ 技術深入
🔮 前景展望基於引用來源的 AI 分析
⏳ 時間線
2025-09
Pathway 在科學論文中首次發表 BDH(Dragon Hatchling)後 transformer 架構
2026-03-16
Pathway 宣布 BDH 在 Sudoku Extreme 基準上達成 97.4% 準確率,而主流 LLM 準確率為 0%
📎 來源 (9)
Factual claims are grounded in the sources below. Forward-looking analysis is AI-generated interpretation.
📰
AI 週報
閱讀本週精選 AI 大事摘要 →
👉相關動態
AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: Reddit r/MachineLearning ↗
每週電子報
每週一封,可隨時退訂。