價值十億美元的錯誤,如何造福程式設計師
文章回顧 Tony Hoare 的一生;他的 Quicksort 演算法、Hoare logic 與程式語言設計工作深刻塑造了現代軟體工程。隨著 LLM 與 Coding Agent 讓產生程式碼變得更容易,他對簡潔、形式化驗證與程式可理解性的重視,顯得更加重要。
Tag: #formal-verification43 results
文章回顧 Tony Hoare 的一生;他的 Quicksort 演算法、Hoare logic 與程式語言設計工作深刻塑造了現代軟體工程。隨著 LLM 與 Coding Agent 讓產生程式碼變得更容易,他對簡潔、形式化驗證與程式可理解性的重視,顯得更加重要。

本文立場論文主張,若沒有針對個別實例的符號認證,神經約束推理在分布偏移下無法提供可靠的正確性。論文以 Sudoku 為測試平台,倡議雙向神經符號系統,讓神經模型提供啟發式方法,並由符號求解器驗證輸出。
OpenAI 發表了下一代旗艦模型 Astra,該模型已成功解決 10 個數學與理論計算機科學領域的未解難題。此模型展現了在高等數學研究與形式化驗證方面的巨大潛力。

Pythagoras-Prover 是一個全新的高效能 Lean 定理證明模型系列,在 MiniF2F 基準測試中達到了領先水準。透過使用增強型形式化(ALF)與課程微調技術,該模型能以遠少於現有巨型模型的參數規模,提供卓越的推理能力。

Inductive Deductive Synthesis (IDS) 是一種新型代理式 LLM 框架,可同時合成程式碼與形式化證明。它在分散式鍵值儲存規格上達到了 100% 的驗證成功率,表現顯著優於目前的頂尖程式編寫代理。

OpenAI 研究人員成功解決了一項困擾數學界八十年之久的難題。這項突破凸顯了 AI 模型在高等科學推理與形式化證明驗證方面日益增強的能力。
OpenAI 宣布其內部 AI 模型成功反證了一個長達 80 年的離散幾何猜想。此成果已獲得外部數學家的驗證,標誌著 AI 在執行複雜數學推理能力上的重要里程碑。
一個 AI Agent 在僅一週內獨立使用 Lean 形式化了本世紀首次菲爾茲獎成果。它產生了 20 萬行程式碼,現已公開。這是歷史上最大規模的單一目的 Lean 形式化項目。

Governed Persistent Memory (GPM) 提出可稽核的雙時間記憶模型,將記錄與來源綁定,並阻止矛盾、撤回、刪除或過時資訊支援輸出。GPM 在 3,600 個案例的基準測試及封閉式服務評估中達到完整正確率,而未受治理的 Qwen2.5-7B 僅在 2,400 個叢集中正確完成 600 個。

PULSE 是一種用於建構時空知識圖譜的具型別可執行語言,將狀態、證據、約束、流程與假設分支整合到單一執行期契約中。評估結果顯示其通過形式安全性檢查、在不同工作流程間達成軌跡一致性,並在超過 147 萬個轉換區域配對上與 GEOS 結果一致,但研究也指出其易用性與語言優越性尚未獲得證明。