📄ArXiv AI•較早收集於 9h
程式碼增強LLM符號回歸

💡新型LLM-SR方法利用程式碼獲取資料洞見,擊敗基準。(38字)
⚡ 30-Second TL;DR
有什麼變化
引入程式化上下文增強用於LLM符號回歸。
為什麼重要
提升LLM符號回歸效能,加速科學發現。為從資料中發掘表達式提供更好工具。
下一步行動
下載arXiv:2605.03101,將程式碼增強整合至您的LLM-SR實驗。
誰應關注:Researchers & Academics
關鍵要點
- •引入程式化上下文增強用於LLM符號回歸。
- •搜尋過程中利用程式碼執行進行豐富資料集分析。
- •克服如MSE之純量指標限制。
- •在LLM-SRBench基準上展現優異效率與準確度。
🧠 深度解析
AI-generated analysis for this event.
🔑 增強重點摘要
- •該框架採用了「程式碼即搜尋空間」的策略,將符號回歸問題轉化為程式碼生成與執行任務,利用 LLM 的程式編寫能力直接探索數學表達式空間。
- •透過動態執行回饋機制,系統能夠在搜尋過程中即時評估候選表達式的數值穩定性與邊界條件,而不僅僅依賴於訓練資料的擬合度。
- •此方法解決了傳統符號回歸中常見的「過度擬合」問題,透過引入程式碼結構約束,確保了生成的數學模型具有更好的可解釋性與物理一致性。
📊 競品分析▸ Show
| 特性 | LLM-SR (本框架) | 傳統遺傳演算法 (如 PySR) | 基於深度學習的符號回歸 (如 DSO) |
|---|---|---|---|
| 搜尋機制 | LLM 程式碼生成與執行 | 遺傳演算法 (變異/交叉) | 強化學習策略梯度 |
| 領域知識整合 | 高 (透過程式碼上下文) | 低 | 中 |
| 運算效率 | 高 (利用 LLM 推理) | 中 (需大量迭代) | 低 (訓練成本高) |
| 基準表現 | LLM-SRBench 領先 | 穩定但速度較慢 | 依賴特定資料分佈 |
🛠️ 技術深入
- 架構核心:採用兩階段流程,第一階段利用 LLM 生成候選函數的 Python 程式碼,第二階段透過沙盒環境執行程式碼以計算損失函數與驗證約束。
- 上下文增強:將資料集的統計特徵(如分佈、相關性矩陣)與變數名稱作為 Prompt 的一部分輸入給 LLM,以引導其生成更具物理意義的表達式。
- 評估指標:除了 MSE,引入了基於程式碼複雜度(如 AST 節點數)的懲罰項,以防止模型生成過於冗長且難以解釋的表達式。
- 執行環境:使用受限的 Python 解釋器進行執行,並包含錯誤處理機制,以過濾掉語法錯誤或執行超時的候選解。
🔮 前景展望AI analysis grounded in cited sources
符號回歸將從純數值擬合轉向語義感知建模。
程式碼上下文增強技術使模型能理解變數間的物理關係,而非僅僅是數值對應。
自動化科學發現的門檻將顯著降低。
透過 LLM 降低了符號回歸對專家調參的依賴,使得非數學背景的研究人員也能快速從數據中提取物理定律。
📰
AI 週報
閱讀本週精選 AI 大事摘要 →
👉相關動態
AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: ArXiv AI ↗