🦙較早收集於 3h

難以作弊程式碼基準測試揭露 LLM 極限

難以作弊程式碼基準測試揭露 LLM 極限
PostLinkedIn
🦙閱讀原文: Reddit r/LocalLLaMA

💡新基準證明頂尖 LLM 在冷門語言真實程式碼推理僅 11% 極限。

⚡ 30-Second TL;DR

有什麼變化

使用 HumanEval 風格問題測試冷門語言,避免訓練資料洩漏

為什麼重要

揭露 LLM 靠記憶而非泛化成功,敦促轉向 OOD 基準。挑戰高基準分數的有效性。啟發新評估範式追蹤 AI 進展。

下一步行動

在 https://esolang-bench.vercel.app/ 測試你的程式碼代理。

誰應關注:Researchers & Academics

關鍵要點

  • 使用 HumanEval 風格問題測試冷門語言,避免訓練資料洩漏
  • 最佳結果:Befunge-98 使用 self-scaffolding 得 11.2%
  • 代理系統透過回饋提升 2-3 倍,但無真正推理轉移
  • 錯誤模式顯示有資料時語法可,但無資料邏輯全失效

🧠 深度解析

Web-grounded analysis with 8 cited sources.

🔑 增強重點摘要

  • EsoLang-Bench包含五種冷門程式語言:Brainfuck、Befunge-98、Whitespace、Unlambda和Shakespeare,每種語言各80題問題(每難度等級20題)。[1]
  • 論文於2026年3月發布(arXiv:2603.09678),作者為Sharma等人,並提供GitHub儲存庫(https://github.com/Lossfunk/EsolangBench)供重現實驗。[[7]](#cite-7)[8]
  • 基準強調僅輕鬆難度題目有解題成功,中高難度及額外困難題目所有模型均為0%,Kimi K2在Befunge-98僅得1.2%。[1]

🛠️ 技術深入

  • 基準使用類似HumanEval風格的問題,每語言80題,分為Easy、Medium、Hard、Extra-Hard四級,每級20題。
  • 評估配置包括零樣本(Zero-shot)和三樣本少樣本(3-shot ICL),僅Easy級有成功率,中高級全0%。
  • 測試語言經濟上不理性,避免預訓練資料洩漏,專注真實程式碼推理而非記憶。
  • GitHub儲存庫提供完整基準實現和模型評估腳本。[8]

🔮 前景展望AI analysis grounded in cited sources

LLM程式碼生成將轉向離散語言基準以避免飽和
EsoLang-Bench揭示標準基準如HumanEval已被記憶主導,需更多OOD任務如冷門語言來精準評估推理能力。[1]
代理系統僅短期提升,無跨語言推理轉移
雖然self-scaffolding和代理回饋可將得分提高2-3倍,但中高難度仍為0%,顯示缺乏泛化推理。[1]

時間線

2026-03
EsoLang-Bench論文發布於arXiv (2603.09678)
📰

AI 週報

閱讀本週精選 AI 大事摘要 →

👉相關動態

AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: Reddit r/LocalLLaMA