🦙Reddit r/LocalLLaMA•較早收集於 3h
難以作弊程式碼基準測試揭露 LLM 極限

💡新基準證明頂尖 LLM 在冷門語言真實程式碼推理僅 11% 極限。
⚡ 30-Second TL;DR
有什麼變化
使用 HumanEval 風格問題測試冷門語言,避免訓練資料洩漏
為什麼重要
揭露 LLM 靠記憶而非泛化成功,敦促轉向 OOD 基準。挑戰高基準分數的有效性。啟發新評估範式追蹤 AI 進展。
下一步行動
在 https://esolang-bench.vercel.app/ 測試你的程式碼代理。
誰應關注:Researchers & Academics
關鍵要點
- •使用 HumanEval 風格問題測試冷門語言,避免訓練資料洩漏
- •最佳結果:Befunge-98 使用 self-scaffolding 得 11.2%
- •代理系統透過回饋提升 2-3 倍,但無真正推理轉移
- •錯誤模式顯示有資料時語法可,但無資料邏輯全失效
🧠 深度解析
Web-grounded analysis with 8 cited sources.
🔑 增強重點摘要
- •EsoLang-Bench包含五種冷門程式語言:Brainfuck、Befunge-98、Whitespace、Unlambda和Shakespeare,每種語言各80題問題(每難度等級20題)。[1]
- •論文於2026年3月發布(arXiv:2603.09678),作者為Sharma等人,並提供GitHub儲存庫(https://github.com/Lossfunk/EsolangBench)供重現實驗。[[7]](#cite-7)[8]
- •基準強調僅輕鬆難度題目有解題成功,中高難度及額外困難題目所有模型均為0%,Kimi K2在Befunge-98僅得1.2%。[1]
🛠️ 技術深入
- •基準使用類似HumanEval風格的問題,每語言80題,分為Easy、Medium、Hard、Extra-Hard四級,每級20題。
- •評估配置包括零樣本(Zero-shot)和三樣本少樣本(3-shot ICL),僅Easy級有成功率,中高級全0%。
- •測試語言經濟上不理性,避免預訓練資料洩漏,專注真實程式碼推理而非記憶。
- •GitHub儲存庫提供完整基準實現和模型評估腳本。[8]
🔮 前景展望AI analysis grounded in cited sources
⏳ 時間線
2026-03
EsoLang-Bench論文發布於arXiv (2603.09678)
📎 來源 (8)
Factual claims are grounded in the sources below. Forward-looking analysis is AI-generated interpretation.
📰
AI 週報
閱讀本週精選 AI 大事摘要 →
👉相關動態
AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: Reddit r/LocalLLaMA ↗
