來源較早收集於 3h

難以作弊程式碼基準測試揭露 LLM 極限

閱讀原文: Reddit r/LocalLLaMA
#esoteric-languages#benchmarking#reasoning-eval

新基準證明頂尖 LLM 在冷門語言真實程式碼推理僅 11% 極限。

30 秒速覽

有什麼變化

使用 HumanEval 風格問題測試冷門語言,避免訓練資料洩漏

為什麼重要

揭露 LLM 靠記憶而非泛化成功,敦促轉向 OOD 基準。挑戰高基準分數的有效性。啟發新評估範式追蹤 AI 進展。

下一步行動

在 https://esolang-bench.vercel.app/ 測試你的程式碼代理。

誰應關注:Researchers & Academics

關鍵要點

  • •使用 HumanEval 風格問題測試冷門語言,避免訓練資料洩漏
  • •最佳結果:Befunge-98 使用 self-scaffolding 得 11.2%
  • •代理系統透過回饋提升 2-3 倍,但無真正推理轉移
  • •錯誤模式顯示有資料時語法可,但無資料邏輯全失效
關鍵數字0%1.2%11.2%

深度解析

背景與延伸:來自公開資料,非原文內容。引用 8 個來源。

增強重點摘要

  • •EsoLang-Bench包含五種冷門程式語言:Brainfuck、Befunge-98、Whitespace、Unlambda和Shakespeare,每種語言各80題問題(每難度等級20題)。[1]
  • •論文於2026年3月發布(arXiv:2603.09678),作者為Sharma等人,並提供GitHub儲存庫(https://github.com/Lossfunk/EsolangBench)供重現實驗。[[7]](#cite-7)[8]
  • •基準強調僅輕鬆難度題目有解題成功,中高難度及額外困難題目所有模型均為0%,Kimi K2在Befunge-98僅得1.2%。[1]

技術深入

  • •基準使用類似HumanEval風格的問題,每語言80題,分為Easy、Medium、Hard、Extra-Hard四級,每級20題。
  • •評估配置包括零樣本(Zero-shot)和三樣本少樣本(3-shot ICL),僅Easy級有成功率,中高級全0%。
  • •測試語言經濟上不理性,避免預訓練資料洩漏,專注真實程式碼推理而非記憶。
  • •GitHub儲存庫提供完整基準實現和模型評估腳本。[8]

前景展望基於引用來源的 AI 分析

LLM程式碼生成將轉向離散語言基準以避免飽和
EsoLang-Bench揭示標準基準如HumanEval已被記憶主導,需更多OOD任務如冷門語言來精準評估推理能力。[1]
代理系統僅短期提升,無跨語言推理轉移
雖然self-scaffolding和代理回饋可將得分提高2-3倍,但中高難度仍為0%,顯示缺乏泛化推理。[1]

時間線

2026-03
EsoLang-Bench論文發布於arXiv (2603.09678)

AI 週報

閱讀本週精選 AI 大事摘要 →

AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: Reddit r/LocalLLaMA ↗

這是摘要,不是原文。去看原站,或訂閱每週簡報。

每週電子報

每週一封,可隨時退訂。