Search

Tag: #llm-evaluation69 results

LLM 生成能力問題跨領域研究

LLM 生成能力問題跨領域研究

這篇 arXiv 論文分析 LLM 生成的能力問題 (CQs),用於本體工程,採用可讀性、相關性和結構複雜度等量化指標。比較開源模型 (KimiK2-1T、Llama3.1-8B、Llama3.2-3B) 與閉源模型 (Gemini 2.5 Pro、GPT 4.1) 在各使用案例中的表現。結果顯示生成特徵因使用案例而異,形成獨特生成輪廓。

初級AI研究員的健全性檢查建議

初級AI研究員的健全性檢查建議

本文分享給初級研究員的最常見建議:進行快速健全性檢查,以避免在有缺陷的想法上浪費時間。它涵蓋檢查偏差、基本資料相關性、摘要統計,以及檢查LLM實驗中的典型範例和離群值,例如工具呼叫和推理鏈。範例包括河內塔失敗和較弱模型中隱藏任務提及。

AI Alignment ForumCommunityApr 2#sanity-checks#research-tips#llm-evaluation
Page 6 of 7