Search

Tag: #ai-evaluation19 results

AI 道德測試忽略規範推理

AI 道德測試忽略規範推理

這篇立場論文指出,現有的 LLM 道德評估主要關注模型輸出是否符合人類價值觀,卻忽略模型能否正確識別並應用具情境性的道德規範。論文提議建立標準化規範表示法、專家標註資料集,以及區分價值層級與規範層級能力的評估方法。

AI系統日誌分析的七個簡單步驟

AI系統日誌分析的七個簡單步驟

AI系統在與工具和使用者互動時產生大量日誌,有助於了解模型能力、傾向與行為,或評估評估是否如預期運作。此arXiv論文建議基於當前最佳實務的管線,並以Inspect Scout函式庫的具體程式碼範例說明,提供每個步驟的詳細指引並強調常見陷阱。此框架為研究者提供嚴謹且可重現的日誌分析基礎。

Page 1 of 2