Search

Tag: #calibration5 results

基礎LLM展現語義校準

基礎LLM展現語義校準

蘋果研究人員發現,僅以權杖訓練的基礎LLM,在開放領域問答任務中使用基於抽樣的度量,展現出強大的語義校準。即使未經明確訓練,它們也能提供超越權杖層級的可靠信心估計。一個理論機制解釋了此現象的出現。

Apple Machine LearningOfficialMar 24#calibration#semantic#qa-evaluation
TAC修正LLM不確定性代理失效

TAC修正LLM不確定性代理失效

研究人員將LLM不確定性估計指標的代理失效形式化,這些指標在低資訊情境中失效。他們提出Truth AnChoring (TAC),一種後處理校準方法,使用噪音少樣本監督將分數對齊事實真相。TAC實現可靠幻覺偵測;程式碼在GitHub。

ArXiv AIResearchApr 3#calibration