🤖較早收集於 39m

Transformer 內部訊號預測生成正確性

PostLinkedIn
🤖閱讀原文: Reddit r/MachineLearning
#auroc#moe-signalstransformer-internal-signalsllama-3.1-8b-instructqwen-2.5-7b-instructmistral-7b-instructmixtral-8x7b-instructgsmskhumaneval

💡內部訊號以 0.90 AUROC 預測 LLM 正確性—重排序抽樣提升 3 倍(24字元)

⚡ 30-Second TL;DR

有什麼變化

AUROC 高達 0.90(Qwen/HumanEval T6);Mixtral 早期視窗驚奇度單獨達 0.80

為什麼重要

無需額外運算即可不確定性估計,提升抽樣候選選擇。需每架構校準;提升部署 LLM 高信心準確度。

下一步行動

從 Llama/Qwen 模型提取早期權標記驚奇度以排序生成候選。

誰應關注:Researchers & Academics

關鍵要點

  • AUROC 高達 0.90(Qwen/HumanEval T6);Mixtral 早期視窗驚奇度單獨達 0.80
  • 依前 10 權標記驚奇度排序 k=10:HumanEval Pass@1 +25-35pp
  • MoE(Mixtral)vs 密集:collapsed_rate_mean 分離 rank-biserial -0.899;無跨模型轉移
  • 預測格式失敗(Mistral 0.88 AUROC);與 top-k 邊際信心正交
📰

AI 週報

閱讀本週精選 AI 大事摘要 →

👉相關動態

AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: Reddit r/MachineLearning

這是摘要,不是原文。去看原站,或訂閱每週簡報。

每週 AI 簡報

每週一封,可隨時退訂。