🤖Reddit r/MachineLearning•較早收集於 39m
Transformer 內部訊號預測生成正確性
#auroc#moe-signalstransformer-internal-signalsllama-3.1-8b-instructqwen-2.5-7b-instructmistral-7b-instructmixtral-8x7b-instructgsmskhumaneval
💡內部訊號以 0.90 AUROC 預測 LLM 正確性—重排序抽樣提升 3 倍(24字元)
⚡ 30-Second TL;DR
有什麼變化
AUROC 高達 0.90(Qwen/HumanEval T6);Mixtral 早期視窗驚奇度單獨達 0.80
為什麼重要
無需額外運算即可不確定性估計,提升抽樣候選選擇。需每架構校準;提升部署 LLM 高信心準確度。
下一步行動
從 Llama/Qwen 模型提取早期權標記驚奇度以排序生成候選。
誰應關注:Researchers & Academics
關鍵要點
- •AUROC 高達 0.90(Qwen/HumanEval T6);Mixtral 早期視窗驚奇度單獨達 0.80
- •依前 10 權標記驚奇度排序 k=10:HumanEval Pass@1 +25-35pp
- •MoE(Mixtral)vs 密集:collapsed_rate_mean 分離 rank-biserial -0.899;無跨模型轉移
- •預測格式失敗(Mistral 0.88 AUROC);與 top-k 邊際信心正交
📰
AI 週報
閱讀本週精選 AI 大事摘要 →
👉相關動態
AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: Reddit r/MachineLearning ↗
每週 AI 簡報
每週一封,可隨時退訂。

