Search

直接匹配不多,已補上最新動態。

Tag: #jailbreak-defense1 results

IH-Challenge:提升LLM指令層級的訓練資料集

IH-Challenge:提升LLM指令層級的訓練資料集

IH-Challenge 是一款新型強化學習資料集,旨在提升前沿 LLM 的指令層級,強化對越獄攻擊和提示注入的防禦。對 GPT-5-Mini 進行微調後,在多項基準測試中提升 10% 穩健性,將不安全行為降至 0.7%,並維持有用性。資料集已在 Hugging Face 釋出以支持後續研究。

ArXiv AIResearchMar 12#jailbreak-defense#rlhf
🔬

影像解析度會改變模型的類腦評估結果

一篇預印本指出,在 V1 比較中,評估影像解析度會大幅改變哪種 CNN 學習規則看起來最接近人腦。研究涵蓋六種影像解析度,發現未訓練模型在 V1 的表面優勢很大程度上是評估解析度造成的,而 backpropagation 在 LOC 仍保有優勢。

Reddit r/MachineLearningCommunity55m ago#visual-cortex#rsa