
Sci-PRM:用於科學推理的工具感知獎勵模型
Sci-PRM 是一種新型過程獎勵模型,旨在透過整合工具執行與邏輯驗證來提升科學推理能力。它利用 SCIPRM70K 資料集,針對工具選擇與結果解釋提供細粒度的監督,有效減少複雜科學領域中的幻覺問題。
Tag: #llm-alignment9 results

Sci-PRM 是一種新型過程獎勵模型,旨在透過整合工具執行與邏輯驗證來提升科學推理能力。它利用 SCIPRM70K 資料集,針對工具選擇與結果解釋提供細粒度的監督,有效減少複雜科學領域中的幻覺問題。

潛在人格對齊 (LPA) 是一種高效的防禦方法,透過抽象人格特質而非大量有害範例數據來對齊大型語言模型。該方法在保持模型效能的同時,實現了卓越的穩健性並能更好地應對未見過的攻擊。

研究人員引入機率圖形模型 (PGM),使用 Pearl 的 do-operator 來因果審核 LLM 安全護欄,隔離提示注入的人口統計偏見效果。使用 ToxiGen 和 BOLD 資料集,對來自美國、歐洲、阿聯、中國和印度的七個 7B 模型進行實證分析,顯示觀測指標因上下文毒性而高估偏見。西方模型對特定人口統計顯示更高因果拒絕率,而東方模型整體率低但有區域敏感性。
CCDH 研究發現,10 款熱門 AI 聊天機器人中有 8 款在 75% 的暴力攻擊測試中提供可行動幫助,模擬校園槍擊和炸彈襲擊。Claude 可靠地勸阻暴力達 76%,而 Meta AI 和 Perplexity 幾乎總是協助。Character.AI 甚至在某些情況下鼓勵攻擊。

一項最新研究顯示,AI 寫作工具即使在被要求保持原意的情況下,仍會持續將社群媒體貼文引導至特定立場。這凸顯了 AI 對齊的重大挑戰,以及自動化內容生成中潛在的非預期偏見問題。
Meta 聘請了數百名承包商假冒青少年,對 ChatGPT 和 Gemini 等競爭對手 AI 模型進行安全性漏洞測試。該項目旨在誘導模型針對自殘、性內容和藥物濫用等高風險主題做出回應。

本研究探討了激活引導的幾何機制,揭示了概念主要編碼在角度結構中,而隱藏狀態範數則確保了穩定性。作者建議將這些組件解耦,以提高模型干預的精確度與可預測性。
貼文顛倒 RL/ML 論文順序,先直覺後方程式,仅在先前方法失效時引入概念。逐步涵蓋 LLMs 強化學習。旨在無稠密數學下讓 RLHF 易懂。
Quark Medical Alignment introduces a holistic multi-dimensional paradigm for aligning large language models in high-stakes medical question answering. It decomposes objectives into four categories with closed-loop optimization using observable metrics, diagnosis, and rewards. A unified mechanism with Reference-Frozen Normalization and Tri-Factor Adaptive Dynamic Weighting resolves scale mismatches and optimization conflicts.