
BehaviorBench:從行為軌跡建模真實用戶決策
BehaviorBench 是一個新的基準測試,旨在利用來自預測市場和鏈上紀錄的真實行為數據來評估個性化決策建模。它挑戰模型在超過 160 萬個實例中預測用戶立場和交易行為,超越了模擬用戶環境的限制。
Tag: #personalization120 results

BehaviorBench 是一個新的基準測試,旨在利用來自預測市場和鏈上紀錄的真實行為數據來評估個性化決策建模。它挑戰模型在超過 160 萬個實例中預測用戶立場和交易行為,超越了模擬用戶環境的限制。

POLAR 是一個新框架,透過維護長期使用者互動的多模態知識圖譜,使具身多模態代理能夠提供個人化協助。它透過檢索語義與情節記憶來更準確地解讀隱含的使用者需求,進而提升任務執行效率。
OpenAI 推出 GPT-5.5 Instant 作為 ChatGPT 的新預設模型。它提供更智能、更準確的回答,並減少幻覺現象。使用者獲得更好的個人化控制功能。

X 為 iOS Premium 訂閱者推出功能,讓使用者置頂特定主題,由 Grok 策展個人化時間軸。它結合 Grok 對每篇貼文的理解與演算法個人化。Android 版即將開放搶先體驗。

X 推出自訂時間軸,讓 Premium 用戶將 75 個主題釘選到首頁標籤,獲得個人化動態。由 Grok 的貼文理解與演算法驅動,初期限 iOS Premium,用戶 Android 版即將推出。另新增工具可在 For You 標籤隱藏如政治等主題 24 小時。

大型語言模型常因 RLHF 的單一全球目標而無法對齊多樣使用者偏好。GRPO 假設樣本可交換,透過混淆使用者獎勵分佈限制個人化。Apple 的個人化群組相對政策最佳化解決異質偏好於 on-policy RL 中的問題。

使用 Amazon Bedrock AgentCore 和 Amazon Nova Sonic 2.0 建置超個人化電影體驗的代理式 AI。涵蓋兩個提升觀眾互動的使用案例,透過自然對話。採用 Model Context Protocol 打造了解偏好的娛樂禮賓。
MAPLE 將 LLM 代理的限制分解為記憶、學習與個人化三個專屬子代理。記憶負責儲存與擷取,學習非同步從互動中提取洞見,個人化則即時應用於有限脈絡預算中。它在 MAPLE-Personas 基準測試中將個人化分數提升 14.6%,特徵融入率從 45% 提高至 75%。

由前 Spotify 員工創立的新創公司募得 1,000 萬美元,將推薦技術帶入電子商務。其平台會預測消費者下一個想購買的產品、學習整體偏好,並根據即時行為持續調整。
本文探討目前的 AI 記憶體系統是否因過度專注於靜態事實檢索而受到限制,而非動態的模式推論。文章建議未來的架構應進化為能模擬使用者的推理風格與解釋框架。