🤖Reddit r/MachineLearning•較早收集於 14h
徵稿啟事:COLM'26 大型語言模型社會模擬研討會
💡與致力於為政策與治理構建穩健、可解釋的 LLM 模擬社會的研究人員交流。
⚡ 30-Second TL;DR
有什麼變化
主題:基於 LLM 模擬社會的應用真實性
為什麼重要
此研討會有助於彌合 LLM 代理理論研究與現實政策或治理應用之間的差距,並鼓勵為模擬社會環境建立嚴謹的實證基礎。
下一步行動
請於 2026 年 6 月 23 日前將您的 LLM 代理評估或社會模擬研究投稿至 COLM'26 研討會。
誰應關注:Researchers & Academics
關鍵要點
- •主題:基於 LLM 模擬社會的應用真實性
- •投稿截止日期:2026 年 6 月 23 日 (AoE)
- •涵蓋領域包含模擬評估、角色建模及社會風險分析
- •歡迎機器學習、社會科學、心理學及政策領域研究者參與
🧠 深度解析
Web-grounded analysis with 20 cited sources.
🔑 增強重點摘要
- •大型語言模型(LLM)社會模擬面臨五大關鍵挑戰,包括多樣性不足、內在偏見、諂媚行為、非人類機制導致的「異化」以及泛化性限制,但研究人員正透過情境豐富的提示工程、社會科學數據微調、引導向量和代幣採樣等方法積極應對這些問題。
- •LLM社會模擬的應用潛力廣泛,涵蓋城市規劃、政策測試、危機應對模擬、社交媒體平台設計以及市場與消費者行為研究等領域,有望為社會科學研究提供可擴展且易於獲取的數據來源。
- •COLM'26是第二屆大型語言模型社會模擬研討會,其前身Social Sim'25於2025年在蒙特婁的COLM大會上首次舉辦,當時的研討會重點關注利用LLM模擬線上社會行為、代理人行為預測與人格建模,以及評估線上危害。
- •COLM(語言模型大會)是一個專注於語言模型研究的學術平台,旨在匯集不同學科的專家,共同理解、改進和評估語言模型技術的發展,並預計在2026年舉辦16場研討會。
🛠️ 技術深入
- 核心挑戰: LLM社會模擬面臨多樣性、偏見、諂媚、異化和泛化性等挑戰。其中,偏見指模型系統性地不準確呈現特定社會群體,常依賴刻板印象;諂媚指模型傾向於提供看似有幫助但不一定準確的答案;異化則指模型輸出雖看似人類行為,但其底層機制卻是非人類的;泛化性問題則限制了LLM在研究新群體或大規模群體行為時的準確性。
- 緩解策略: 針對上述挑戰,研究方向包括使用情境豐富的提示(context-rich prompting)、利用社會科學數據進行模型微調、應用引導向量(steering vectors)來注入類人變化,以及調整代幣採樣(token sampling)以增加輸出多樣性。
- 評估方法: 該領域強調超越單純演示的嚴謹評估,需關注模擬的穩健性、可解釋性和經驗基礎。評估方法包括統計真實性基準(如SSDataBench)以及將LLM本身作為評估判官(LLM-as-a-judge)的方法,後者利用LLM的高推理能力,根據自然語言標準來評分輸出。
- 模擬框架與平台:
- Generative Agents: Park等人於2023年提出的工作展示了LLM驅動代理人如何在沙盒世界中展現出湧現的社會行為。
- OASIS (Open Agent Social Interaction Simulations): 一個可擴展的開源社交媒體模擬器,能夠整合LLM代理人與基於規則的代理人,模擬多達一百萬用戶的行為。它具備動態社交網絡、多樣化的行動空間(21-23種動作)以及基於興趣和熱度分數的推薦系統。
- AgentSociety: 一個開源模擬框架,能夠在真實的城市、社會和經濟環境中模擬30,000個基於LLM的代理人。它利用真實地圖數據、Golang移動引擎、動態社交網絡和宏觀經濟追蹤,並透過24個NVIDIA A800 GPU和Ray分佈式引擎實現超時鐘速度的性能。
- YSocial: 一款無程式碼工具,用於模擬社交媒體動態,允許自定義用戶資料、推薦系統和內容流。
- 代理人建模框架: 典型的代理人社會認知建模框架包含屬性建模、記憶管理、規劃與行動等環節。
📎 來源 (20)
Factual claims are grounded in the sources below. Forward-looking analysis is AI-generated interpretation.
📰
AI 週報
閱讀本週精選 AI 大事摘要 →
👉相關動態
AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: Reddit r/MachineLearning ↗
