
OSCToM:透過強化學習引導生成提升心智理論能力
OSCToM 提出了一種用於建模 LLM 中嵌套信念衝突的新方法,顯著提升了複雜社交推理任務的表現。透過結合強化學習與組合代理模型,該方法在 FANToM 等資訊不對稱基準測試中實現了卓越的準確度。
Tag: #data-synthesis5 results

OSCToM 提出了一種用於建模 LLM 中嵌套信念衝突的新方法,顯著提升了複雜社交推理任務的表現。透過結合強化學習與組合代理模型,該方法在 FANToM 等資訊不對稱基準測試中實現了卓越的準確度。
MagicLab 在矽谷舉辦 GEIS 大會,發布 MagicBot X1 機器人、MagicHand H01 靈巧手,以及具身 AI 的 Magic-Mix 世界模型。Magic-Mix 包含 WAM 物理推理引擎與 Creator 資料合成,形成閉環系統。公司目標 2036 年營收 140 億美元,涵蓋九大場景。

LOGIGEN 是一個使用邏輯驅動方法和三代理協作的框架,為代理型 LLM 合成可驗證訓練資料。它生成橫跨 8 個領域的 20,000 個複雜任務,並透過狀態等價檢查保證有效性。使用 SFT 和 RL 訓練的模型在 τ²-Bench 上達到 79.5% 成功率,大幅超越基準。

MMKG-RDS 是一個靈活框架,利用多模態知識圖譜進行高品質推理資料合成,克服現有方法在覆蓋率、驗證與可解釋性方面的限制。它具備細粒度提取、可自訂路徑採樣與多維度品質評分,使用 MMKG-RDS-Bench(5 領域、17 任務、14,950 樣本)驗證。微調 Qwen3 模型可提升推理準確率 9.2%;程式碼開源於 GitHub。
Feature Activation Coverage (FAC) measures diversity in LLM feature space using sparse autoencoders. FAC Synthesis generates samples targeting missing features from seed data. Boosts diversity and performance on instruction, toxicity, reward, and steering tasks.