Search

Tag: #synthetic-data54 results

LACE 實現跨執行緒 LLM 推理

LACE 實現跨執行緒 LLM 推理

LACE 透過跨執行緒注意力,將孤立的 LLM 推理轉變為協調平行過程,讓路徑分享洞見並互相修正錯誤。它使用合成資料管線訓練缺乏於自然資料的協作行為。實驗顯示相較標準平行搜尋,準確率提升超過 7 點。

ArXiv AIResearchApr 20#synthetic-data
透過正則化理論優化合成數據

透過正則化理論優化合成數據

蘋果研究人員提出學習理論框架,平衡合成與真實數據,解決分布不匹配問題。他們利用演算法穩定性推導泛化誤差界,並依據Wasserstein距離計算最佳合成對真實數據比例。此方法以核嶺迴歸情境為動機。

Apple Machine LearningOfficialMar 30#synthetic-data#wasserstein-distance
持續自我改進的 AI

持續自我改進的 AI

這篇 arXiv 論文指出現代 LLM 的三大限制:知識獲取資料低效、依賴有限的人類資料,以及受限於人類訓練流程。它提出合成資料放大以高效更新小規模語料庫、自生成資料啟動預訓練(無需蒸餾),以及測試時演算法空間搜尋。這些步驟旨在實現持續自我改進的 AI 系統。

透過合成任務擴展的 AI 科學家

透過合成任務擴展的 AI 科學家

研究人員開發了一個合成環境管線,用於使用 SWE-agent 框架訓練機器學習代理。此管線產生基於真實 Huggingface 資料集且經自除錯驗證的 ML 挑戰。使用 GPT-5 軌跡訓練的學生模型,在 MLGym 基準測試上將 Qwen3-4B 提升 9%,Qwen3-8B 提升 12%。

ArXiv AIResearchMar 19#ai-agents#synthetic-data
NVIDIA Cosmos 擴充機器人合成資料

NVIDIA Cosmos 擴充機器人合成資料

NVIDIA 推出 Cosmos 世界基礎模型,用於生成高保真、物理感知的合成資料,適用於人形機器人和自動駕駛車輛等 AI 驅動機器人。這解決了真實世界資料集的限制,提升泛化能力和邊緣案例處理。無需大量真實世界資料收集,即可實現可擴充訓練。

NVIDIA Developer BlogOfficialMar 13#synthetic-data#physical-ai#robotics
Page 3 of 6