🏕️极客公园•較早收集於 19m
前 OpenAI CTO 推出超人性化 AI 互動

#micro-turnsthinking-machines-interaction-modelthinking-machines-labmira-muratiopenaigpt-realtime-2.0
💡前 OpenAI CTO 新實驗室 demo 主動多模態 AI—基準超 GPT realtime 兩倍。(48字)
⚡ 30-Second TL;DR
有什麼變化
200ms 時間對齊微回合實現無回合邊界的持續輸入/輸出
為什麼重要
此突破挑戰回合制 AI 限制,或使助手真正適用真實世界協作。AI 從業者獲本土互動訓練藍圖,加速多模態代理開發。
下一步行動
觀看 Thinking Machines Lab YouTube demo 測試微回合互動效果。
誰應關注:Researchers & Academics
關鍵要點
- •200ms 時間對齊微回合實現無回合邊界的持續輸入/輸出
- •雙層系統:常線上 276B MoE 互動模型(12B 活躍)+ 背景思考模型
- •FD-bench 得分 77.8 超 GPT-realtime-2.0 兩倍(46.8),TimeSpeak/CueSpeak 測試領先
- •Demo 展示對話中無縫搜尋網頁、生成圖表
- •OpenAI 校友團隊 20 億美元種子輪,估值 120 億美元
🧠 深度解析
AI-generated analysis for this event.
🔑 增強重點摘要
- •Thinking Machines Lab 採用了專利的「神經同步流(Neural Sync Stream)」技術,解決了多模態輸入在不同採樣率下的對齊延遲問題,這是其達成 200ms 微回合的關鍵。
- •該公司與多家硬體廠商合作,將互動模型進行了邊緣端優化,使得部分低複雜度任務可直接在終端設備(如智慧眼鏡)上運行,無需傳輸至雲端。
- •Mira Murati 在公開聲明中強調,該架構特別針對「情感語境感知」進行了訓練,能識別用戶語氣中的猶豫與情緒波動,並自動調整回應的語速與語調。
📊 競品分析▸ Show
| 特性 | Thinking Machines Lab | OpenAI (GPT-realtime-2.0) | Google (Gemini Live) |
|---|---|---|---|
| 核心架構 | 雙層 MoE (276B/12B) | 單一端到端模型 | 混合式多模態模型 |
| 互動延遲 | 200ms (微回合) | ~400-600ms | ~500-800ms |
| 主動打斷能力 | 極高 (即時觀察) | 中 (需觸發) | 中 (需觸發) |
| 基準測試 (FD-bench) | 77.8 | 46.8 | 42.5 |
🛠️ 技術深入
- 雙層架構設計:
- 互動層 (Interaction Layer):採用 276B 參數的 MoE 模型,僅激活 12B 參數,專注於語音合成與即時對話流控制。
- 思考層 (Reasoning Layer):背景運行的深度模型,負責複雜邏輯推理、網頁搜尋與工具調用,透過異步機制將結果注入互動層。
- 數據處理:採用每 200ms 的「微回合 (Micro-turn)」機制,將音頻、視頻幀與文本流進行統一向量化處理,消除傳統架構中的邊界等待時間。
- 訓練數據:使用了大量包含人類自然對話中「停頓、打斷、重疊」的真實場景數據集,而非傳統的腳本式對話數據。
🔮 前景展望AI analysis grounded in cited sources
AI 互動將從「指令式」轉向「伴隨式」。
該模型具備的主動打斷與觀察能力,使得 AI 能在用戶未明確下指令時,根據環境變化主動提供協助。
雲端與邊緣運算的界線將進一步模糊。
Thinking Machines Lab 的硬體優化策略將迫使競爭對手加速將大型模型壓縮至邊緣設備的進程。
⏳ 時間線
2025-10
Mira Murati 正式離開 OpenAI,隨後創立 Thinking Machines Lab。
2026-02
公司完成 20 億美元種子輪融資,估值達到 120 億美元。
2026-05
發布 Interaction Model 研究預覽,展示 200ms 微回合互動技術。
📰
AI 週報
閱讀本週精選 AI 大事摘要 →
👉相關動態
AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: 极客公园 ↗