💼VentureBeat•較早收集於 11m
Thinking Machines 預覽即時 AI 互動模型

💡即時全雙工 AI 模型實現自然多模態對話—互動應用遊戲規則改變者。(48字)
⚡ 30-Second TL;DR
有什麼變化
推出「interaction models」作為原生多模態系統,將互動性視為核心架構。
為什麼重要
這推動 AI 邁向自然的人類般互動,可能轉變協作工具和即時應用。對從業人員而言,它預示模型設計新範式,優先流暢性而非批次處理。
下一步行動
造訪 Thinking Machines 部落格,報名有限研究預覽。
誰應關注:Researchers & Academics
關鍵要點
- •推出「interaction models」作為原生多模態系統,將互動性視為核心架構。
- •採用全雙工多串流設計,同時處理 200ms 輸入/輸出區塊。
- •使用無編碼器早期融合,透過輕量嵌入層處理原始音頻 (dMel) 和 40x40 影像區塊。
- •在第三方基準測試中獲得顯著提升並降低延遲,優於回合制系統。
- •數月內開放有限研究預覽,今年晚些發布更廣版本。
🧠 深度解析
AI-generated analysis for this event.
🔑 增強重點摘要
- •Thinking Machines 的核心技術架構強調「互動優先」設計,旨在解決傳統大型語言模型在處理即時語音對話時,因等待完整語句輸入而產生的顯著延遲問題。
- •該公司獲得了包括 Andreessen Horowitz (a16z) 在內的多家頂級風險投資機構支持,顯示市場對於 Mira Murati 與 John Schulman 離開 OpenAI 後的創業項目具有高度信心。
- •研究預覽版特別針對邊緣運算進行了優化,目標是讓該多模態模型能在不依賴雲端伺服器強大算力的情況下,在消費級硬體上實現低延遲的互動體驗。
📊 競品分析▸ Show
| 特性 | Thinking Machines (Interaction Models) | OpenAI (GPT-4o) | Google (Gemini 1.5 Pro) |
|---|---|---|---|
| 互動模式 | 原生全雙工 (Full-Duplex) | 類全雙工 (串流) | 類全雙工 (串流) |
| 處理延遲 | ~200ms (區塊處理) | 視網路與負載而定 | 視網路與負載而定 |
| 核心架構 | 無編碼器早期融合 | 模組化多模態 | 模組化多模態 |
| 定價 | 未公開 (研究預覽) | API 付費制 | API 付費制 |
🛠️ 技術深入
- 無編碼器早期融合 (Encoder-less Early Fusion):捨棄傳統將音訊與影像先轉換為文字或特徵向量的編碼器,直接將原始數據映射至模型潛在空間。
- dMel 音頻處理:採用專有的 dMel (Deep Mel-spectrogram) 嵌入技術,直接處理原始音頻訊號,減少特徵提取階段的計算開銷。
- 40x40 影像區塊 (Image Patches):將視覺輸入切分為 40x40 的小型區塊,透過輕量級嵌入層直接餵入模型,實現對視覺變化的即時反應。
- 全雙工串流機制:系統以 200ms 為時間切片,強制模型在接收輸入的同時輸出回應,避免了傳統「聽完再說」的等待時間。
🔮 前景展望AI analysis grounded in cited sources
即時互動模型將取代傳統語音助理成為作業系統層級的介面。
全雙工處理能力消除了人機對話中的停頓感,使其具備了作為自然人機互動介面的基礎條件。
無編碼器架構將引發多模態模型訓練的新趨勢。
早期融合技術顯著降低了多模態對齊的複雜度,並提升了模型對原始感官數據的處理效率。
⏳ 時間線
2025-10
Mira Murati 與 John Schulman 正式宣布離開 OpenAI。
2026-01
Thinking Machines 公司正式成立並完成種子輪融資。
2026-05
Thinking Machines 發布首個「interaction models」研究預覽。
📰
AI 週報
閱讀本週精選 AI 大事摘要 →
👉相關動態
AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: VentureBeat ↗