💼較早收集於 11m

Thinking Machines 預覽即時 AI 互動模型

Thinking Machines 預覽即時 AI 互動模型
PostLinkedIn
💼閱讀原文: VentureBeat

💡即時全雙工 AI 模型實現自然多模態對話—互動應用遊戲規則改變者。(48字)

⚡ 30-Second TL;DR

有什麼變化

推出「interaction models」作為原生多模態系統,將互動性視為核心架構。

為什麼重要

這推動 AI 邁向自然的人類般互動,可能轉變協作工具和即時應用。對從業人員而言,它預示模型設計新範式,優先流暢性而非批次處理。

下一步行動

造訪 Thinking Machines 部落格,報名有限研究預覽。

誰應關注:Researchers & Academics

關鍵要點

  • 推出「interaction models」作為原生多模態系統,將互動性視為核心架構。
  • 採用全雙工多串流設計,同時處理 200ms 輸入/輸出區塊。
  • 使用無編碼器早期融合,透過輕量嵌入層處理原始音頻 (dMel) 和 40x40 影像區塊。
  • 在第三方基準測試中獲得顯著提升並降低延遲,優於回合制系統。
  • 數月內開放有限研究預覽,今年晚些發布更廣版本。

🧠 深度解析

AI-generated analysis for this event.

🔑 增強重點摘要

  • Thinking Machines 的核心技術架構強調「互動優先」設計,旨在解決傳統大型語言模型在處理即時語音對話時,因等待完整語句輸入而產生的顯著延遲問題。
  • 該公司獲得了包括 Andreessen Horowitz (a16z) 在內的多家頂級風險投資機構支持,顯示市場對於 Mira Murati 與 John Schulman 離開 OpenAI 後的創業項目具有高度信心。
  • 研究預覽版特別針對邊緣運算進行了優化,目標是讓該多模態模型能在不依賴雲端伺服器強大算力的情況下,在消費級硬體上實現低延遲的互動體驗。
📊 競品分析▸ Show
特性Thinking Machines (Interaction Models)OpenAI (GPT-4o)Google (Gemini 1.5 Pro)
互動模式原生全雙工 (Full-Duplex)類全雙工 (串流)類全雙工 (串流)
處理延遲~200ms (區塊處理)視網路與負載而定視網路與負載而定
核心架構無編碼器早期融合模組化多模態模組化多模態
定價未公開 (研究預覽)API 付費制API 付費制

🛠️ 技術深入

  • 無編碼器早期融合 (Encoder-less Early Fusion):捨棄傳統將音訊與影像先轉換為文字或特徵向量的編碼器,直接將原始數據映射至模型潛在空間。
  • dMel 音頻處理:採用專有的 dMel (Deep Mel-spectrogram) 嵌入技術,直接處理原始音頻訊號,減少特徵提取階段的計算開銷。
  • 40x40 影像區塊 (Image Patches):將視覺輸入切分為 40x40 的小型區塊,透過輕量級嵌入層直接餵入模型,實現對視覺變化的即時反應。
  • 全雙工串流機制:系統以 200ms 為時間切片,強制模型在接收輸入的同時輸出回應,避免了傳統「聽完再說」的等待時間。

🔮 前景展望AI analysis grounded in cited sources

即時互動模型將取代傳統語音助理成為作業系統層級的介面。
全雙工處理能力消除了人機對話中的停頓感,使其具備了作為自然人機互動介面的基礎條件。
無編碼器架構將引發多模態模型訓練的新趨勢。
早期融合技術顯著降低了多模態對齊的複雜度,並提升了模型對原始感官數據的處理效率。

時間線

2025-10
Mira Murati 與 John Schulman 正式宣布離開 OpenAI。
2026-01
Thinking Machines 公司正式成立並完成種子輪融資。
2026-05
Thinking Machines 發布首個「interaction models」研究預覽。
📰

AI 週報

閱讀本週精選 AI 大事摘要 →

👉相關動態

AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: VentureBeat