
ByteDance 發布 SeedRealtime 全雙工模型
ByteDance 發布 SeedRealtime 音視頻全雙工大模型,旨在提供更自然的即時互動體驗。同篇報導亦提到 JD.com 開源 JoyAI-Video-Edit 模型,支援即時互動式影片編輯。
Tag: #full-duplex8 results

ByteDance 發布 SeedRealtime 音視頻全雙工大模型,旨在提供更自然的即時互動體驗。同篇報導亦提到 JD.com 開源 JoyAI-Video-Edit 模型,支援即時互動式影片編輯。

ByteDance 推出全雙工 AI 模型 SeedRealtime,專為持續性對話而設計。該模型整合音訊、影片與文字,並支援主動回應及更自然的對話節奏。

Thinking Machines 由前 OpenAI 領導人 Mira Murati 和 John Schulman 創立,發布「interaction models」的研究預覽,用於近即時多模態語音和視訊對話。這些模型從回合制 AI 轉向全雙工處理,以 200ms 區塊同時處理輸入和輸出。有限預覽即將開放以收集回饋。

字節跳動推出 Seeduplex,這是一款全雙工語音模型,已整合至其 Doubao 平臺。它實現 AI 通話中的即時、自然語音互動。此模型大幅提升回應速度與對話流暢度。

NVIDIA 已在 Hugging Face 上發布 NemotronLabs VoiceChat 11B 模型,主打全雙工語音互動。貼文提供的細節有限,但顯示即時對話式音訊應用多了一個新的開放模型選項。

Sommelier 推出適用於全雙工語音語言模型的可擴展開源多輪音頻數據預處理管道。它解決高品質多講者對話數據集的缺乏,以及重疊語音、後通道、辨識錯誤和 ASR 幻覺等問題。這彌補了開發即時自然人機互動系統的關鍵差距。

Microsoft 可能正在開發原生雙向語音模型 MAI Realtime,據報已以隱藏項目出現在 MAI Playground。據稱該系統可同時聆聽與說話,支援 17 種語言,未來可能透過 Microsoft Foundry 與 Copilot 提供。

華為推出 U6GHz 頻段 E-band 長距全雙工微波解決方案,以應對穿戴式 AI 設備與 AI 機器人的指數級流量增長。它針對 6G ITU-R 關鍵指標,如上行邊緣速率 50Mbps 與下行 300Mbps。現有回傳網路面臨嚴峻壓力。