
推出 Gemini Omni
Google 正式推出 Gemini Omni,這是一款專為即時、低延遲互動而設計的多模態模型。該模型透過提供無縫的跨模態處理,增強了 Gemini 生態系統的功能。
Tag: #real-time21 results

Google 正式推出 Gemini Omni,這是一款專為即時、低延遲互動而設計的多模態模型。該模型透過提供無縫的跨模態處理,增強了 Gemini 生態系統的功能。
OpenAI 推出了 GPT-Live,這是一代專為流暢的人機互動而設計的語音模型。該技術目前已應用於 ChatGPT 的語音功能中。

OpenAI 推出了具備同時聽說能力的新語音模型。此功能旨在提升即時對話的流暢度,並實現即時翻譯應用。

一位開發者創建了一個完全本地、即時的語音對話機器人,由 Qwen3.5-397B、Whisper 與 Orpheus TTS 驅動。該系統具備可中斷回應功能,並能為長時間對話保持上下文。

學習如何將 Stream 的 Vision Agents 與 Amazon Bedrock 及 Amazon Nova 2 Sonic 整合。此架構可打造具備進階功能的生產級即時語音代理。

xAI 推出了 Grok Voice Think Fast 1.0,這是一款專為語音代理設計的即時語音模型。它能幫助企業高效自動化複雜工作流程。此模型現已透過 API 提供存取。

展示使用 Gemma E2B 在 M3 Pro Mac 上實現即時音頻/視頻輸入與語音輸出,適合語言學習如對準物體拍照。模型支援多語言,可回退至母語。提供儲存庫供複製。

Microsoft 正在開發其首款原生即時語音模型,目前稱為 MAI Realtime。該模型已在 MAI Playground 環境中被發現。

ChatGPT 最新的 Live Voice 更新具備同時監聽、對話與線上搜尋的能力。此功能為使用者帶來了更自然、更接近真人的互動體驗。

Threads 正在測試類似 Grok 的 Meta AI 整合。它提供趨勢和突发新聞的即時脈絡。使用者可在對話中直接獲得推薦。