
OpenAI 測試 Codex 即時語音模式
OpenAI 正在為其 Codex 模型測試全新的即時語音模式。此功能旨在協助使用者處理日常任務(如管理 Slack 更新與訂餐),將其應用範圍從單純的程式編碼擴展至日常事務。
Tag: #multimodal329 results

OpenAI 正在為其 Codex 模型測試全新的即時語音模式。此功能旨在協助使用者處理日常任務(如管理 Slack 更新與訂餐),將其應用範圍從單純的程式編碼擴展至日常事務。

Google 在 Gboard 中整合了手語識別功能,標誌著鍵盤從單純的輸入工具轉型為多模態 AI 平台。此舉不僅提升了無障礙體驗,也展示了將複雜的電腦視覺任務整合至日常行動介面的能力。

早期中國大語言模型 MOSS 的開發團隊成立了模思智能,將重心轉向「情境智能」,優先發展端到端語音交互而非純文本模型。目前正開發語音轉寫、視頻理解及 TTS 等系列模型,旨在實現更自然的人機交互。

Google 已將 Gemini Omni 與個人 AI 虛擬替身整合至 Vids 平台。這些功能讓付費用戶能透過自然語言描述來生成與編輯影片內容。
NeurIPS 2026 首屆 RTCA 工作坊現正徵求關於即時多模態對話代理的論文。重點在於解決即時互動系統中的延遲、輪流對話及評估等挑戰。

ByteDance 取消了第一代 AI 眼鏡計畫,轉而專注於更具競爭力的雙模型第二代產品。此舉旨在於快速成長的市場中挑戰 Meta 的 Ray-Ban 智慧眼鏡。
全球AI全模態內容互動娛樂平台SeaArt近日完成超億元人民幣B輪融資。資金將用於多模態底層研發、全球市場拓展及AI垂類應用孵化。

YouTube 已在美國推出 AI 驅動的搜尋功能,允許使用者透過描述特定情境、想法或活動來尋找影片。這種對話式介面旨在透過超越簡單的關鍵字匹配,來提升內容搜尋的精準度。

ChatGPT 最新的 Live Voice 更新具備同時監聽、對話與線上搜尋的能力。此功能為使用者帶來了更自然、更接近真人的互動體驗。

Horus Hiero 是一款基於 Qwen 3.5 的新型開源多模態模型,專為翻譯古埃及象形文字而設計。它支援 150 種語言,並具備 512K 的超大上下文視窗。