
Gemini for Mac 即將加入 Voice Mode 與 Omni 功能
Google 正準備為 Mac 版 Gemini 桌面客戶端進行重大更新。此次發布將引入包括 Voice Mode、Stream to Cursor 以及 Omni 影片生成在內的多項進階功能。
Tag: #multimodal329 results

Google 正準備為 Mac 版 Gemini 桌面客戶端進行重大更新。此次發布將引入包括 Voice Mode、Stream to Cursor 以及 Omni 影片生成在內的多項進階功能。

Microsoft 將先進的 AI 工具直接整合至桌面版與行動版 Edge 瀏覽器中。新增功能包括多頁籤推理、Vision、語音功能以及專門的學習工具,旨在提升用戶生產力。

Google 正在 Chromebook 上以 Gemini AI 重新定義電腦游標。使用者可指向螢幕元素、語音指令,並獲得桌面全方位脈絡幫助。此方法無需輸入詳細提示詞。

Thinking Machines 正在開發一款 AI 模型,能同時處理使用者輸入並產生回應。這改變了目前輪流互動的模式(說、聽、回應),轉為即時如電話般的對話。目標是讓 AI 對話比文字鏈更自然流暢。

ArXiv新論文顯示,在圖表影像上疊加座標網格的空間引導,顯著優於語義提示,提升多模態LLM資料萃取準確率。語義方法如元資料優先與思維鏈無顯著改善。在合成資料集上,錯誤率從25.5%降至19.5% SMAPE(p<0.05)。
Thinking Machines 發表全新 Interaction Voice Models。這項預覽展示了其 AI 在音頻、視頻和文字上的即時原生交換功能。
卓驭科技在北京車展發布面向移動物理AI的原生多模態基礎模型,強調視覺、音頻與動作的預訓練融合。副總裁于貝貝認為,此轉型是演算法廠商的生存法則,以應對數位AI巨頭競爭。公司正轉向L4應用如Robotaxi的訂閱、分潤與動作令牌模式。

這篇 AWS 機器學習部落格文章探討多模態生物基礎模型 (BioFMs) 的運作原理。它展示其在藥物發現與臨床開發的實際應用。本文並說明 AWS 如何協助組織建置與部署這些模型。

使用者分享的堆疊讓 Qwen3.6-27B 模型在單一 RTX 3090 GPU 上達到 85 個 token 每秒、125K 上下文長度並支援視覺功能。此設定一夜之間完成,並在 Reddit 上發布給社群使用。展示了大型模型的高效能本地推理。

地平線機器人推出類似特斯拉FSD結合Grok的系統。此系統讓機器適應人類表達習慣。定位挑戰特斯拉自動駕駛技術。