
Google 地圖以 Gemini 進化:Ask Maps 與 3D 導航
Google 宣布 Google 地圖的 Gemini 驅動更新,推出「Ask Maps」用於處理複雜條件的對話式搜尋,以及「Immersive Navigation」提供直觀 3D 路線導航。功能包含根據使用者偏好與歷史的個人化建議,加上自然語音導航,重新定義導航體驗。日本尚未提供。
Tag: #multimodal329 results

Google 宣布 Google 地圖的 Gemini 驅動更新,推出「Ask Maps」用於處理複雜條件的對話式搜尋,以及「Immersive Navigation」提供直觀 3D 路線導航。功能包含根據使用者偏好與歷史的個人化建議,加上自然語音導航,重新定義導航體驗。日本尚未提供。

Google Maps 推出 AI 驅動的「Ask Maps」功能,支持自然語言查詢。同時升級「Immersive Navigation」體驗。Google 稱這是 Maps 十年來最大更新。

周暢身後支撐著阿里巴巴的Qwen大語言模型與Seedance多模態AI。他七年歷程從達摩院招生到領導Seed成為多模態一哥。本文回顧其在中國AI發展中的關鍵角色。

OpenAI 計劃將 Sora 影片生成器整合至 ChatGPT。用戶可直接在聊天介面創作短篇 AI 影片。這提升 ChatGPT 的多模態功能。

蘋果與OpenAI將Shazam深度整合進ChatGPT應用,用戶可在聊天介面直接識別背景播放歌曲,無需切換獨立Shazam應用。此新工具已面向全球iOS、Android及網頁端ChatGPT用戶推出。

研究人員提出一個可重現框架,透過分解為感知(模式識別)和演繹(臨床邏輯)兩部分,評估多模態大型語言模型在心電圖信號上的推理能力。感知使用代理程式碼生成來實證驗證時間結構。演繹透過檢索方式比對模型邏輯與臨床標準資料庫。
樂奇 Rokid 旗下 AI 眼鏡 Rokid Glasses 海外版重磅升級,正式接入谷歌 Gemini、ChatGPT、DeepSeek、阿里通義千問四大主流 AI 大模型。成為行業首款支援 Gemini 的 AI 眼鏡,在端雲協同架構下體驗跨模型切換、多模態互動與即時翻譯。

Qwen 發布 Qwen 3.5 Small 多模態模型,尺寸從 0.8B 到 9B,適合設備端應用。演示使用 Transformers.js 在 WebGPU 瀏覽器本地運行 0.8B 變體。視覺編碼器為主要瓶頸,但能運行已相當出色。

瑞幸營收增長43%至4930億元,3.1萬店;加速Lucky AI用豆包大模型語音點單,支付寶/鴻蒙鏈路。多模態聚焦推薦/供應鏈,研發穩6%。

Chart Insight Agent Flow 是一種新型多代理框架,利用 MLLMs 從圖表影像中提取深刻洞察,超越基本描述。它引入 ChartSummInsights,一個包含真實世界圖表與專家撰寫洞察摘要的資料集。實驗顯示它大幅提升 MLLM 在圖表摘要任務的表現。