📰較早收集於 13m

Google 將使用搜尋互動數據進行 AI 訓練

Google 將使用搜尋互動數據進行 AI 訓練
PostLinkedIn
📰閱讀原文: The Verge

💡了解 Google 如何利用使用者產生的多模態數據來推動其 AI 訓練管線。

⚡ 30-Second TL;DR

有什麼變化

Google 將透過新的「搜尋服務紀錄」類別儲存 Lens 照片、語音搜尋及 Translate 音訊。

為什麼重要

此政策轉變凸顯 Google 正積極從龐大的用戶群中獲取多模態訓練數據。這引發了關於個人互動數據如何被重新用於開發專有模型的隱私疑慮。

下一步行動

檢查您的 Google 帳戶「搜尋服務紀錄」設定,若您不希望個人互動數據被用於 AI 訓練,請務必手動關閉該選項。

誰應關注:Developers & AI Engineers

關鍵要點

  • Google 將透過新的「搜尋服務紀錄」類別儲存 Lens 照片、語音搜尋及 Translate 音訊。
  • 收集的媒體數據明確標示將用於訓練 Google 的 AI 模型。
  • 使用者可透過「儲存媒體」開關或完全停用紀錄設定來保有數據控制權。

🧠 深度解析

Web-grounded analysis with 16 cited sources.

🔑 增強重點摘要

  • Google 的人工智慧模型,包括 Gemini,正利用龐大的數據集進行訓練,其中包含超過 200 億支 YouTube 影片,此舉引發了創作者對智慧財產權的擔憂,且許多創作者對此並不知情。
  • Google 在 2023 年 7 月更新了其隱私權政策,明確指出可能會收集公開的線上資訊或其他公共來源的資訊,以協助訓練其人工智慧模型。
  • 自 2025 年 9 月起,Google Gemini 的免費版本預設會將用戶的對話數據用於 AI 訓練,這些數據可能由人工審核員查看,並保留長達三年;然而,企業 Workspace 用戶則享有更嚴格的隱私保護,其數據預設不會用於 AI 模型訓練。
  • 「搜尋服務紀錄」的推出是 Google 將搜尋轉型為「AI 模式」和「搜尋代理」策略的一部分,旨在將搜尋從單純的資訊檢索工具,進化為能夠規劃、發想、決策甚至執行任務的「任務引擎」。
📊 競品分析▸ Show
特性/公司GoogleOpenAIApple
AI 訓練數據來源廣泛使用公開網路數據、YouTube 影片、搜尋互動數據(Lens、Search Live、Translate)、Gmail/Calendar 等服務數據(用戶可選擇關閉,但免費版 Gemini 預設開啟對話數據訓練)主要依賴 Microsoft Azure 雲端平台,也與 Google Cloud 合作獲取算力,使用大量用戶數據訓練 LLM 和生成式 AI 模型。堅持隱私保護,AI 系統主要使用規模較小、經過篩選的數據進行訓練,這可能使其在大型語言模型和 AI 基礎設施方面處於劣勢。
用戶數據控制提供「搜尋服務紀錄」設定,用戶可關閉數據收集;Gemini 免費版預設使用對話數據訓練 AI,但企業 Workspace 版承諾客戶數據不用於 AI 訓練。允許用戶選擇不讓其內容用於第三方訓練,但具體控制選項可能因平台而異。強調裝置端處理,限制雲端數據收集,提供嚴格的隱私保護選項。
主要 AI 模型Gemini (Ultra, Pro, Flash, Nano)ChatGPT, GPT 系列模型較少公開具體模型名稱,但其 AI 應用內建於其生態系統。
市場地位 (AI)與 OpenAI、Anthropic 形成「三強鼎立」,Gemini 在新興市場領先。ChatGPT 為全球領導者,但在特定區域面臨競爭。在大規模語言模型和 AI 基礎設施方面可能處於劣勢,但在穿戴裝置和消費者應用方面與 Meta、Google 競爭。

🛠️ 技術深入

  • Google 的 Gemini 模型專為處理多模態數據而設計,能夠同時理解和生成文字、圖片、音訊和影片等不同類型的內容。
  • Gemini 1.5 Pro 版本能夠處理長達 100 萬個 token 的文件、程式碼和影片內容,適用於研究報告彙整、技術文件摘要和多模態分析。
  • Google 採用其自研的張量處理單元 (TPU),特別是 TPU 8t,並結合 Google DeepMind 共同設計的軟體,用於訓練大型語言模型,聲稱可將 LLM 開發速度提升 36%。
  • 資料處理週期包含收集原始資料、準備/清理(處理遺漏值、修正錯誤、移除重複資料)、輸入至處理器(如 AI 模型)、執行演算法進行處理、輸出/解讀結果,以及安全儲存已處理的資料。
  • BigQuery 平台與 Gemini 整合,提供代理功能,協助資料工程師和數據分析師結合 AI 技術和自然語言,提升海量數據分析的查詢效能,並自動生成程式碼以簡化工作流程。

🔮 前景展望AI analysis grounded in cited sources

AI 驅動的搜尋功能將加速普及並改變用戶行為。
Google 的 AI 模式在推出一年後每月使用者已突破 10 億人,且搜尋量每季翻倍成長,顯示用戶正快速適應並依賴 AI 輔助的搜尋體驗。
數據隱私爭議和相關法律訴訟將持續成為 AI 發展的關鍵挑戰。
Google 因預設啟用 AI 功能存取 Gmail 等私人數據而面臨集體訴訟,凸顯了 AI 模型訓練與用戶隱私保護之間的持續緊張關係。
搜尋引擎將從資訊檢索工具轉變為能夠執行複雜任務的「任務引擎」和「AI 代理」。
Google 正積極開發「搜尋代理」功能,使其能夠在搜尋中直接建立、自訂並管理 AI 代理來執行預訂、規劃等任務,從根本上改變搜尋的性質。

時間線

2021-12
Google 廣泛收集用戶數據,包括位置、搜尋歷史和應用程式使用情況。
2023-02
Gemini(作為 Bard 的繼任者)首次亮相,專注於多模態處理,並整合到 Google 搜尋和 Workspace 中。
2023-07
Google 更新隱私權政策,明確表示可能使用公開線上資訊訓練 AI 模型。
2025-09
Google Gemini 免費版預設將用戶對話數據用於 AI 訓練,數據可保留長達三年並由人工審核。
2025-11
Google 因被指控在未經用戶同意下,預設啟用 Gemini 存取 Gmail 等私人訊息而面臨集體訴訟。
2026-05
Google I/O 2026 宣布將 AI 模式的預設模型升級為 Gemini 3.5 Flash,並推出「搜尋代理」和重新設計的智慧搜尋框,深化 AI 在搜尋中的整合。
📰

AI 週報

閱讀本週精選 AI 大事摘要 →

👉相關動態

AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: The Verge