🇨🇳較早收集於 6m

Google 計畫付費購買應用程式原始碼以訓練 AI 模型

Google 計畫付費購買應用程式原始碼以訓練 AI 模型
PostLinkedIn
🇨🇳閱讀原文: cnBeta (Full RSS)

💡Google 正付費購買專有應用程式碼以訓練更強的程式碼模型;這是開發者的新變現途徑。

⚡ 30-Second TL;DR

有什麼變化

Google 計畫向開發者授權應用程式原始碼

為什麼重要

此舉可能為開發者創造新的收入來源,同時顯著提升程式碼生成模型的品質。這凸顯了業界正轉向獲取高品質、人類編寫的專有程式碼進行訓練。

下一步行動

審視您的應用程式碼庫與服務條款,為未來與大型 AI 實驗室進行數據授權的潛在機會做好準備。

誰應關注:Developers & AI Engineers

關鍵要點

  • Google 計畫向開發者授權應用程式原始碼
  • 數據將用於改進 AI 驅動的開發工具
  • 開發者透過非獨家授權保留智慧財產權

🧠 深度解析

Web-grounded analysis with 28 cited sources.

🔑 增強重點摘要

  • Google 的這項計畫旨在從 Google Play 開發者獲取高品質且多樣化的應用程式原始碼,以補充其現有來自開源儲存庫和內部程式碼庫的訓練數據來源。
  • 所獲取的程式碼將主要用於強化 Google 的 Gemini 系列模型,特別是專注於程式碼生成與理解的工具,例如 Gemini Code Assist 和 Gemini CLI,這些工具已整合至 Vertex AI 和 Google AI Studio 等開發者平台。
  • 此舉符合 Google 發展「AI 代理」的廣泛戰略,旨在透過 AI 大幅自動化開發工作流程並提升工程效率;Google 內部數據顯示,高達 75% 的新程式碼已由 AI 生成,並將開發效率提升了 6 倍。
  • 透過確保多樣化且高品質的數據集,Google 期望在 AI 程式碼生成領域保持競爭優勢,減少模型「幻覺」並提升 AI 在程式碼推理方面的精準度。
📊 競品分析▸ Show
功能/方面Google (此計畫)Microsoft/GitHub CopilotMeta (Code Llama/MCI)
主要目標獲取 Google Play 應用程式原始碼,訓練 AI 模型以改進開發工具。透過用戶互動數據(提示、生成程式碼、上下文)訓練 AI 模型,提供程式碼生成、補全、審查。釋出 Code Llama 模型,並透過內部「Model Capability Initiative」(MCI) 追蹤員工電腦使用行為(滑鼠、點擊、鍵盤輸入)以訓練 AI 代理。
數據來源Google Play 開發者授權的應用程式原始碼;結合開源程式碼庫、技術文件、內部程式碼等。免費版、專業版、專業加強版用戶的互動數據(預設啟用,可選擇退出);企業版和企業加強版用戶數據不受影響。Llama 2 程式碼庫;員工在數百個網站和應用程式上的電腦操作行為數據。
授權/隱私開發者透過非獨家授權保留智慧財產權。非企業用戶數據預設用於訓練,可手動關閉;企業用戶數據不被用於訓練。員工數據用於訓練 AI 代理,引發隱私爭議;強調設有保護機制,僅用於模型訓練。
主要模型/工具Gemini 系列模型 (Gemini Code Assist, Gemini CLI, Codey), Vertex AI, Google AI Studio。GitHub Copilot (基於 OpenAI Codex 或其他 LLM)。Code Llama (7B, 13B, 34B 參數版本), Muse Spark。
定價模式支付費用購買原始碼授權;相關開發工具如 Gemini Code Assist 個人版提供免費預覽,企業級服務則按用量計費。免費版、專業版、專業加強版(付費訂閱);企業版(付費訂閱)。Code Llama 可用於研究和商業用途(部分情況需額外申請);MCI 為內部計畫。

🛠️ 技術深入

  • 核心模型: Google 的 AI 程式碼生成與理解能力主要由 Gemini 系列模型驅動,包括 Gemini Pro、Gemini Flash、Gemini Nano,以及專為程式碼設計的 Gemini Code Assist 和 Codey 模型。
  • 模型架構: Gemini 模型是多模態大型語言模型 (LLM),能夠理解和生成文字、程式碼、圖像、音訊和影片等多種內容形式,並在 Google 自主開發的 TPU 晶片上進行訓練。
  • 程式碼能力: 這些模型具備程式碼生成、補全、摘要、偵錯輔助、語義搜尋、自動重構和情境感知漏洞偵測等功能。Gemini 2.0 模型還具備直接在 API 中執行 Python 程式碼的能力,並能從執行結果中學習和修正。
  • 訓練數據來源: 除了此次計畫中向 Google Play 開發者獲取的應用程式原始碼,Google 的 AI 模型也利用廣泛的數據來源進行訓練,包括開源程式碼庫 (如 GitHub)、技術文件、API 文件、程式碼競賽平台 (如 LeetCode) 和論壇問答內容 (如 Stack Overflow)。
  • 訓練方法: Google 採用「人類回饋強化學習」(RLHF) 和「監督式強化學習」(SRL) 等技術,並透過資料篩選與標註流程,旨在減少訓練所需的高忠實度資料量,同時維持模型精度,以優化模型在複雜任務中的表現。
  • 開發平台與工具: 開發者可透過 Vertex AI、Google AI Studio、Gemini CLI 和 Cloud Code 等平台和工具,利用 Gemini 模型進行程式碼開發、原型設計和部署 AI 應用。

🔮 前景展望AI analysis grounded in cited sources

加速 AI 驅動的應用程式開發。
透過獲取更多高品質的應用程式原始碼,Google 的 AI 模型將能更精準地生成、理解和優化程式碼,從而顯著提升開發者的生產力並縮短開發週期。
提升 Google Play 生態系統的 AI 整合度。
該計畫將使 Google 能夠為 Android 開發者提供更先進、更深入整合的 AI 開發工具,可能導致 Google Play 應用程式的品質和創新速度提升。
引發對數據倫理和開發者權益的進一步討論。
儘管 Google 承諾非獨家授權,但大型科技公司大規模獲取第三方原始碼用於 AI 訓練的行為,可能會促使開發者社群和監管機構更關注數據使用透明度、公平報酬和潛在的智慧財產權爭議。

時間線

2023-03-14
Google 推出生成式 AI 功能於 Workspace,並提供 PaLM API 和 MakerSuite 供開發者使用
2023-12-06
Google 推出 Gemini 模型,強調其多模態能力,包括程式碼生成
2025-02-26
Google Cloud 宣布推出免費版 Gemini Code Assist for individuals 公開預覽版
2025-11-25
Google 採取全棧式 AI 策略,從晶片到應用皆自行開發,利用用戶基礎收集高品質回饋數據
2026-04-23
Google 內部新程式碼高達 75% 由 AI 生成,開發效率提升 6 倍
2026-05-20
Google I/O 大會展示多款 Gemini AI 工具,包括個人 AI 代理 Gemini Spark,並推出 Gemini 3.5 Flash
📰

AI 週報

閱讀本週精選 AI 大事摘要 →

👉相關動態

AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: cnBeta (Full RSS)