🇨🇳cnBeta (Full RSS)•較早收集於 6m
Google 計畫付費購買應用程式原始碼以訓練 AI 模型

💡Google 正付費購買專有應用程式碼以訓練更強的程式碼模型;這是開發者的新變現途徑。
⚡ 30-Second TL;DR
有什麼變化
Google 計畫向開發者授權應用程式原始碼
為什麼重要
此舉可能為開發者創造新的收入來源,同時顯著提升程式碼生成模型的品質。這凸顯了業界正轉向獲取高品質、人類編寫的專有程式碼進行訓練。
下一步行動
審視您的應用程式碼庫與服務條款,為未來與大型 AI 實驗室進行數據授權的潛在機會做好準備。
誰應關注:Developers & AI Engineers
關鍵要點
- •Google 計畫向開發者授權應用程式原始碼
- •數據將用於改進 AI 驅動的開發工具
- •開發者透過非獨家授權保留智慧財產權
🧠 深度解析
Web-grounded analysis with 28 cited sources.
🔑 增強重點摘要
- •Google 的這項計畫旨在從 Google Play 開發者獲取高品質且多樣化的應用程式原始碼,以補充其現有來自開源儲存庫和內部程式碼庫的訓練數據來源。
- •所獲取的程式碼將主要用於強化 Google 的 Gemini 系列模型,特別是專注於程式碼生成與理解的工具,例如 Gemini Code Assist 和 Gemini CLI,這些工具已整合至 Vertex AI 和 Google AI Studio 等開發者平台。
- •此舉符合 Google 發展「AI 代理」的廣泛戰略,旨在透過 AI 大幅自動化開發工作流程並提升工程效率;Google 內部數據顯示,高達 75% 的新程式碼已由 AI 生成,並將開發效率提升了 6 倍。
- •透過確保多樣化且高品質的數據集,Google 期望在 AI 程式碼生成領域保持競爭優勢,減少模型「幻覺」並提升 AI 在程式碼推理方面的精準度。
📊 競品分析▸ Show
| 功能/方面 | Google (此計畫) | Microsoft/GitHub Copilot | Meta (Code Llama/MCI) |
|---|---|---|---|
| 主要目標 | 獲取 Google Play 應用程式原始碼,訓練 AI 模型以改進開發工具。 | 透過用戶互動數據(提示、生成程式碼、上下文)訓練 AI 模型,提供程式碼生成、補全、審查。 | 釋出 Code Llama 模型,並透過內部「Model Capability Initiative」(MCI) 追蹤員工電腦使用行為(滑鼠、點擊、鍵盤輸入)以訓練 AI 代理。 |
| 數據來源 | Google Play 開發者授權的應用程式原始碼;結合開源程式碼庫、技術文件、內部程式碼等。 | 免費版、專業版、專業加強版用戶的互動數據(預設啟用,可選擇退出);企業版和企業加強版用戶數據不受影響。 | Llama 2 程式碼庫;員工在數百個網站和應用程式上的電腦操作行為數據。 |
| 授權/隱私 | 開發者透過非獨家授權保留智慧財產權。 | 非企業用戶數據預設用於訓練,可手動關閉;企業用戶數據不被用於訓練。 | 員工數據用於訓練 AI 代理,引發隱私爭議;強調設有保護機制,僅用於模型訓練。 |
| 主要模型/工具 | Gemini 系列模型 (Gemini Code Assist, Gemini CLI, Codey), Vertex AI, Google AI Studio。 | GitHub Copilot (基於 OpenAI Codex 或其他 LLM)。 | Code Llama (7B, 13B, 34B 參數版本), Muse Spark。 |
| 定價模式 | 支付費用購買原始碼授權;相關開發工具如 Gemini Code Assist 個人版提供免費預覽,企業級服務則按用量計費。 | 免費版、專業版、專業加強版(付費訂閱);企業版(付費訂閱)。 | Code Llama 可用於研究和商業用途(部分情況需額外申請);MCI 為內部計畫。 |
🛠️ 技術深入
- 核心模型: Google 的 AI 程式碼生成與理解能力主要由 Gemini 系列模型驅動,包括 Gemini Pro、Gemini Flash、Gemini Nano,以及專為程式碼設計的 Gemini Code Assist 和 Codey 模型。
- 模型架構: Gemini 模型是多模態大型語言模型 (LLM),能夠理解和生成文字、程式碼、圖像、音訊和影片等多種內容形式,並在 Google 自主開發的 TPU 晶片上進行訓練。
- 程式碼能力: 這些模型具備程式碼生成、補全、摘要、偵錯輔助、語義搜尋、自動重構和情境感知漏洞偵測等功能。Gemini 2.0 模型還具備直接在 API 中執行 Python 程式碼的能力,並能從執行結果中學習和修正。
- 訓練數據來源: 除了此次計畫中向 Google Play 開發者獲取的應用程式原始碼,Google 的 AI 模型也利用廣泛的數據來源進行訓練,包括開源程式碼庫 (如 GitHub)、技術文件、API 文件、程式碼競賽平台 (如 LeetCode) 和論壇問答內容 (如 Stack Overflow)。
- 訓練方法: Google 採用「人類回饋強化學習」(RLHF) 和「監督式強化學習」(SRL) 等技術,並透過資料篩選與標註流程,旨在減少訓練所需的高忠實度資料量,同時維持模型精度,以優化模型在複雜任務中的表現。
- 開發平台與工具: 開發者可透過 Vertex AI、Google AI Studio、Gemini CLI 和 Cloud Code 等平台和工具,利用 Gemini 模型進行程式碼開發、原型設計和部署 AI 應用。
🔮 前景展望AI analysis grounded in cited sources
加速 AI 驅動的應用程式開發。
透過獲取更多高品質的應用程式原始碼,Google 的 AI 模型將能更精準地生成、理解和優化程式碼,從而顯著提升開發者的生產力並縮短開發週期。
提升 Google Play 生態系統的 AI 整合度。
該計畫將使 Google 能夠為 Android 開發者提供更先進、更深入整合的 AI 開發工具,可能導致 Google Play 應用程式的品質和創新速度提升。
引發對數據倫理和開發者權益的進一步討論。
儘管 Google 承諾非獨家授權,但大型科技公司大規模獲取第三方原始碼用於 AI 訓練的行為,可能會促使開發者社群和監管機構更關注數據使用透明度、公平報酬和潛在的智慧財產權爭議。
⏳ 時間線
2023-03-14
Google 推出生成式 AI 功能於 Workspace,並提供 PaLM API 和 MakerSuite 供開發者使用
2023-12-06
Google 推出 Gemini 模型,強調其多模態能力,包括程式碼生成
2025-02-26
Google Cloud 宣布推出免費版 Gemini Code Assist for individuals 公開預覽版
2025-11-25
Google 採取全棧式 AI 策略,從晶片到應用皆自行開發,利用用戶基礎收集高品質回饋數據
2026-04-23
Google 內部新程式碼高達 75% 由 AI 生成,開發效率提升 6 倍
2026-05-20
Google I/O 大會展示多款 Gemini AI 工具,包括個人 AI 代理 Gemini Spark,並推出 Gemini 3.5 Flash
📎 來源 (28)
Factual claims are grounded in the sources below. Forward-looking analysis is AI-generated interpretation.
- mickhuang.com
- google.com
- skills.google
- blog.google
- google.com
- google.com
- google.dev
- techbang.com
- bnext.com.tw
- ettoday.net
- line.me
- technews.tw
- more-news.tw
- sunmedia.tw
- newmobilelife.com
- appinn.com
- udn.com
- cnyes.com
- inside.com.tw
- awoo.ai
- infuseai.io
- koc.com.tw
- knowmad.tw
- google.com
- android.com
- blog.google
- managertoday.com.tw
- udn.com
📰
AI 週報
閱讀本週精選 AI 大事摘要 →
👉相關動態
AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: cnBeta (Full RSS) ↗

