💰最新收集於 20m

天下沒有免費的 DeepSeek

天下沒有免費的 DeepSeek
PostLinkedIn
💰閱讀原文: 钛媒体
#inference-cost#ai-economics#model-hostingdeepseekdeepseek

💡提醒你檢視所謂免費 AI 模型背後的總體成本。

⚡ 30-Second TL;DR

有什麼變化

標題挑戰了 DeepSeek 使用完全免費的看法。

為什麼重要

如果文章揭示了重要的運營或基礎設施成本,AI 建構者可能需要重新評估低成本模型的整體擁有成本。不過,僅憑目前節錄,仍不足以判斷 DeepSeek 的實際經濟模式。

下一步行動

在將 DeepSeek 用於正式環境前,請計算推論、託管、監控與資料治理成本,不要只比較 API 價格。

誰應關注:Developers & AI Engineers

關鍵要點

  • 標題挑戰了 DeepSeek 使用完全免費的看法。
  • 文章將討論焦點指向 AI 使用、運營或分發中的隱性成本。
  • 現有節錄未說明具體涉及哪些成本或定價機制。

🧠 深度解析

背景與延伸:來自公開資料,非原文內容。引用 29 個來源。

🔑 增強重點摘要

  • DeepSeek 的模型雖然常以 MIT 許可證等開源軟體許可證發布,但其訓練資料並未開放許可,這澄清了其「免費」性質的界限。
  • DeepSeek 近期大幅調漲了其 API 價格,旗艦模型 DeepSeek V4-Pro 在高峰時段的輸出 token 價格上漲了 350%,而快取命中輸入價格更是飆升了 1100%。
  • 為應對算力壓力,DeepSeek 也對其聊天機器人實施了使用限制,例如限制重新生成回應的次數,這對用戶而言是另一種形式的「成本」或限制。
  • DeepSeek 的商業模式包括透過其模型的雲端 API 服務產生收入,據報導其年化經常性收入已達到 4 億至 5 億美元。
  • DeepSeek 聲稱其模型訓練成本顯著低於競爭對手(例如 DeepSeek V3 訓練成本約 600 萬美元,而 GPT-4 估計為 1 億美元),並且使用較少的運算能力,這有助於其提供具競爭力的定價。
📊 競品分析▸ Show
模型/特點DeepSeek-V4 Pro (2026)DeepSeek-V4 Flash (2026)DeepSeek-V2.5 (2024)OpenAI GPT-5.3 Codex (2026)OpenAI GPT-4 Turbo (2024)Anthropic Claude Fable 5 (2026)Moonshot AI Kimi K3 (2026)
模型類型開放權重 (MoE)開放權重 (MoE)開放權重 (MoE)閉源閉源閉源閉源
總參數量1.6 兆 (約 490 億活躍)未詳2360 億 (約 210 億活躍)未詳未詳未詳未詳
上下文視窗1M token未詳131,072 token400,000 token未詳未詳未詳
多模態文本+圖像+視頻 (V4)文本+圖像+視頻 (V4)支援多模態輸入未詳未詳未詳
輸入價格 (每百萬 token)高峰時段 9.0 元人民幣 (未快取)高峰時段 3.0 元人民幣 (未快取)$0.14$1.75$72 (DeepSeek-V2 比較)未詳未詳
輸出價格 (每百萬 token)高峰時段 27.0 元人民幣高峰時段 9.0 元人民幣$0.28$14.00$217 (DeepSeek-V2 比較)未詳未詳
單次任務成本未詳約 3 美分未詳未詳未詳$3.15$0.86
基準表現 (部分)強大推理與程式設計未詳GSM8k: 95.1%, MT-Bench: 90.2%, HumanEval: 89.0% (V2.5)SWE-Lancer: 81.4%, Cybersecurity CTFs: 77.6%MT-Bench: 9.32 (V4 Turbo)未詳未詳

🛠️ 技術深入

  • DeepSeek-V2 採用了「多頭潛在注意力 (Multi-head Latent Attention, MLA)」機制和「DeepSeek 混合專家 (Mixture-of-Experts, MoE)」架構。MLA 透過低秩鍵值聯合壓縮減少了鍵值快取,顯著提升了推論速度和效率。
  • DeepSeek MoE 相較傳統 MoE,專家劃分更細緻且更專業化,並結合了共享專家和路由專家兩種模式。
  • DeepSeek-V3 採用 MoE 架構,總參數達 6710 億,每個 token 處理時僅激活 370 億參數,並引入了 DeepSeek 稀疏注意力 (DSA) 機制、可擴展的強化學習框架以及大規模代理任務合成管道。
  • DeepSeek-V4 Pro 是一款萬億參數級 MoE 模型,總參數 1.6 兆,每個 token 約激活 490 億參數,支援 1M token 上下文視窗。
  • DeepSeek-V4 引入了三項關鍵架構創新:流形約束超連接 (Manifold-constrained Hyper-Connections, mHC)、Engram 條件記憶系統,以及升級的分層稀疏注意力機制,以處理超長上下文並提升效率。
  • DeepSeek-Coder-V2 支援超過 300 種程式語言,並具備 128,000 token 的上下文長度,適用於大規模程式碼庫分析。
  • DeepSeek 的模型訓練資料規模龐大,例如 DeepSeek-R1 在 2 兆 token 上訓練,DeepSeek-V2 在 8.1 兆 token 上訓練,DeepSeek-V3 更是在 14.8 兆 token 的資料集上進行訓練。

🔮 前景展望AI analysis grounded in cited sources

DeepSeek 的開放權重策略和成本效益將持續加劇 AI 市場的價格競爭。
DeepSeek 過去的低價 API 和開源模型已促使競爭對手降價,即使近期有所調漲,其仍強調成本效率,預示著市場將持續面臨價格壓力。
先進 AI 模型不斷增長的營運成本將導致更普遍的付費 AI 服務和分級存取模式。
DeepSeek 近期因硬體成本上升和算力壓力而調漲 API 價格並實施使用限制,表明即使是強調成本效益的模型也難以無限期維持完全免費或極低價服務,將推動用戶轉向付費方案。
DeepSeek 將繼續專注於優化模型效率和發展專業化能力,以維持其對抗大型競爭對手的競爭優勢。
DeepSeek 的成功歸因於其創新的 MoE 和 MLA 架構,這些技術降低了訓練和推論成本,以及其開發 DeepSeek-Coder 和 DeepSeek-Math 等專業模型,使其在資源相對有限的情況下仍能有效競爭。

時間線

2023-07
杭州深度求索人工智能基礎技術研究有限公司 (DeepSeek) 成立,由幻方量化旗下 AGI 實驗室分拆而來。
2023-11
DeepSeek Coder 程式碼大模型開源發布。
2024-05
DeepSeek-V2 聊天機器人模型發布,在中國市場廣受歡迎並引發了中國競爭對手之間的價格戰。
2025-01
DeepSeek-R1 推理模型及其同名聊天應用程式推出,於 2025 年 1 月 27 日成為美國 Apple App Store 下載量最高的應用程式。
2026-06
DeepSeek 完成首輪外部融資,籌集超過 74 億美元,公司估值超過 500 億美元。
2026-08
DeepSeek API 針對其旗艦模型 DeepSeek V4-Pro 實施了顯著的價格調漲。
📰

AI 週報

閱讀本週精選 AI 大事摘要 →

👉相關動態

AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: 钛媒体

這是摘要,不是原文。去看原站,或訂閱每週簡報。

每週 AI 簡報

每週一封,可隨時退訂。