🔥較早收集於 29m

DeepSeek 輸入快取價格砍九成

DeepSeek 輸入快取價格砍九成
PostLinkedIn
🔥閱讀原文: 36氪

💡快取價格砍9成,使 DeepSeek 成為成本效益最高的 LLM 擴展首選。

⚡ 30-Second TL;DR

有什麼變化

DeepSeek 全 API 輸入快取價格降至原價1/10

為什麼重要

大幅降低聊天機器人與 RAG 等需重複上下文的 AI 應用成本,提升 DeepSeek 在生產環境的採用率。

下一步行動

使用啟用快取提示測試 DeepSeek-V4-Pro API,以降低 RAG 管線推論成本。

誰應關注:Developers & AI Engineers

關鍵要點

  • DeepSeek 全 API 輸入快取價格降至原價1/10
  • Pro 模型至2026-5-5 享2.5折額外優惠
  • DeepSeek-V4-Pro 快取輸入:0.025元/百萬 Tokens
  • DeepSeek-V4-Flash 快取輸入:0.02元/百萬 Tokens

🧠 深度解析

AI-generated analysis for this event.

🔑 增強重點摘要

  • 此次降價策略旨在進一步降低開發者使用長上下文(Long Context)應用時的營運成本,特別是針對需要頻繁調用相同提示詞(Prompt)的場景。
  • DeepSeek 透過優化底層推理引擎的快取管理機制,實現了在維持模型效能的同時,大幅降低記憶體佔用與計算資源消耗。
  • 市場分析指出,DeepSeek 此舉意在透過極致的價格競爭力,加速其在企業級 AI 應用市場的滲透率,並對其他提供類似快取功能的雲端模型供應商構成壓力。
📊 競品分析▸ Show
特性/模型DeepSeek-V4-ProOpenAI GPT-4oAnthropic Claude 3.5 Sonnet
輸入快取機制支援 (Context Caching)支援 (Prompt Caching)支援 (Prompt Caching)
價格競爭力極高 (降價後)中等中等
適用場景高頻重複輸入、長文本通用、多模態長文本、程式碼

🛠️ 技術深入

  • Context Caching 技術:DeepSeek 利用 KV Cache(Key-Value Cache)持久化技術,將重複的輸入序列預先計算並儲存在記憶體中,避免重複計算。
  • 記憶體分層管理:透過動態記憶體分配策略,將熱點數據保留在 GPU 高速記憶體中,冷數據則根據存取頻率進行置換。
  • 推理引擎優化:針對 V4 架構進行了算子融合(Operator Fusion),減少了快取讀取時的延遲,提升了 Token 生成的吞吐量。

🔮 前景展望AI analysis grounded in cited sources

AI 模型 API 市場將進入「快取價格戰」階段。
DeepSeek 的大幅降價將迫使其他主流模型供應商跟進調整其快取定價策略,以維持市場競爭力。
長上下文應用開發成本將顯著下降。
快取命中率的提升與價格降低,將使開發者能以更低成本部署基於 RAG(檢索增強生成)的複雜 AI 系統。

時間線

2024-01
DeepSeek 發布首個開源模型系列,正式進入大模型競爭領域。
2025-05
DeepSeek 推出 V3 系列模型,並開始引入針對 API 的成本優化方案。
2026-02
DeepSeek 正式發布 V4 系列模型,強化了對長上下文處理與快取技術的支援。
📰

AI 週報

閱讀本週精選 AI 大事摘要 →

👉相關動態

AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: 36氪