🔥36氪•較早收集於 29m
DeepSeek 輸入快取價格砍九成
💡快取價格砍9成,使 DeepSeek 成為成本效益最高的 LLM 擴展首選。
⚡ 30-Second TL;DR
有什麼變化
DeepSeek 全 API 輸入快取價格降至原價1/10
為什麼重要
大幅降低聊天機器人與 RAG 等需重複上下文的 AI 應用成本,提升 DeepSeek 在生產環境的採用率。
下一步行動
使用啟用快取提示測試 DeepSeek-V4-Pro API,以降低 RAG 管線推論成本。
誰應關注:Developers & AI Engineers
關鍵要點
- •DeepSeek 全 API 輸入快取價格降至原價1/10
- •Pro 模型至2026-5-5 享2.5折額外優惠
- •DeepSeek-V4-Pro 快取輸入:0.025元/百萬 Tokens
- •DeepSeek-V4-Flash 快取輸入:0.02元/百萬 Tokens
🧠 深度解析
AI-generated analysis for this event.
🔑 增強重點摘要
- •此次降價策略旨在進一步降低開發者使用長上下文(Long Context)應用時的營運成本,特別是針對需要頻繁調用相同提示詞(Prompt)的場景。
- •DeepSeek 透過優化底層推理引擎的快取管理機制,實現了在維持模型效能的同時,大幅降低記憶體佔用與計算資源消耗。
- •市場分析指出,DeepSeek 此舉意在透過極致的價格競爭力,加速其在企業級 AI 應用市場的滲透率,並對其他提供類似快取功能的雲端模型供應商構成壓力。
📊 競品分析▸ Show
| 特性/模型 | DeepSeek-V4-Pro | OpenAI GPT-4o | Anthropic Claude 3.5 Sonnet |
|---|---|---|---|
| 輸入快取機制 | 支援 (Context Caching) | 支援 (Prompt Caching) | 支援 (Prompt Caching) |
| 價格競爭力 | 極高 (降價後) | 中等 | 中等 |
| 適用場景 | 高頻重複輸入、長文本 | 通用、多模態 | 長文本、程式碼 |
🛠️ 技術深入
- •Context Caching 技術:DeepSeek 利用 KV Cache(Key-Value Cache)持久化技術,將重複的輸入序列預先計算並儲存在記憶體中,避免重複計算。
- •記憶體分層管理:透過動態記憶體分配策略,將熱點數據保留在 GPU 高速記憶體中,冷數據則根據存取頻率進行置換。
- •推理引擎優化:針對 V4 架構進行了算子融合(Operator Fusion),減少了快取讀取時的延遲,提升了 Token 生成的吞吐量。
🔮 前景展望AI analysis grounded in cited sources
AI 模型 API 市場將進入「快取價格戰」階段。
DeepSeek 的大幅降價將迫使其他主流模型供應商跟進調整其快取定價策略,以維持市場競爭力。
長上下文應用開發成本將顯著下降。
快取命中率的提升與價格降低,將使開發者能以更低成本部署基於 RAG(檢索增強生成)的複雜 AI 系統。
⏳ 時間線
2024-01
DeepSeek 發布首個開源模型系列,正式進入大模型競爭領域。
2025-05
DeepSeek 推出 V3 系列模型,並開始引入針對 API 的成本優化方案。
2026-02
DeepSeek 正式發布 V4 系列模型,強化了對長上下文處理與快取技術的支援。
📰
AI 週報
閱讀本週精選 AI 大事摘要 →
👉相關動態
AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: 36氪 ↗

