⚛️量子位•較早收集於 14m
DeepSeek Code 即將發布,由 ACM 金牌大神崔添翼領軍

💡DeepSeek 憑藉頂尖人才與巨額資金進軍程式設計領域,將對現有的 AI 程式輔助工具構成強大威脅。
⚡ 30-Second TL;DR
有什麼變化
DeepSeek Code 模型已正式進入開發階段,即將發布。
為什麼重要
這支資金雄厚且由專家領導的團隊進入程式設計模型領域,可能會對 GitHub Copilot 和 Cursor 等現有市場領導者構成重大挑戰。
下一步行動
請密切關注 DeepSeek 的 GitHub 儲存庫與官方網站,以獲取即將發布的模型權重與 API 文件。
誰應關注:Developers & AI Engineers
關鍵要點
- •DeepSeek Code 模型已正式進入開發階段,即將發布。
- •項目由 ACM 金牌得主崔添翼擔任負責人。
- •公司獲得 700 億融資,將加速 AI 研發進程。
🧠 深度解析
Web-grounded analysis with 27 cited sources.
🔑 增強重點摘要
- •DeepSeek由量化對沖基金幻方量化創辦人梁文鋒於2023年7月創立,總部位於浙江杭州。
- •DeepSeek採行開源策略,其核心模型可免費下載、修改及商用,此舉獲得Meta首席AI科學家楊立昆的讚揚。
- •公司近期完成一輪融資,據報導規模高達人民幣500億元(約73.5億美元),創辦人梁文鋒個人出資約40%以維持控制權,並可能由中國國家集成電路產業投資基金領投。
- •DeepSeek正積極組建「Harness」團隊,在北京開發一款桌面端編程智能體產品,旨在直接與Anthropic的Claude Code競爭。
- •DeepSeek的模型,包括最新的DeepSeek V4,採用了混合專家模型(MoE)、多頭潛注意力(MLA)、流形約束超連接(mHC)及Engram條件記憶架構等創新技術,以提升效率、降低成本並處理百萬級Token的長上下文。
📊 競品分析▸ Show
| 特性/模型 | DeepSeek Code/V4 | Anthropic Claude Code | OpenAI GPT系列 (如GPT-4o, Codex) |
|---|---|---|---|
| 主要功能 | 代碼生成、項目級代碼補全、代碼填充、原生多模態(V4)、編程智能體(Harness團隊開發中) | 專用編程智能體、代碼生成 | 通用大型語言模型,具備強大代碼生成能力 (Codex為專用代碼模型),多模態 (GPT-4o) |
| 上下文長度 | DeepSeek Coder: 16K tokens;DeepSeek-Coder V2: 128K tokens;DeepSeek V4: 高達1M tokens | 長上下文處理能力,但具體數值未詳述,DeepSeek-TUI因長上下文受歡迎 | GPT-4o: 128K tokens |
| 開源狀態 | DeepSeek Coder: 開源且免費供研究和商業使用;DeepSeek V4: 預覽版已開源 | 閉源 | 閉源 |
| 定價 | DeepSeek V4 Flash: 每1M tokens 0.14美元;DeepSeek模型普遍以低成本著稱 | 據稱價格較高,DeepSeek-TUI的吸引力之一是成本較低 | API定價,通常高於DeepSeek的開源產品 |
| 基準測試表現 | DeepSeek-Coder-Base-33B在HumanEval Python、多語言、MBPP、DS-1000上優於CodeLlama-34B;DeepSeek-Coder-Instruct-33B在HumanEval上優於GPT-3.5-turbo;DeepSeek V4在內部基準測試中聲稱超越Claude和GPT系列,尤其在長代碼提示和SWE-bench Verified上表現突出 | DeepSeek V4旨在超越Claude | DeepSeek V4旨在超越GPT系列 |
| 技術亮點 | MoE、MLA、mHC、Engram條件記憶架構 | 專有模型架構 | Transformer架構,多模態能力 (GPT-4o) |
🛠️ 技術深入
- 模型架構: DeepSeek模型採用混合專家模型(MoE)和多頭潛注意力(MLA)技術,以提高效率和性能。
- DeepSeek V4創新: 引入流形約束超連接(mHC)和Engram條件記憶架構。mHC旨在改善深度網絡中的邏輯推理能力和穩定性,消除長上下文生成中的「邏輯幻覺」。Engram則將靜態記憶卸載到可擴展的查找系統,大幅降低GPU顯存佔用,推理成本最高可降90%。
- 訓練數據: DeepSeek Coder模型在2萬億個tokens上從頭開始訓練,其中包含87%的代碼和13%的自然語言(中英文),涵蓋80多種編程語言。DeepSeek-Coder V2在此基礎上額外預訓練了6萬億個tokens。
- 上下文窗口: DeepSeek Coder支持16K的上下文窗口。DeepSeek-Coder V2擴展至128K tokens。DeepSeek V4則支持高達1M tokens的上下文長度,能夠處理超長文檔和複雜的項目級代碼。
- 多模態能力: DeepSeek V4是一款原生多模態大型語言模型,支持文本、圖像、音頻和視頻等多種輸入形式。
🔮 前景展望AI analysis grounded in cited sources
DeepSeek將加速AI編程工具的普及與競爭。
其開源策略、成本效益高的模型以及對標Claude Code的專用編程智能體開發,將降低開發者使用AI編程工具的門檻,並激化市場競爭。
中國AI產業將在基礎模型和應用層面實現更高程度的自主可控。
DeepSeek與國產芯片廠商的優先合作策略,以及國家級資本的投入,旨在構建「中國芯片+中國模型」的軟硬件協同生態。
AI模型訓練和推理的成本效益將成為行業關鍵競爭力。
DeepSeek通過MoE、MLA、mHC和Engram等創新架構顯著降低了模型訓練和推理成本,挑戰了傳統上對龐大算力資源的依賴。
⏳ 時間線
2013
崔添翼從浙江大學計算機學院畢業,並加入Jane Street Capital香港分公司擔任Assistant Quantitative Researcher。
2023-07-17
杭州深度求索人工智能基礎技術研究有限公司(DeepSeek)成立。
2023-11-02
DeepSeek發布首個代碼模型DeepSeek Coder。
2024-12-26
DeepSeek發布DeepSeek-V3模型,引入MoE等技術。
2026-04-24
DeepSeek-V4預覽版正式上線並開源,具備百萬級上下文和多模態能力。
2026-05-20
DeepSeek宣布在北京組建「Harness」團隊,開發對標Claude Code的編程智能體產品。
📎 來源 (27)
Factual claims are grounded in the sources below. Forward-looking analysis is AI-generated interpretation.
📰
AI 週報
閱讀本週精選 AI 大事摘要 →
👉相關動態
AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: 量子位 ↗