🔥較早收集於 29m

網易新聞與網易小蜜蜂宣布接入 DeepSeek-V4 模型

PostLinkedIn
🔥閱讀原文: 36氪

💡中國主流媒體採用 DeepSeek-V4,顯示該模型已具備在高流量生產環境中運行的成熟度。

⚡ 30-Second TL;DR

有什麼變化

DeepSeek-V4 接入網易新聞與網易小蜜蜂

為什麼重要

此舉顯示 DeepSeek 模型在中國媒體生態系統中的企業級部署日益增加。這凸顯了業界正轉向使用高效能開源權重模型來實現個性化內容分發。

下一步行動

評估 DeepSeek-V4 的 API 效能,並將其與您現有的內容推薦或生成流程進行對比,以測試其替代專有模型的潛力。

誰應關注:Developers & AI Engineers

關鍵要點

  • DeepSeek-V4 接入網易新聞與網易小蜜蜂
  • 功能涵蓋 AI 輔助內容創作與智慧推薦
  • 即將推出「校園龍蝦養成計畫」,將 AI 融入社交場景

🧠 深度解析

Web-grounded analysis with 38 cited sources.

🔑 增強重點摘要

  • DeepSeek-V4 採用了混合專家 (MoE) 架構,其中旗艦級 V4-Pro 模型擁有 1.6 兆總參數,但在每次推論時僅啟用約 490 億參數,有效平衡了性能與運算效率。
  • DeepSeek-V4 具備 100 萬 token 的超長上下文視窗,使其能夠處理極其龐大的內容,例如完整的程式碼庫或多部小說,這對於複雜的代理任務至關重要。
  • DeepSeek-V4 是一個原生多模態模型,在訓練階段即同時處理文本、圖像、影片和音訊數據,而非將視覺能力作為附加組件。
  • DeepSeek-V4 的 API 定價顯著低於 OpenAI 的 GPT-5.5 和 Anthropic 的 Claude Opus 4.7 等西方領先模型,使其在提供前沿能力的同時,具有極高的成本效益。
  • 網易長期以來奉行「務實 AI」戰略,將 AI 技術廣泛整合到遊戲以外的各個業務領域,包括教育 (網易有道)、音樂和企業服務,並在某些環節實現了高達 300% 的效率提升。
📊 競品分析▸ Show
模型名稱DeepSeek V4 ProDeepSeek V4 FlashOpenAI GPT-5.5 (參考)Anthropic Claude Opus 4.7 (參考)Kimi K2.6 (參考)
總參數 (MoE)1.6 兆 (490 億活躍)2840 億 (130 億活躍)未公開 (估計數兆)未公開 (估計數兆)未公開
上下文視窗100 萬 tokens100 萬 tokens約 100 萬 tokens約 100 萬 tokens未公開 (已知長上下文)
多模態能力原生多模態 (文本、圖像、影片、音訊)原生多模態 (文本、圖像、影片、音訊)文本、圖像 (部分模型)文本、圖像 (部分模型)文本
API 輸入價格 (每百萬 tokens)約 $1.74約 $0.14約 $5.00約 $5.00未公開 (DeepSeek V4 Flash 輸出價格約為其 1/14)
API 輸出價格 (每百萬 tokens)約 $3.48約 $0.28約 $30.00約 $25.00未公開 (DeepSeek V4 Flash 輸出價格約為其 1/14)
SWE-bench Verified80.6% (Pro-Max)79.0%領先模型 (DeepSeek V4 Pro-Max 略低於 Gemini 3.1 Pro)領先模型 (DeepSeek V4 Pro-Max 略低於 Claude Opus 4.6)68/100 (某測試)
LiveCodeBench93.5% (Pro-Max)91.6%未公開未公開未公開
GDPval-AA1554 (領先開源模型)未公開未公開未公開1484

🛠️ 技術深入

  • 模型架構: DeepSeek V4 採用混合專家 (Mixture-of-Experts, MoE) 架構,並保留了 DeepSeekMoE 框架和多 token 預測 (Multi-Token Prediction, MTP) 策略。
  • 參數規模: V4-Pro 版本總參數為 1.6 兆,每次推論時僅啟用約 490 億參數;V4-Flash 版本總參數為 2840 億,每次推論時啟用約 130 億參數。
  • 上下文視窗: 兩個版本均原生支援 100 萬 token 的上下文視窗。
  • 多模態能力: DeepSeek V4 是一個原生多模態模型,在訓練階段即同時處理文本、圖像、影片和音訊數據。
  • 注意力機制: 引入混合注意力架構,結合了壓縮稀疏注意力 (Compressed Sparse Attention, CSA) 和重度壓縮注意力 (Heavily Compressed Attention, HCA),以顯著提升長上下文處理效率。
  • 記憶體架構: 採用 Engram 條件記憶體,旨在高效檢索百萬級 token 上下文中的資訊,避免計算成本爆炸。
  • 推理效率: 在 100 萬 token 上下文下,V4-Pro 僅需 DeepSeek-V3.2 27% 的單 token 推理 FLOPs 和 10% 的 KV 快取記憶體;V4-Flash 更進一步,僅需 10% 的 FLOPs 和 7% 的 KV 快取。
  • 推理模式: 支援三種推理模式:「非思考 (Non-think)」、「高思考 (Think High)」和「最大思考 (Think Max)」,允許用戶根據任務需求平衡延遲和性能。
  • 工具調用: 引入 DSML 特殊 token 和基於 XML 的工具調用格式,並在工具調用時保留推理內容,以支援複雜且長期的代理工作流程。
  • 訓練數據: DeepSeek V4 的兩個模型均在超過 32 兆 tokens 的大規模多樣化數據集上進行訓練。

🔮 前景展望AI analysis grounded in cited sources

網易新聞與網易小蜜蜂的內容生成與推薦將達到業界領先水平。
DeepSeek-V4 具備 100 萬 token 的超長上下文視窗和原生多模態能力,能深度理解複雜新聞內容並進行精準個性化推薦及輔助創作。
DeepSeek-V4 的成本效益將加速中國市場大型模型應用的普及。
DeepSeek-V4 的 API 定價遠低於西方同級模型,結合其開放權重策略,將降低企業導入先進 AI 的門檻。
網易將進一步鞏固其在「AI+內容」領域的競爭優勢。
透過整合 DeepSeek-V4 的先進能力,網易能夠在新聞、社交及其他內容產品中提供更智慧、更具互動性的用戶體驗,符合其「務實 AI」的長期戰略。

時間線

2016-02
高飛 (High-Flyer) 成立,由梁文峰共同創立,專注於 AI 驅動的量化交易。
2023-07
DeepSeek AI 公司成立,由梁文峰創立。
2024-05
DeepSeek-V2 發布,引入混合專家 (MoE) 架構,在中國市場廣受歡迎並引發價格戰。
2024-12
DeepSeek-V3 發布,性能大幅提升,總參數 6850 億,活躍參數 370 億。
2025-01
DeepSeek-R1 推理模型及其聊天機器人應用發布,成為 Apple App Store 下載量第一,並引發美國科技股下跌。
2026-04-24
DeepSeek-V4-Pro 和 DeepSeek-V4-Flash 模型正式發布,提供 100 萬 token 上下文視窗和原生多模態能力。
📰

AI 週報

閱讀本週精選 AI 大事摘要 →

👉相關動態

AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: 36氪