🇭🇰SCMP Technology•較早收集於 1m
DeepSeek 聊天機器人新增視覺功能

💡DeepSeek 聊天機器人新增視覺,V4 降價後—測試更廉價 GPT-4o 多模態競爭者。(48字)
⚡ 30-Second TL;DR
有什麼變化
DeepSeek 旗艦聊天機器人新增圖像與影片處理
為什麼重要
DeepSeek 視覺升級提升多模態應用吸引力,可能加速成本敏感市場採用,於中美 AI 競爭中。開發者獲更廉價 GPT-4o 類視覺替代方案。
下一步行動
透過 DeepSeek 平台申請多模態測試版存取,將視覺整合進原型。
誰應關注:Developers & AI Engineers
關鍵要點
- •DeepSeek 旗艦聊天機器人新增圖像與影片處理
- •首次多模態更新與全球競爭對手看齊
- •限量發布繼 V4 推出與降價之後
- •多模態團隊領導陳曉康宣布
🧠 深度解析
本篇為 AI 生成分析,非原文內容。
🔑 增強重點摘要
- •DeepSeek 的多模態功能採用了原生視覺編碼器架構,旨在減少對外部 OCR 工具的依賴,提升對複雜圖表與手寫文字的理解能力。
- •此次更新整合了 DeepSeek 自研的視覺-語言對齊技術,顯著降低了多模態推理的延遲,並優化了在低頻寬環境下的圖像處理效率。
- •該功能目前優先開放給 API 開發者與企業級用戶進行封閉測試,預計將透過 DeepSeek 的開源策略,推動中國國產多模態模型的生態建設。
📊 競品分析▸ Show
| 特性/模型 | DeepSeek (V4 多模態) | OpenAI (GPT-4o) | Anthropic (Claude 3.5 Sonnet) |
|---|---|---|---|
| 視覺處理 | 原生多模態 | 原生多模態 | 原生多模態 |
| 價格策略 | 極具競爭力的低價/開源導向 | 標準 API 定價 | 標準 API 定價 |
| 核心優勢 | 高性價比、開源生態 | 生態系統完整、多模態能力強 | 程式碼理解與邏輯推理能力 |
🛠️ 技術深入
- 採用了基於 Transformer 的視覺編碼器(Vision Encoder),支援動態解析度輸入,以適應不同比例的圖像與影片幀。
- 實作了高效的視覺-語言投影層(Projection Layer),將視覺特徵空間映射至語言模型的隱藏層空間,實現跨模態對齊。
- 針對影片處理,採用了關鍵幀採樣與時序特徵融合技術,在保持推理速度的同時捕捉影片中的動態資訊。
🔮 前景展望AI analysis grounded in cited sources
DeepSeek 將進一步壓縮多模態模型的推理成本。
基於其過往在 V4 模型中展現的成本控制策略,預計其多模態 API 定價將持續對市場造成價格壓力。
DeepSeek 將加速中國國產多模態模型的開源進程。
DeepSeek 傾向於透過開源模型權重來建立開發者社群,這將迫使其他中國 AI 廠商跟進開源策略以爭奪開發者資源。
⏳ 時間線
2024-01
DeepSeek 發布首個開源大語言模型系列。
2025-05
DeepSeek V3 模型發布,顯著提升推理效能。
2026-02
DeepSeek V4 模型發布並實施大幅降價策略。
2026-04
DeepSeek 宣布為旗艦聊天機器人新增視覺與影片處理功能。
📰
AI 週報
閱讀本週精選 AI 大事摘要 →
👉相關動態
AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: SCMP Technology ↗
每週 AI 簡報
每週一封,可隨時退訂。