🏠較早收集於 8m

DeepSeek 釐清 <think> 標籤引發的模型幻覺問題

DeepSeek 釐清 <think> 標籤引發的模型幻覺問題
PostLinkedIn
🏠閱讀原文: IT之家

💡學習如何處理 LLM 中的特殊字元觸發,以防止不可預期的模型幻覺與輸出錯誤。

⚡ 30-Second TL;DR

有什麼變化

「<think>」標籤問題被確認為模型幻覺,而非安全漏洞。

為什麼重要

此事件凸顯了在 LLM 應用中進行輸入清理與穩健提示詞處理的重要性,以防止模型出現不可預期的行為。

下一步行動

為您的 LLM 應用程式實施嚴格的輸入驗證與提示詞注入測試,以過濾掉保留的控制 Token。

誰應關注:Developers & AI Engineers

關鍵要點

  • 「<think>」標籤問題被確認為模型幻覺,而非安全漏洞。
  • 事件過程中未發生任何使用者隱私或資料外洩。
  • DeepSeek 將實施針對性訓練,以更有效地處理特殊字元。
  • 公司強調其對使用者資料安全與體驗的承諾。

🧠 深度解析

Web-grounded analysis with 27 cited sources.

🔑 增強重點摘要

  • DeepSeek 的「」標籤問題具體表現為模型在推理任務中失去上下文連貫性,並任意將「」替換為「final」,這使得模型在處理複雜的程式碼修改請求時變得不可靠。
  • DeepSeek 的模型,特別是 R1 系列,以其強大的推理能力而聞名,在數學、編碼和邏輯基準測試中常超越競爭對手,這使得與推理標籤相關的幻覺問題尤為引人注目。
  • DeepSeek 採用了專家混合 (MoE) 架構和多頭潛在注意力 (MLA) 機制,以顯著降低計算成本,同時實現高效能,使其模型在效率和成本效益方面具有競爭優勢。
  • DeepSeek 公司本身承認,儘管他們透過檢索增強生成 (RAG) 等技術努力減少幻覺,但人工智慧仍處於早期階段,無法保證模型不會產生幻覺,這是一個「不可避免」的問題。
  • DeepSeek 自 2023 年 7 月成立以來,已發布多個模型系列(如 Coder、LLM、V2、V3、R1、V4),其中 R1 模型於 2025 年 1 月發布後在全球引起廣泛關注,因其卓越的性能和成本效益,甚至導致其他人工智慧供應商的股價下跌。
📊 競品分析▸ Show
特性/指標DeepSeek (V3/R1/V4)OpenAI (GPT-4o/o1/o3/GPT-5)Google (Gemini 2.0 Flash/Pro)Anthropic (Claude 3.5 Sonnet/Opus)
核心架構專家混合 (MoE) 變壓器架構變壓器架構 (GPT 系列)變壓器架構,原生多模態理解變壓器架構,專注於安全
總參數量V3: 671B (激活 37B);V4-Pro: 1.6T (激活 49B)GPT-4o: 未公開Gemini Pro: 未公開Claude Opus: 未公開
推理能力R1 在數學、編碼、邏輯方面表現出色,可與 OpenAI o1 媲美或超越o1/o3 系列專注於複雜問題解決擅長多模態推理擅長安全關鍵應用和長上下文準確性
編碼能力DeepSeek Coder 專為編碼任務設計;V4-Pro 在 SWE-bench Verified 達 81%支援程式碼生成和調試支援程式碼理解和生成擅長代理編碼工作流程
成本效益顯著低於競爭對手,R1 比 OpenAI o1 便宜約 30 倍,比 GPT-5 便宜高達 95%成本較高,GPT-5 輸入 $1.25/M tokens,輸出 $10/M tokens成本中等,與 Google 生態系統深度整合成本較高,Claude Opus 輸入 $15/M tokens,輸出 $75/M tokens
開源狀態大部分模型開源 (MIT 許可證),可自行託管專有模型,API 存取專有模型,API 存取專有模型,API 存取
上下文窗口V3/R1: 128K tokens;V4: 1M tokensGPT-4o: 128K tokensGemini 2.0 Pro: 2M tokensClaude: 200K tokens
發布時間V3: 2024年12月;R1: 2025年1月;V4: 2026年4月GPT-4o: 2024年5月Gemini 2.0: 2024年12月Claude 3.5 Sonnet: 2024年6月

🛠️ 技術深入

  • DeepSeek 的核心模型(如 V3 和 V4)採用了專家混合 (MoE) 變壓器架構,這種架構會根據不同的輸入選擇性地激活參數子集,從而顯著降低計算成本。
  • DeepSeek V3 總參數量為 6710 億,每個 token 激活 370 億參數。DeepSeek V4-Pro 總參數量為 1.6 兆,每個 token 激活 490 億參數;DeepSeek-V4-Flash 總參數量為 2840 億,每個 token 激活 130 億參數。
  • 模型整合了多頭潛在注意力 (MLA) 機制,旨在提高訓練和推理過程中的文本處理效率,減少資源消耗。
  • DeepSeek V3 和 R1 模型還採用了 SwiGLU 激活函數、RoPE (旋轉位置嵌入) 和 RMSNorm (均方根歸一化) 等技術。
  • 模型的訓練過程最初不依賴於監督式微調 (SFT),而是透過強化學習 (RL) 進行,隨後再結合冷啟動數據和來自寫作、事實問答等領域的 SFT 數據進行多階段微調。
  • 為了提高效率,DeepSeek 在訓練中使用了 FP8 精度,並為注意力模組後的線性層輸入使用了自定義的 12 位浮點數 (E5M6),優化器狀態則採用 16 位 (BF16)。
  • 針對「」標籤引發的幻覺問題,技術分析指出這可能是一個模型注意力機制或上下文窗口實作上的根本性問題,導致模型在單一回應中失去關鍵上下文。

🔮 前景展望AI analysis grounded in cited sources

DeepSeek 對成本效益和開源模型的持續關注將進一步推動人工智慧領域的價格戰,並提高先進人工智慧技術的可及性。
DeepSeek 的模型比競爭對手顯著便宜,其開源性質允許更廣泛的採用和自行託管,這將迫使其他供應商降低價格以保持競爭力。
解決特殊字元處理和推理模型中的幻覺問題,對於 DeepSeek 在複雜、高風險應用中的可靠性至關重要。
」標籤問題凸顯了推理過程中的漏洞,改進這一點對於編碼、醫療診斷等對準確性要求極高的任務至關重要。
DeepSeek 將可能繼續在模型架構(例如 MoE、混合注意力)方面進行創新,以平衡性能與計算效率。
DeepSeek 的歷史表明,他們一直致力於透過高效設計(如 MoE、MLA、FP8、V4 中的 CSA/HCA)以較低的成本實現競爭性性能。

時間線

2023-07
DeepSeek 公司由梁文峰創立。
2023-11
發布 DeepSeek Coder (首個開源編碼模型) 和 DeepSeek LLM 系列。
2024-05
發布 DeepSeek-V2,因其成本效益在中國廣受歡迎並引發價格戰。
2024-12
發布 DeepSeek-V3,採用專家混合 (MoE) 架構。
2025-01
發布 DeepSeek-R1 推理模型及其聊天機器人應用,在全球引起廣泛關注,並登上應用商店榜首,甚至引發科技股拋售。
2026-04
發布 DeepSeek-V4 系列 (V4-Pro, V4-Flash) 預覽版,支援 1M 上下文窗口和混合注意力機制。
📰

AI 週報

閱讀本週精選 AI 大事摘要 →

👉相關動態

AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: IT之家