🐯較早收集於 23m

大模型消極怠工實測

大模型消極怠工實測
PostLinkedIn
🐯閱讀原文: 虎嗅
#llm-benchmarks#user-complaints#prompt-engineeringdoubaodeepseekdoubaoyuanbaoqianwenwenxin-yiyan

💡真實測試揭大模型偷懶—立即優化你的提示詞(18字)

⚡ 30-Second TL;DR

有什麼變化

Doubao初僅生成10張消費者權益海報中的2張,需催促續做。

為什麼重要

揭免費大模型體驗缺口,供應商須平衡成本與深度;用戶需優化提示。

下一步行動

用10張海報生成與福布斯分類任務基準測試大模型懶惰度。

誰應關注:Developers & AI Engineers

關鍵要點

  • Doubao初僅生成10張消費者權益海報中的2張,需催促續做。
  • Doubao依大洲/國家分類福布斯富豪榜表現最佳。
  • DeepSeek、千問提供部分油價數據;元寶有事實錯誤。
  • 模型自認或迴避『最懶』排名;Doubao最承認。

🧠 深度解析

背景與延伸:來自公開資料,非原文內容。引用 9 個來源。

🔑 增強重點摘要

  • Doubao每日處理超過50萬億tokens,超越Google的43.3萬億tokens,位居全球前三大AI基礎設施運營商。[1]
  • Doubao 2.0 Pro在多項基準測試中領先GPT-5.2,如AIME 2025得分98.3%及GPQA Diamond 88.9%,並在IMO及ICPC獲金牌。[3][5]
  • Doubao擁有1.55億週活躍用戶,遠超DeepSeek的8160萬,並推出海外版Dola達1000萬日活躍用戶。[4]
📊 競品分析▸ Show
模型關鍵基準 (GPQA Diamond)定價優勢用戶規模 (週活躍)
Doubao 2.0 Pro88.9% [3][5]90%低於西方對手 [4]1.55億 [4]
GPT-5.2~93% (AIME較低) [3]高成本 [4]未指定
DeepSeek未指定高於Doubao [4]8160萬 [4]
Claude Opus 4.5SWE-Bench 80.9% [3]未指定未指定

🛠️ 技術深入

  • Doubao Seed-Code支援文字與圖像輸入,輸出文字,上下文窗口達256k tokens,在Intelligence Index得分34,高於平均13。[2]
  • 端到端語音模型實現接近人類的情感語音與即時中斷能力,超越Siri等傳統級聯方法。[1]
  • 儘管使用10倍tokens (78M vs 7.2M),Doubao在相同成本下智商分數高55%,展現優異性能-美元比。[1]
  • Seed 2.0專為長鏈邏輯與高階推理優化,在代理任務如BrowseComp得分77.3及VideoMME 89.5。[5]

🔮 前景展望AI analysis grounded in cited sources

Doubao定價優勢將加速中國AI代理應用企業化部署
以10%成本提供與GPT-5.2匹敵性能,使高量多步驟任務經濟可行,推動自動化勞動規模化。[4][5]
西方模型將面臨中國競爭壓力,提升迭代速度
Doubao在基準與成本領先,迫使OpenAI與Google等加速代理架構與價格優化。[1][3]

時間線

2025-10
Doubao月活躍用戶達1.7億
2025-12
每日處理50萬億tokens,海外版Dola達1000萬日活躍用戶
2026-02-14
Seed 2.0家族正式發布,驅動Doubao應用
📰

AI 週報

閱讀本週精選 AI 大事摘要 →

👉相關動態

AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: 虎嗅

這是摘要,不是原文。去看原站,或訂閱每週簡報。

每週 AI 簡報

每週一封,可隨時退訂。