💰钛媒体•最新收集於 25m
Tencent 重整多模態 AI 策略

💡Tencent 的策略轉向揭示下一個戰場:能理解上下文並採取行動的 AI。
⚡ 30-Second TL;DR
有什麼變化
Tencent 正將多模態重點從內容生成轉向上下文理解。
為什麼重要
轉向具備上下文感知與行動能力的多模態系統,可能影響 Tencent 的模型訓練、產品優先順序與機器人投資。對實務工作者而言,這表示多模態競爭可能不再只聚焦於圖像或影片生成,而會更重視與現實世界連結的行動能力。
下一步行動
建立一個將視覺與文字上下文轉換為工具呼叫的多模態代理,並將行動成功率與生成品質分開評估。
誰應關注:Founders & Product Leaders
關鍵要點
- •Tencent 正將多模態重點從內容生成轉向上下文理解。
- •新方向強調能在物理世界中採取行動的 AI 系統。
- •報導形容這項策略更靠近梁文鋒,並遠離 Fei-Fei Li 的路線。
🧠 深度解析
AI-generated analysis for this event.
🔑 增強重點摘要
- •Tencent 此次戰略調整與其內部「混元」大模型(Hunyuan)的演進路徑高度相關,旨在解決通用模型在複雜任務規劃中的長鏈條推理瓶頸。
- •該轉向反映了騰訊在工業機器人與自動化領域的佈局,試圖將 AI 能力從單純的數位內容生產(AIGC)延伸至實體經濟的自動化控制。
- •梁文鋒(原雲天勵飛創始人)的技術哲學強調「推理與執行」的閉環,騰訊正透過整合其技術架構,強化 AI 在邊緣計算設備上的即時決策能力。
- •與 Fei-Fei Li 倡導的「空間智慧」(Spatial Intelligence)強調視覺感知與物理世界模擬不同,騰訊的新策略更側重於任務導向的行動執行與環境交互。
- •騰訊已開始在智慧物流與倉儲自動化場景中測試該類多模態系統,以驗證其在非結構化環境下的上下文理解與操作精準度。
📊 競品分析▸ Show
| 特性/公司 | Tencent (新策略) | OpenAI (o1/Sora) | Google (DeepMind) |
|---|---|---|---|
| 核心定位 | 實體世界行動與推理 | 通用推理與內容生成 | 空間智慧與世界模型 |
| 執行能力 | 強調物理世界任務執行 | 偏向數位邏輯與推理 | 偏向感知與模擬 |
| 應用場景 | 工業自動化、機器人 | 軟體開發、創意內容 | 機器人控制、自動駕駛 |
🛠️ 技術深入
- 採用基於 Transformer 的任務規劃架構,整合了視覺-語言-行動(VLA)模型,實現從感知到動作的端到端映射。
- 引入了強化學習(RL)機制,用於優化 AI 在物理環境中的試錯與決策路徑,減少對預定義規則的依賴。
- 針對上下文理解,採用了長窗口注意力機制(Long-context Attention),以處理複雜的物理環境狀態序列。
- 系統架構支援邊緣端部署,透過模型量化與剪枝技術,確保在低算力環境下的即時推理效能。
🔮 前景展望AI analysis grounded in cited sources
騰訊將在 2027 年前發布專用於工業機器人的多模態控制系統。
該戰略轉向顯示騰訊正積極將 AI 能力從雲端軟體服務轉移至硬體控制層,以搶佔工業自動化市場。
騰訊將減少對純生成式 AI 模型的研發資源投入。
戰略重心從內容生成轉向上下文理解與行動,意味著資源配置將向推理與決策模型傾斜。
⏳ 時間線
2023-09
騰訊正式發布「混元」大模型,初期聚焦於內容生成與對話能力。
2024-05
騰訊混元大模型升級,開始強化多模態理解能力,支援影片與圖像生成。
2025-11
騰訊內部調整 AI 組織架構,整合機器人與自動化研究團隊。
2026-06
騰訊在工業場景中啟動基於上下文理解的 AI 決策系統試點項目。
📰
AI 週報
閱讀本週精選 AI 大事摘要 →
👉相關動態
AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: 钛媒体 ↗



