⚛️量子位•較早收集於 64m
國內首家百億估值純推理GPU獨角獸

💡新百億中國GPU獨角獸瞄準百萬Token 1分錢推理—LLM成本遊戲規則改變者(38字元)
⚡ 30-Second TL;DR
有什麼變化
曦望達百億估值,專攻純推理GPU領導者
為什麼重要
加劇AI推理硬體競爭,可能壓低全球LLM部署成本。顯示中國在高效AI基礎設施的強勢推進。
下一步行動
聯繫曦望銷售團隊,對其GPU進行推理工作負載與Nvidia基準測試。
誰應關注:Founders & Product Leaders
關鍵要點
- •曦望達百億估值,專攻純推理GPU領導者
- •國內首家此類AI硬體獨角獸
- •CEO指最低推理成本決定勝負
- •目標百萬Token僅1分錢
🧠 深度解析
AI-generated analysis for this event.
🔑 增強重點摘要
- •曦望(Xiwang)的核心技術路徑聚焦於針對大語言模型(LLM)推理場景進行架構優化,透過捨棄通用訓練功能以極大化提升推理算力密度與能效比。
- •該公司在融資過程中獲得了多家頂級風險投資機構與產業資本的青睞,顯示資本市場對於AI基礎設施從『訓練導向』轉向『推理導向』的趨勢高度認可。
- •曦望的技術架構設計重點在於記憶體頻寬的優化與低精度運算(如INT8/FP8)的硬體加速,旨在解決目前通用GPU在處理長文本推理時的瓶頸。
📊 競品分析▸ Show
| 競爭對手 | 核心定位 | 推理成本優勢 | 技術特點 |
|---|---|---|---|
| 曦望 (Xiwang) | 純推理GPU | 極致低成本 (百萬Token 1分錢) | 專用架構,去訓練功能 |
| NVIDIA (Blackwell/Hopper) | 通用GPU (訓練+推理) | 較高 (硬體成本與功耗) | 生態系統完善,軟硬體整合度高 |
| Groq | LPU (推理加速器) | 極高吞吐量 (低延遲) | 確定性架構,無快取設計 |
🛠️ 技術深入
• 架構設計:採用專為推理優化的特定領域架構(DSA),移除了傳統GPU中用於訓練的複雜邏輯單元,以降低晶片面積與功耗。 • 記憶體架構:針對LLM推理中KV Cache的讀寫需求,採用了高頻寬記憶體(HBM)與片上靜態隨機存取記憶體(SRAM)的混合架構,以減少對外部記憶體的存取依賴。 • 運算單元:硬體層面原生支援低精度數據格式(如FP8、INT4),在保證模型精度的前提下,顯著提升了單晶片的Token生成速率。 • 軟體堆疊:提供專用的編譯器與推理引擎,能夠自動將主流框架(如PyTorch)訓練的模型進行量化與圖優化,以適配其硬體架構。
🔮 前景展望AI analysis grounded in cited sources
AI推理硬體市場將出現嚴重的架構分化。
隨著推理需求爆發,通用GPU的高成本將推動市場轉向曦望這類專用推理晶片以降低營運支出。
百萬Token 1分錢的成本目標將重塑AI應用商業模式。
極低的推理成本將使過去因成本過高而無法落地的AI應用(如全天候即時語音助理)具備大規模商業化可行性。
⏳ 時間線
2024-05
曦望公司正式成立,專注於AI推理晶片研發。
2025-09
完成大規模融資,估值突破百億人民幣,成為國內首家純推理GPU獨角獸。
📰
AI 週報
閱讀本週精選 AI 大事摘要 →
👉相關動態
AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: 量子位 ↗