
Google 四夥伴晶片供應鏈挑戰 Nvidia AI 推論
Google 正在打造最多元化的客製晶片供應鏈,與四家設計夥伴合作:Broadcom、MediaTek、Marvell 和 Intel。目前 Ironwood TPU 已大量出貨,路線圖延伸至 2027 年底 TSMC 2nm 的 TPU v8。此策略旨在 Google Cloud Next 前挑戰 Nvidia 在 AI 推論領域。
Tag: #inference127 results

Google 正在打造最多元化的客製晶片供應鏈,與四家設計夥伴合作:Broadcom、MediaTek、Marvell 和 Intel。目前 Ironwood TPU 已大量出貨,路線圖延伸至 2027 年底 TSMC 2nm 的 TPU v8。此策略旨在 Google Cloud Next 前挑戰 Nvidia 在 AI 推論領域。
Google本週公布新一代自訂TPU,專注AI推理。Bloomberg的Dina Bass於Bloomberg Tech解釋其差異化及Google競爭優勢。

Moonshot AI的Kimi團隊發布新論文,創新KVCache,將其轉化為新型商業模式。此突破被定位為超長上下文處理的福音。此方法承諾在延長推理場景中帶來效率提升。

了解推測解碼如何在 AWS Trainium2 上加速解碼密集型 LLM 推論。透過 vLLM 整合降低每產生權重的成本。本文解釋技術原理與優勢。

全球AI競爭出現微妙轉變,重視推論而非原始模型威力。美國透過Nvidia主導晶片,但中國在效率指標「計分板」領先。Nvidia執行長黃仁勳強調推論工作負載、權杖為商品、運算為營收。

使用 Gemma 4 E2B 草稿模型的推測解碼,讓 Gemma 4 31B 推理速度平均提升 29%,程式碼生成達 50%。關鍵問題是 GGUF 元數據不匹配導致權重翻譯開銷。結構化任務如數學和程式碼有高接受率。
純 Triton 的融合 MoE 分派核心在 Mixtral-8x7B 推理批次大小下擊敗 CUDA 優化的 Megablocks(32 個 token 時快 131%)。透過融合操作減少 35% 記憶體流量,並支援 NVIDIA 與 AMD 硬體的多模型。GitHub 有程式碼與文章。

Deepgram 的生產級語音轉文字 (STT) 和文字轉語音 (TTS) 模型現已原生可用於 Together AI。此整合可透過 Dedicated Model Inference 存取,用於建置即時語音代理。

AI 晶片新創 Rebellions 在預 IPO 輪融資中獲得 4 億美元,估值達 23 億美元。公司專注設計 AI 推論晶片,並計劃今年晚些上市。它成為挑戰 Nvidia 主導地位的另一競爭者。
開發者 peva3 在 llama.cpp 中加入 Turboquant、Heavy-Hitter Oracle (H2O) 和 StreamingLLM,大幅提升效能。在 16GB 4060ti GPU 上,使用 Qwen 3.5 4B 模型可達 256k+ 上下文的全速生成。CPU 和 CUDA 版本已完整可用,GitHub 上有詳細文件。