
AI 硬體加速:GPU、TPU 至 LPU 演進
CPU 在 AI 矩陣運算低效,驅動 GPU(SIMT 並行)、TPU(脈動陣列)與 ASIC(資料流最佳化)等專用硬體。解釋訓練/推理的彈性 vs 效率權衡。涵蓋量化、稀疏化與分散式策略。
Tag: #accelerators18 results

CPU 在 AI 矩陣運算低效,驅動 GPU(SIMT 並行)、TPU(脈動陣列)與 ASIC(資料流最佳化)等專用硬體。解釋訓練/推理的彈性 vs 效率權衡。涵蓋量化、稀疏化與分散式策略。
中國 AI 晶片設計商 Moore Threads Technology 計劃在適當時機於香港上市。自去年在上海首次上市以來,公司股價已上漲超過 420%。

Cambricon Technologies 上半年營收達 60 億元人民幣,年增 108%,受惠於中國加速推動國產 AI 硬體替代。淨利潤年增 122.6% 至 23 億元人民幣,第二季營收則達 31 億元人民幣。
據報 AMD 收購 Taalas,以強化其針對快速成長 AI 推論市場的運算解決方案。Reddit 討論推測,AMD 對企業市場的重視,可能降低消費者導向熱插拔 AI 模型硬體出現的可能性。
AMD 發布的銷售展望令投資人在 AI 帶動的股價上漲後感到失望。這項指引顯示,股東原本期待公司能更大幅受惠於全球 AI 資料中心的擴張。

綜述涵蓋從 ANN 到 Transformer 的神經網路硬體加速器,強調推理中記憶體頻寬為關鍵瓶頸。詳述 GPU 分塊/融合、TPU 脈動陣列、FPGA 管線用於 CNN/ANN。ASIC 效率最高但靈活性低。

預訓練現代大型語言模型(LLM,約100B參數)需數千加速器與海量權杖語料庫,運行數天至數月。成功指標為速度(權杖/秒)與學習進展。本文主張從吞吐量轉向良吞吐量以衡量真正效率。

OpenAI, Anthropic, Google, and other tech giants are collaborating on F/ai. This new startup accelerator is based in Paris. It unites competitors to support emerging AI ventures.