
傳 DeepSeek 正在研發自有 AI 推理晶片
中國 AI 新創公司 DeepSeek 據傳正在研發自有 AI 晶片,專注於推理場景以降低對 Nvidia 與 Huawei 的依賴。該項目目前處於早期階段,正與設計及製造合作夥伴洽談中。
Tag: #inference127 results

中國 AI 新創公司 DeepSeek 據傳正在研發自有 AI 晶片,專注於推理場景以降低對 Nvidia 與 Huawei 的依賴。該項目目前處於早期階段,正與設計及製造合作夥伴洽談中。

Intel 即將推出的 Nova Lake 處理器家族將重新啟用 AVX-512 指令集。該指令集自第 11 代 Tiger Lake 後便長期缺席,對於加速 AI 與高效能運算任務至關重要。
本研究探討了在固定 k 值的預訓練模型上進行後設適應性 MoE(AMG)門控。研究結果顯示,對分佈平坦的路由機制應用閾值門控會導致訊號丟失,而非提升效率。
Amazon Bedrock 報告稱,僅 2026 年第一季的代幣處理量就超過了過去所有時期的總和。AWS 強調,在 AI 推論負載巨大的時代,構建「可靠的基礎設施」至關重要。
Hugging Face 推出了一項簡化流程,可直接在其 Jobs 基礎設施上部署 vLLM 推論伺服器。此更新讓開發者能透過單一指令快速啟動高效能的 LLM 服務環境。

OpenAI 正與 Broadcom 合作開發專為大規模 LLM 推論優化的客製化晶片。此舉旨在解決日益增長的算力需求,並降低對標準硬體的依賴。

SGLang 在 NVIDIA GB300 硬體上成功將 DeepSeek-V4 的服務吞吐量提升了 5 倍。此項優化在保持互動性的同時,顯著提升了推論效率。
Groq 獲得 6.5 億美元的新一輪融資,旨在擴大其數據中心容量。這筆資金將支持該公司轉型為主要的 AI 運算服務提供商。
Kog AI 發布了一款針對 AMD MI300X GPU 優化的 Monokernel 推論引擎,透過將記憶體存取模式直接映射到硬體的物理晶片拓撲,實現了高吞吐量。

NVIDIA Dynamo Snapshot 解決了 Kubernetes 推論部署中的冷啟動問題,大幅縮短了啟動時間。此解決方案可避免擴展期間的 GPU 空轉,確保更好的資源利用率並符合 SLA 要求。