
Bedrock TTFT 與配額新 CloudWatch 指標
AWS 推出 Amazon Bedrock 的兩個新 CloudWatch 指標:TimeToFirstToken (TTFT) 和 EstimatedTPMQuotaUsage。這些指標提升推論工作負載的操作可見度,可設定警報、建立基準並主動管理容量。
Tag: #inference127 results

AWS 推出 Amazon Bedrock 的兩個新 CloudWatch 指標:TimeToFirstToken (TTFT) 和 EstimatedTPMQuotaUsage。這些指標提升推論工作負載的操作可見度,可設定警報、建立基準並主動管理容量。

英偉達即將在GTC推出Groq設計的LPU推理系統,使用片上SRAM,引發對三星與SK海力士等HBM供應商需求減少的擔憂。分析師反駁稱,SRAM密度低僅適合小型模型與低延遲應用,而非取代HBM。英偉達CEO黃仁勳指出,SRAM適合特定工作負載,但無法擴展至大型AI模型。

Llama.cpp GGUF格式的真NVFP4支援即將到來,僅數小時或數天。於Blackwell GPU提供2.3倍速度提升及30-70%大小節省,並支援RAM卸載。優於有bug的vLLM。
在雙 A100 40GB GPU 上使用 VLLM 進行的基準測試顯示,Qwen3.5-35B-A3B-AWQ-4bit-FlashInfer 最快,輸出 352 tok/s,總計 1357 tok/s。Qwen3-30B 變體落後,FP8 FlashAttn 最慢。測試涵蓋 FP8/AWQ 量化及 FlashAttn/FlashInfer 注意力機制。
英偉達計劃推出專為 OpenAI 等定制的全新處理器,助力更快、更高效的 AI 推理工具。該平台整合 Groq 設計晶片,將於下月聖荷西 GTC 大會公布。OpenAI 同意成為最大客戶之一。

Amazon SageMaker 在 2025 年帶來容量、價格效能、觀測性和可用性的重大基礎設施升級。第一部分強調 Flexible Training Plans 改善容量,以及推理工作負載的更好價格效能。第二部分將涵蓋觀測性、模型自訂和託管增強。

本期早報聚焦消費硬體、雲端基礎設施、開源、端側模型與區域電商等領域的 AI 發展。重點包括據報導售價 400 美元的 OpenAI 音箱、Apple 進軍智慧家庭、AWS 算力短缺、NVIDIA cuFile 開源、Google DeepMind 氣旋模型,以及 vLLM 與低資源語言模型的進展。

AWS 在 SageMaker AI Studio 中推出了全新的使用者介面,旨在簡化生成式 AI 的推論優化流程。該介面透過引導式的使用情境設定與視覺化比較,讓缺乏基礎設施專業知識的團隊也能輕鬆完成部署。

阿里巴巴為 QoderWork 與 Qoder Desktop 產品線推出「峰谷 Token」定價模式。用戶在夜間時段使用 Qwen3.7 模型可享有低至 2 折的優惠。

Infinigence 的 Agentic MaaS 平台代幣調用量在六個月內激增 20 倍。該公司正將自己定位為晶片與 AI 模型之間的中立基礎設施層。