
OpenAI 預覽速度提升 14 倍的企業模式
OpenAI 已向企業開放 GPT-5.6 Sol UltraFast 預覽版,承諾最高可提升 14 倍推理速度。該模式每秒最多可生成 750 個 tokens,但存取權限須依企業使用情境經 OpenAI 審核批准。
Tag: #token-throughput6 results

OpenAI 已向企業開放 GPT-5.6 Sol UltraFast 預覽版,承諾最高可提升 14 倍推理速度。該模式每秒最多可生成 750 個 tokens,但存取權限須依企業使用情境經 OpenAI 審核批准。
OpenAI 正預覽 GPT-5.6 Sol 的全新 API 服務層級 Ultrafast。此服務由 Cerebras 提供支援,輸出速度最高可達每秒 750 個 token,速度提升最高達 14 倍。

騰訊混元 Hy3 模型登頂 OpenRouter 週榜,單週處理超過 6 兆個 Token。此里程碑凸顯了該模型在全球 AI 市場中日益增長的採用率與高吞吐量處理能力。

Andrej Karpathy 透露他已基本停止手寫程式碼,80% 時間用於指揮 AI 代理。他強調 Token 吞吐量取代 GPU 算力成為生產力指標。預測軟體轉向 API 驅動,以及代理主導的研究範式。

NVIDIA Run:ai 推出動態 GPU 分割功能,為擴展 AI 工作負載提供高吞吐量、資源使用效率和可預測延遲。此功能完全支援雲端、NCP 和內部部署環境。NVIDIA 與 AI 合作夥伴的聯合基準測試展示了其效能。

DeepSeek V4 Flash 在 7 月 27 日至 8 月 2 日的 OpenRouter 每週模型使用量排行榜中排名第一,處理了 7.22 兆個 token。8 月 1 日,該模型透過 OpenCode 處理了 8 兆個 token,其中 5 兆來自免費試用,3 兆由開發者付費。