
OpenAI 預覽速度提升 14 倍的企業模式
OpenAI 已向企業開放 GPT-5.6 Sol UltraFast 預覽版,承諾最高可提升 14 倍推理速度。該模式每秒最多可生成 750 個 tokens,但存取權限須依企業使用情境經 OpenAI 審核批准。
Tag: #inference-speed24 results

OpenAI 已向企業開放 GPT-5.6 Sol UltraFast 預覽版,承諾最高可提升 14 倍推理速度。該模式每秒最多可生成 750 個 tokens,但存取權限須依企業使用情境經 OpenAI 審核批准。

Hugging Face 強調 LFM2.5-DSpark 的推理速度最高可提升 3.2 倍。提供的文章內容未包含基準測試條件、硬體細節或實作指南。

Google 發布了一款利用擴散模型技術進行文字生成的新模型,推論速度提升了 4 倍。此更新顯示了擴散模型在文字任務應用上的轉變。

開源27B-32B模型在Terminal-Bench 2.0上測試,Qwen 3.6-27B在預設超時下得分38.2%。此表現相當於2025年底的雲端前沿模型如Claude Opus 4.1。MOE模型推理速度大幅提升。
FlashAttention-4 在 B200 GPU 上達到 1613 TFLOPs/s,比 Triton 快 2.7 倍,比 cuDNN 快至 1.3 倍。已整合至 vLLM 0.17.0 和 PyTorch FlexAttention,支持 GQA/MQA 模型。僅限 Hopper/Blackwell GPU,全用 Python CuTe-DSL 撰寫。

Google 的 Gemini 模型再次在 AI 基準測試中名列前茅,鞏固其領導地位。本新聞通訊強調 10 倍更快的模型以提升效能。它也討論 AI 領域日益增長的諮詢機會。

Google 正式發布了 Gemini 3.6 Flash 模型以及全新的網路安全 AI 工具。該公司同時確認 Gemini 3.5 Pro 與下一代 Gemini 4 的開發工作已經展開。

Google 正推廣如 Gemma 4 31B 等小型模型用於 AI 輔助軟體工程,並強調其卓越的推論速度。這顯示業界正將重心轉向用於程式開發任務的高效、低延遲本地模型。

由於收到超過 6.6 萬份申請,小米決定延長提供 1000 tokens/s 推理能力的 UltraSpeed 模式試用期,讓更多開發者能進行接入與測試。

Google DeepMind 發布了針對 NVIDIA 硬體優化的 DiffusionGemma 模型。此更新旨在解決聊天機器人與代理工作流等即時 AI 應用中的延遲問題。