🤝較早收集於 19h

編碼代理的推理效能基準測試

編碼代理的推理效能基準測試
PostLinkedIn
🤝閱讀原文: Together AI Blog

💡了解 Together AI 如何在編碼代理的推理速度與成本上超越 Claude Opus 與 TensorRT-LLM。

⚡ 30-Second TL;DR

有什麼變化

吞吐量 (TPS) 較 TensorRT-LLM 提升 31%。

為什麼重要

這些基準測試顯示,開發者透過更換基礎設施供應商,可顯著降低代理工作流的營運成本與延遲。這為高需求的編碼 AI 應用樹立了新的效能標竿。

下一步行動

透過在 Together AI 的基礎設施上運行試點工作負載,評估您目前的推理成本與延遲,並與現有架構進行比較。

誰應關注:Developers & AI Engineers

關鍵要點

  • 吞吐量 (TPS) 較 TensorRT-LLM 提升 31%。
  • 在飽和狀態下,首字延遲 (TTFT) 表現提升 2 倍。
  • 推理成本較 Claude Opus 4.6 降低 76%。
  • 專為實際編碼代理工作負載進行了優化。

🧠 深度解析

Web-grounded analysis with 23 cited sources.

🔑 增強重點摘要

  • Together AI 是一個雲端平台,專為大規模運行開源和基礎模型而設計,提供數千種模型選項,例如 Llama 2、Mistral 和 Code Llama,作為 OpenAI 等閉源 API 的替代方案。
  • Together AI 的推理引擎整合了專有核心(如 FlashAttention-3)、基於 RedPajama 的自訂推測解碼,以及市場上最精確的量化技術,以實現領先的效能。
  • 該公司於 2026 年 5 月發布的 ATLAS 系統,利用運行時學習加速器和自適應推測解碼,透過學習即時流量,將大型語言模型 (LLM) 的推理速度提升高達 4 倍。
  • Together AI 的平台支援超過 200 種開源模型,並提供無伺服器和專用 GPU 叢集選項,配備 NVIDIA H100、H200 和 GB200 等高效能 GPU。
  • 該公司專注於全棧優化,包括自訂並行策略、進階量化、智慧排程和動態批次處理,以實現快速部署並遵守嚴格的延遲服務水準協議 (SLA)。
📊 競品分析▸ Show
特性/定價/基準Together AITensorRT-LLMClaude Opus 4.6/4.7
主要功能開源模型雲端平台(支援 100+ 模型),無伺服器/專用 GPU 叢集,API 存取,模型微調,自訂模型,具備程式碼解釋功能的代理工作流程。NVIDIA 的開源函式庫,專為 NVIDIA GPU 上的 LLM 推理優化,具備自訂注意力核心、即時批次處理、分頁鍵值 (KV) 快取、量化(FP8, FP4, INT4 AWQ, INT8 SmoothQuant)、推測解碼、多 GPU/多節點部署。Anthropic 的前沿模型,擅長複雜規劃、編排、多步驟任務和代理執行,具備改進的視覺能力,可生成高品質介面/投影片/文件。Opus 4.7 專為長時間運行的非同步代理而建構。
定價模式按分鐘計費,透明定價。Llama 3 INT4 Lite 端點每百萬 token 0.10 美元(比 GPT-4o-mini 低 6 倍)。 新帳戶提供 25 美元免費額度。作為優化函式庫,無直接服務定價。透過提高效率實現成本節省。Opus 4.6/4.7 每百萬輸入 token 5 美元,每百萬輸出 token 25 美元。 提示快取可節省高達 90% 成本,批次處理可節省 50%。 美國境內推理會產生 1.1 倍的乘數。
基準效能吞吐量 (TPS) 較 TensorRT-LLM 提升 31%(原文)。飽和狀態下,首字延遲 (TTFT) 提升 2 倍(原文)。推理成本較 Claude Opus 4.6 降低 76%(原文)。Together Turbo 端點在 Llama-3-8B-Instruct 和 Llama-3-70B-Instruct 模型上,效能比 vLLM 提升高達 4.5 倍。在 NVIDIA GPU 上實現絕對峰值效能通常優於 vLLM。 在桌上型 GPU 上比 llama.cpp 快高達 70%。 最佳單請求吞吐量,低併發時具競爭力的每 token 延遲。Claude Opus 4.7 在 Artificial Analysis 智慧指數為 57.3(優於 98% 模型),程式碼指數為 52.5(優於 99%),代理指數為 71.3(優於 98%)。 Opus 4.7 在 SWE-bench Verified 基準測試中得分 87.6%。 Claude Code(使用 Opus 4.5)在 SWE-bench 上得分 80.9%。

🛠️ 技術深入

  • Together AI 推理引擎整合了專有核心,例如 FlashAttention-3,以及基於 RedPajama 的自訂推測解碼技術。
  • 該引擎採用品質保留量化技術,確保在低精度下仍能維持模型的效能和準確性。
  • Together AI 的 ATLAS 系統利用運行時學習加速器和自適應推測解碼方法,透過學習即時流量來優化 LLM 推理。
  • 平台利用 NVIDIA H100、H200 和 GB200 等高效能 GPU,並透過自訂並行策略、進階量化、智慧排程和動態批次處理來實現全棧優化。
  • TensorRT-LLM 採用 CUDA 圖形優化、融合核心和 Tensor Core 加速,以最大化 NVIDIA GPU 的效能。
  • TensorRT-LLM 的優化包括自訂注意力核心、即時批次處理、分頁鍵值 (KV) 快取、多種量化技術(FP8、FP4、INT4 AWQ、INT8 SmoothQuant)和推測解碼。

🔮 前景展望AI analysis grounded in cited sources

AI 推理效率的提高將加速複雜程式碼代理在軟體開發中的採用。
更低的推理成本和更快的響應時間,使得開發人員將 AI 代理整合到日常工作流程中處理複雜任務,在經濟上更可行且實用。
Together AI 對開源模型優化的關注將加劇 AI 推理市場的競爭,促使其他供應商提升開源模型的效能並降低成本。
透過展示開源模型的卓越效能和成本效益,Together AI 鼓勵從專有解決方案轉向,並迫使競爭對手進行調整。
推理效率的進步將促使開發出更複雜、更自主的 AI 代理,能夠處理端到端專案開發。
提高吞吐量和降低延遲對於需要執行多步驟推理、迭代改進以及大量程式碼生成和測試的代理至關重要。

時間線

2022-06
Together AI 成立。
2023
Together GPU 叢集(NVIDIA H100/A100)推出,Together 推理 API 上線。
2023-11
Together AI 完成 1.025 億美元的 A 輪融資。
2024-03
Together AI 完成 1.06 億美元的 A 輪擴展融資。
2025-02
Together AI 獲得 3.05 億美元的 B 輪融資,公司估值達 33 億美元。
2025-05
Together AI 收購 Refuel.ai。
2026-05
Together AI 宣布推出 ATLAS 系統,可將 LLM 推理速度提升高達 4 倍。
📰

AI 週報

閱讀本週精選 AI 大事摘要 →

👉相關動態

AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: Together AI Blog