📄ArXiv AI•最新收集於 7h
一年真實世界 LLM 服務洞察

💡了解生產規模證據,打造更貼近真實的 LLM 服務基準與基礎設施。
⚡ 30-Second TL;DR
有什麼變化
研究採用 Chutes 長達一年的生產環境追蹤資料,而非短期或抽樣工作負載。
為什麼重要
這份資料集可能提升 LLM 服務基準測試的真實性,特別適用於快取、負載平衡、容量規劃與多模型路由。實務團隊也能據此更有依據地設計支援長尾模型與變動使用者行為的系統。
下一步行動
待 Chutes 追蹤資料公開後,使用它在你的服務堆疊中重播混合熱門與長尾模型流量,並測量快取命中率、尾端延遲與路由效率。
誰應關注:Researchers & Academics
關鍵要點
- •研究採用 Chutes 長達一年的生產環境追蹤資料,而非短期或抽樣工作負載。
- •分析涵蓋整體、時間、模型層級與使用者層級行為,並包括熱門模型與長尾模型。
- •研究探討使用者與模型之間的關係如何影響生產流量與工作負載演變。
- •完整追蹤資料將公開,讓研究者無需依賴合成或抽樣工作負載即可進行可重現研究。
🧠 深度解析
AI-generated analysis for this event.
🔑 增強重點摘要
- •該研究揭示了生產環境中 LLM 請求呈現顯著的『突發性』與『晝夜週期性』,這與學術界常用的靜態工作負載模型有很大差異。
- •數據顯示長尾模型(Long-tail models)在總請求量中佔據了不可忽視的比例,挑戰了僅關注少數頂級模型(如 GPT-4)的傳統研究範式。
- •研究發現使用者互動模式具有高度的『會話依賴性』,即單一使用者在短時間內會頻繁切換或連續呼叫不同模型,影響了快取策略的有效性。
- •Chutes 的資料集特別標註了冷啟動(Cold Start)延遲與模型載入時間的關聯,為優化伺服器無狀態(Serverless)架構提供了實證數據。
- •分析指出,生產環境中的輸入與輸出 Token 長度分佈呈現長尾特徵,這對於動態批次處理(Dynamic Batching)演算法的設計具有關鍵參考價值。
📊 競品分析▸ Show
| 特色/平台 | Chutes (本研究) | Anyscale | Together AI |
|---|---|---|---|
| 核心定位 | 生產環境數據透明化與研究 | 企業級 LLM 擴展與託管 | 開源模型推理與訓練加速 |
| 數據公開性 | 高(公開完整追蹤資料) | 低(封閉生態) | 中(部分基準測試) |
| 定價模式 | 依使用量計費 | 依節點/請求計費 | 依 Token 計費 |
| 基準測試 | 基於真實生產流量 | 基於合成工作負載 | 基於標準化評測集 |
🛠️ 技術深入
- 數據集包含完整的請求時間戳記、模型識別碼、輸入/輸出 Token 計數以及錯誤代碼。
- 採用了基於 Kubernetes 的無狀態推理架構,支援多模型並行部署與自動擴展。
- 實作了針對異質模型(Heterogeneous Models)的動態資源分配機制,以應對不同參數規模模型的記憶體需求。
- 追蹤資料記錄了從請求發起到模型回應的完整延遲鏈路,包含網路傳輸、排隊時間與推理時間的拆解。
🔮 前景展望AI analysis grounded in cited sources
學術界將轉向使用真實生產數據集進行 LLM 系統評測。
公開的真實追蹤資料將使合成工作負載在系統研究中的地位大幅下降,成為新的基準標準。
推理服務供應商將更依賴預測性自動擴展(Predictive Autoscaling)。
研究揭示的流量週期性模式將推動演算法從反應式擴展轉向基於歷史行為的預測式資源調度。
⏳ 時間線
2024-05
Chutes 平台正式啟動,開始收集生產環境推理流量數據。
2025-06
累積滿一年生產數據,研究團隊開始進行系統性分析與清理。
2026-07
研究成果整理完畢,並於 ArXiv 發布相關技術報告與數據集。
📰
AI 週報
閱讀本週精選 AI 大事摘要 →
👉相關動態
AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: ArXiv AI ↗