
一年真實世界 LLM 服務洞察
一項新研究分析 Chutes 長達一年的生產環境 LLM 服務流量,涵蓋模型、使用者、時間變化與互動模式。研究團隊將公開完整追蹤資料,協助研究者進行更貼近真實情境的基準測試與服務系統研究。
Tag: #caching9 results

一項新研究分析 Chutes 長達一年的生產環境 LLM 服務流量,涵蓋模型、使用者、時間變化與互動模式。研究團隊將公開完整追蹤資料,協助研究者進行更貼近真實情境的基準測試與服務系統研究。

SpecMD 是一個標準化框架,用於在各種硬體配置上基準測試 Mixture-of-Experts (MoE) 模型的臨時快取策略。它解決了快取如何與稀疏性和硬體規格互動的知識缺口。這能將 MoE 的稀疏激活轉化為實際效能提升。
OpenAI 在 Responses API 中引入 WebSockets,以加速代理工作流程。部落格深入探討 Codex 代理迴圈,強調 WebSockets 和連線範圍快取如何減少 API 開銷。這大幅改善模型延遲。

Vercel Blob 現已支援私有儲存的一致性讀取,開發者可選擇繞過 CDN 快取。此功能確保讀取操作能立即反映最新寫入,對於代理記憶體或會話記錄等動態資料至關重要。

Cloudflare 推出了 Workers Cache,這是一種直接整合於 Worker 入口點的區域分層快取解決方案。開發者現在可以透過標準 HTTP 標頭來降低延遲並減輕原始伺服器的負載。

Cloudflare 因 AI 機器人流量爆炸(超過每週 100 億請求)而重新思考快取設計。此流量與人類模式不同,對 CDN 快取帶來新挑戰。他們正開發構想,以優化 AI 機器人與人類體驗。

Vercel 在其 ISR Observability 儀表板中引入了「寫入利用率」指標。此工具可協助開發人員識別頻繁重新生成但流量較低的路由,進而優化成本。

GitBook 在單一 Vercel 部署上託管 30,000 個文件網站,每月提供 1.2 億頁面瀏覽量,每天處理 40,000 次快取無效化,每個在 300ms 內解決。他們使用由合併事件觸發的標籤式無效化,實現精準高效更新而無需廣泛清除。AI 爬蟲流量現佔 41%,年增 5 倍。
FlowCache is a caching framework for autoregressive video models, using chunkwise policies and KV cache compression. Achieves 2.38x speedup on MAGI-1 and 6.7x on SkyReels-V2 with minimal quality loss. Code available on GitHub.