🤝Together AI Blog•近期收集於 28h
直接在生產環境中對模型進行 A/B 測試

💡了解如何測試使用者是否真正偏好新模型,而不只是確認它能穩定運作。
⚡ 30-Second TL;DR
有什麼變化
Shadow Traffic 可驗證系統運作是否正常,但無法衡量使用者偏好。
為什麼重要
這能讓模型評估更貼近真實使用者結果,例如互動率或任務成功率。同時,將實驗流量路由移出個別應用程式,也能降低部署複雜度。
下一步行動
設定 Together AI 端點實驗,將少量生產流量分配給目前模型與候選模型,接著追蹤使用者層級的成功指標。
誰應關注:Developers & AI Engineers
關鍵要點
- •Shadow Traffic 可驗證系統運作是否正常,但無法衡量使用者偏好。
- •模型流量分割可直接在端點層級執行。
- •端點層級測試可避免在應用程式程式碼中自行實作路由邏輯。
🧠 深度解析
AI-generated analysis for this event.
🔑 增強重點摘要
- •Together AI 的 A/B 測試功能整合了伺服器端權重分配(Weight-based routing),允許開發者在不更動客戶端程式碼的情況下,動態調整模型流量比例。
- •該功能支援即時監控指標,包括延遲(Latency)、吞吐量(Throughput)以及錯誤率,並能針對不同模型版本進行自動化比較。
- •此架構利用了 Together AI 的推理引擎優化,確保在進行流量分割時,不會因為額外的路由邏輯而增加顯著的推理延遲。
- •該解決方案特別針對生產環境中的模型版本控制(Model Versioning)進行了優化,支援快速回滾(Rollback)機制,以應對候選模型表現不佳的情況。
- •此功能與 Together AI 的 API 閘道(API Gateway)深度整合,支援基於請求標頭(Request Headers)的進階路由規則,不僅限於隨機流量分割。
📊 競品分析▸ Show
| 功能/服務 | Together AI (A/B Testing) | AWS Bedrock (Model Evaluation) | LangSmith (LangChain) |
|---|---|---|---|
| 流量分割 | 原生端點層級路由 | 需透過 API Gateway 設定 | 應用程式層級路由 |
| 定價模式 | 隨用隨付 (推理成本) | 隨用隨付 + 評估費用 | 訂閱制 + 追蹤量計費 |
| 測試重點 | 生產環境真實流量 | 離線評估與人工審核 | 實驗追蹤與除錯 |
🛠️ 技術深入
- 實作機制:利用 API 端點的權重配置(Weighting),將請求分發至不同的模型實例(Model Instances)。
- 路由邏輯:在推理伺服器層級執行,透過負載平衡器(Load Balancer)根據預設權重進行加權隨機分配。
- 監控整合:與內建的指標收集系統連結,自動將不同模型的效能數據(如 TTFT - Time To First Token)標記並分類。
- 狀態管理:模型權重更新為原子操作(Atomic Operation),確保在更新流量比例時不會中斷現有請求。
🔮 前景展望AI analysis grounded in cited sources
自動化模型優化將成為標準配置
隨著端點層級 A/B 測試的普及,未來將出現基於效能指標自動調整流量權重的閉環優化系統。
應用程式層級的路由邏輯將大幅減少
將路由責任下放到推理平台端點,能顯著降低開發者維護複雜路由程式碼的技術債。
⏳ 時間線
2023-05
Together AI 推出其推理 API 服務,提供開源模型託管。
2024-02
發布 Together Inference Engine,大幅提升推理效能與吞吐量。
2025-09
擴展 API 閘道功能,強化企業級模型管理與監控能力。
2026-08
正式推出端點層級的生產環境模型 A/B 測試功能。
📰
AI 週報
閱讀本週精選 AI 大事摘要 →
👉相關動態
AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: Together AI Blog ↗