🇨🇳cnBeta (Full RSS)•最新收集於 5h
AT&T 借助開源模型削減 Anthropic 帳單

#inference-costs#model-routing#enterprise-ai#open-modelsnvidia-nemotronat&tanthropicopenainvidianemotron
💡AT&T 的計畫展示企業如何將合適的工作負載轉向開源模型,以降低專有模型帳單。
⚡ 30-Second TL;DR
有什麼變化
AT&T 旨在避免員工使用 Anthropic 與 OpenAI 閉源模型推高 AI 帳單。
為什麼重要
AT&T 的做法可能促使大型企業將適合的工作負載轉向開源模型,而非完全依賴高價的專有 API。這可能增加 Anthropic 與 OpenAI 的競爭壓力,也讓模型選擇更加重視成本。
下一步行動
在一項內部且不涉及敏感資料的工作負載上試用 NVIDIA Nemotron,並將其品質、延遲、託管成本與維護負擔與目前使用的 Anthropic 或 OpenAI API 比較。
誰應關注:Enterprise & Security Teams
關鍵要點
- •AT&T 旨在避免員工使用 Anthropic 與 OpenAI 閉源模型推高 AI 帳單。
- •公司計畫擴大部署包括 NVIDIA Nemotron 在內的開源模型。
- •這項成本控制策略預計將在未來幾年逐步實施。
🧠 深度解析
背景與延伸:來自公開資料,非原文內容。引用 12 個來源。
🔑 增強重點摘要
- •AT&T 的內部 AI 平台「Ask AT&T」每日處理的 Token 數量已從 80 億大幅增長至 450 億。
- •公司已開發一套具備「快取感知(cache-aware)」功能的內部 AI 閘道器,能根據任務需求在對話中動態切換模型。
- •透過將程式編寫等任務轉移至開源模型,AT&T 在相關領域的 AI 推理成本降低了高達 56%。
- •AT&T 目前已將 40% 的員工 AI 使用量轉移至開源模型,並計畫在未來幾年將此比例提升至 60% 至 70%。
- •除了 NVIDIA Nemotron,AT&T 還整合了 Meta 的 Llama、Google 的 Gemma,以及基於 Gemma 微調的電信專用模型「OTel」。
📊 競品分析▸ Show
| 特性 | AT&T (多模型路由) | 傳統企業 (單一模型) |
|---|---|---|
| 成本控制 | 高 (動態路由) | 低 (固定高額支出) |
| 模型靈活性 | 高 (混合開源與閉源) | 低 (依賴單一供應商) |
| 推理效能 | 針對任務優化 | 統一使用頂級模型 |
| 實作複雜度 | 高 (需自建閘道器) | 低 (直接串接 API) |
🛠️ 技術深入
- 採用多模型路由架構:利用內部閘道器根據任務複雜度、成本與延遲需求,自動分配請求至最合適的模型。
- 快取感知路由:系統能識別重複或相似的查詢,優先調用快取結果或輕量級模型以節省 Token 成本。
- 混合模型策略:結合閉源模型(如 Claude, GPT-4)處理複雜推理,並以開源模型(如 Llama, Nemotron, Gemma)處理日常事務。
- 垂直領域微調:開發「OTel」模型,針對電信產業的特定術語與數據結構進行優化,以提升開源模型在特定領域的表現。
🔮 前景展望AI analysis grounded in cited sources
企業 AI 預算將從「模型優先」轉向「路由優先」。
隨著 Token 消耗量呈指數級成長,企業必須透過智慧路由技術來維持 AI 支出的可持續性。
開源模型將在企業內部應用中取代 70% 的通用任務。
AT&T 的實證顯示,開源模型在特定任務上的品質與閉源模型差距極小,且成本效益顯著更高。
⏳ 時間線
2024-01
AT&T 啟動「Ask AT&T」內部 AI 平台,初期依賴單一閉源模型供應商。
2025-06
隨著 Token 使用量激增,AT&T 開始開發內部 AI 閘道器以進行成本控管。
2026-03
AT&T 正式將開源模型納入核心生產環境,並開始大規模部署 OTel 微調模型。
📎 來源 (12)
Factual claims are grounded in the sources below. Forward-looking analysis is AI-generated interpretation.
📰
AI 週報
閱讀本週精選 AI 大事摘要 →
👉相關動態
AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: cnBeta (Full RSS) ↗
每週 AI 簡報
每週一封,可隨時退訂。


