
NVIDIA 降低 AI 模型切換成本
NVIDIA 研究人員提出跨模型 KV cache 傳輸技術,透過簡單的線性映射,在相容的 LLM 之間轉移對話記憶。測試顯示,該方法比重新計算上下文快 2.7 至 25 倍,同時保留目標模型最高 98% 的獨立準確率。
Tag: #model-routing43 results

NVIDIA 研究人員提出跨模型 KV cache 傳輸技術,透過簡單的線性映射,在相容的 LLM 之間轉移對話記憶。測試顯示,該方法比重新計算上下文快 2.7 至 25 倍,同時保留目標模型最高 98% 的獨立準確率。

AT&T 計畫在未來幾年讓員工使用 Anthropic 與 OpenAI 閉源模型的支出大致維持不變。這家電信公司將增加採用 NVIDIA Nemotron 等開源模型,以控制推理成本。

AI Agent 開發正從不加節制地使用前沿模型,轉向結合本地開源模型與高階模型的混合架構。OpenClaw 推動了 local-first 與工具調用型 Agent 的普及,而未來的 Agent 蜂群與 A2A 網路可能仍會持續增加 Token 需求。

Ramp 推出 AI 模型路由服務 Router,讓個人與企業透過同一服務存取及切換多種大型語言模型。該服務可透過 API 使用。
Callosum 在早期融資中籌得 1 億美元,開發可將特定 AI 任務配對至合適模型與晶片的軟體。投資者包括英國公共 AI 基金。

Together AI 在 904 次 DeepSWE rollout 中比較 GLM-5.3 與 GPT-5.6 Sol。GPT-5.6 Sol 的 pass@1 領先 3.7 個百分點,但 GLM-5.3 以約一半成本取得更高的 pass@4;GLM 優先的級聯策略達到 85.9%。

Snowflake 的 Cortex AI Gateway 現可根據任務複雜度、品質與成本,動態將 AI 查詢路由至不同模型。該公司表示,此功能在部分工作負載上可降低最高 3 倍的 token 成本,且不收取額外路由費用。

Z.ai 的 GLM 5.3 現已透過 Vercel AI Gateway 提供,相較 GLM 5.2,在複雜軟體工程、多步驟代理任務與漏洞探索方面有所提升。開發者可使用 `zai/glm-5.3` slug,並將其整合至 Claude Code、Codex、OpenCode、Cursor 與 Pi 等程式設計代理。

PhanRouter 已上線智譜的 GLM-5.3 模型支援。使用者即日起可透過該平台呼叫此模型 API。
據報 Stripe 即將達成協議,以超過 70 億美元收購 OpenRouter。OpenRouter 協助企業在不同 AI 模型之間切換,使這筆交易對 AI 基礎設施與模型存取具有戰略意義。