🐯虎嗅•較早收集於 12m
1M 上下文時代太費 Token,Coding Agent 省錢方法

💡1M 上下文 Coding Agent 燒 token 快—會話技巧省 50%+ 成本(22字)
⚡ 30-Second TL;DR
有什麼變化
不同任務啟新會話,避免上下文污染。
為什麼重要
實現長上下文 LLM 生產編碼可持續使用,避 token 耗盡減成本。
下一步行動
立即在 Claude Code 會話用「聚焦 X 模組」執行 /compact。
誰應關注:Developers & AI Engineers
關鍵要點
- •不同任務啟新會話,避免上下文污染。
- •Claude Code 中用 rewind 刪除失敗路徑,保留檔案。
- •子 Agent 處理雜訊子任務,只返結論。
- •主動依任務指令壓縮上下文。
🧠 深度解析
AI-generated analysis for this event.
🔑 增強重點摘要
- •向量資料庫(Vector Database)整合已成為主流 Coding Agent 的標配,透過 RAG 技術僅在需要時檢索相關程式碼片段,而非將整個 1M Token 上下文全數載入,大幅降低冗餘 Token 消耗。
- •快取機制(Prompt Caching)在 API 層級的應用已成為降低成本的關鍵,透過快取重複的系統提示詞(System Prompt)與專案結構定義,可減少高達 80% 的輸入 Token 計費。
- •基於 AST(抽象語法樹)的程式碼分析工具被引入 Agent 工作流,能精準識別函數依賴關係,從而實現更細粒度的上下文修剪,避免傳統基於 Token 數量的暴力截斷導致的邏輯遺失。
📊 競品分析▸ Show
| 特性/模型 | Claude 3.5/4.x (Anthropic) | DeepSeek V3/V4 | GitHub Copilot Workspace |
|---|---|---|---|
| 上下文視窗 | 200K - 1M+ | 128K - 1M+ | 整合式專案上下文 |
| 成本優勢 | 高,支援 Prompt Caching | 極高,主打性價比 | 訂閱制,隱藏 Token 成本 |
| 核心優勢 | 複雜邏輯推理與指令遵循 | 程式碼生成效率與價格 | 深度整合 IDE 與 Git 工作流 |
🛠️ 技術深入
- Prompt Caching 技術:允許開發者將長文本(如專案文檔、API 定義)預先快取,後續請求僅需傳輸差異部分,顯著降低長上下文的重複計算成本。
- RAG 與 Context Window 的權衡:現代 Coding Agent 採用混合策略,將全域專案結構存入向量庫,僅將當前編輯檔案與相關依賴注入上下文,而非盲目擴大視窗。
- AST-based Pruning:利用編譯器前端技術解析程式碼結構,Agent 可自動識別並移除未被當前任務引用的死代碼(Dead Code)或無關模組,優化輸入 Token 品質。
🔮 前景展望AI analysis grounded in cited sources
「Token 計費模式」將逐漸向「推理效能計費」轉型。
隨著快取技術與上下文壓縮成熟,單純按輸入 Token 計費將無法反映 Agent 的實際運算價值。
專用型小型模型(SLM)將取代通用大模型處理 Coding Agent 的子任務。
為了進一步降低成本與延遲,複雜任務將被拆解,由輕量級模型執行簡單的語法檢查與格式化。
⏳ 時間線
2024-03
Claude 3 系列發布,將上下文視窗提升至 200K,開啟長上下文編碼時代。
2024-12
DeepSeek V3 發布,以極低的 API 價格與高效能震撼市場,推動長上下文普及。
2025-02
Anthropic 推出 Claude 3.7 Sonnet,進一步優化編碼能力與上下文處理效率。
📰
AI 週報
閱讀本週精選 AI 大事摘要 →
👉相關動態
AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: 虎嗅 ↗


