
Claude Opus 5 以半價提供高效能表現
Anthropic 發布了 Claude Opus 5,針對開發者與企業提升了編碼與推理能力。該模型在提供接近 Fable 效能的同時,大幅降低了使用者的成本。
Tag: #llm-optimization47 results

Anthropic 發布了 Claude Opus 5,針對開發者與企業提升了編碼與推理能力。該模型在提供接近 Fable 效能的同時,大幅降低了使用者的成本。

GATS 是一個全新的規劃框架,透過分層世界模型與系統化的 UCB1 樹狀搜尋,取代了昂貴的 LLM 推理。該框架在複雜任務中實現了 100% 的成功率,並在規劃階段完全消除了 LLM 的調用需求。

JetSpec 引入了一種用於推測解碼的平行樹狀草擬方法,在 LLM 推論上實現了高達 9.64 倍的速度提升。它在保持無損生成品質的同時,於單張 B200 GPU 上達到了每秒 1000 個 Token 的速度。

Z.ai 推出了 GLM-5.2,這是一款擁有 7,530 億參數的開源權重模型,專為長跨度編碼任務進行了優化。該模型具備 100 萬 token 的上下文窗口,並採用全新的 IndexShare 架構,大幅降低了運算成本。

月之暗面(Moonshot AI)發布並開源了 Kimi K2.7 Code 程式模型,顯著提升了長上下文指令遵循能力與程式編寫效能。相比前代 K2.6 模型,該模型平均 token 消耗減少了 30%。

Apple 研究人員推出了 Length Value Model (LenVM),這是一個在 Token 層級對剩餘生成長度進行建模的框架。透過將長度建模視為帶有負獎勵的價值估計問題,它提升了對生成長度和推理效率的控制能力。

Apple 研究人員推出了 CLaRa,這是一個透過連續潛在推理整合檢索與生成的框架。它利用基於嵌入的壓縮技術來減少文件長度,同時為 LLM 保持語義豐富度。

YUKTI 引入了型別命題圖(typed-proposition graph),旨在超越語言模型中單純的點值優化。透過整合不確定性、來源追溯以及假設穩健的帕累托前沿(Pareto frontiers),該框架能顯著降低複雜現實場景中的決策遺憾。

KV-PRM 提出了一種透過直接讀取 LLM 的 KV cache 而非重新編碼文字來進行流程獎勵建模的方法。此方法在維持或超越傳統文字型 PRM 效能的同時,顯著降低了長上下文多代理系統的計算開銷。

SwarmResearch 是一個新型的多代理框架,透過 Shepherd Agent 在不同的 git 分支中協調多個 Search Agent。它克服了單一代理系統容易收斂於次優解的傾向,實現了更高層次的探索。