昆侖萬維發布高性能 Agent 模型 SkyClaw
昆侖萬維推出 SkyClaw-v1.0 及其輕量版,專為 Agent 工作流設計,支持百萬token上下文,並在複雜工具調用與多步任務執行上表現優異。
Tag: #llm-optimization47 results
昆侖萬維推出 SkyClaw-v1.0 及其輕量版,專為 Agent 工作流設計,支持百萬token上下文,並在複雜工具調用與多步任務執行上表現優異。

AgentNLQ 引入了一種多代理協調器,利用 LLM 來規劃、反思並自我修正 SQL 查詢。透過整合語義豐富的架構元數據,該方法在 BIRD 基準測試中達到了 78.1% 的語義準確度。

Skim 是一個全新的推測執行框架,透過繞過針對可預測網站任務的繁重模型推論來優化網頁代理。它利用離線分析將查詢與模板進行匹配,在不犧牲準確性的前提下顯著降低了延遲與成本。

此新框架針對大型語言模型聯合調整測試時計算分配與生成分佈。暖身階段識別簡單查詢並從測試集建構初始問答對。適應階段集中計算於未解查詢,使用語義相近成功回應的演化式脈絡示範,在數學、程式與推理基準上超越基線且耗用更少推論計算。

英特爾 Arc Pro B70 在 MLPerf v6.0 基準測試中,AI 推理性能比 B60 提升 80%。4 張 B70(128GB 顯存)搭配至強 6 處理器,輕鬆處理 1200 億參數 LLM。軟體升級讓現有 B60 提升 18%。

NVIDIA 推出 AIConfigurator,自動化分散式 LLM 服務優化。它探索硬體、並行性和預填充/解碼分割的龐大搜尋空間。這消除手動猜測,实现高性能、成本效益部署。

LLM 上下文長度爆炸性增長,架構轉向如多頭潛在注意力 (MLA) 和分組查詢注意力 (GQA) 等複雜注意力機制。這使得 softmax 的超越函數數學成為主要效能瓶頸,而非矩陣乘法。NVIDIA Blackwell Ultra 優化 softmax 以實現更快 AI 推論。
一位開發者成功在 Samsung S26 Ultra 手機上運行了私有的 Qwen 35B MoE 模型。該實作在不犧牲精度的情況下,達到了每秒 90 個輸入 token 和每秒 8 個輸出 token 的處理速度。
本提案提出了一種受擴散模型啟發的方法,透過將語義壓縮作為漸進式渲染工具來處理超長 AI 對話。藉由將文本壓縮為從粗略到精細的片段,模型能夠在超出原生上下文視窗的情況下保持對話連貫性。
本文探討目前的微調技術是否能超越 LoRA 的效能與效率。文章深入研究了大型語言模型參數高效微調(PEFT)的新方法。