
NVIDIA 降低 AI 模型切換成本
NVIDIA 研究人員提出跨模型 KV cache 傳輸技術,透過簡單的線性映射,在相容的 LLM 之間轉移對話記憶。測試顯示,該方法比重新計算上下文快 2.7 至 25 倍,同時保留目標模型最高 98% 的獨立準確率。
Tag: #agentic-workflows79 results

NVIDIA 研究人員提出跨模型 KV cache 傳輸技術,透過簡單的線性映射,在相容的 LLM 之間轉移對話記憶。測試顯示,該方法比重新計算上下文快 2.7 至 25 倍,同時保留目標模型最高 98% 的獨立準確率。

GitLab 19.3 新增批次 SAST 誤報偵測與 Agentic SAST 漏洞修復功能,協助處理既有的漏洞積壓。團隊可自動評估發現項目、排除可能的誤報,並產生可直接合併的修復方案,也支援匯入 SARIF 格式的第三方掃描結果。

一名 Reddit 使用者表示,Qwen3.8-27B 僅憑登入憑證與大學名稱,就透過 80 次工具呼叫自主取得課表。另一項測試中,它下載並分析社群媒體影片、自行安裝 Whisper 進行轉錄,還強化影片畫面,全程無需人工介入。
全新的「Schema」評測工具透過優化模型與遊戲環境之間的互動流程,提升了在 ARC-AGI-3 基準測試上的表現。它利用 Claude Opus 4.8 和 Fable 5,在不修改模型權重的情況下達到了 99% 的準確率。
Databricks 已正式將 GPT-5.5 模型整合至其企業級 Agent 工作流程中。此舉是在該模型於 OfficeQA Pro 基準測試中創下新高紀錄後所進行的部署。

DeepMind 推出 Gemma 4,這是其迄今最智能的開源模型。這些模型專為進階推理和代理工作流程而建,並宣稱是位元組對位元組最強大的開源模型。
文章認為,Workboddy、千問辦公與 TraeWork 等 AI 辦公智能體若要求消費者付費,成功機會不高,因為生產力提升主要由雇主受益。作者指出,這類產品必須提供可靠且高頻的流程自動化,或在底層模型能力、企業交付與生態入口方面建立優勢。

Gartner 預測,到 2030 年 LLM token 成本可能下降 95%,但 Agent 工作流程的推理成本可能在兩年內增加五倍以上。更複雜的推理、結果驗證、多模態輸入,以及 Agent 之間的協作,正推高日益嚴重的推理成本。

Salesforce 最新的 Agentic Enterprise Index 指出,企業今年採用 AI 代理的比例翻了三倍。研究結果顯示,企業正找出符合自身業務需求的部署策略,並開始獲得可衡量的投資報酬率。

GitHub 說明 Canvas 如何讓代理工作流程更容易檢視、引導與管理。這種方法旨在解決聊天介面的限制,因為持續進行的代理工作可能埋藏在對話紀錄中,也可能增加操作成本。