
Databricks 多步代理超越 RAG 20% 於混合資料
Databricks 研究顯示,多步代理在 STaRK 和 KARLBench 等基準測試中超越單輪 RAG 20%以上,適用於橫跨資料庫與文件任務。Supervisor Agent 拆解查詢、路由至結構化/非結構化來源並整合結果,解決 RAG 在混合資料的架構限制。此差距為結構性問題,而非模型品質問題。
Tag: #rag131 results

Databricks 研究顯示,多步代理在 STaRK 和 KARLBench 等基準測試中超越單輪 RAG 20%以上,適用於橫跨資料庫與文件任務。Supervisor Agent 拆解查詢、路由至結構化/非結構化來源並整合結果,解決 RAG 在混合資料的架構限制。此差距為結構性問題,而非模型品質問題。
turboquant-pro 推出 autotune CLI,從 PostgreSQL/pgvector 取樣嵌入向量,測試 12 種壓縮配置,在約 10 秒內依最小召回率推薦最佳方案。在 194K 生產嵌入上達 20.9 倍壓縮、96% 召回率,將 758MB 縮至 36MB。僅需 CPU、無需訓練,使用 PCA-Matryoshka + TurboQuant。
TurboQuant Pro 是一個開源工具包,可將高維向量壓縮 5-42 倍,同時保留 0.95+ 餘弦相似度。它在 240 萬個真實 BGE-M3 嵌入向量上基準測試 6 種方法,並與 pgvector/FAISS 整合。MIT 授權,透過 pip 安裝,用於 RAG、KV 快取和向量資料庫。
開源原型將 Unix 哲學應用於 ML 檢索管線,具可替換階段及類型合約,如 PII 遮罩與分塊。便於隔離變更精準評估比較。徵求設計回饋;儲存庫 github.com/mloda-ai/rag_integration。
開發者分享在澳洲合規領域(如建築和礦業)部署 RAG 機器人的寶貴經驗。關鍵洞見包括查詢擴展優於區塊大小、來源提升、分層提示、本地嵌入,以及每個客戶獨立 VM。程式碼在 GitHub 上公開。

研究人員提出將微調與檢索結合,用於 LLM 代理以實現對未見任務的更好泛化。他們開發了優越的 LoRA 基礎 SFT 配方,並分析儲存、查詢和選擇的最佳檢索策略。整合管道超越了最先進方法。

NVIDIA 推出 NeMo Retriever,這是一款超越傳統語義相似度方法的通用代理式檢索管道。該工具託管於 Hugging Face,能為 AI 系統提供更先進且適應性強的檢索功能。此創新旨在提升 RAG 和代理式工作流程。

Databricks 推出 KARL,一款透過強化學習訓練的 RAG 代理,能處理六種企業搜尋行為,並使用合成資料。於 KARLBench 基準測試中,其效能匹配 Claude Opus,但查詢成本降低 33%、延遲降低 47%。該代理擅長非可驗證任務,如跨文件綜合與內部筆記事實彙總。
YuanLab.ai 正式開源發布 Yuan3.0 Ultra 多模態基礎大模型。它將 MoE 大模型訓練效率優化系統性引入模型結構設計,並針對企業應用進行深度優化。在多模態文件理解、RAG、表格分析、內容摘要與工具調用等任務中表現突出。

這篇 AWS 部落格示範使用 Amazon Bedrock AgentCore 元件快速部署生產就緒的活動助理。它處理對話脈絡與偏好記憶、安全認證、無伺服器擴展,並透過 Knowledge Bases 進行 RAG 以提供個人化與會者體驗。