
騰訊混元 3 正式版表現強勁
騰訊混元 3 正式版獲得高分評價,其搜索能力已追平 GPT-5.5 標準。此次更新同時將幻覺率降低了 50%。
Tag: #rag131 results

騰訊混元 3 正式版獲得高分評價,其搜索能力已追平 GPT-5.5 標準。此次更新同時將幻覺率降低了 50%。
TRACE 引入了一種用於 LLM 代理記憶的層級主題樹結構,在 EventQA 基準測試中顯著優於 Mem0 和 MemGPT 等現有解決方案。它為管理長期對話歷史提供了一種比扁平化 RAG 區塊更高效的替代方案。
Competence Gate 是一個為 Qwen3.5-4B 設計的 10MB LoRA 適配器,透過讀取模型內部激活訊號來決定直接回答、網路搜尋或檢索本地文件。它能有效減少幻覺並防止隱私資料外洩,透過驗證後的信心程度而非模型口頭聲稱來控管工具使用。
BaryGraph 引入了一種創新的知識圖譜架構,將關係視為具有獨立向量的一等公民文件,而非單純的邊。這種方法能發現那些在標準嵌入空間中缺乏語義相似性,但在結構上具有關聯的概念。

Trunk Tools 以專用的三層架構取代通用型 LLM,以處理複雜的建築工程文件。透過專注於領域特定的推理能力,該公司將文件審閱週期從 60 天縮短至 10 天。

Contrastive Reflection 是一個透過識別錯誤行為片段並利用 Teacher LLM 提出針對性修改,進而優化 LLM 提示詞的新框架。此方法在 HotpotQA 基準測試中顯著優於隨機證據選擇,並達到了業界領先的效能。

ToE (Tree of Evidence) 是一個將聲明建模為動態論證樹的新框架,旨在提升自動化事實查核能力。它利用強化學習驅動的檢索與證據聚合技術,以對抗 AI 生成的錯誤資訊與 GEO 毒化攻擊。

MKG-RAG-Bench 是一個全新的跨領域基準測試,旨在評估多模態知識圖譜增強生成(MKG-RAG)中的檢索效能。它透過提供經過策劃的數據集來測試檢索與下游生成品質,解決了異質數據對齊這一關鍵瓶頸。

新加坡國立大學的研究人員開發了 MRAgent,這是一個以主動式、多步驟記憶重構取代靜態檢索的框架。與 LangMem 等傳統代理記憶系統相比,此方法顯著降低了 Token 消耗與運行成本。
Papers with Code 推出 OCR 集中化平台,收錄 Chandra OCR 2 與 Mistral OCR v4 等頂尖模型。該平台提供關鍵基準測試與程式碼連結,協助開發者在快速發展的文件數位化工具領域中進行選擇。