
代理記憶11倍令牌縮減
結構化蒸餾將個人化AI代理對話歷史壓縮成緊湊檢索結構,每交換從371令牌減至38令牌,實現11倍縮減。在14k交換評估中,保留96%逐字召回率,跨層搜尋超越基準。開源實作發布。
Tag: #retrieval20 results

結構化蒸餾將個人化AI代理對話歷史壓縮成緊湊檢索結構,每交換從371令牌減至38令牌,實現11倍縮減。在14k交換評估中,保留96%逐字召回率,跨層搜尋超越基準。開源實作發布。

Perplexity 推出兩款新型嵌入模型:pplx-embed-v1 和 pplx-embed-context-v1,專為大規模檢索任務優化。這些模型採用 int8 和二進位量化以提升效率。模型提供 0.6B 和 4B 參數規模版本。

Weaviate 為 Query Agent 的 Search Mode 推出 medium、high 與 ultrahigh 三種努力層級。這項更新讓實務使用者可依據搜尋品質與資源需求調整測試時運算量。

這項研究提出一套用於建築文件審查的證據導向管線,將文字、幾何、頁面與版本資訊正規化,並以決定性規則進行約束檢查。在重複測試中,增加重疊頁面區塊的解析度可提升準確率;但在更廣泛的資料集上未穩定勝過頁面涵蓋率,顯示仍需要具備規則感知能力的證據路由與人工覆核。
RAGless 是一個語義檢索系統,透過直接進行「問題對問題」的匹配來取代標準的 RAG。它消除了生成步驟,能為預定義的 FAQ 資料集提供更快、更精確的答案。

一位《生化危機》女主角扮演者打造的免費 AI 記憶系統在 GitHub 上爆火。它利用「記憶宮殿」技巧,將檢索性能提升 34%。此開源工具旨在強化 AI 代理的記憶功能。

MongoDB 認為,最大化 Token 使用量並不能有效代表 Agent 品質,因為 Context Window 是稀缺資源。文章主張採用具備持久化、可查詢、語意檢索與角色型存取控制的 Agentic Memory,打造更具擴展性的架構。

Synthetic Query Probing 不直接比較 embedding 向量,而是測量 synthetic questions 與內容區塊之間的相似度分數,以比較不同 embedding models。研究顯示,Titan 與 Ada 等模型的分數範圍可能不同且呈非線性關係,會影響檢索門檻設定與模型遷移。
YC 支持的 Moss 公司舉辦實作工作坊,現場演示亞 10ms 檢索。參與者可報名深入探討、與創辦人對談,並爭取暑期實習機會。結束時將有精彩禮品抽獎。
瑪特廖什卡表示學習在嵌入壓縮下維持優異效能。然而,近期研究顯示在某些檢索任務中效能下降。社群徵求其他限制的論文與實驗。