🤖較早收集於 49h

4.5B ColQwen3.5-v1 於 ViDoRe V1 創 SOTA

PostLinkedIn
🤖閱讀原文: Reddit r/MachineLearning

💡開源 4.5B 模型於 ViDoRe 文件檢索基準創 SOTA(24字)

⚡ 30-Second TL;DR

有什麼變化

ViDoRe V1 SOTA #1 (nDCG@5 0.917),V3 具競爭力

為什麼重要

推動開源視覺文件檢索極限,提升財金/表格 RAG 效能。

下一步行動

從 Hugging Face 下載 ColQwen3.5-v1 並於 ViDoRe V1 基準測試。

誰應關注:Researchers & Academics

關鍵要點

  • ViDoRe V1 SOTA #1 (nDCG@5 0.917),V3 具競爭力
  • 基於 Qwen3.5-4B 採用 ColPali 晚期互動方法
  • 4 階段訓練:難負樣本挖掘、財金/表格文件專精
  • Apache 2.0 權重於 HF:https://huggingface.co/athrael-soju/colqwen3.5-v1

🧠 深度解析

背景與延伸:來自公開資料,非原文內容。引用 6 個來源。

🔑 增強重點摘要

  • Tomoro ColQwen3-8B 模型在 ViDoRe V3 基準上達到 nDCG@10 63.54,領先第二名 3%,並在 V2 英文版平均分 0.6772 排名第一[1][4]
  • ColQwen 系列先前版本如 colqwen2-v1.0 在 ViDoRe V1 達到 nDCG@5 89.3%,顯示從 Qwen2 到 Qwen3.5 的迭代進展[5]
  • ViDoRe V3 引入 Recall@k、mAP 及視覺 grounding 指標如 IoU 和 Dice/F1,即使頂尖模型在多跳查詢上 nDCG@10 仍低於 65%[3]
📊 競品分析▸ Show
模型參數規模ViDoRe V1 nDCG@5ViDoRe V3 nDCG@10授權
ColQwen3.5-v14.5B0.917未公布Apache 2.0
Nemotron ColEmbed V28B0.848063.54未指定
Nemotron ColEmbed V24BTop-6Top-6未指定
Tomoro ColQwen38B未公布0.6772 (V2 Avg)未指定
colqwen2-v1.0~2B0.893未公布Apache 2.0

🛠️ 技術深入

  • 採用 ColPali 晚期互動(late interaction)架構,基於 Qwen3-VL 產生平均 773 個視覺嵌入 per ViDoRe V3 頁面,支持動態解析度與 768 圖像 patch 訓練[2][5]
  • 訓練技巧包括正向感知硬負樣本挖掘(positive-aware hard-negative mining)、基於叢集的資料取樣、跨語言翻譯及模型合併(model merging,提升 0.8–1.5%)[2][3]
  • 雙向注意力 VLM 骨幹如 Qwen3-VL,提升 ViDoRe 效能;批次大小從 32 擴至 256 以更強 GPU 訓練[2][5]

🔮 前景展望AI analysis grounded in cited sources

ColQwen3.5-v2 將挑戰 ViDoRe V3 SOTA
基於 v1 在 V1 的領先及系列迭代歷史,v2 目標 V3 結合硬負樣本與專精訓練具競爭力[1][3]
晚期互動將主導視覺文件檢索
ViDoRe V2–V3 領先板顯示晚期互動遠勝 bi-encoder,兼顧效率與準確度[3]

時間線

2025-07
Llama-Nemoretriever 3B 在 ViDoRe V1 達 91.0
2025-11
ColMate-Pali-3B 及 colqwen2 系列發布,ViDoRe V1 達 89.3
2026-01
ViDoRe V3 引入新指標如 Recall@k 及視覺 grounding
2026-02
Nemotron ColEmbed V2 發布,ViDoRe V3 8B 模型達 SOTA
2026-03
ColQwen3.5-v1 在 ViDoRe V1 創 nDCG@5 0.917 SOTA
📰

AI 週報

閱讀本週精選 AI 大事摘要 →

👉相關動態

AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: Reddit r/MachineLearning

這是摘要,不是原文。去看原站,或訂閱每週簡報。

每週 AI 簡報

每週一封,可隨時退訂。