🗾較早收集於 45m

Ricoh 推出可「日語推論」多模態 LLM

Ricoh 推出可「日語推論」多模態 LLM
PostLinkedIn
🗾閱讀原文: ITmedia AI+ (日本)
#japanese-llm#multimodal#vision-languageqwen3-vl-ricoh-32b-20260227ricohqwen3-vl-ricoh-32b-20260227gemini-2.5-pro

💡全新 32B 日語多模態 LLM 匹敵 Gemini 2.5 Pro 文件/圖表表現(45字)

⚡ 30-Second TL;DR

有什麼變化

320 億參數多模態 LLM,針對日語推論優化

為什麼重要

此模型提升日語 AI 能力,可能降低對英文中心 LLM 的依賴,利於日本從業者的多模態文件分析應用。

下一步行動

透過 Hugging Face 下載並基準測試 Qwen3-VL-Ricoh-32B-20260227 在日語 OCR 任務上的表現。

誰應關注:Researchers & Academics

關鍵要點

  • 320 億參數多模態 LLM,針對日語推論優化
  • 能處理包含圖表與圖形的複雜日語文件
  • 宣稱性能匹敵 Gemini 2.5 Pro

🧠 深度解析

本篇為 AI 生成分析,非原文內容。

🔑 增強重點摘要

  • Ricoh 採用了基於阿里巴巴 Qwen3-VL 的開源架構進行二次開發,並針對日本企業常見的複雜文件格式(如含有手寫註記的 PDF)進行了專門的微調。
  • 該模型整合了 Ricoh 自有的 OCR(光學字元辨識)引擎技術,使其在處理低解析度掃描文件時的圖表解析準確率優於通用型多模態模型。
  • Ricoh 計劃將此模型部署於其「RICOH Intelligent Data Management」雲端平台,旨在為製造業與金融業提供在地化部署的隱私保護解決方案。
📊 競品分析▸ Show
特性Qwen3-VL-Ricoh-32BGemini 2.5 ProGPT-4o
參數規模320 億未公開 (MoE架構)未公開
日語推論優化極高 (針對日本商務場景)高 (通用型)高 (通用型)
部署模式支援地端/私有雲雲端 API雲端 API
核心優勢複雜圖表與掃描件解析多模態綜合推理能力生態系統整合度

🛠️ 技術深入

  • 模型基礎:基於 Qwen3-VL 視覺語言模型架構。
  • 參數規模:320 億參數 (32B)。
  • 視覺編碼器:針對高密度文字與圖表混合頁面進行了視覺特徵提取優化。
  • 推論優化:採用了針對日語語法與商務術語的特定領域指令微調 (SFT)。
  • 部署架構:支援量化部署 (INT4/INT8),以適應企業級邊緣運算伺服器。

🔮 前景展望AI analysis grounded in cited sources

Ricoh 將在 2026 年底前將此模型整合至其全線複合機產品線。
Ricoh 正在推動硬體設備的 AI 邊緣化,以實現文件即時處理與自動化分類。
此模型將顯著降低日本企業採用多模態 AI 的合規成本。
透過在地化部署與針對日語文件的優化,企業可減少將敏感資料傳輸至海外雲端的需求。

時間線

2025-06
Ricoh 宣佈啟動「AI 轉型加速計畫」,投入資源開發專用 LLM。
2025-11
Ricoh 內部測試基於 Qwen 系列架構的日語視覺模型原型。
2026-02
正式發布 Qwen3-VL-Ricoh-32B-20260227 版本。
📰

AI 週報

閱讀本週精選 AI 大事摘要 →

👉相關動態

AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: ITmedia AI+ (日本)

這是摘要,不是原文。去看原站,或訂閱每週簡報。

每週 AI 簡報

每週一封,可隨時退訂。