🦙較早收集於 2h

在 opencode 中啟用 Qwen 3.5 圖像理解

PostLinkedIn
🦙閱讀原文: Reddit r/LocalLLaMA

💡解鎖 Qwen 3.5 本地圖像理解—llama.cpp 使用者簡單 JSON 修改(內含教學)

⚡ 30-Second TL;DR

有什麼變化

新增「modalities」JSON 設定:輸入 ['text', 'image'],輸出 ['text']

為什麼重要

讓 Qwen 3.5 在本地支援多模態推論,減少開發者對雲端的依賴,並降低運行視覺語言模型的成本。

下一步行動

在 opencode.json 中新增 modalities 設定,並透過 llama-server 以圖像提示測試 Qwen3.5-35B-local。

誰應關注:Developers & AI Engineers

關鍵要點

  • 新增「modalities」JSON 設定:輸入 ['text', 'image'],輸出 ['text']
  • 針對 Qwen3.5-35B-local 模型,使用 llama-server 於 http://127.0.0.1:8001/v1
  • 上下文限制 122880 令牌,輸出限制 32768 令牌
  • 使用 @ai-sdk/openai-compatible npm 套件

🧠 深度解析

背景與延伸:來自公開資料,非原文內容。引用 4 個來源。

🔑 增強重點摘要

  • Qwen3.5 採用原生多模態架構,從訓練初始即整合文字與視覺處理,而非先前 Qwen3-VL 的附加式方法,提升視覺 grounding 準確度與處理速度。[1]
  • 模型擁有 250k 詞彙表及多令牌預測功能,可在單步預測多個未來詞彙,降低 10-60% 跨 201 語言的令牌成本。[1]
  • 透過異質基礎設施同時訓練視覺與語言部分,以及 FP8 壓縮與推測解碼的非同步強化學習,加速代理技能學習 3-5 倍。[1]

🛠️ 技術深入

  • Qwen3.5 的原生多模態意指單一模型從頭訓練處理文字、圖像、UI 截圖與結構化內容,支持視覺問答、文件理解、圖表解讀及像素級 grounding。[1]
  • 視覺與語言組件分開但同時訓練,實現近 100% 訓練吞吐量相較純文字模型;使用 FP8 壓縮儲存數字並以推測解碼運行數千任務,提升代理如 UI 點擊的多步驟能力。[1]

🔮 前景展望AI analysis grounded in cited sources

Qwen3.5 的原生多模態將推動本地多模態 LLM 普及
其高效訓練與 llama.cpp 相容性降低部署門檻,讓 35B 模型在家用硬體運行複雜視覺任務,提升開源社群創新。
多令牌預測將降低多語言應用成本
250k 詞彙與 10-60% 令牌節省適用於 201 語言,利於全球開發者建構低成本代理系統。

時間線

2025-09
發布 Qwen3.5 系列,引入原生多模態代理功能

📎 來源 (4)

Factual claims are grounded in the sources below. Forward-looking analysis is AI-generated interpretation.

  1. datacamp.com — Qwen3 5
  2. qwenlm.github.io
  3. qwen.ai — Research
  4. qwen.ai — Blog
📰

AI 週報

閱讀本週精選 AI 大事摘要 →

👉相關動態

AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: Reddit r/LocalLLaMA

這是摘要,不是原文。去看原站,或訂閱每週簡報。

每週 AI 簡報

每週一封,可隨時退訂。