
阿里千問開源 Qwen3.5 小尺寸模型
阿里千問開源四款 Qwen3.5 小尺寸模型:0.8B、2B、4B、9B。繼承強大多模態能力,適用邊端設備至緊湊伺服器。目前 Qwen3.5 家族全系列已在魔搭社區與 Hugging Face 開源。
Tag: #multimodal329 results

阿里千問開源四款 Qwen3.5 小尺寸模型:0.8B、2B、4B、9B。繼承強大多模態能力,適用邊端設備至緊湊伺服器。目前 Qwen3.5 家族全系列已在魔搭社區與 Hugging Face 開源。

SleepLM 推出基礎模型,將多模態多導睡眠圖與自然語言對齊,用於睡眠分析。它策劃首個大規模睡眠-文字資料集,來自超過 10 萬小時、涵蓋 10,000 多人的資料。此模型在零/少樣本任務、檢索、標題生成中超越 SOTA,並具備語言引導事件定位等新能力。
Reddit 貼文詳細說明如何在 opencode 中使用 llama.cpp 啟用 Qwen 3.5 的多模態圖像理解。使用者需在 opencode.json 檔案中新增「modalities」設定,指定文字與圖像輸入。這可讓 35B 模型在本地運行視覺功能。

Google 為 Gemini 3 Flash 推出新功能「Agentic Vision」,結合視覺推論與程式碼執行。它會自動產生 Python 程式碼調查影像,將影像理解精度提升 10%。

Gemini 3.1 Flash Image Preview(Nano Banana 2)現已在 AI Gateway 上線,提升視覺品質同時維持 flash 階層的速度與成本。它使用 Google Image Search 以真實世界資料 grounding 影像,並引入可配置思考等級(Minimal/High)來處理複雜提示。新解析度如 512p 及長寬比(1:4、1:8)支援更多創意資產。
清華大學數學系頂尖人才跳槽加入OpenAI。他先前主導Meta的SAM影像分割模型與Llama大型語言模型開發。OpenAI的Sora專案負責人公開歡迎他加入。

Pika 以 AI 影片聞名,推出 AI Selves,讓使用者創造並養育個性化 AI 分身,可自訂人格、記憶,甚至如花生過敏等細節。這些數字分身能處理群聊、製作遊戲、打電話,並在 X、Discord 等平台上與使用者共同進化。它從文字代理轉向影片訓練的多模態具身。

Hugging Face 推出 LFM2.5-VL-3B,這是一款旨在為邊緣裝置提供更佳、更快速視覺能力的視覺語言模型。此次更新強調適合需要本地端或低延遲多模態推理的應用情境。

紫东太初推出適用於多模態模型的 GMC 核心集剪枝方法。這項免訓練、開箱即用的技術據稱可減少 80% Token 使用量,同時保留多模態能力。

Ming-Flash-Omni 被介紹為全模態統一基礎模型。文章聚焦於建構可端到端處理多種模態模型的關鍵技術與實務經驗。