
Ricoh 推出可「日語推論」多模態 LLM
Ricoh 開發了 Qwen3-VL-Ricoh-32B-20260227,這是一款擁有 320 億參數的多模態 LLM,能以日語進行推論。宣稱性能匹敵 Gemini 2.5 Pro,並可讀解包含複雜圖表的日語資料。
Tag: #multimodal329 results

Ricoh 開發了 Qwen3-VL-Ricoh-32B-20260227,這是一款擁有 320 億參數的多模態 LLM,能以日語進行推論。宣稱性能匹敵 Gemini 2.5 Pro,並可讀解包含複雜圖表的日語資料。

美團開源了 LongCat-Next,這是一個真正的原生多模態模型。它將文字、視覺和音頻統一為單一架構中的 token,無需獨立的模態編碼器。

Meta 內部工具顯示 Avocado 變體正在評估中:9B 模型、多模態 Mango 代理、TOMM 工具模型、Thinking 5.6,以及純文字 Paricado。這暗示即將推出具代理與多模態功能的開源模型。來自洩露選擇器圖像。

天工AI在全模態領域領先後,進軍世界模型領域。國產玩家不再藏拙。宣告邁入AI原生平台經濟時代。
深度機智為中關村學院與中關村人工智能研究院孵化首家具身智能企業,於3月27日中關村論壇發布PhysBrain 1.0。該模型採用人類學習範式與多模態大模型架構,將物理常識內化於參數中,具備物理世界理解的時空一致性。以有限數據實現真正泛化能力。

Google 在日本及所有啟用 AI 模式的地區推出「Search Live」功能。由 Gemini 3.1 Flash Live 驅動,可進行即時語音與相機互動,具備更好的音訊細微差別理解及情緒適應回應。並與 Google Lens 整合,提供使用者偏好語言的視覺支援。

字節跳動推出 Dreamina Seedance 2.0 新一代多模態影片生成模型,已正式整合至 CapCut 影片剪輯應用。OpenAI 關閉 Sora 應用之際,字節跳動加碼消費級影片生成領域。意在提升全球創作者工具市場競爭力。

谷歌 TurboQuant 將 AI 記憶體使用量縮減 6 倍,導致 SanDisk 和 Micron 股價下跌。本文拆解其背後的軟硬體博弈。這可能刺激多模態 AI 在企業與消費端的規模化應用。
Google 為 Google TV 推出三項 Gemini AI 功能:更豐富的視覺幫助處理如體育比分和食譜查詢、互動主題深度探索,以及語音體育簡報。這些功能將被動觀看轉為教育體驗。美國即刻推出,後續擴展。