
Ovis2.6-80B-A3B:具備主動視覺能力的 MoE 多模態模型
AIDC-AI 推出了 Ovis2.6-80B-A3B,這是一款採用專家混合(MoE)架構的多模態大型語言模型。它具備「圖像思考」(Think with Image)能力,允許模型在推理過程中主動操作視覺輸入。
Tag: #multimodal328 results

AIDC-AI 推出了 Ovis2.6-80B-A3B,這是一款採用專家混合(MoE)架構的多模態大型語言模型。它具備「圖像思考」(Think with Image)能力,允許模型在推理過程中主動操作視覺輸入。
NVIDIA 推出 Nemotron 3 Nano Omni,這是一款緊湊的長上下文多模態模型,用於建構處理文件、音頻和視頻的智能代理。該模型託管於 Hugging Face,推進高效多模態 AI 能力。此發布針對尋求輕量但強大解決方案的代理開發者。
商湯科技正式發布並開源日日新SenseNova U1系列原生理解生成統一模型。基於今年三月自主研發的NEO-unify架構,在單一模型架構上統一多模態理解、推理與生成。該模型將語言與視覺資訊作為統一複合體直接建模,實現高效協同,保留語義豐富度並維持像素級視覺保真度。

小米推出開源 MiMo-V2.5 和 V2.5-Pro 模型,採用 MIT 授權,可於 Hugging Face 下載用於商業應用。它們在如 OpenClaw 的代理「爪」任務中領先,Pro 版達 63.8% 成功率僅用 ~70K 令牌,比 Claude 或 GPT 少 40-60%。具 310B 參數與 1M 令牌上下文,挑戰閉源前沿模型。
全新無審查 Qwen3.6-27B Aggressive 模型發布,附優化 K_P GGUF 量化版本。實現 0 拒絕率,無能力損失,支持多模態輸入。對提示清晰度敏感;透過 Jinja 參數停用思考模式。
Qwen3.6-35B-A3B 的全新無審查激進變體發布,支援 K_P 量化與完整多模態功能。零拒絕、無能力損失,優化本地推理。包含多種量化版本、視覺 mmproj 與 262K 上下文。

Anthropic 推出 Claude Opus 4.7,其最強通用模型在 SWE-bench Pro 達 64.3%(優於 GPT-5.4 的 57.7%),支援長時程多代理協調、3 倍影像解析度,以及代理推理提升 14% 並減少工具錯誤。定價:每百萬 token 輸入 $5/輸出 $25。

Qwen3.6-35B-A3B 是全新開源稀疏 MoE 模型,總參數 35B,活躍參數 3B,採用 Apache 2.0 許可。代理編碼能力媲美活躍參數大 10 倍的模型,並具強大多模態感知與思考/非思考模式。可於 HuggingFace、ModelScope 及 Qwen Studio 下載。

Apple 配備相機的 AI AirPods 計畫據報仍按原定進度,目標於 2027 年推出。公司內部洩漏資訊曾暗示產品可能提前上市,但目前時程並未改變。

Microsoft 推出 MAI-Code-1.1-Flash,這款面向 GitHub Copilot 的升級程式設計模型具備更佳的基準測試表現,Token 生成速度提升 25%,完成相同任務所需的 Token 數量降低 25%。其價格降至初代模型的四分之一,並新增原生影像理解能力。