
Kimi K3:全球最大規模開源模型發布
Kimi K3 模型作為全球最大規模的開源模型發布,具備原生視覺理解能力與 100 萬 token 上下文窗口。該模型針對軟體工程與深度研究等複雜任務進行了優化。
Tag: #multi-modal27 results

Kimi K3 模型作為全球最大規模的開源模型發布,具備原生視覺理解能力與 100 萬 token 上下文窗口。該模型針對軟體工程與深度研究等複雜任務進行了優化。

Meissa 是一款 4B 參數的多模態醫療 LLM,透過從 GPT 等前沿模型蒸餾軌跡實現離線代理功能。它具備統一軌跡建模、三層分級監督用於策略選擇,以及前瞻-回顧學習用於執行。在 40K 軌跡訓練下,它在 13 個醫療基準上匹配或超越專有代理,參數少 25 倍、延遲低 22 倍;完全開源。
騰訊遊戲發布 2026 年暑期未成年人保護專項行動,採用 AI 雙引擎防沉迷模式。整合 Hunyuan 與 DeepSeek 模型,提供家長對話式管理與遊戲內多模態身份驗證。

Perceptron 推出旗艦影片分析推理模型 Mk1,比 Anthropic 的 Claude Sonnet 4.5、OpenAI 的 GPT-5 及 Google 的 Gemini 3.1 Pro 便宜 80-90%。定價為每百萬輸入 token 0.15 美元、輸出 1.50 美元,在 EmbSpatialBench (85.1) 和 VSI-Bench (88.5) 等空間與影片基準測試中表現出色。提供公開演示網站供測試。

Gemini Omni Agent 即將推出,並整合 Avatars 支援。新横幅顯示可使用圖像、文字和片段製作影片的功能。個人化 Avatars 將提升使用者互動體驗。

小米正式開源其雙模型 MiMo-V2.5-Pro,能無中斷運行「macOS」模擬,同時開啟 54 個應用,並支援真實瀏覽器衝浪。本次發布還包含 1 兆 token 免費發放,以及新興 Agent 框架免費接入。

Guaardvark 是一個開源的自託管 AI 平台,透過 Ollama 在使用者硬體上完全離線運行。它具備 RAG 聊天、圖像/影片生成、語音互動、自改善代理,以及多機同步等功能。僅需一條指令即可簡單設定,並可透過 ComfyUI 等插件擴展。

Lemonade v10 引入 Linux NPU 支援,並提供強大的多模態功能,包括圖像生成/編輯、轉錄和語音合成。它支援 Ubuntu、Arch、Debian、Fedora 和 Snap,使用單一基底 URL 供應用程式使用。控制中心應用程式有助於模型和後端管理,並有社群挑戰提供 AMD 筆電。
Qwen Code SDK v0.1.8 引入了多模態輸入支援、改進了 API 提供商的錯誤處理機制,並增強了子代理追蹤功能。此版本還針對 CLI 執行和 IDE 輔助工具整合進行了重要的穩定性修復。

一套新型 AI 系統問世,在識別虛假線上評論方面達到了超過 94% 的準確率。該系統透過交叉比對文字內容、圖像以及使用者行為模式來達成此目標。