為 16GB VRAM 調校 Qwen3.8
一名 LocalLLaMA 使用者分享了在 Windows 上,於約 16GB VRAM 內執行 Qwen3.8 27B IQ4-XS-MTP GGUF 模型的配置。該設定透過將多模態元件與特定張量移至系統 RAM,以量化品質與速度換取 90K–100K 的上下文視窗。
Tag: #context-window28 results
一名 LocalLLaMA 使用者分享了在 Windows 上,於約 16GB VRAM 內執行 Qwen3.8 27B IQ4-XS-MTP GGUF 模型的配置。該設定透過將多模態元件與特定張量移至系統 RAM,以量化品質與速度換取 90K–100K 的上下文視窗。

Z.ai 的 GLM 5.3 現已透過 Vercel AI Gateway 提供,相較 GLM 5.2,在複雜軟體工程、多步驟代理任務與漏洞探索方面有所提升。開發者可使用 `zai/glm-5.3` slug,並將其整合至 Claude Code、Codex、OpenCode、Cursor 與 Pi 等程式設計代理。

阿里巴巴推出 Qwen3.5-397B-A17B,這款開源權重 MoE 模型擁有 3970 億總參數,但每 token 僅激活 170 億,基準測試超越自家萬億參數 Qwen3-Max。它在 256K 上下文長度下解碼速度快 19 倍,運行成本降低 60%,並從頭訓練具備原生多模態能力,涵蓋文字、圖像與影片。託管版本支援高達 100 萬 token。
本文主張 AI Agent 的未來在於「上下文獲取」(Context Acquisition),即智慧地捕捉、篩選並更新相關用戶資訊的能力,而非僅僅擴展記憶容量。

研究人員推出了潛在上下文語言模型 (LCLMs),這是一種在解碼器處理前壓縮輸入 token 的編碼器-解碼器架構。此方法顯著減少了記憶體與運算瓶頸,效能優於傳統的 KV 快取壓縮技術。

騰訊開源 Hy3 預覽版,這是一個擁有 295B 參數的混合專家模型,具備 256K 上下文窗口。此發布結束了一週的忙碌,包括 3D 世界模型以及 QClaw 消費代理的全球 Beta 版。這突顯騰訊專注於工具、記憶體和工作流程的「韁繩」層,以主宰代理時代。

小米認領了排行榜首位的神秘模型 Hunter Alpha。該模型擁有萬億參數和百萬 token 上下文長度。即使「龍蝦之父」等知名人士也忍不住打聽。
Anthropic 推出 Claude Opus 4.6 與 Sonnet 4.6,完整 100 萬令牌上下文窗口以標準價格提供。無長上下文附加費,全長度適用完整速率限制。定價:Opus 每百萬令牌 5 美元輸入/25 美元輸出;Sonnet 3 美元/15 美元。

OpenAI 工程師在 Codex 的 GitHub 拉取請求中意外提及「gpt-5.4」。該模型據傳下週上線,具備 200 萬 token 上下文視窗與持久化狀態,告別頻繁遺忘。

OpenClaw v2026.2.17 釋出版本,啟用 Anthropic Opus 和 Sonnet 的百萬 Token 上下文窗口。新增 Sonnet 4.6 支援,並更新 iOS、Slack、Telegram、Discord 及 cron 系統。