
Xiaohongshu 開源 280B 多模態模型
Xiaohongshu 發布 dots3-note preview,這是一個總參數 280B、啟用參數 16B 的開放權重 MoE 模型。該模型支援 512K 上下文,以及文字、視覺與語音理解,並以 Apache 2.0 授權釋出。
Tag: #long-context85 results

Xiaohongshu 發布 dots3-note preview,這是一個總參數 280B、啟用參數 16B 的開放權重 MoE 模型。該模型支援 512K 上下文,以及文字、視覺與語音理解,並以 Apache 2.0 授權釋出。
一名獨立開發者表示,他以 300 億個 FineWeb tokens 訓練 SHADOW-250M,這個 2.5 億參數 LLM 經量化後低於 2 bits。據稱模型可在筆電 CPU 上以每秒約 400 tokens 運行,並透過磁碟上的 1-bit 壓縮機制,從最長 1 億 tokens 的歷史內容中進行檢索。

一名開發者表示,透過兩組 PLX PEX88096 交換器連接 16 張 RTX 5060 Ti 16GB,DeepSeek V4 Flash-0731 可達約每秒 130–150 個 token。該配置在 Tensor Parallelism 8 下支援最高 500,000 token context,在 Tensor Parallelism 4 下則可達 100 萬 token。
一項在搭載 ROCm 的 AMD R9700 上進行的社群測試指出,Qwen3.8-27B 使用 FP16 與 q8_0 KV cache 時,在品質與長上下文記憶方面存在明顯差異。測試者表示,FP16 能產生更謹慎的結構化輸出,並在超過 120k token 後維持表現,這挑戰了兩種格式等效的普遍假設。
OpenAI 發布 GPT-5.4,這是其最強大且高效的前沿模型,專為專業工作設計。它在編碼、電腦使用、工具搜尋方面達到最先進水準,並支援 1M 權重上下文視窗。

一名 Reddit 使用者表示,透過 llama.cpp,他在 RTX 5060 Ti 16GB 上讓 Qwen3.8-27B 執行 73,728-token 的上下文視窗。在代理式程式設計測試中,模型處理超過 100 萬個 tokens,僅用三個提示就完成了可運作的 REST API 與 MCP Server。

阿里已開放 Qwen3.8-2.4T-A95B 權重,這是 Qwen-Max 級別模型首次開放權重。該 MoE 模型擁有 2.4T 總參數、每個 Token 啟用 95B 參數,原生支援 256K 上下文,並鎖定程式設計、辦公、科研與長週期 Agent 任務。

Huawei 已開源 openPangu-2.0-Pro,內容包括模型權重、推理程式碼與技術報告。該模型具備 5050 億參數、1800 億稀疏啟用參數及 512K 上下文視窗,並完全使用 Ascend NPU 訓練。

一個名為「Kivine」的神祕模型現身 LMArena,其強大的長上下文處理能力與外界對 Moonshot AI 下一代模型 Kimi K3 的預期高度吻合。後台洩漏資訊與性能表現顯示該模型即將正式發布。

Kimi K3 模型作為全球最大規模的開源模型發布,具備原生視覺理解能力與 100 萬 token 上下文窗口。該模型針對軟體工程與深度研究等複雜任務進行了優化。