SHADOW-250M:僅 60 MB 的長上下文 LLM
一名獨立開發者表示,他以 300 億個 FineWeb tokens 訓練 SHADOW-250M,這個 2.5 億參數 LLM 經量化後低於 2 bits。據稱模型可在筆電 CPU 上以每秒約 400 tokens 運行,並透過磁碟上的 1-bit 壓縮機制,從最長 1 億 tokens 的歷史內容中進行檢索。
Tag: #open-weights77 results
一名獨立開發者表示,他以 300 億個 FineWeb tokens 訓練 SHADOW-250M,這個 2.5 億參數 LLM 經量化後低於 2 bits。據稱模型可在筆電 CPU 上以每秒約 400 tokens 運行,並透過磁碟上的 1-bit 壓縮機制,從最長 1 億 tokens 的歷史內容中進行檢索。

中國 AI 新創公司 z.ai 已透過 API 發布 GLM-5.3,開發者可將模型整合至代理程式與應用程式中。定價維持與 GLM-5.2 相同,每百萬輸入 token 為 1.40 美元、每百萬輸出 token 為 4.40 美元,快取輸入則為 0.26 美元。

Google DeepMind 推出 Gemma 4,這是開放權重多模態模型,尺寸包括 E2B、E4B、26B A4B 和 31B。它們處理文字、圖像、影片和音訊,具備高達 256K 上下文,並強化推理、程式設計和代理功能。提供 Dense 和 MoE 變體,適合裝置端部署。

文章探討 OpenAI 策略負責人 Dean W. Ball 的觀點:開放權重模型可能降低前沿模型投資的商業回報。文章則認為,開放權重或許會壓縮模型層的壟斷利潤,但會把價值轉移至算力、資料、部署、軟體、硬體與產業應用。

Alibaba 釋出 Qwen3.8-2.4T-A95B(又稱 Qwen3.8-Max)的開放權重,這是其目前最大的開放權重模型。NVIDIA Developer Blog 說明如何在 NVIDIA GB300 NVL72 上部署此 2.4T 參數模型,並配置推理能力。

文章介紹 Moonshot AI 的 Kimi K3,稱其為擁有 2.8 兆參數、在程式設計、知識、推理與視覺任務上達到前沿水準的開源模型。文章認為,Kimi K3 的發布在美國引發重大爭論,原因是低成本開放權重模型可能削弱閉源模型供應商的定價能力與監管優勢。

Huawei 已開源 openPangu-2.0-Pro,內容包括模型權重、推理程式碼與技術報告。該模型具備 5050 億參數、1800 億稀疏啟用參數及 512K 上下文視窗,並完全使用 Ascend NPU 訓練。
隨著《歐盟人工智慧法》進入強制執行階段,中國模型供應商進入歐洲市場時將面臨透明度、版權與系統性風險等義務。然而,歐洲企業仍因成本較低、可在本地部署,以及擔心依賴美國供應商,而採用 DeepSeek、Qwen、Kimi 和 GLM。

Moonshot 推出的 2.8 兆參數 Kimi K3 模型,在效能上展現出與 GPT-4o 和 Claude 3.5 Sonnet 競爭的實力。值得注意的是,它維持開放權重架構,為開發者提供了一個強大的替代選擇。

Moonshot AI 發布了擁有 2.8 兆參數的 Kimi K3 模型。此舉旨在於競爭激烈的 AI 市場中爭取開發者忠誠度。