
算力,而非參數,才是 AI 智能的關鍵
唐杰指出,參數量並不是衡量 AI 能力的完整指標。更有意義的 Scaling Law 衡量方式是計算量,也就是訓練或推理所使用的 FLOPs。
Tag: #model-scaling25 results

唐杰指出,參數量並不是衡量 AI 能力的完整指標。更有意義的 Scaling Law 衡量方式是計算量,也就是訓練或推理所使用的 FLOPs。
月之暗面(Moonshot AI)正準備推出其下一代模型 Kimi K3。該模型預計將具備 2 萬億至 3 萬億的龐大參數規模。

WeChat 正在灰度測試內建於應用程式中的 AI 助手 Xiaowei,該助手由 WeLM 驅動。WeLM 現已採用稀疏 MoE 架構,總參數達6170億,但每個 token 僅啟用230億參數,團隊也正在探索 Hidden Decoding。

Tencent 的 WeChat AI 團隊介紹了 WeLM 模型系列的 Hidden Decoding 擴展方法。團隊在不增加主要 Transformer 骨幹的情況下,訓練 WeLM-HD4-80B 與 WeLM-HD4-617B,實現大幅增加總參數量。
據報導,ByteDance 成立了名為「AI 資料與安全」的一級部門,與 Seed、Flow 和抖音等部門平行運作。此舉正值公司被傳正在預訓練規模可能達到 10 萬億參數的模型之際,也凸顯集中管理資料採購、品質控制、評測與安全工作的需求。

Cursor 與 SpaceX 旗下公司(特別是 xAI)結盟,獲取強大計算叢集存取權。此聯盟旨在大幅擴展 Cursor AI 模型的智能水平。這標誌著該 AI 程式碼工具的策略性重生。
探討大模型架構的下半場,引入Flash Depth Attention與混合深度注意力。此機制實現LLM更深層擴展。聚焦巨型模型深度延伸。

馬斯克據傳洩露參數量:Anthropic 的 Claude Opus 達 5 兆,Sonnet 1T。xAI 的 Grok 4.2 總參數 0.5T。此消息引發前沿模型擴展猜測。

中國AI公司包括Alibaba Cloud和Zhipu AI不將最新模型開源,以透過官方渠道獲取收入。此趨勢因模型規模過大難以在本地硬體託管而起。這些公司表示並未放棄開源策略。
橫跨 4 款小型 LLM(360M-1B 參數)的 18 項實驗顯示,支架原始(Layer 0a:SOMEONE、TIME、PLACE)與內容原始(Layer 0b:FEAR、GRIEF)間存在激活差距,平均 +0.245,且隨規模縮小。11 種組合匹配 Layer 1 概念;可透過 Ollama 重現。