來源ArXiv AI•近期收集於 19h
開放 7B 模型瞄準數學與代理搜尋

#agentic-search#long-context#training-efficiencyzgcm-1zgcm-1qwen3glm-5.1
完全開放的 7B 模型宣稱以小得多的規模達到近似前沿的數學與搜尋表現。
30 秒速覽
有什麼變化
ZGCM-1 是完全開放的 7B dense 基礎模型。
為什麼重要
ZGCM-1 顯示,小型開放模型不必只依靠規模,也能透過刻意思考與工具使用提升能力。其開放訓練方法可能對尋求低成本領域基礎模型的團隊很有價值。
下一步行動
下載 ZGCM-1,並在固定評估集上將其工具使用與數學表現與目前的 7B 模型比較。
誰應關注:Researchers & Academics
關鍵要點
- •ZGCM-1 是完全開放的 7B dense 基礎模型。
- •它透過交錯滑動視窗與完整注意力支援 256K 上下文。
- •訓練方法使用 FP8 Muon 最佳化器與逐步上下文擴展。
- •作者報告 16K 預訓練 time-to-loss 效率約提升 4.2 倍。
- •模型以數學推理及搭配外部工具的代理搜尋為目標。
深度解析
背景與延伸:來自公開資料,非原文內容。引用 2 個來源。
增強重點摘要
- •ZGCM-1 是由中關村人工智慧研究院(Zhongguancun Academy)完全從頭訓練(from scratch)的 7.39B 稠密基礎模型,非基於現有模型蒸餾或續訓而成。
- •訓練採用的上下文課程式學習將長度逐步由 16K 擴展至 64K,最終達到 256K tokens,專門支援長鏈思維推理與跨大文本工具互動。
- •後訓練(SFT 與 RL)將外部工具互動及搜尋軌跡形式化為馬可夫決策過程(MDP),使模型能在深思模式與直接工具呼叫間動態切換。
- •在基準測試中,該模型於 MATH-500 與多步代理搜尋表現上,宣稱可匹敵參數規模大得多的 Qwen3-235B-A22B 與 GLM-5.1。
- •該專案實現全流程開源,除了釋出雙語資料集 ZGCM-1-Data,亦公開預訓練、中度訓練至後訓練的完整檢查點、程式碼與 Weights & Biases 訓練日誌。
競品分析
ZGCM-1
- 參數量 / 架構
- 7.39B Dense
- 上下文長度
- 256K
- 核心定位與優勢
- 結合 FP8 Muon 與交錯滑動視窗注意力,主打數學推理與 MDP 代理搜尋
- 開源程度
- 完全開源(含資料集、全階段檢查點與 W&B 日誌)
DeepSeek-R1-0528-Qwen3-8B
- 參數量 / 架構
- 8B Dense
- 上下文長度
- 未揭露
- 核心定位與優勢
- 強調強化學習驅動的純長鏈內在思維推理
- 開源程度
- 開放權重
MiniCPM4.1-8B
- 參數量 / 架構
- 8B Dense
- 上下文長度
- 未揭露
- 核心定位與優勢
- 聚焦端側邊緣運算與高效率推論部署
- 開源程度
- 開放權重
Olmo 3 7B Think
- 參數量 / 架構
- 7B Dense
- 上下文長度
- 未揭露
- 核心定位與優勢
- 全開源學術推理模型,側重純文字推理任務
- 開源程度
- 完全開源
| 模型名稱 | 參數量 / 架構 | 上下文長度 | 核心定位與優勢 | 開源程度 |
|---|---|---|---|---|
| ZGCM-1 | 7.39B Dense | 256K | 結合 FP8 Muon 與交錯滑動視窗注意力,主打數學推理與 MDP 代理搜尋 | 完全開源(含資料集、全階段檢查點與 W&B 日誌) |
| DeepSeek-R1-0528-Qwen3-8B | 8B Dense | 未揭露 | 強調強化學習驅動的純長鏈內在思維推理 | 開放權重 |
| MiniCPM4.1-8B | 8B Dense | 未揭露 | 聚焦端側邊緣運算與高效率推論部署 | 開放權重 |
| Olmo 3 7B Think | 7B Dense | 未揭露 | 全開源學術推理模型,側重純文字推理任務 | 完全開源 |
技術深入
- 參數量與架構:精確規模為 7.39B 參數的稠密(dense)語言模型,非蒸餾產生。
- 注意力機制設計:捨棄傳統均勻的全注意力架構,採用交錯門控滑動視窗注意力(Interleaved Gated Sliding-Window Attention)與全注意力混合機制,大幅降低顯存佔用並提升吞吐量。
- 訓練硬體與最佳化:採用 FP8 混合精度搭配 Muon 最佳化器,在 16K 初始上下文預訓練階段達到約 4.2 倍的 time-to-loss 效率提升。
- 進階上下文擴展策略:透過漸進式中度訓練(Mid-training),階段性推進上下文長度:16K → 64K → 256K。
- 代理後訓練架構:將工具呼叫與搜尋互動過程正式表述為馬可夫決策過程(MDP),實現內部推理與外部環境反饋的動態切換。
- 訓練資料集釋出:釋出 ZGCM-1-Data 中英雙語資料集,涵蓋網路爬取、論文、數學、程式碼及各階段代理人軌跡資料。
前景展望基於引用來源的 AI 分析
7B 等級邊緣端模型將普遍具備匹敵超大模型的特定任務推理能力
透過將參數容量聚焦於核心推理邏輯並外接工具搜尋,小模型可克服參數記憶上限而在特定基準上達到千億級別性能。
全透明開源(含訓練日誌與中繼檢查點)將成為 AI 社群驗證重現性的新標準
ZGCM-1 釋出原始 W&B 訓練日誌與各階段檢查點,加大了其他僅釋出最終權重的偽開源專案在學術界所面臨的公信力挑戰。
時間線
2026-09
中關村人工智慧研究院正式發表 ZGCM-1 7.39B 模型技術報告,並開源 ZGCM-1-Data 訓練資料集與各階段檢查點
- 2026-09中關村人工智慧研究院正式發表 ZGCM-1 7.39B 模型技術報告,並開源 ZGCM-1-Data 訓練資料集與各階段檢查點
來源 (2)
Factual claims are grounded in the sources below. Forward-looking analysis is AI-generated interpretation.
AI 週報
閱讀本週精選 AI 大事摘要 →
AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: ArXiv AI ↗
每週電子報
每週一封,可隨時退訂。