💼VentureBeat•較早收集於 29m
Weibo 的 3B 模型在基準測試中挑戰 AI 擴展定律

💡一個 3B 模型據稱擊敗了 600B+ 的巨頭:這是真正的突破,還是僅僅在基準測試上作弊?
⚡ 30-Second TL;DR
有什麼變化
VibeThinker-3B 在 AIME 2026 基準測試中獲得 94.3 分,與 671B 參數的 DeepSeek V3.2 旗鼓相當。
為什麼重要
如果得到證實,這表明更小、高度優化的模型可能會顛覆業界對大規模參數的依賴,並迫使我們重新評估衡量 LLM「智慧」的方式。
下一步行動
查看 VibeThinker-3B 的 GitHub 儲存庫,分析其測試時擴展技術的實作,並評估是否能將類似技術應用於您自己的小型模型中。
誰應關注:Researchers & Academics
關鍵要點
- •VibeThinker-3B 在 AIME 2026 基準測試中獲得 94.3 分,與 671B 參數的 DeepSeek V3.2 旗鼓相當。
- •研究團隊使用了名為「Claim-Level Reliability Assessment」的專有技術來提升推理分數。
- •該模型在 IMO-AnswerBench 和 LiveCodeBench 等複雜數學與程式設計基準測試中表現優異。
- •AI 社群正質疑這些結果是真正的突破,還是僅僅針對基準測試進行了優化(Benchmark gaming)。
🧠 深度解析
Web-grounded analysis with 19 cited sources.
🔑 增強重點摘要
- •VibeThinker-3B 是一個 30 億參數的密集推理模型,其基礎是 Qwen2.5-Coder-3B,並採用了升級版的「頻譜到信號原則 (Spectrum-to-Signal Principle, SSP)」後訓練管道,該管道結合了基於課程的監督式微調、多領域強化學習、離線自蒸餾和指令導向強化學習。
- •該模型在可驗證推理任務(如數學、編碼和 STEM)上的卓越表現,歸因於其提出的「參數壓縮覆蓋假設 (Parametric Compression-Coverage Hypothesis)」,該假設認為這些能力可以高度壓縮到緊湊的推理核心中。
- •「聲明級可靠性評估 (Claim-Level Reliability Assessment, CLR)」是一種推理時擴展策略,它進一步提升了 VibeThinker-3B 在可驗證數學基準測試上的性能,例如將其 AIME 2026 分數從 94.3 提高到 97.1。
- •VibeThinker-3B 在 2026 年 4 月至 5 月期間的最新未見 LeetCode 每週和雙週競賽中,達到了 96.1% 的提交通過率,展現了強大的分佈外泛化能力。
- •該模型專為具有明確驗證信號的任務而設計,並非旨在取代大型通用聊天機器人,因為大型模型在廣泛知識和開放域對話方面仍具有優勢。
📊 競品分析▸ Show
| 模型名稱 | 參數數量 | 架構 | AIME 2026 分數 | IMO-AnswerBench 分數 | 備註 |
|---|---|---|---|---|---|
| VibeThinker-3B | 30 億 | 密集模型 | 94.3 (CLR 97.1) | 76.4 (CLR 80.6) | 專注於可驗證推理,挑戰擴展定律 |
| DeepSeek V3.2 | 6710 億 (370 億活躍) | 稀疏專家混合 (MoE) | - (VibeThinker-3B 聲稱可媲美) | 78.3 | 統一對話速度與深度推理,成本效益高 |
| GLM-5 | 7440 億 | - | 95.8% (GLM-5.1) | 82.5 | 前沿推理模型 |
| Kimi K2.5 | 1 兆 | - | 95.8% | 81.8 | 前沿推理模型 |
| Qwen3.6 Plus | - | - | 95.3% | 83.8% (Qwen3.6 Plus) | 前沿推理模型 |
| Gemini 3 Pro | - | - | - (VibeThinker-3B 聲稱可媲美) | - | 前沿推理模型 |
| GPT-5 | - | - | 100% | - | 在 AIME 2026 上表現出色 |
🛠️ 技術深入
- 模型架構: VibeThinker-3B 是一個 30 億參數的密集推理模型,基於 Qwen2.5-Coder-3B 構建。
- 訓練管道: 遵循 VibeThinker-1.5B 中引入的「頻譜到信號原則 (Spectrum-to-Signal Principle, SSP)」。
- SFT 階段: 構建廣泛的有效推理軌跡。
- RL 階段: 使用可驗證的獎勵放大正確的推理信號。
- 優化管道: 包含基於課程的監督式微調、多領域強化學習、離線自蒸餾和指令導向強化學習。
- 推理時擴展策略: 採用「聲明級可靠性評估 (Claim-Level Reliability Assessment, CLR)」。CLR 專注於影響問題解決關鍵決策的重要聲明,而非聚合整個推理過程。
- 核心假設: 該模型基於「參數壓縮覆蓋假設 (Parametric Compression-Coverage Hypothesis)」,認為可驗證的推理是一種高度可壓縮、參數密集的技能,緊湊型模型可以在其中實現接近前沿的性能。
- 推薦推理設置: 建議使用 vLLM 或 SGLang,設置 temperature=1.0, top_p=0.95, top_k=-1。
- 輸出令牌支持: 支持高達 102K 的輸出令牌。
🔮 前景展望AI analysis grounded in cited sources
小型模型將在特定、可驗證的推理領域中挑戰大型模型的霸主地位。
VibeThinker-3B 的表現證明,通過專門的訓練技術和推理時策略,小型模型可以在數學和編碼等領域達到與大型旗艦模型相當的性能,這將促使更多針對特定能力的緊湊型模型出現。
AI 基準測試的設計和有效性將面臨更嚴格的審查和持續演變。
VibeThinker-3B 的發布引發了關於基準測試有效性的激烈爭論,以及模型是否僅針對基準測試進行優化,這將加速業界對更具抗污染性、更貼近實際應用場景的評估方法的探索。
AI 擴展定律的傳統觀點將被重新定義,更加強調「智能擴展」而非單純的「參數擴展」。
隨著前沿模型的回報遞減和小型模型在特定領域的突破,業界將從單純增加模型規模轉向更智能的擴展策略,例如推理時計算、專家混合架構和更好的數據策劃。
⏳ 時間線
2009-08
新浪微博 (Sina Weibo) 推出
2023-07
Weibo 推出對話式 AI 聊天機器人 CommentR
2025-11
WeiboAI 宣布 VibeThinker-1.5B 開源並發布技術報告
2026-05
Weibo 推出首個 AI 專屬社交社區「矽茶室」
2026-06
WeiboAI 發布 VibeThinker-3B 模型,挑戰 AI 擴展定律
📎 來源 (19)
Factual claims are grounded in the sources below. Forward-looking analysis is AI-generated interpretation.
📰
AI 週報
閱讀本週精選 AI 大事摘要 →
👉相關動態
AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: VentureBeat ↗