🐼Pandaily•最新收集於 13m
匿名 Ox Alpha 模型稱霸程式設計基準測試

#coding-benchmarks#anonymous-model#frontier-models#model-evaluationox-alphaox alphaopenrouter
💡一個未知的免費模型據報擊敗封閉式領先模型;趁熱度擴散前先驗證這項說法。
⚡ 30-Second TL;DR
有什麼變化
OpenRouter 悄悄上架了匿名且免費的 stealth/ox-alpha 模型。
為什麼重要
若經獨立驗證,Ox Alpha 可能加大封閉式模型供應商的競爭壓力,也讓人難以僅根據公司公開模型陣容預測程式設計能力。匿名發布亦凸顯當前沿模型透過第三方路由器分發時,追蹤其能力的困難。
下一步行動
透過 OpenRouter 對 stealth/ox-alpha 執行符合自身需求的程式設計任務評測,並在採用前與目前的生產模型比較。
誰應關注:Developers & AI Engineers
關鍵要點
- •OpenRouter 悄悄上架了匿名且免費的 stealth/ox-alpha 模型。
- •據報該模型在實際程式設計任務上的表現超越數個封閉式前沿模型。
- •模型來源不明,引發外界對中國隱密模型開發策略的跨國猜測。
🧠 深度解析
背景與延伸:來自公開資料,非原文內容。引用 10 個來源。
🔑 增強重點摘要
- •Ox Alpha 具備 100 萬個 token 的上下文視窗,並支援文字、圖像與影片的多模態輸入。
- •獨立研究人員透過 tokenizer 探測與伺服器端錯誤代碼追蹤,發現其與智譜 AI (Zhipu AI) 的 GLM 模型家族高度吻合。
- •儘管在 DeepSWE 基準測試子集表現優異,但在更廣泛的 113 項任務測試中,其實際得分約為 63%。
- •OpenRouter 提供的免費測試期僅限於 2026 年 8 月 20 日至 8 月 27 日,屬限時公開策略。
- •此匿名發布模式與 2024 年的「gpt2-chatbot」策略相似,旨在正式發布前收集真實世界的用戶反饋與數據。
📊 競品分析▸ Show
| 模型名稱 | 程式設計基準測試表現 | 價格模式 | 多模態支援 |
|---|---|---|---|
| Ox Alpha | 高 (DeepSWE 80%) | 免費 (限時) | 文字/圖像/影片 |
| GPT-4o | 極高 | 付費 | 文字/圖像/影片 |
| Claude 3.5 Sonnet | 極高 | 付費 | 文字/圖像 |
| GLM-5.3 (推測) | 高 | 依 API 計費 | 文字/圖像/影片 |
🛠️ 技術深入
- 架構推測:基於智譜 AI 的 GLM-5.3 模型變體。
- Tokenizer 特徵:與 GLM-5 詞彙表匹配度達 95/95。
- 基礎設施:伺服器端追蹤顯示 Java 類別路徑與 Z.ai 基礎設施相關。
- 隱私政策:OpenRouter 確認提供商會保留提示詞與輸出內容,但承諾不將其用於後續模型訓練。
🔮 前景展望AI analysis grounded in cited sources
智譜 AI 將於 2026 年第四季正式發布 GLM-5.3 的視覺增強版。
Ox Alpha 的匿名測試通常是大型模型正式發布前的最後壓力測試階段。
匿名模型發布將成為中國 AI 實驗室獲取國際市場反饋的標準手段。
透過 OpenRouter 等中立平台進行匿名測試,可規避品牌偏見並獲取真實的開發者使用數據。
⏳ 時間線
2026-08-20
OpenRouter 上架匿名模型 Ox Alpha 並開放免費測試。
📎 來源 (10)
Factual claims are grounded in the sources below. Forward-looking analysis is AI-generated interpretation.
📰
AI 週報
閱讀本週精選 AI 大事摘要 →
👉相關動態
AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: Pandaily ↗
每週 AI 簡報
每週一封,可隨時退訂。


