Search

直接匹配不多,已補上最新動態。

Tag: #confidence-control1 results

ReBalance 修正 LRM 過度/不足思考

ReBalance 修正 LRM 過度/不足思考

ReBalance 是一個無需訓練的框架,利用信心度作為動態指標,緩解大型推理模型 (LRM) 的過度思考與不足思考問題。它從隱藏狀態建立推理原型,並應用即時調變的導向向量來刪減冗餘或促進探索。在 0.5B-32B 模型及九項基準測試中,證實降低輸出冗餘並提升準確度。

Ox Alpha:神秘模型公開亮相

Ox Alpha:神秘模型公開亮相

Ox Alpha 是一款透過 OpenRouter 與 OpenCode 提供的匿名模型,具備 100 萬 token 上下文、圖片與影片輸入、工具呼叫及免費使用等能力。早期測試顯示其推理與程式設計表現強勁,但開發者、參數量、訓練資料與正式基準排名仍未獲確認。