Search

直接匹配不多,已補上最新動態。

Tag: #rft1 results

LLM 後訓練的策略價值

LLM 後訓練的策略價值

作者認為,與單純的推論相比,後訓練是一項高價值且非同小可的技能。它涉及複雜的資料合成、監督式微調 (SFT) 以及新興的強化微調 (RFT) 技術,以解決特定的業務問題。

Reddit r/LocalLLaMACommunityJun 26#fine-tuning#rft#engineering
Ox Alpha:神秘模型公開亮相

Ox Alpha:神秘模型公開亮相

Ox Alpha 是一款透過 OpenRouter 與 OpenCode 提供的匿名模型,具備 100 萬 token 上下文、圖片與影片輸入、工具呼叫及免費使用等能力。早期測試顯示其推理與程式設計表現強勁,但開發者、參數量、訓練資料與正式基準排名仍未獲確認。