Search

Tag: #reasoning112 results

Phi-4-Vision 以 1/5 資料匹敵巨頭

Phi-4-Vision 以 1/5 資料匹敵巨頭

Microsoft 推出 Phi-4-reasoning-vision-15B,這是 15B 參數的開放權重多模態模型,在視覺語言任務、數學/科學推理與 GUI 導航表現出色。僅用 200B 多模態 token 訓練—僅對手 1/5—透過優異資料策劃匹敵更大模型。即刻在 Hugging Face 與 GitHub 上架。

RLVR 勝 SFT:Qwen2.5 數學 +11.9 分

RLVR 勝 SFT:Qwen2.5 數學 +11.9 分

在 GSM8K 上以 RLVR (GRPO) 及 SFT 訓練 Qwen2.5-1.5B-Instruct;RLVR 提升數學推理 +11.9 分,甚至單例也改善無關 MATH。SFT 則惡化 -15.2 分。基準測試 388 檢查點,資料在 HF Spaces/GitHub。

Reddit r/MachineLearningCommunityMar 3#fine-tuning#reasoning#rlhf
LLM-WikiRace 揭示 LLM 規劃限制

LLM-WikiRace 揭示 LLM 規劃限制

LLM-WikiRace 是一個新基準,用於評估大型語言模型透過維基百科超連結從來源頁面導航至目標頁面的長期規劃與推理能力。先進模型如 Gemini-3、GPT-5 和 Claude Opus 4.5 在簡單層級表現出色,但在困難層級成功率僅 23%。分析顯示,知識僅是必要條件,超過門檻後規劃能力主導,且頂尖模型在錯誤後難以重新規劃。

ArXiv AIResearchFeb 20#benchmark#planning#reasoning
Page 6 of 12