
周浩加盟阿里通義千問,前Gemini核心推手
前谷歌DeepMind周浩,Gemini 3.0後訓練核心,加盟阿里通義實驗室,正值領導層變動。中科大數學畢業生帶來從LaMDA到Gemini的RL、多步推理專長。定位通義千問代理AI進展於推理與自我演化。
Tag: #reasoning112 results

前谷歌DeepMind周浩,Gemini 3.0後訓練核心,加盟阿里通義實驗室,正值領導層變動。中科大數學畢業生帶來從LaMDA到Gemini的RL、多步推理專長。定位通義千問代理AI進展於推理與自我演化。

Llama.cpp 引入基於 sampler 的推理預算,限制思考 token 並強制終止。包含 --reasoning-budget-message 旗標平滑轉換,在 Qwen3 9B HumanEval 上從 78% 恢復至 89%。鼓勵實驗最佳設定。
科研AI推出強大開源30B參數模型,挑戰Gemini與Claude。它完整實現「假設-證據-驗證」推理循環。這推進LLM中可及的科學推理。

Luma 推出 UNI-1,這是視覺理解與影像生成的統一模型。它合併文字與影像處理來處理推理任務。
Microsoft 推出 Phi-4-reasoning-vision-15B,這是 15B 參數的開放權重多模態模型,在視覺語言任務、數學/科學推理與 GUI 導航表現出色。僅用 200B 多模態 token 訓練—僅對手 1/5—透過優異資料策劃匹敵更大模型。即刻在 Hugging Face 與 GitHub 上架。

在 GSM8K 上以 RLVR (GRPO) 及 SFT 訓練 Qwen2.5-1.5B-Instruct;RLVR 提升數學推理 +11.9 分,甚至單例也改善無關 MATH。SFT 則惡化 -15.2 分。基準測試 388 檢查點,資料在 HF Spaces/GitHub。
LLM-WikiRace 是一個新基準,用於評估大型語言模型透過維基百科超連結從來源頁面導航至目標頁面的長期規劃與推理能力。先進模型如 Gemini-3、GPT-5 和 Claude Opus 4.5 在簡單層級表現出色,但在困難層級成功率僅 23%。分析顯示,知識僅是必要條件,超過門檻後規劃能力主導,且頂尖模型在錯誤後難以重新規劃。

Andrej Karpathy 正倡議將《魔戒》作為評估大型語言模型的新基準。這項提議可用於測試模型處理及推理長篇複雜敘事的能力。

一項禁用外部工具的測試比較 Opus 5 與 GPT-5.6,並認為兩者的能力差距因此更加清晰。文章也指出,更強的原生推理能力可能降低傳統提示詞工程的重要性。

AWS 引入了 Self-Distilled Reasoning (SDR),旨在為監督式微調 (SFT) 中缺乏明確推理軌跡的數據集注入推理能力。此方法解決了推理抑制問題,並為提升 Amazon Nova 的模型性能提供了框架。