
GRPO 多語言推理差距小於預期
Apple Machine Learning 發表了一項大規模研究,探討 Group Relative Policy Optimization(GRPO)在非英語與多語言推理上的表現。研究發現,訓練模型以母語進行推理,其效果可能與訓練英語推理相近,對以英語為中心的 RLVR 假設提出挑戰。
Tag: #reasoning-models24 results

Apple Machine Learning 發表了一項大規模研究,探討 Group Relative Policy Optimization(GRPO)在非英語與多語言推理上的表現。研究發現,訓練模型以母語進行推理,其效果可能與訓練英語推理相近,對以英語為中心的 RLVR 假設提出挑戰。

DeepSeek 更新了 API 文件,要求在工具呼叫序列中保留「reasoning_content」。此變更凸顯了在 Agent 系統中管理中間狀態以確保執行穩定性的必要性。

Sina Weibo 的研究人員推出了 VibeThinker-3B,這是一款 30 億參數的模型,據稱其推理能力可媲美甚至超越大型旗艦模型。此發布在 AI 社群中引發了關於當前基準測試有效性的激烈爭論。
阿里巴巴發布了專為自主智能體任務優化的旗艦模型 Qwen3.7-Max。該模型在編程與推理能力上取得重大突破,並在國際基準測試中表現優異。
林俊旸離開阿里後揭露Qwen3混合思維模式失敗,因數據分佈不匹配。主張從推理鏈轉向「智能體思維」,強調行動導向、環境互動AI。借鏡Anthropic Claude演進,注重工具使用與反饋迴圈。

Moonshot AI 推出了 Kimi K3 模型,定價顯著高於 DeepSeek 等競爭對手。此舉顯示該公司正轉向高價值、複雜任務處理能力的市場定位。

RareDxR1 是一款以推理為核心的端到端大型語言模型,旨在直接從非結構化臨床筆記中診斷罕見疾病。它透過內化醫學知識並利用演化學習來提升診斷準確性,從而繞過傳統基於管線的提取方式。
研究顯示,使用獨立驗證者進行測試時間計算擴展,比自我反思或無驗證者方法更有效。將驗證者與生成器解耦,被視為提升 AI 代理可靠性與性能的關鍵架構轉變。
研究人員成功運用 OpenAI 推理模型協助醫師診斷複雜且先前無法解決的罕見遺傳疾病案例。該研究最終確認了 18 例新診斷,展示了推理模型在臨床診斷中的潛力。

Microsoft Research 發表了 NextLat,這是一種自我監督學習方法,能訓練 Transformer 預測自身的潛在狀態。此方法提升了模型的推理能力,並透過自我推測解碼實現高達 3.3 倍的推論加速。