
Gemini 3.1 Pro:處理最複雜任務的更智能模型
DeepMind 推出 Gemini 3.1 Pro,這是一款更智能的 AI 模型,專為複雜任務設計。它在簡單回應不足的情況下表現出色,能實現進階問題解決。
Tag: #reasoning112 results

DeepMind 推出 Gemini 3.1 Pro,這是一款更智能的 AI 模型,專為複雜任務設計。它在簡單回應不足的情況下表現出色,能實現進階問題解決。

來自 xAI 的 Grok 4.6 現已透過 Vercel AI Gateway 提供,支援 500K token 上下文視窗,以及文字和圖片輸入。開發者可選擇 low、medium、high 或 xhigh 推理等級,預設為 high,也能透過 AI SDK 或 coding agents 使用該模型。

Woodpecker Distillation 顯示,強大語言模型的失敗往往源於中間推理步驟中的局部錯誤,而非整體能力不足。該方法利用弱模型的對比式介入與後續 token 分布,在數學推理基準上提升強模型的表現。

Qwen 開發團隊表示全新的 27B 模型即將發布,並稱其能力將大幅提升,而不只是重新訓練版本。他們也透露 Qwen3.8 的細節,包括 2.4T 總參數、95B 活躍參數、大量後訓練運算,以及用於處理超過 100 小時影片的階層式影片記憶方法。

ARCANA 是一個協作式多代理框架,旨在於嚴格限制下解決複雜的 ARC-AGI-2 任務。它結合了以物件為中心的感知、潛在程式策略和反思性回饋,以提高推理效率。

程序記憶蒸餾(PMD)是一種新的訓練框架,透過從模型輸出中提取跨情境模式來建立可重複使用的程序記憶。這種記憶作為訓練支架,使模型能夠內化策略並提升效能,且在推論階段無需額外記憶。

本研究引入了「能力切片」(capability slice) 框架,旨在彌合模型評估失敗與針對性數據干預之間的差距。透過按任務類型和操作對評估樣本進行分類,工程師可以系統性地診斷並修復模型缺陷。

ToE (Tree of Evidence) 是一個將聲明建模為動態論證樹的新框架,旨在提升自動化事實查核能力。它利用強化學習驅動的檢索與證據聚合技術,以對抗 AI 生成的錯誤資訊與 GEO 毒化攻擊。

研究人員提出了一種三階段訓練流程,使 LLM 代理具備「假設性」推理能力。透過內化世界模型,代理可以在執行前模擬未來結果並評估計畫。

MER-R1 是一個全新的強化學習框架,透過平衡快思維的直覺與慢思維的精確度,優化多模態情緒識別。該框架解決了召回率與精確度之間的權衡問題,並在 MER-UniBench 等基準測試中達到業界領先水平。