
Nvidia 證明代理程式框架才是真正主角
Nvidia 的研究顯示,即使底層模型不擅長特定任務,AI 代理程式仍可透過微調展現良好效能並維持穩定。這項發現將焦點從單純的模型能力,轉向代理程式框架的設計與訓練方式。
Tag: #model-efficiency30 results

Nvidia 的研究顯示,即使底層模型不擅長特定任務,AI 代理程式仍可透過微調展現良好效能並維持穩定。這項發現將焦點從單純的模型能力,轉向代理程式框架的設計與訓練方式。

一名創作者在原版 Minecraft 中使用 445,782 個命令方塊打造可運作的 AI 聊天機器人,完全不需要模組、插件或資料包。透過避開命令方塊數學運算能力有限的問題,改良後的實作將規模從超過一百萬個方塊大幅縮減。

一項複製研究確認,原始 FLOPs 無法可靠預測 AI 執行時間,因為不同運算的平行化特性並不相同。在新一代硬體上的測試也發現,執行時間存在 α-FLOPs 公式通常低估的跳躍與振盪現象。

Ant Group 擁有 11 億參數的 LingBot-Vision 基礎模型,在效能上超越了 Meta 的 70 億參數 DINOv3。該模型屬於 LingBot-Depth 2.0 空間感知套件的一部分,並創下了 12 項世界第一的基準測試紀錄。

Liquid AI 發布了 LFM2.5-230M,這是一款專為邊緣裝置高效數據提取而設計的 2.3 億參數模型。它採用 LFM2 架構,在保持低於 400MB 記憶體佔用的同時,效能超越了多款規模更大的模型。

ByteDance 旗下的火山引擎已具備大規模量產媲美 Anthropic Opus 4.6 等級模型的能力。此進展大幅降低了部署頂尖 AI 功能的成本門檻。

Pythagoras-Prover 是一個全新的高效能 Lean 定理證明模型系列,在 MiniF2F 基準測試中達到了領先水準。透過使用增強型形式化(ALF)與課程微調技術,該模型能以遠少於現有巨型模型的參數規模,提供卓越的推理能力。

In2AI 解決方案引入了延遲的每步獎勵歸因技術,以解決複雜的多智能體強化學習挑戰。該模型在 MindGames Arena 基準測試中超越了 GPT-5 等大型模型,證明了 8B 參數模型的高效能。

字節跳動 Seed 團隊在 CVPR 2026 發表四篇論文,聚焦於計算效率優化,包括單步生成技術與動態 KV Cache 壓縮。這些創新旨在解決高算力需求下的推理成本與硬體依賴問題。
NVIDIA 發布了擁有 300 億參數的開放模型 Nemotron 3.5 Lightning。該模型專為 OpenClaw 等常時運作的代理設計,據稱以約四分之一的規模達到接近 gpt-oss-120b 的效能。