
國產多模態Agent拿下醫學分割SOTA!不用改模型、不加token
國產開發的多模態Agent在醫學影像分割達成最先進效能,無需修改模型或額外token。此研究已被CVPR 2026接收,突顯高效能代理方法。
Tag: #zero-shot10 results

國產開發的多模態Agent在醫學影像分割達成最先進效能,無需修改模型或額外token。此研究已被CVPR 2026接收,突顯高效能代理方法。

估值20億美元的蘇度科技推出首款具身AI模型Sudo R1。以零真機數據,在零樣本設定下實現98%首次抓取成功率。此首秀展現機器人操作的先進能力。

CourtGuard 是一個檢索增強的多代理框架,將 LLM 安全視為基於外部政策文件的證據辯論。它在 7 個安全基準上無需微調即達到最先進性能,超越專用政策遵循基線。它在零樣本適應性(Wikipedia 破壞任務達 90% 準確率)和自動化 9 個對抗性數據集策展方面表現出色。

僅使用單一兒童視覺資料訓練的零樣本世界模型(ZWM),在視覺認知任務上零樣本即達到最先進模型水準。縮小了 AI 與人類兒童間的巨量資料差距。為人類規模資料的資料高效 AI 提供藍圖。
結構化 5 層提示無需微調,將 Tulu(低資源達羅毗荼語)的詞彙污染從 80% 降至 5%。層級包含音韻基礎、形態學、負面約束、羅馬化、自玩範例。在 GPT-4o、Gemini 2.0 Flash、Llama 3.1 70B 上驗證。

原力靈機發布了全新 DM0.5 模型,該模型經過 15 萬小時的數據訓練。其 Zero-Shot 性能提升了 31%,並展現出泛化湧現的跡象。

「Query Retrieve Conclude」框架透過檢索即時網路證據,解決了解釋動態新興迷因的挑戰。該框架在迷因理解與偵測任務中,表現優於現有的零樣本基準模型。

這篇 ArXiv 論文使用零樣本、CoT 和 ToT 提示,在 400 個 Solidity 智慧合約上基準測試 LLM 的錯誤檢測與分類。CoT 和 ToT 在檢測任務中將召回率提升至 95-99%,但降低精確度。Claude 3 Opus 以 ToT 在錯誤分類中取得 90.8 加權 F1 分數領先。
為期兩年的專案使用MARL「車隊經理」(PPO)處理高階叢集/調度,以及LP「碼頭工人」處理箱裝/TSP,優化即時線haul物流網路。透過正規化密度圖實現零樣本泛化。分享完整架構深入剖析。
Multi-dimensional zero-shot benchmark evaluates four TSFMs (Chronos, Moirai, TinyTimeMixer) vs. baselines on ERCOT data. Tests context sensitivity, calibration, robustness to shifts like COVID/Winter Storm. Top models hit MASE 0.31; Chronos-2 best calibrated.