
Nvidia 證明代理程式框架才是真正主角
Nvidia 的研究顯示,即使底層模型不擅長特定任務,AI 代理程式仍可透過微調展現良好效能並維持穩定。這項發現將焦點從單純的模型能力,轉向代理程式框架的設計與訓練方式。
Tag: #fine-tuning102 results

Nvidia 的研究顯示,即使底層模型不擅長特定任務,AI 代理程式仍可透過微調展現良好效能並維持穩定。這項發現將焦點從單純的模型能力,轉向代理程式框架的設計與訓練方式。

AntLing 已發布六個官方 Ling-3.0 基礎檢查點,涵蓋兩種模型尺寸與三個訓練階段。這些採用 MIT 授權且無存取限制的儲存庫, предназначено 用於持續預訓練、微調與研究,而非直接聊天使用。
Empirisch Tech 開源 Chaperone-Thinking-LQ-1.0,這是 4-bit GPTQ 量化與 QLoRA 微調的 DeepSeek-R1-32B 模型,在 MedQA 上達 84%。可在單一 L40 GPU 的 20GB VRAM 運行,比基底快 1.6 倍。設計用於本地醫療保健,尊重資料主權。
微調 Qwen2.5-Coder-14B-Instruct 名為 Steelman R5 14B,在自訂 Ada 編譯基準上勝過 Claude Opus 4.6(68.6% 對 42.1%)。在 HumanEval-Ada 上達成首個開放模型 pass@1 47.1%。可在 Hugging Face 和 Ollama 以 GGUF 量化取得。
一名實作者表示,使用 10 萬份法院判決微調 Gemma 4 26B A4B 後,在生成法律原則方面仍未超越透過提示使用的基礎模型。討論聚焦於瓶頸是否來自資料品質、評估設計、任務複雜度或微調流程。
研究人員證實,透過教師模型的輸出對基礎模型進行微調,會導致模型繼承特定的行為特徵(如負面情緒或審查機制),即使過濾掉明確提及這些特徵的內容也無法完全阻止。此研究提供了一種無需大規模 SFT 流程即可重現這些現象的方法。

SRM-LoRA 是一項於 ICML 2026 工作坊發表的研究,利用次黎曼度量(sub-Riemannian metrics)重新塑造 LoRA 梯度。此方法能有效抑制導致幻覺的更新路徑,且不會增加推論成本。

本指南展示如何使用 Amazon SageMaker 對 NVIDIA Nemotron 3 模型進行無伺服器微調。內容涵蓋 Nemotron 3 的獨特架構優勢,並提供客製化的逐步操作流程。

一項新的研究方法透過將微調限制在由受信任的 LoRA 適配器定義的子空間內,來防止模型中毒。這使得惡意行為在幾何上變得無法達成,同時保持模型學習合法任務的能力。

USAF 是一種針對混合專家模型 (MoE) 的新型稀疏微調方法,讓原本僅能進行推論的硬體也能執行微調。透過訓練稀疏專家權重與路由器而非傳統適配器,大幅降低了本地模型客製化的門檻。