Nemotron 3 Nano微調策略
自學從業者轉向微調NVIDIA的Nemotron 3 Nano(混合Mamba-MoE)用於多任務推理,尋求相對於密集模型的策略變更。主要疑慮:MoE路由器/Mamba-2的LoRA、負載平衡、遺忘。使用H100上40-80k蒸餾範例。
Tag: #fine-tuning102 results
自學從業者轉向微調NVIDIA的Nemotron 3 Nano(混合Mamba-MoE)用於多任務推理,尋求相對於密集模型的策略變更。主要疑慮:MoE路由器/Mamba-2的LoRA、負載平衡、遺忘。使用H100上40-80k蒸餾範例。
團隊微調與部署 Gemma-4 的經驗揭露關鍵問題:PEFT 與自訂層不相容、SFTTrainer 因 KV 共享靜默失敗、DeepSpeed 儲存空適配器,以及伺服工具缺乏即時 LoRA 支援。修復包括解包層、更新 transformers、避免 DeepSpeed,以及手動合併權重。

這份實作指南涵蓋使用 Nova Forge SDK 微調 Amazon Nova 模型,從資料準備到資料混合訓練與評估。提供可重複的 playbook,可適應自訂使用案例。第二部建基於先前的 SDK 系列。
兩個相同模型的 LLM 代理在程式設計問題上競爭;執行較佳者形成 DPO 對微調,重複循環。純執行獎勵 (通過率),適合本地硬體具專家溫度及記憶整合。早期 Colab A100 結果:HumanEval Pass@1 從 0.671 至 0.683 (+1.2pp)。
在 Hugging Face 發布全新 10 萬樣本 Chain-of-Thought 數據集,用於微調本地推理模型。每樣本含明確中間推理軌跡以提升一致性。徵求 CoT 長度、風格及對小型模型影響的反饋。

Unsloth 已更新 Hugging Face 上所有 Gemma-4 上傳,包含 Google 最新 commit 的聊天模板及其他修正。使用者應重新下載以獲改進。社群感謝團隊在 Gemma-4 發行後的快速支援。

這篇文章引導使用 Amazon Bedrock 微調 Amazon Nova 模型,以意圖分類器為例。涵蓋準備訓練資料、設定超參數、部署模型,並使用指標和損失曲線評估結果,以提升準確度和降低延遲。

Pramana利用Navya-Nyaya的六階段推理框架精調LLM,提升認知基礎並減少幻覺。在保留評估的邏輯問題上,Llama 3.2-3B與DeepSeek模型達100%語義正確性。所有模型、資料集與程式碼均在Hugging Face釋出。

Unsloth 支援在 8GB VRAM 上本地微調 Gemma 4 E2B/E4B,比 FlashAttention-2 快 1.5 倍且 VRAM 少 60%。修復梯度累積損失爆炸、26B/31B 索引錯誤、use_cache 問題及 float16 音頻溢位等 bug。提供文字、視覺、音頻的免費 Colab 筆記本及 Unsloth Studio UI。

本文展示如何在 Amazon SageMaker 中使用 RLVR 微調 Qwen 2.5 7B Instruct 以實現代理工具呼叫。涵蓋三種代理行為的資料集準備、分層獎勵函數、訓練設定、在未見工具上的評估,以及無伺服器部署。