微調 NVIDIA Cosmos Predict 2.5 進行機器人影片生成
本文探討使用 LoRA 與 DoRA 方法微調 NVIDIA Cosmos Predict 2.5 模型。重點在於將該模型針對機器人相關的影片生成任務進行適應性調整。
Tag: #lora7 results
本文探討使用 LoRA 與 DoRA 方法微調 NVIDIA Cosmos Predict 2.5 模型。重點在於將該模型針對機器人相關的影片生成任務進行適應性調整。
團隊微調與部署 Gemma-4 的經驗揭露關鍵問題:PEFT 與自訂層不相容、SFTTrainer 因 KV 共享靜默失敗、DeepSpeed 儲存空適配器,以及伺服工具缺乏即時 LoRA 支援。修復包括解包層、更新 transformers、避免 DeepSpeed,以及手動合併權重。

ProgramasWeights 將英文函數描述編譯成 22MB LoRA 適配器和偽程式,透過 llama.cpp 在固定 Qwen 0.6B 解釋器上本地運行。由 4B LM 編譯器在 1000 萬合成範例上訓練。在 FuzzyBench 達 73.4%,媲美 32B 提示且成本低。
Tinylora 論文展示僅用 13 參數透過 LoRA 改變模型行為。在 Qwen3.5 上複製確認結果,使用每個 MLP/注意力層 13 參數(總 26)有改善。暗示類似 Engram 的微小行為適配器潛力。

IBM 推出 Granite-4.0-3B-Vision,一款小型 VLM,用於企業文件提取,包括圖表轉 CSV/程式碼、複雜表格轉 JSON/HTML,以及語義 KVP。作為 Granite 4.0 Micro 的 LoRA 提供,支援文字/視覺雙用;與前版相容。

mlx-tune 是一個用 Python 撰寫的程式庫,利用 Apple 的 MLX 框架在 Apple Silicon 上原生微調 LLM。它支援 SFT、DPO、ORPO、GRPO、KTO、SimPO 訓練器以及 VLM 微調(已測試 Qwen3.5),API 仿 Unsloth/TRL,便於跨平台使用。具備 LoRA/QLoRA、15 個模型家族的聊天模板,以及 8GB+ 統一 RAM 的 GGUF 匯出功能。
Evaluates LoRA for parameter-efficient fine-tuning of LLMs on organic reaction datasets like USPTO and C-H functionalisation. Matches full fine-tuning accuracy while preserving multi-task performance and mitigating forgetting. Reveals distinct reactivity patterns for better adaptation.