微調服務基準測試報告
對微調服務進行成本、速度與使用者體驗的基準測試,用於自訂模型。Nebius 在函數呼叫效率上表現出色。領域快速演變;完整分析連結提供。
Tag: #fine-tuning102 results
對微調服務進行成本、速度與使用者體驗的基準測試,用於自訂模型。Nebius 在函數呼叫效率上表現出色。領域快速演變;完整分析連結提供。
Tinylora 論文展示僅用 13 參數透過 LoRA 改變模型行為。在 Qwen3.5 上複製確認結果,使用每個 MLP/注意力層 13 參數(總 26)有改善。暗示類似 Engram 的微小行為適配器潛力。
標準 LoRA 縮放在 FP8 E4M3 硬體上溢位凍結適配器,造成 68% 品質損失。新 b-bit 浮點縮放方法將損失降至 5.2%,過擬合降 33 倍。在 A100、H200 和 B300 上驗證,詳見 koscak.ai。

Intercom 推出 Fin Apex 1.0,這款小型後訓練 AI 模型在客服解析率上勝過 GPT-5.4(73.1% 對 71.1%)及 Claude 模型。它提供更快的 3.7 秒回應、幻覺減少 65%,且成本僅五分之一。此模型擁有數億參數,基於開源權重,驅動 Intercom 的 Fin AI 代理。

研究人員提出將微調與檢索結合,用於 LLM 代理以實現對未見任務的更好泛化。他們開發了優越的 LoRA 基礎 SFT 配方,並分析儲存、查詢和選擇的最佳檢索策略。整合管道超越了最先進方法。

樂天推出 Rakuten AI 3.0,號稱日本最大 7000 億參數模型,日語基準勝 GPT-4o。經 config.json 揭為 DeepSeek V3,未提基模且初無授權,儘管獲 GENIAC 政府資助。引發誤導與民族主義反彈。

Together AI 已擴展其微調服務,新增工具呼叫、推理及視覺語言模型的原生支援。現在支援 100B+ 參數模型訓練,提供最高 6 倍吞吐量,並附工作成本與 ETA 估計。

mlx-tune 是一個用 Python 撰寫的程式庫,利用 Apple 的 MLX 框架在 Apple Silicon 上原生微調 LLM。它支援 SFT、DPO、ORPO、GRPO、KTO、SimPO 訓練器以及 VLM 微調(已測試 Qwen3.5),API 仿 Unsloth/TRL,便於跨平台使用。具備 LoRA/QLoRA、15 個模型家族的聊天模板,以及 8GB+ 統一 RAM 的 GGUF 匯出功能。

對 15 款小型語言模型在 9 項任務進行基準測試,找出最佳微調模型。Qwen3-8B 以最佳平均排名和一致性領先。LFM2-350M 在可調性增益上表現出色;Qwen3-4B 在 8/9 基準測試中勝過 120B 教師模型。

在 Amazon EC2 上微調排行榜領先的 NVIDIA Nemotron 語音自動辨識模型 Parakeet TDT 0.6B V2。使用合成語音資料進行領域適應轉錄,適用專門應用。端到端工作流程結合 AWS 基礎設施與開源框架。