
4Chan 數據提升 8B/70B 模型
使用 4chan 數據訓練 8B 與 70B 模型優於基模型,為罕見微調成功。模型卡片詳述基準測試結果。提供 Reddit 討論與 HF 儲存庫連結。
Tag: #fine-tuning102 results

使用 4chan 數據訓練 8B 與 70B 模型優於基模型,為罕見微調成功。模型卡片詳述基準測試結果。提供 Reddit 討論與 HF 儲存庫連結。
Hugging Face 發布 TRL v1.0,這是一個後訓練庫,即使 AI 領域推翻其基礎假設仍能持續運作。它支援如 RLHF 等穩健微調方法,應對快速進展。此穩定工具幫助開發者維持可靠模型對齊。

通用大模型在分鏡腳本上缺乏鏡頭節奏、視覺細節及格式穩定。作者使用自製資料集精調如Qwen等開源模型,提升適合AI生圖的電影化輸出。涵蓋模型選擇、資料製作及踩坑經驗。

Unsloth Studio 新版新增預編譯二進位檔、20-30% 更快推論、改良工具呼叫與跨平台安裝。修復 Windows/Mac 安定性、CPU RAM 問題與 Colab 支持。MLX/AMD/API 功能即將推出。

AWS 整合 Amazon S3 通用儲存桶與 SageMaker Unified Studio,便利 ML 工作流程中使用非結構化資料。本文示範使用 SageMaker Catalog 微調 Llama 3.2 11B Vision Instruct 進行視覺問答。簡化 S3 儲存資料的 LLM 訓練。
部落格文章從頭介紹視覺變換器(ViTs),包含補丁嵌入、位置編碼及僅編碼器分類模型的視覺說明。討論優缺點、真實應用,並提供影像分類微調教學。連結關鍵論文,對比 ViTs 與其他影像表示方法。
Hugging Face 部落格文章提供一天內建立領域特定嵌入模型的指南。它簡化了針對語意搜尋和 RAG 等專門 AI 任務的微調。從業人員可快速調整開源模型以適應其資料。

TeachingCoach 是一款微調聊天機器人,為高等教育教師提供即時、教學基礎的指導。它使用資料導向管道從教育資源提取規則,並產生合成對話來微調模型。專家評估顯示其在清晰度和回應性上優於 GPT-4o mini,使用者研究指出深度與效率的權衡。

研究人員建置文字多代理《Clue》遊戲,評估 GPT-4o-mini 與 Gemini-2.5-Flash 的多步推論推理能力。在 18 場模擬遊戲中,代理僅獲四次正確勝利,難以維持一致推理。邏輯拼圖微調未可靠提升表現,有時僅增加推理冗長而非精準。
一個涵蓋 8 種語言的 125k 程式碼資料集已在 Hugging Face 上發布,用於訓練和升級程式碼模型。使用隱藏的 Hunter Alpha 模型免費生成。完整 450k 版本即將推出,並開放合作。