停止使用過濾版 Opus 資料集,改用原版
nohurry 敦促使用者停止使用他過濾版的 Opus-4.6-Reasoning-3000x 資料集,因為 Crownelius 已更新原版。過濾版僅為臨時修復拒絕回應。透過 ko-fi 捐款給 Crownelius。
Tag: #fine-tuning102 results
nohurry 敦促使用者停止使用他過濾版的 Opus-4.6-Reasoning-3000x 資料集,因為 Crownelius 已更新原版。過濾版僅為臨時修復拒絕回應。透過 ko-fi 捐款給 Crownelius。
使用者使用 DPO 在心理治療資料集上微調 Gemma 3 4B,採用 QLoRa 和 PeFT 在 RTX 3050Ti 筆電上執行。尋求本地評估基準以比較基底模型。強調僅為實驗,非醫療建議。
像 Gemini 3 這樣的前沿模型提升了推理和編碼能力,但放棄了像素級圖像分割等功能。OpenAI 和 Anthropic 已停用舊版 GPT 和 Claude 變體,影響文件提取等利基任務的精細 OCR。專門微調模型提供可靠替代方案,無需通用能力分散注意力。
使用 Opus 4.6、程式設計和 OpenClaw 資料集微調 Qwen 3.5 9B,推出 Crow-9B-Opus-4.6-Distill-Heretic_Qwen3.5 模型。模型現已在 Hugging Face 上發布。作者鼓勵透過 Ko-fi 支持,並在 Hugging Face 上點讚追蹤。
使用敏感客戶資料微調面臨大量非技術障礙,如資料存取記錄、合規與合約。Together、Fireworks、Replicate 等供應商需法律審查,延遲 ML 工作。DeepInfra 因快速合規通過而被選中。
一名 Reddit 使用者尋求打造預算型電腦的建議,主要用於本地 AI 推論,以及對 10B 以下模型進行 LoRA/QLoRA 微調。主要選項是約 770 美元的 16GB RTX 5060 Ti,或價格可能更低的 16GB RTX 4060 Ti;CUDA 支援與 VRAM 容量比遊戲效能更重要。
Reddit 上的一場討論探討了現有的 Qwen 微調模型是否真的優於基礎模型。使用者對當前社群主導的微調工作之成效提出了質疑。

簡短討論了在沒有高階資料中心 GPU 的情況下執行與微調 LLM 的挑戰。該貼文強調了對本地 AI 社群中過於複雜的模型命名慣例的無奈。
貼文抨擊 LLM 輸出過度濫用「This isn’t X this is Y」短語。倡議從模型訓練中移除以提升生成品質。
律師建 10x Nvidia V100 SXM (320GB VRAM) Threadripper 伺服器,用於私人 RAG/QLORA 法律任務。分享 Linux 無頭 vLLM 初始基準,尋求寫作模擬及法律推理模型建議。Claude 用於協調安裝挑戰。