🤖Reddit r/MachineLearning•較早收集於 39m
Cleo:將完整的分析師行為塞進 2B 模型中
#text-to-sql#data-analysiscleoqwencleosql
💡了解如何透過統一執行架構與 2B 小型模型,優化企業資料分析代理人的效能。
⚡ 30-Second TL;DR
有什麼變化
基於 Qwen3.5-2B-Base 建構,適用於資源受限的環境。
為什麼重要
此專案證明了小型專用模型在特定企業工作流程中,表現可超越大型通用模型。它為開發者提供了一套建構高效、安全且具成本效益的資料分析代理人的藍圖。
下一步行動
複製 Cleo 的 GitHub 儲存庫,並在您自己的資料庫架構上測試其 SQL 生成架構,評估 2B 模型是否符合您的生產環境準確度需求。
誰應關注:Developers & AI Engineers
關鍵要點
- •基於 Qwen3.5-2B-Base 建構,適用於資源受限的環境。
- •統一架構整合了模型合約、SQL 安全層與方言處理。
- •使用即時執行證據而非僅依賴模型機率來進行查詢搜尋。
- •完全開源,包含架構、模型權重與訓練資料集。
🧠 深度解析
背景與延伸:來自公開資料,非原文內容。引用 14 個來源。
🔑 增強重點摘要
- •Cleo所基於的Qwen3.5-2B模型是阿里巴巴雲於2026年2月/3月發布的2B參數多模態基礎模型,具備統一的視覺-語言能力和262k的原生上下文長度。
- •Qwen3.5-2B採用混合架構,結合了門控Delta網路(Gated Delta Networks)和門控注意力(Gated Attention),使其在資源受限環境中仍能保持高效能。
- •小型語言模型(SLMs)如Cleo,透過針對特定領域的微調,能夠在數據分析等專業任務上展現出與大型通用模型相媲美甚至超越的性能,同時顯著降低運算資源需求和部署成本。
🛠️ 技術深入
- 基礎模型架構 (Base Model Architecture):
- 基於Qwen3.5-2B,一個2B參數的多模態基礎模型。
- 採用混合架構,包含門控Delta網路和門控注意力,以6×(3×DeltaNet→FFN→1×Attention→FFN)的模式排列。
- 具有24個Transformer層,隱藏維度為2048,前饋網路(FFN)中間維度為6144。
- 原生上下文長度達262,144個tokens。
- 支援思考模式(thinking mode)和非思考模式(non-thinking mode)。
- Text-to-SQL微調方法 (Text-to-SQL Fine-tuning Methodology - 參考自類似Qwen專案):
- 訓練資料集中的Schema會被剝離INSERT數據,模型從Schema結構而非記憶答案中學習SQL。
- 採用手動聊天格式,以繞過Qwen3.5的
<think>標籤注入,確保輸出格式的純淨。 - 損失函數僅針對SQL輸出計算,提示tokens會被遮罩。
- 訓練資料集會進行去重和污染檢查,以確保訓練和評估資料集的獨立性。
- 微調後的模型旨在生成SQLite兼容的SQL,並可透過提供Schema與現有資料庫配合使用。
🔮 前景展望AI analysis grounded in cited sources
小型、專業化的語言模型將在企業數據分析領域扮演更關鍵的角色。
Cleo證明了即使是2B參數的小型模型,透過微調和特定架構,也能高效執行複雜的分析師任務,這降低了部署成本並提高了領域專用任務的準確性。
結合即時執行證據的Text-to-SQL模型將顯著提升數據查詢的可靠性與準確性。
Cleo利用即時執行證據而非僅依賴模型機率來進行查詢搜尋,這有助於減少大型語言模型常見的「幻覺」問題,確保生成的SQL查詢更符合實際數據庫邏輯。
⏳ 時間線
2026-03
Qwen3.5-2B模型由阿里巴巴雲發布,作為Cleo的基礎模型。
📎 來源 (14)
Factual claims are grounded in the sources below. Forward-looking analysis is AI-generated interpretation.
📰
AI 週報
閱讀本週精選 AI 大事摘要 →
👉相關動態
AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: Reddit r/MachineLearning ↗
每週 AI 簡報
每週一封,可隨時退訂。