
國產 4B 認知模型發布,性能媲美 GPT-4o
中國研發出一款僅 4B 參數的「認知模型」,支援端側部署。據稱其性能表現已可媲美 GPT-4o。
Tag: #slm12 results

中國研發出一款僅 4B 參數的「認知模型」,支援端側部署。據稱其性能表現已可媲美 GPT-4o。

研究人員開發了一種利用 Qwen2.5-1.5B 進行閉環工業控制的框架,結合了符號驗證與迭代式重新提示。此方法在保持適合邊緣部署的低推論延遲的同時,實現了高動作對齊準確度。

ASK+ 引入了軌跡感知上下文與結構化思維鏈,以改善強化學習中 SLM 的指導能力。透過提供地圖與歷史數據,它使小型模型能在複雜的 POMDP 環境中有效地修正代理策略。

Wiola 是一種從第一性原理構建的全新小型語言模型 (SLM) 架構,包含螺旋旋轉位置編碼 (SRPE) 和自適應標記合併 (ATM) 等五項創新技術。該模型提供 120M 到 1.5B 參數四種規模,並完全相容於 HuggingFace 生態系統。

Adobe 推出 Brand Intelligence,這是一個持續學習引擎,使用小型語言模型(SLMs)提供細膩的多模態品牌理解與內容對齊。新 GenStudio 擴充包括 Workfront 中的 Workflow Optimization Agent,同時推出 Firefly AI Assistant。這些工具因應代理式 AI 在內容發現與創作的轉變。

AT&T 重新設計 AI 協調層,以處理每日 80 億個 token,使用基於 LangChain 的多代理系統,其中大型代理指導專門的小型代理,由小型語言模型 (SLM) 驅動。這實現了高達 90% 的成本節省並改善延遲。他們最近在 Microsoft Azure 上推出 Ask AT&T Workflows,一個拖放式代理建構器,用於員工任務自動化,整合專有工具並有人類監督。

CSTutorBench 是一個全新的基準測試,旨在評估小型語言模型 (SLM) 在 VEX VR 等區塊程式設計環境中作為導師的有效性。研究顯示,儘管模型在語氣和詞彙方面表現出色,但在避免洩漏答案和追蹤學生除錯歷史等教學任務上仍面臨挑戰。
開發者分享了從零開始訓練 216M 參數小型語言模型的經驗,強調了分詞器 (Tokenizer) 品質對模型效能的影響遠大於架構調整。文中詳細說明了 GGUF 導出過程中的技術挑戰以及數據集組成對對話能力的影響。

本教學展示如何利用監督式微調 (SFT) 與直接偏好優化 (DPO) 來提升小型語言模型 (SLM) 的工具呼叫準確度。透過 Amazon SageMaker AI 基礎設施,開發者可簡化訓練與評估流程。

Hashicorp 創辦人對本地模型是否成熟表示懷疑,引發了社群辯論。從業者認為小型語言模型 (SLM) 已能勝任程式編寫任務。