
NTT 為何押注小型 LLM?
NTT 的國產 LLM「tsuzumi 2」將小型化、日語處理能力與資料主權置於單純擴大模型參數之上。該模型被定位為企業將生成式 AI 導入實際業務流程時的一種務實選擇。
Tag: #small-models17 results

NTT 的國產 LLM「tsuzumi 2」將小型化、日語處理能力與資料主權置於單純擴大模型參數之上。該模型被定位為企業將生成式 AI 導入實際業務流程時的一種務實選擇。

OpenAI 推出 GPT-5.4 mini 與 nano 模型,基準測試接近完整 GPT-5.4。它們運行更快、成本更低,標誌小型模型轉向真實世界應用。

Om AI 推出端側原生 VLX 模型,目標是以較少參數實現對物理世界的精準感知。文章將其定位為 3B 規模模型,並主張產業進步不應只依賴堆疊算力,而應採用更適合新環境的架構。

阿里千問開源四款 Qwen3.5 小尺寸模型:0.8B、2B、4B、9B。繼承強大多模態能力,適用邊端設備至緊湊伺服器。目前 Qwen3.5 家族全系列已在魔搭社區與 Hugging Face 開源。

Nvidia 優先軟體與本地化小模型推動印度主權 AI,適應多樣語言與低功耗基礎設施。推廣開源 Nemotron 模型與 CUDA Python 工具予開發者。配合政府高效邊緣 AI 解決農業等本地挑戰。
本研究探討了利用多個小型語言模型協作以模擬複雜金融情境的潛力。研究強調了專業化、輕量級的模型在特定領域任務中如何能超越單體系統。
研究人員為25.6M Rust程式碼模型開發混合注意力,在4060 Ti上將推論速度從5.6提升至286 token/秒,達50倍加速。資料集從31MB擴至173MB的收益大於架構變更。困惑度達2.15,驗證損失0.82。
Gemma 4 2B 在舊 RTX 2060 6GB 上優於 Qwen3.5 2B:更快、更低記憶體、更具代理性,圖表及輸出更好。實際感覺等同 Qwen3.5 9B。

Qwen3.5 0.8B/2B/4B/9B 少樣本基準顯示 0.8B 程式碼修復零樣本 67% 加例降至 33%。分類 8 樣本達 100%;4B 全任務穩定。結論推崇 4B 為最佳點。
一種新方法將技能嵌入注入 KV 快取,讓代理技能無需膨脹提示上下文。在 Qwen2.5-0.5B-Instruct 上測試,效能提升至 65/100 分數同時節省 token。完整儲存庫與結果在 GitHub 分享。