Qwen 3.8 中型模型或將於下週推出
Qwen 社群經理據稱表示,新款中型開放權重模型可能於下週推出。該模型不會提供搶先體驗版本,規模尚未確認,但社群猜測參數量可能超過 100B。
Tag: #self-hosting16 results
Qwen 社群經理據稱表示,新款中型開放權重模型可能於下週推出。該模型不會提供搶先體驗版本,規模尚未確認,但社群猜測參數量可能超過 100B。

Cohere 發布 Transcribe,其首款開源自動語音辨識(ASR)模型,參數規模約 20 億。定位輕量級,可在消費級 GPU 運行,針對自託管語音轉文字轉錄及語音內容分析。適合企業與開發者本地部署需求。

Cohere 推出專為轉錄設計的開源語音模型。僅 20 億參數,可在消費級 GPU 上自託管,目前支援 14 種語言。
Microsoft 執行長 Satya Nadella 強調企業將專有數據餵給第三方 AI 模型所帶來的風險。他建議企業應將「自託管 AI」視為保護智慧財產權的必要策略。

本文強調維持在地化 AI 基礎設施與開源評測工具日益重要。主張應減少對中心化專有供應商的依賴。
本文探討了使用具有高通道數 PCIe 5.0 的伺服器搭配大量 NVMe 陣列來託管數 TB 大小 LLM 模型的理論效能。作者質疑為何這種硬體密集型方案在自託管巨型模型中並不常見。

OpenSquilla 發布了 MetaSkill,這是一個可自託管的代理框架,旨在協助 AI 代理組織其自身技能。該平台專注於自動組合功能並優化複雜的工作流程。

成立 30 年的軟體公司 Zoho,在 AI 壓縮 SaaS 利潤率之際,開始進入硬體研發領域。此舉可能旨在更好地掌控支援 AI 服務所需的基礎設施與成本結構。
2026 年 8 月的 r/LocalLLaMA 討論聚焦於開放權重模型的快速進步,包括部分模型據稱能在實用硬體上媲美封閉式前沿系統。文章邀請使用者針對一般用途、代理式編程、創意工作與特殊應用分享推薦。

Reddit 討論質疑 DS4 Flash 異常低廉的 API 定價,是否能在租用 GPU 上重現並維持獲利。貼文將目前的 Token 價格與本地硬體測量結果比較,指出輸出生成成本可能使自託管難以具備經濟效益。