透過單一指令在 HF Jobs 上執行 vLLM 伺服器
Hugging Face 推出了一項簡化流程,可直接在其 Jobs 基礎設施上部署 vLLM 推論伺服器。此更新讓開發者能透過單一指令快速啟動高效能的 LLM 服務環境。
Tag: #deployment75 results
Hugging Face 推出了一項簡化流程,可直接在其 Jobs 基礎設施上部署 vLLM 推論伺服器。此更新讓開發者能透過單一指令快速啟動高效能的 LLM 服務環境。

微軟對OpenAI的130億美元投資瞄準920億美元回報。英偉達400億美元股權投資強化算力與模型綁定;OpenAI斥資40億美元成立部署公司並收購Tomoro,加速企業級AI落地。谷歌與蘋果為跨平台RCS啟用端到端加密。

OpenAI 與 Microsoft 更新合作關係,允許 OpenAI 在任何雲端提供者託管模型,包括 AWS。Azure 仍為優先雲端以優化效能。此舉擴大 OpenAI 產品的部署靈活性。

騰訊開源了其 295B 參數 Hunyuan Hy3 模型預覽版。強調成本高效部署,API 定價從每百萬 token 約 0.17 美元起。

Amazon SageMaker 現支援優化生成式 AI 推論建議。它提供經過驗證的最佳部署配置及效能指標。此功能讓模型開發者專注於建構精準模型,而非管理基礎設施。

Amazon Bedrock AgentCore 推出新功能,簡化代理建置流程。它移除從原型到生產部署各階段的基礎設施障礙。團隊可在數分鐘內建置首個運作代理。
團隊微調與部署 Gemma-4 的經驗揭露關鍵問題:PEFT 與自訂層不相容、SFTTrainer 因 KV 共享靜默失敗、DeepSpeed 儲存空適配器,以及伺服工具缺乏即時 LoRA 支援。修復包括解包層、更新 transformers、避免 DeepSpeed,以及手動合併權重。

Amazon SageMaker JumpStart 推出優化部署,提供特定使用案例的預定義配置。提升自訂化、可見度與效能。客戶可依約束高效部署模型。

LangChain 推出 Deep Agents Deploy 公開測試版,這是部署模型無關、開源代理框架進入生產環境的最快方式。它是 Claude Managed Agents 的開放替代方案。基於 Deep Agents 建構,適用於開放世界。
開發者分享在澳洲合規領域(如建築和礦業)部署 RAG 機器人的寶貴經驗。關鍵洞見包括查詢擴展優於區塊大小、來源提升、分層提示、本地嵌入,以及每個客戶獨立 VM。程式碼在 GitHub 上公開。