
Krea 2 Raw 與 Turbo 以開放權重形式發布
Krea 已在 Hugging Face 上以開放權重形式發布其全新的 Krea 2 圖像生成模型 Raw 與 Turbo。其中 Turbo 版本實現了 2 秒的生成速度,成為企業與創意工作流程的高效能選擇。
Tag: #low-latency29 results

Krea 已在 Hugging Face 上以開放權重形式發布其全新的 Krea 2 圖像生成模型 Raw 與 Turbo。其中 Turbo 版本實現了 2 秒的生成速度,成為企業與創意工作流程的高效能選擇。

Thinking Machines 由前 OpenAI 領導人 Mira Murati 和 John Schulman 創立,發布「interaction models」的研究預覽,用於近即時多模態語音和視訊對話。這些模型從回合制 AI 轉向全雙工處理,以 200ms 區塊同時處理輸入和輸出。有限預覽即將開放以收集回饋。
OpenAI 重建其 WebRTC 堆疊,以實現大規模即時語音 AI。此更新提供低延遲、全域擴展性,以及無縫對話輪流。這驅動全球回應式語音互動。

Mistral 的 Voxtral TTS 模型在 Apple M4 上實現「Day 0」整合,延遲僅 90ms,捕捉情緒細微差別,無雲端冷啟動問題。用於藝術機器人保留個性。提供本地 API 實作的 GitHub 儲存庫。

Google 已透過 Gemini API 和 Google AI Studio 推出 Gemini 3.1 Flash Live。它支援即時語音和視覺代理程式,並降低延遲。該模型可在 90 多種語言中隔離語音。

NVIDIA Groq 3 LPX 是 Vera Rubin 平台的機架規模推論加速器。針對代理式 AI 系統的低延遲與大上下文需求設計。與 Vera Rubin NVL72 共同設計,用於快速權重生成。

DeepMind 推出 Gemini 3.1 Flash-Lite,為 Gemini 3 系列中最快且最具成本效益的模型。專為大規模智能設計,可高效部署於高容量應用中。

Taalas 推出將 LLM 權重與架構直接蝕刻至矽晶片的硬體,實現 16,000 令牌/秒及低於 1ms 延遲,無需 HBM。他們宣稱 60 天內從模型轉為 ASIC,支持 LoRA,並將推出更大模型。由 24 名工程師以 3,000 萬美元打造,針對低延遲 AI 應用。

Hugging Face 推出 LFM2.5-VL-3B,這是一款旨在為邊緣裝置提供更佳、更快速視覺能力的視覺語言模型。此次更新強調適合需要本地端或低延遲多模態推理的應用情境。

Together AI 現可使用共置 STT、LLM 和 TTS 基礎設施建置即時語音代理。它提供 Deepgram 和 Cartesia 的原生支援。端到端延遲低於 700ms,實現回應式互動。