Search

Tag: #low-latency29 results

Thinking Machines 預覽即時 AI 互動模型

Thinking Machines 預覽即時 AI 互動模型

Thinking Machines 由前 OpenAI 領導人 Mira Murati 和 John Schulman 創立,發布「interaction models」的研究預覽,用於近即時多模態語音和視訊對話。這些模型從回合制 AI 轉向全雙工處理,以 200ms 區塊同時處理輸入和輸出。有限預覽即將開放以收集回饋。

VentureBeatMediaMay 11#multimodal#full-duplex#low-latency
Voxtral 在 M4 上達 90ms 延遲

Voxtral 在 M4 上達 90ms 延遲

Mistral 的 Voxtral TTS 模型在 Apple M4 上實現「Day 0」整合,延遲僅 90ms,捕捉情緒細微差別,無雲端冷啟動問題。用於藝術機器人保留個性。提供本地 API 實作的 GitHub 儲存庫。

Reddit r/LocalLLaMACommunityMar 28#tts#low-latency#local-speech
Groq 3 LPX 驅動低延遲 AI 推論

Groq 3 LPX 驅動低延遲 AI 推論

NVIDIA Groq 3 LPX 是 Vera Rubin 平台的機架規模推論加速器。針對代理式 AI 系統的低延遲與大上下文需求設計。與 Vera Rubin NVL72 共同設計,用於快速權重生成。

NVIDIA Developer BlogOfficialMar 16#ai-factory#low-latency
Taalas 將 LLM 嵌入矽晶片,達 16K 令牌/秒

Taalas 將 LLM 嵌入矽晶片,達 16K 令牌/秒

Taalas 推出將 LLM 權重與架構直接蝕刻至矽晶片的硬體,實現 16,000 令牌/秒及低於 1ms 延遲,無需 HBM。他們宣稱 60 天內從模型轉為 ASIC,支持 LoRA,並將推出更大模型。由 24 名工程師以 3,000 萬美元打造,針對低延遲 AI 應用。

Reddit r/LocalLLaMACommunityFeb 20#asic#low-latency#edge-ai
Page 2 of 3