
推出 Gemini Omni
Google 正式推出 Gemini Omni,這是一款專為即時、低延遲互動而設計的多模態模型。該模型透過提供無縫的跨模態處理,增強了 Gemini 生態系統的功能。
Tag: #low-latency29 results

Google 正式推出 Gemini Omni,這是一款專為即時、低延遲互動而設計的多模態模型。該模型透過提供無縫的跨模態處理,增強了 Gemini 生態系統的功能。

Noiz AI 聯合香港科技大學與清華大學,開源了一款音頻生成大模型,實現了4步出聲,單卡推理延遲僅0.24秒。

小米與 TileRT 聯合發布 MiMo-V2.5-Pro 的 UltraSpeed 模式,在通用 GPU 上實現萬億參數模型每秒超過 1000 tokens 的生成速度。該服務目前透過限時 API 申請管道開放體驗。

OpenAI 推出 GPT-5.3 Instant,轻量模型降低幻覺率(聯網下 26.8%),語調更自然,寫作能力提升。Google 發布 Gemini 3.1 Flash-Lite,強調低成本(輸入 0.25 美元/百萬 tokens)、TTFT 快 2.5 倍,並支援思考等級調整。兩者針對如 OpenClaw 的高吞吐代理任務。

Google 推出 Gemini 3.1 Flash-Lite,為 Gemini 3 系列中最具成本效益的模型,價格僅 Gemini 3.1 Pro 的八分之一。它比 Gemini 2.5 Flash 提供 2.5 倍更快的首 token 時間及 45% 更高的輸出速度(每秒 363 token)。新增思考等級功能,可動態調整推理強度以平衡速度與深度。
OpenAI 分享如何在六個月內打造 GPT-Live,這是一套支援連續語音互動的即時系統。該系統結合無需輪流發言的語音模型與低延遲架構,讓 AI 對話更即時、更自然。
阿里巴巴千問大模型升級了實時語音識別模型 Fun-ASR-Realtime,該模型首字延遲控制在百毫秒級別。它支援 30 種語言與 16 種方言,識別準確率接近離線模型。

阿里千問升級了 Fun-ASR-Realtime 模型,現支援 30 種語言與 16 種方言,並具備高識別準確率。該模型已上線阿里雲百煉平台,並實現了百毫秒級的低延遲識別。

Google 推出了全新的圖像生成模型 Nano Banana 2 Lite。該模型被定位為公司迄今為止速度最快且最具成本效益的選擇。

Google DeepMind 推出了 Nano Banana 2 Lite 與 Gemini Omni Flash 的新功能。這些工具旨在協助開發者構建更高效且具備即時響應能力的 AI 應用程式。