📋較早收集於 2m

Sesame 推出 iOS 應用程式,內建 4 款個人語音助理

Sesame 推出 iOS 應用程式,內建 4 款個人語音助理
PostLinkedIn
📋閱讀原文: TestingCatalog

💡探索 Sesame 如何透過人格化語音助理來提升行動 AI 應用程式的使用者參與度。

⚡ 30-Second TL;DR

有什麼變化

於 39 個國家推出 iOS 預覽版。

為什麼重要

此發布凸顯了消費市場中,專用且具備人格特質的 AI 助理趨勢。它透過提供更擬真、多模態的互動能力,對現有的語音助理市場構成挑戰。

下一步行動

下載 Sesame iOS 應用程式,分析其提示工程 (prompt engineering) 與對話流程,以利開發具備人格特質的 AI 助理。

誰應關注:Developers & AI Engineers

關鍵要點

  • 於 39 個國家推出 iOS 預覽版。
  • 包含四款不同的 AI 助理:Maya、Miles、Simone 與 Charlie。
  • 整合搜尋卡片、筆記功能及隱私導向的隱身模式。

🧠 深度解析

Web-grounded analysis with 27 cited sources.

🔑 增強重點摘要

  • Sesame AI 旨在透過其語音驅動的 AI 穿戴式裝置(例如輕量級智慧眼鏡)來重新定義人機互動,預計於 2027 年推出,將語音作為主要的計算介面。
  • 其核心技術是會話語音模型(CSM),這是一個端到端的多模態文本和語音模型,能夠同時處理文本和音頻,實現 200-300 毫秒的低延遲響應時間,並捕捉情感和語氣變化,以實現更自然的對話流程。
  • Sesame AI 於 2025 年 10 月完成了 2.5 億美元的 B 輪融資,由 Sequoia Capital 和 Spark Capital 領投,此前在 2025 年 2 月獲得了 Andreessen Horowitz 領投的 4750 萬美元 A 輪融資。
  • Sesame AI 的隱私政策指出,在用戶登錄並使用服務期間,公司保留使用任何生成的信息和內容來訓練其語言學習模型的權利,除非用戶選擇退出訓練。
📊 競品分析▸ Show
產品/公司主要功能定價基準/特色
Sesame AI語音臨場感、情感智能、上下文理解、獨特 AI 個性、未來整合穿戴式裝置Pro Plan: $15/月;CSM 1B 模型: $7/百萬字符 (有效定價數據待定)200-300 毫秒低延遲響應,旨在實現更自然、富有情感的對話
ChatGPT Plus最強大的對話式 AI、廣泛功能(寫作、編碼、圖像生成)、通用知識$20/月速度、準確性和自然語言理解的結合
Claude Pro更強的推理能力、更好的寫作質量、更大的上下文窗口$20/月擅長處理複雜的寫作和分析任務
Google Gemini Advanced深度整合 Google Workspace (Gmail, Docs, Calendar)、跨 Google 應用程式的上下文感知$19.99/月針對 Google 生態系統用戶提供強大整合
Microsoft Copilot深度整合 Microsoft 365 (Outlook, Word, Excel, Teams)、生態系統內的上下文協助$42-$52/月 (含 M365 總價)適用於 Microsoft 365 用戶,提供應用程式內協助
Alfred_自動化電子郵件分類、語音匹配回覆、任務提取、早間簡報$24.99/月專注於自主工作流程,無需持續提示

🛠️ 技術深入

  • Sesame AI 的核心是會話語音模型(Conversational Speech Model, CSM),這是一個端到端的多模態文本和語音模型。
  • CSM 由兩個自回歸變換器組成:一個多模態骨幹網絡和一個音頻解碼器,兩者均為 Llama 架構的變體。
  • 模型能夠同時處理文本和音頻標記,實現低至 200-300 毫秒的響應時間,以提供自然的對話流程。
  • 文本標記使用 Llama 分詞器,而音頻標記則透過一個分段殘差向量量化 (split-RVQ) 分詞器(Mimi)生成,將音頻波形轉換為離散的「潛在」標記。
  • CSM 經過超過一百萬小時的過濾音頻數據訓練,並明確建模了情感和韻律元素,如音高、節奏和能量,以捕捉人類語音的細微差別。
  • 模型可在消費級硬件上運行,參數規模從 10 億到 80 億不等,使其適用於計劃中的智慧眼鏡設備上的部署。
  • 為了優化訓練效率和減少內存使用,Sesame 採用了計算分攤技術,在保持音頻質量的同時,音頻解碼器在隨機子集幀上進行訓練。
  • 助理 Maya 據報導運行在 Gemma 27B 模型上。

🔮 前景展望AI analysis grounded in cited sources

語音將成為下一個主要的計算介面。
Sesame AI 及其投資者(如 Sequoia Capital)認為,語音將取代觸控螢幕和鍵盤,成為人機互動的主導方式,並透過其智慧眼鏡產品線推動這一趨勢。
AI 助理將從被動響應轉變為主動協作者。
Sesame AI 的設計目標是創建一個富有表現力、環境感知且能夠維持對話上下文的協作者,而非僅僅是回答查詢的工具,這預示著 AI 助理將在日常生活中扮演更積極的角色。
穿戴式裝置將成為個人 AI 助理的關鍵載體。
Sesame AI 正在開發輕量級、語音啟用的智慧眼鏡,旨在提供全天候的 AI 伴侶體驗,這表明硬體整合對於實現無縫、自然的人機互動至關重要。

時間線

2023
Sesame AI 成立,由 Oculus 聯合創始人 Brendan Iribe 和技術專家 Ankit Kumar 創立。
2023-10
獲得 1010 萬美元種子輪融資。
2025-02
發布其語音技術(Maya 和 Miles)的研究演示,並獲得 Andreessen Horowitz 領投的 4750 萬美元 A 輪融資。
2025-03
Maya 的逼真 AI 語音演示引起轟動,其會話語音模型 (CSM) 的技術突破被廣泛討論。
2025-10
完成 2.5 億美元的 B 輪融資,由 Sequoia Capital 和 Spark Capital 領投,並開放了 iOS 應用程式的早期測試版。
2026-05-27
iOS 預覽版在 39 個國家推出,內建四款個人語音助理。
📰

AI 週報

閱讀本週精選 AI 大事摘要 →

👉相關動態

AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: TestingCatalog