💰較早收集於 13m

Google AI 在基礎拼字與 Tokenization 上面臨挑戰

Google AI 在基礎拼字與 Tokenization 上面臨挑戰
PostLinkedIn
💰閱讀原文: TechCrunch AI

💡了解為何 LLM 在基礎拼字上會遇到困難,以及 Tokenization 的限制如何影響您應用程式的可靠性。

⚡ 30-Second TL;DR

有什麼變化

Google 的 AI 模型在拼字準確度上表現出明顯的弱點。

為什麼重要

這些限制顯示,依賴 LLM 進行文字敏感型應用的開發者必須實作二次驗證層。這也提醒我們,機率模型在拼字任務上並非本質上具備確定性。

下一步行動

當使用 LLM 執行需要高拼字精確度的任務時,請務必實作確定性的拼字檢查或字元層級驗證層。

誰應關注:Developers & AI Engineers

關鍵要點

  • Google 的 AI 模型在拼字準確度上表現出明顯的弱點。
  • 此類錯誤凸顯了當前 LLM 在 Tokenization 策略上的局限性。
  • 這些錯誤引發了對 LLM 在需要精確字元操作任務中可靠性的擔憂。

🧠 深度解析

Web-grounded analysis with 24 cited sources.

🔑 增強重點摘要

  • 大型語言模型(LLM)處理文本的單位是「Token」而非人類認知的「單字」或「字元」,這導致模型在需要精確字元操作(如拼字、單字反轉)時,因無法直接存取底層字元序列而表現不佳。
  • 對於中文等缺乏明確空格分隔的語言,Tokenization 策略的選擇尤為關鍵,不同的分詞器會導致相同文本的Token數量差異巨大,進而影響運算成本與效率。
  • 不精確的Tokenization 不僅影響拼字,更可能從根本上阻礙LLM對輸入的精確理解,尤其是在需要深度推理或計數的複雜任務中,導致輸出不盡理想。
  • 為解決Tokenization帶來的字符級理解瓶頸,研究者正探索如「Token內部位置意識(TIPA)」等方法,透過反向字符預測任務訓練模型,以提升其對Token內部字符位置的感知能力。
📊 競品分析▸ Show
特性/模型Google Gemini 1.5/2.5 ProOpenAI GPT-4oAnthropic Claude 3.5/4 Sonnet
上下文窗口大小1,000,000–2,000,000 tokens (2.5 Pro即將2M)128,000 tokens200,000–1,000,000 tokens (依版本)
輸入Token價格 (USD/1M Tokens)$2.5-3.5$5$3-5
輸出Token價格 (USD/1M Tokens)$7.5-10.5$15$15-20
主要用途/備註超長上下文、多模態、整個倉庫分析通用,適合中等程式碼專案安全穩定、程式碼生成強

🛠️ 技術深入

  • Tokenization 演算法: 大型語言模型主要採用子詞(subword)Tokenization 演算法,包括位元組對編碼(BPE)、WordPiece 和 SentencePiece。
  • BPE (Byte Pair Encoding): 透過迭代合併文本中最常見的連續字元對或子詞對來建立詞彙表,廣泛應用於GPT系列、RoBERTa和Llama2等模型。
  • WordPiece: 由Google提出,與BPE類似,但其合併標準基於統計尤度(likelihood),而非單純頻率,主要用於BERT模型。
  • SentencePiece: 由Google開發,是一種語言獨立的Tokenization工具,將輸入文本視為原始字節序列處理,並將空格也納入字元集合,特別適合處理中文、日文等沒有明確空格分隔的語言,可採用類似BPE或Unigram的方法,廣泛應用於Google的T5模型。
  • Tokenization 機制: Tokenization 是將非結構化文本轉換為機器學習模型可理解的結構化數字形式的關鍵步驟,將文本切分成Token後,每個Token會被賦予一個數值ID,再透過嵌入層(Embedding Layer)轉換為高維向量,以捕捉語義信息。
  • 字元層級理解挑戰: 由於Tokenization 將文本分割成子詞單位,模型在處理需要精確字元操作的任務時,可能因無法直接存取或推理個別字元序列而面臨困難,例如單字反轉或精確拼字。
  • 多語言效率問題: 對於中文等語言,由於其文字結構與英文不同,Tokenization 可能導致相同語義的文本消耗更多Token,進而影響模型的運算效率和成本。
  • 改進方法: 研究者正探索新的方法來增強LLM的字元層級理解,例如「Token內部位置意識(TIPA)」,透過反向字元預測任務訓練模型,使其能更好地感知Token內部的字元位置,尤其適用於中文拼字糾正等任務。

🔮 前景展望AI analysis grounded in cited sources

LLM將更精確地處理字元層級任務。
隨著TIPA等新興Tokenization技術的發展,模型將能更好地理解Token內部結構,從而提升拼字糾正、單字反轉等精確字元操作的表現。
多語言LLM的Token化效率將顯著提升。
針對中文等非空格分隔語言的Tokenization挑戰,未來將有更多優化策略,減少Token消耗,降低多語言處理成本並提高效率。
Tokenization優化將成為提升LLM推理能力的關鍵。
由於不精確的Tokenization會阻礙LLM對輸入的精確理解和深度推理,未來對Tokenization方法的改進將直接影響模型在複雜推理任務上的可靠性。

時間線

2012
Google提出WordPiece演算法,用於BERT等模型的分詞處理。
2018-08
Google發布SentencePiece,一種語言獨立的Tokenization工具,將輸入視為原始字節序列處理。
2023-11
Google Research研究指出,儘管LLM難以自行發現推理錯誤,但若提供錯誤資訊,可透過回溯方法進行糾正,這間接反映了模型在基礎理解層面的挑戰。
2025-08
Google推出「Google Sans Code」字型,旨在提升程式碼中易混淆字元的辨識度,顯示其對字元精確度的重視。
2025-11
Google推出Nano Banana Pro,改進了圖像生成中中文字亂碼問題,並提升多語言處理能力。
2026-01
Google Research研究發現,透過「提示詞重複」的簡單方法,可顯著提升包括Gemini 2.0在內的多種LLM在因果語言模型中的效能,彌補單向注意力機制的缺陷。
📰

AI 週報

閱讀本週精選 AI 大事摘要 →

👉相關動態

AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: TechCrunch AI