Search

Tag: #tokenizer5 results

美團發布原生多模態 LongCat-Next

美團發布原生多模態 LongCat-Next

美團於3月27日發布並全面開源原生多模態大模型 LongCat-Next 及其核心組件——離散原生分辨率視覺分詞器 dNaViT。該模型打破以語言為中心的傳統拼湊式架構,將圖像、語音與文本統一映射為同源離散 Token。透過純粹的「下一個 Token 預測」(NTP)範式,讓視覺與語音成為 AI 的「原生母語」。

LLM中文Token稅:為何更貴

LLM中文Token稅:為何更貴

西方LLM如Claude/GPT因英文主導BPE分詞器,對中文漢字拆分低效致Token更多。中國模型Qwen/DeepSeek優化漢字/詞組,使中文更省。Claude 4.7升級僅膨脹英文Token,中文用戶倖免。

虎嗅MediaMay 3#tokenizer#multilingual#bpe
20 倍速 C++ Qwen 分詞器

20 倍速 C++ Qwen 分詞器

全新零分配、僅標頭 C++ Qwen 模型分詞器,在 Ryzen 5 3600 上達 1009 MB/s,幾乎是 OpenAI Tiktoken 50 MB/s 的 20 倍速。專為 HPC 設計,無依賴,為教育性優化專案。程式碼在 GitHub 上提供。

Reddit r/LocalLLaMACommunityApr 3#tokenizer#c-plus-plus#hpc-optimization