⚙️
quicktok:高效能且位元組完全相同的 BPE 分詞器
quicktok 是一款基於 C++ 的全新 BPE 分詞器,在保持與 tiktoken 位元組完全相同的前提下,效能提升了 4 至 11 倍。它支援包括 Llama-3、Qwen2.5/3 以及多種 GPT 編碼在內的主流模型。
Tag: #tokenizer5 results
quicktok 是一款基於 C++ 的全新 BPE 分詞器,在保持與 tiktoken 位元組完全相同的前提下,效能提升了 4 至 11 倍。它支援包括 Llama-3、Qwen2.5/3 以及多種 GPT 編碼在內的主流模型。
美團於3月27日發布並全面開源原生多模態大模型 LongCat-Next 及其核心組件——離散原生分辨率視覺分詞器 dNaViT。該模型打破以語言為中心的傳統拼湊式架構,將圖像、語音與文本統一映射為同源離散 Token。透過純粹的「下一個 Token 預測」(NTP)範式,讓視覺與語音成為 AI 的「原生母語」。
開發者分享了從零開始訓練 216M 參數小型語言模型的經驗,強調了分詞器 (Tokenizer) 品質對模型效能的影響遠大於架構調整。文中詳細說明了 GGUF 導出過程中的技術挑戰以及數據集組成對對話能力的影響。

西方LLM如Claude/GPT因英文主導BPE分詞器,對中文漢字拆分低效致Token更多。中國模型Qwen/DeepSeek優化漢字/詞組,使中文更省。Claude 4.7升級僅膨脹英文Token,中文用戶倖免。

全新零分配、僅標頭 C++ Qwen 模型分詞器,在 Ryzen 5 3600 上達 1009 MB/s,幾乎是 OpenAI Tiktoken 50 MB/s 的 20 倍速。專為 HPC 設計,無依賴,為教育性優化專案。程式碼在 GitHub 上提供。