Token(令牌)是大语言模型处理文本的基本单位,也是理解大模型工作原理的核心概念。简单来说,Token就是模型读取和生成文本时的最小单元——它可以是一个完整的单词,也可以是一个词根或一个字符。例如”ChatGPT”可能被切分为”Chat”和”GPT”两个Token。不同的分词方式会影响模型的理解能力、上下文窗口长度以及API调用成本(大多数LLM按Token计费)。本视频用通俗易懂的方式,手把手带你理解Token的概念、分词原理,以及为什么Token限制会影响模型能处理的内容长度。