商城首页欢迎来到中国正版软件门户

您的位置: 首页 > 文章列表 > 编程开发 > C++ 实现脚本词法分析状态机跳转跳转逻辑 Token 分词实现【源码】

C++ 实现脚本词法分析状态机跳转跳转逻辑 Token 分词实现【源码】

  发布于2026-07-02 阅读(0)

扫一扫,手机访问

需通过状态机驱动字符流识别Token,核心步骤包括:一、定义TokenType和LexerState枚举,用std::array构建状态转移表,按字符类别而非ASCII值跳转;二、实现字符分类预处理函数,将输入字符映射为有限类别码以提升查表效率。

C++ 实现脚本词法分析状态机跳转跳转逻辑 Token 分词实现【源码】

如果你正在实现 C++ 脚本的词法分析器,需要靠状态机驱动字符流来识别各种 Token(标识符、数字、字符串、运算符等等),那么状态跳转逻辑的精确度直接决定了分词结果的对错。下面拆解实现的几个关键环节。

一、定义状态枚举与转移表结构

状态机首先要预设所有合法的状态——比如初始态、正在识别标识符、正在识别数字、字符串刚开头、注释内部等。然后通过一个二维数组(或者 map)来建立“当前状态 + 当前字符类型 → 下一状态”的跳转规则。字符类型按语义归类,比如字母、数字、引号、斜杠、空白、运算符符号等,这样就不需要针对每个 ASCII 值单独写一条规则了。

具体来说:

1. 声明 enum class TokenType { IDENTIFIER, NUMBER, STRING, PLUS, MINUS, ASSIGN, COMMENT, WHITESPACE, UNKNOWN };

2. 声明 enum class LexerState { START, IN_IDENTIFIER, IN_NUMBER, IN_STRING, IN_COMMENT, AFTER_SLASH, ERROR };

3. 使用 std::array, 7> 构建转移表,行索引是当前状态,列索引是 static_cast(ch)

4. 对每一组(状态,字符类别)调用初始化函数填充转移表,例如:table[START]['a'] = IN_IDENTIFIERtable[IN_IDENTIFIER]['0'] = IN_IDENTIFIER

二、字符分类预处理函数

为了提升跳转效率,需要把输入字符映射成有限的类别码(0–9),而不是直接用 ASCII 值查表。这个映射可以屏蔽大小写差异、合并数字范围、统一符号组,同时把不可见字符归为 WHITESPACE 或 INVALID 类别。

实现方式:

1. 定义 constexpr std::array CHAR_CLASS,用 lambda 初始化:遍历所有可能的字符值,按规则分组赋值(比如字母映射到 1,数字映射到 2,等等)。

2. 每次读取字符后,执行 uint8_t cls = CHAR_CLASS[static_cast(ch)]

3. 用 cls 作为转移表第二维的索引,替代原始字符值,这样表体积更小,访问也更快。

三、主状态机循环与 Token 提取逻辑

主循环逐字符消费输入流,根据当前状态和字符类别查表跳转;当进入终止状态(比如从 IN_NUMBER 跳回 START)时,立即截取已缓冲的字符序列构造 Token,并重置缓冲区。关键在于区分“接受状态”和“中间状态”,只有在明确可以结束的位置才触发 Token 输出。

流程大致如下:

1. 初始化 state = LexerState::STARTpos = 0buffer.clear()

2. 进入循环:while (pos < input.length()),读取当前字符,获取类别码,然后查表得到下一状态。

3. 如果下一状态是 ERROR,直接抛出词法错误(throw std::runtime_error)。

4. 如果当前状态不是 START 且下一状态变成了 START,说明一个 Token 结束了,调用 emitToken(buffer, state) 输出 Token,然后清空缓冲区。

5. 如果下一状态既不是 START 也不是 ERROR,就把当前字符追加到缓冲区中。

6. 更新状态为下一状态,位置加 1,继续循环。

四、特殊 Token 的嵌套状态处理

字符串字面量和块注释需要支持跨行以及转义序列,不能只靠单层状态跳转就能搞定。必须引入子状态栈或者递进式子状态,比如 IN_STRING → ESCAPE_SEQUENCE → IN_STRING,并在遇到结束符之前禁止退出该主状态分支。

具体做法:

1. 当状态是 IN_STRING 且当前字符是反斜杠 \ 时,设置一个临时子状态 ESCAPE_NEXT,并且直接跳转到 ESCAPE_NEXT。

2. 在 ESCAPE_NEXT 状态下,不把反斜杠加入缓冲区,而是读取下一个字符,根据其值决定如何转义(例如 'n' → '\n''"' → '"'),然后强制跳回 IN_STRING。

3. 如果 ESCAPE_NEXT 遇到换行或 EOF,则跳转至 ERROR。

4. 当状态是 IN_STRING 且遇到双引号 " 且前一个字符不是反斜杠时,跳转至 START 并发射 STRING Token。

五、关键字与标识符的后置识别机制

标识符和关键字共享同一条状态路径(IN_IDENTIFIER),所以必须在状态退出之后进行字符串比对。如果缓冲内容匹配预定义的关键字集合(比如 "if""while""return"),就生成对应的关键字 Token;否则生成 IDENTIFIER Token。这个判断不能放到状态机内部去做,否则会破坏状态的正交性。

实现要点:

1. 定义 const std::unordered_set KEYWORDS = {"if", "else", "for", "while", "return", "int", "char", "void"};

2. 在 emitToken(buffer, state) 函数中,当状态是 IN_IDENTIFIER 时,检查缓冲区内容是否在关键字集合里:如果在,返回 Token{TokenType::KEYWORD, buffer};否则返回 Token{TokenType::IDENTIFIER, buffer}

3. 注意:关键字匹配必须区分大小写,而且缓冲区内容不能包含首尾空格或控制字符。

本文转载于:https://www.php.cn/faq/2462449.html 如有侵犯,请联系zhengruancom@outlook.com删除。
免责声明:正软商城发布此文仅为传递信息,不代表正软商城认同其观点或证实其描述。

热门关注