当前位置:首页 > 文章列表 > Golang > Go问答 > Go text/scanner 解析数字时如何保留原始字面量

Go text/scanner 解析数字时如何保留原始字面量

来源:17golang原创 2026-09-15 01:14:42 0浏览 收藏

我在做配置表达式和代码片段分析时,最容易踩到的坑不是“数字能不能转成 int”,而是转完以后已经看不出用户原来写的是 1_0000x2a 还是 1e3。如果使用 Go 的 text/scanner,正确做法是:每次调用 Scan() 后,立刻读取 TokenText() 保存原始字面量;需要计算时,再把这份原文交给 strconv

数字的词法原文和数值含义是两份数据。TokenText() 保留前者,strconv 负责后者,二者不要互相替代。

下面的示例只展示词法扫描的处理边界,图中内容也是结构示意,不代表本机运行截图。

先把原始字面量和数值结果分开

text/scanner.ScannerScan() 返回一个 rune token;对数字启用 Go token 模式后,整数、浮点数和虚数会分别落在 ScanIntsScanFloats 等能力覆盖的范围内。扫描完成后,TokenText() 返回最近一个 token 在输入中的原始文本。

因此建议把记录设计成两层:Raw 保存用户输入,Value 保存业务真正要计算的值。前者用于错误提示、格式化回写和审计,后者用于比较、排序或后续计算。

text scanner 将数字原文、token 类型和转换结果分开的静态结构示意图
图1:数字输入、TokenText 原文、token 类型与数值记录之间的静态关系示意图。

Scan 之后马上读取 TokenText

下面这个最小写法把每个数字先记录下来,再决定是否转换。关键点是 TokenText() 读取的是“最近一次扫描结果”,下一次 Scan() 会更新它,所以不要把读取动作拖到循环外。

package main

import (
    "fmt"
    "go/token"
    "strconv"
    "strings"
    "text/scanner"
)

type NumberLexeme struct {
    // Raw 保留输入中的进制、下划线和指数写法。
    Raw string
    // Kind 用于决定后续采用整数、浮点数还是虚数转换。
    Kind token.Token
}

func scanNumbers(src string) ([]NumberLexeme, error) {
    var s scanner.Scanner
    // GoTokens 会打开 Go 数字和标识符等常见 token 扫描能力。
    s.Init(strings.NewReader(src))
    s.Mode = scanner.GoTokens

    var numbers []NumberLexeme
    for {
        tok := s.Scan()
        if tok == scanner.EOF {
            break
        }
        if tok == scanner.Int || tok == scanner.Float || tok == scanner.Imag {
            // 必须在下一次 Scan 前复制原文,否则 TokenText 会被覆盖。
            numbers = append(numbers, NumberLexeme{
                Raw:  s.TokenText(),
                Kind: token.Token(tok),
            })
        }
        if tok == scanner.Ident || tok == scanner.String {
            continue
        }
    }
    if s.ErrorCount != 0 {
        return numbers, fmt.Errorf("scan failed with %d error(s)", s.ErrorCount)
    }
    return numbers, nil
}

func main() {
    // 先保留原文;数值解析放在业务真正需要时进行。
    raw := "limit=1_000 ratio=3.14e+2 mask=0x2a"
    numbers, err := scanNumbers(raw)
    if err != nil {
        panic(err)
    }
    for _, item := range numbers {
        fmt.Println(item.Kind, item.Raw)
        if item.Kind == token.INT {
            // ParseInt 只负责语义转换,不会替代 Raw 的保存职责。
            value, parseErr := strconv.ParseInt(item.Raw, 0, 64)
            if parseErr != nil {
                panic(parseErr)
            }
            fmt.Println("value:", value)
        }
    }
}

这里的 Raw 仍然是输入文本;即使以后把 0x2a 解析成十进制的 42,回写或展示时也能恢复用户原来的表达方式。

不要用格式化后的值反推输入

常见错误是直接把 TokenText() 交给 strconv.ParseFloat,随后只保存浮点结果。这样做会丢掉进制、下划线、指数以及部分精度边界。更稳妥的字段关系如下:

字段用途示例
Raw原始词法文本1_000
Kind决定转换策略token.INT
Value计算或比较1000

如果输入是配置、查询条件或代码编辑器内容,建议把三者一起传递。错误消息可以指出原文,业务判断使用 Value,格式化输出则根据需求选择保留 Raw 或生成规范格式。

Scan 与 TokenText 的静态调用契约示意图
图2:Scan、TokenText、token 类型判断和 strconv 转换之间的静态调用契约示意图。

三个边界要提前处理

第一,TokenText() 只对应最近一次 token;如果先扫描下一个字符,再回头读取,得到的就不是数字原文。第二,scanner.EOF 是结束信号,不能把它当成空数字继续转换。第三,扫描器可能在报告错误后仍返回部分 token,不能只看 token 序列,还要检查 ErrorCount 或自定义错误回调。

另外,text/scanner 解决的是词法切分,不会替你决定业务范围。例如配置文件只允许十进制整数时,即使扫描器识别了十六进制形式,也应在保存 Raw 后自行拒绝或给出明确提示。

最后的判断标准

只要读者需要“原样展示、精确回写、定位输入错误或保留审计痕迹”,就应该把 TokenText() 的结果当作一等数据;只在需要算术含义时调用 strconv。可以用一句话检查实现是否可靠:任何数值转换失败时,错误信息还能指出用户输入的完整原文吗?如果答案是否定的,说明原始字面量保存得太晚了。

相关问题

为什么不能只保存 ParseInt 的结果? 因为数值结果无法区分十进制、十六进制和带下划线的原始写法,回写和错误提示会失去上下文。

TokenText 可以在下一次 Scan 后再读吗? 不建议。它描述的是最近一次扫描到的 token,应在同一轮中复制到自己的结构体或字符串字段。

版本声明
本文转载于:17golang原创 如有侵犯,请联系study_golang@163.com删除
MySQL 直方图之外如何判断列选择性是否真实下降MySQL 直方图之外如何判断列选择性是否真实下降
上一篇
MySQL 直方图之外如何判断列选择性是否真实下降
Redis SCAN 使用 MATCH 和 COUNT 时为什么仍会返回重复键
下一篇
Redis SCAN 使用 MATCH 和 COUNT 时为什么仍会返回重复键
查看更多
最新文章
查看更多
课程推荐
  • 前端进阶之JavaScript设计模式
    前端进阶之JavaScript设计模式
    设计模式是开发人员在软件开发过程中面临一般问题时的解决方案,代表了最佳的实践。本课程的主打内容包括JS常见设计模式以及具体应用场景,打造一站式知识长龙服务,适合有JS基础的同学学习。
    543次学习
  • GO语言核心编程课程
    GO语言核心编程课程
    本课程采用真实案例,全面具体可落地,从理论到实践,一步一步将GO核心编程技术、编程思想、底层实现融会贯通,使学习者贴近时代脉搏,做IT互联网时代的弄潮儿。
    516次学习
  • 简单聊聊mysql8与网络通信
    简单聊聊mysql8与网络通信
    如有问题加微信:Le-studyg;在课程中,我们将首先介绍MySQL8的新特性,包括性能优化、安全增强、新数据类型等,帮助学生快速熟悉MySQL8的最新功能。接着,我们将深入解析MySQL的网络通信机制,包括协议、连接管理、数据传输等,让
    500次学习
  • JavaScript正则表达式基础与实战
    JavaScript正则表达式基础与实战
    在任何一门编程语言中,正则表达式,都是一项重要的知识,它提供了高效的字符串匹配与捕获机制,可以极大的简化程序设计。
    487次学习
  • 从零制作响应式网站—Grid布局
    从零制作响应式网站—Grid布局
    本系列教程将展示从零制作一个假想的网络科技公司官网,分为导航,轮播,关于我们,成功案例,服务流程,团队介绍,数据部分,公司动态,底部信息等内容区块。网站整体采用CSSGrid布局,支持响应式,有流畅过渡和展现动画。
    485次学习
查看更多
AI推荐
  • PubMedQA数据集详解:生物医学问答基准、功能与应用指南
    PubMedQA
    深入了解PubMedQA生物医学问答数据集,涵盖其核心功能、使用方法及在临床决策、药物研发等场景的应用,助力提升NLP模型性能。
    26次使用
  • H2O EvalGPT:开源LLM大模型评估与排行榜工具
    H2O EvalGPT
    H2O EvalGPT是H2O.ai推出的开源LLM评估平台,提供详细的大模型性能排行榜、行业特定基准测试及A/B测试功能,助您快速选择最适合项目的高性能大语言模型。
    131次使用
  • LMArena是什么?伯克利AI模型评估平台使用指南与功能解析
    LMArena
    LMArena是加州大学伯克利分校推出的AI模型匿名评测平台。通过盲测投票机制,用户可对比不同大模型回答并生成实时排行榜,助力开发者优化模型及用户选择最佳AI工具。
    62次使用
  • 斯坦福HELM:大语言模型Holistic Evaluation整体评估框架详解
    HELM
    深入了解斯坦福推出的HELM(Holistic Evaluation of Language Models)大模型评测体系。本文解析其核心功能、安装配置步骤及应用场景,涵盖准确性、公平性、鲁棒性等多维度指标,助力开发者全面优化语言模型性能。
    23次使用
  • CMMLU中文大模型评估基准:功能、使用教程与应用场景解析
    CMMLU
    深入了解CMMLU中文评估基准,涵盖67个学科主题,提供数据集下载、Zero-shot/Five-shot评估方法及排行榜,助力优化中文语言模型性能。
    2次使用
微信登录更方便
  • 密码登录
  • 注册账号
登录即同意 用户协议隐私政策
返回登录
  • 重置密码