字符 / 词数统计
统计字符(含/不含空白)、词、行、中英文与 UTF-8 字节
输入或粘贴文本即可实时统计。核对字段限制时,先确认目标要求是字符数、字节数还是平台自己的计数方式。
| 字符数(含空白) | 0 |
|---|---|
| 字符数(不含空白) | 0 |
| 词组数 | 0 |
| 行数 | 0 |
| 汉字数(CJK 统一表意文字) | 0 |
| 字节数(UTF-8) | 0 |
示例
输入
A中 B
示例结果
码点数:4 · 非空白字符数:3 · 行数:2 · UTF-8 字节数:6
换行占一个码点和一个 UTF-8 字节;“中”占三个字节。
技术细节与边界
字符数通过码点迭代计算,字节数通过 TextEncoder 的 UTF-8 编码计算,两者通常不同。组合附加符和连字序列可能由多个码点组成。词数按连续字母、数字及连接符统计,不是中文分词;汉字计数覆盖代码中列出的常用及扩展范围,不是全部 Unicode 汉字版本。
关于此工具
实时统计文本的 Unicode 码点数、非空白字符、词组、行数、汉字与 UTF-8 字节数。用于核对字段长度、接口字节限制和内容规模,并说明不同计数口径。
适用场景
- 发布或提交文本前核对字符数量;目标平台可能采用不同的计数规则,应再按其规则确认。
- 估算一段中英混排文本在数据库里占多少字节。
- 快速看一份 CSV 有多少行、是否有空行。
注意事项
词组按连续的 Unicode 字母、数字、下划线及部分连接符统计,不做自然语言分词。连续中文可能只算一个词组,中文字数请查看汉字栏。字节数按 UTF-8 计算。
常见问题
- 为什么一整句中文只统计为一个词?
- 词数统计连续字母和数字,而不是自然语言分词。连续汉字可形成一个词组;需要中文字数时请看汉字或码点栏目。
- `\n` 会被算成 1 个字符吗?
- 会被算作 1 个字符(空白类)。行数则按 `\n` / `\r\n` 切分。
- 为什么和编辑器的字符数不同?
- 编辑器可能统计 UTF-16 码元、用户可见字形或包含不同的换行符。对接长度限制时应先确认系统要求的是字节、码点还是字形。
- 为什么一个可见字符可能统计成多个字符?
- 这里按 Unicode 码点计数。组合附加符和某些连字序列可能包含多个码点;这与用户感知的字形数量并不总是一致。
相关工具