Unicode 编码转换
文本与 Unicode 互转(\uXXXX、U+XXXX、UTF-8/16/32 字节序列、HTML 实体),支持 emoji。
Unicode 编码转换工具
这是 HyperGrad Text 提供的免费 Unicode 编码转换工具,文本与 Unicode 互转,同时给出码点(U+XXXX)、
\uXXXX 转义(JavaScript/Java)、UTF-8 字节序列、UTF-16 单元(含代理对)、HTML 实体(NNN;)五种表示。
完整支持 emoji(如 😀 = U+1F600)与扩展平面字符,自动识别与生成代理对。所有转换在浏览器本地完成,
适合国际化开发、emoji 处理、源码中文字段处理、字符编码学习。
\uXXXX 与 U+XXXX 的区别
\uXXXX 是 JavaScript/Java/Python 字符串中的转义序列,4 位十六进制,
只能表示基本多文种平面(BMP,0-65535)的字符。U+XXXX 是 Unicode 码点表示法,
可表示所有码点(含扩展平面,用 5-6 位十六进制,如 U+1F600)。
emoji 等超出 BMP 的字符需用 U+XXXX 或 UTF-16 代理对表示。
emoji 与代理对
😀(U+1F600)超出 BMP,UTF-16 用代理对 \uD83D\uDE00 表示(由高位代理 D83D 与低位代理 DE00 组成),
UTF-8 是 4 字节 F0 9F 98 80。本工具会同时显示码点、UTF-8 字节、UTF-16 单元、JS 转义、HTML 实体五种表示,
方便开发者按语言规范选用。反向转换 emoji 时会输出代理对(JavaScript 风格)和码点(U+1F600 风格)两种。
常见使用场景
- 源码中文转义:把源码里的中文字段转
\uXXXX以避免编码问题(如 ASCII-only 字符串)。 - emoji 在不同语言的表示:Python 用
\U0001F600(8 位),JS 用\uD83D\uDE00(代理对),HTML 用 😀。 - 编码排错:字符显示乱码时,查它的码点与字节序列判断是 UTF-8 还是 GBK 还是 Latin-1 误读。
- 扩展汉字:CJK Extension B/C/D/E(古籍生僻字)超出 BMP,需用代理对或 U+XXXXX 表示。
支持的反向输入格式
解码模式支持四种格式混合输入:\uXXXX(含代理对 \uD83D\uDE00)、U+XXXXX(5-6 位码点)、
NNN;(十进制 HTML 实体)、HH;(十六进制 HTML 实体)。工具会逐段识别并还原为字符。