DeepSeal — 本地加密笔记应用,你的隐私只有你说了算。 免费下载 → ×
U+

Unicode 编码转换

文本与 Unicode 互转(\uXXXX、U+XXXX、UTF-8/16/32 字节序列、HTML 实体),支持 emoji。

P2
方向:
完整支持 emoji 与代理对
文本输入
四种 Unicode 表示

Unicode 编码转换工具

这是 HyperGrad Text 提供的免费 Unicode 编码转换工具,文本与 Unicode 互转,同时给出码点(U+XXXX)、 \uXXXX 转义(JavaScript/Java)、UTF-8 字节序列、UTF-16 单元(含代理对)、HTML 实体(&#NNN;)五种表示。 完整支持 emoji(如 😀 = U+1F600)与扩展平面字符,自动识别与生成代理对。所有转换在浏览器本地完成, 适合国际化开发、emoji 处理、源码中文字段处理、字符编码学习。

\uXXXX 与 U+XXXX 的区别

\uXXXX 是 JavaScript/Java/Python 字符串中的转义序列,4 位十六进制, 只能表示基本多文种平面(BMP,0-65535)的字符。U+XXXX 是 Unicode 码点表示法, 可表示所有码点(含扩展平面,用 5-6 位十六进制,如 U+1F600)。 emoji 等超出 BMP 的字符需用 U+XXXX 或 UTF-16 代理对表示。

emoji 与代理对

😀(U+1F600)超出 BMP,UTF-16 用代理对 \uD83D\uDE00 表示(由高位代理 D83D 与低位代理 DE00 组成), UTF-8 是 4 字节 F0 9F 98 80。本工具会同时显示码点、UTF-8 字节、UTF-16 单元、JS 转义、HTML 实体五种表示, 方便开发者按语言规范选用。反向转换 emoji 时会输出代理对(JavaScript 风格)和码点(U+1F600 风格)两种。

常见使用场景

  • 源码中文转义:把源码里的中文字段转 \uXXXX 以避免编码问题(如 ASCII-only 字符串)。
  • emoji 在不同语言的表示:Python 用 \U0001F600(8 位),JS 用 \uD83D\uDE00(代理对),HTML 用 😀。
  • 编码排错:字符显示乱码时,查它的码点与字节序列判断是 UTF-8 还是 GBK 还是 Latin-1 误读。
  • 扩展汉字:CJK Extension B/C/D/E(古籍生僻字)超出 BMP,需用代理对或 U+XXXXX 表示。

支持的反向输入格式

解码模式支持四种格式混合输入:\uXXXX(含代理对 \uD83D\uDE00)、U+XXXXX(5-6 位码点)、 &#NNN;(十进制 HTML 实体)、&#xHH;(十六进制 HTML 实体)。工具会逐段识别并还原为字符。

Unicode 常见问答

\uXXXX 和 U+XXXX 有什么区别?
\uXXXX 是 JavaScript/Java/Python 字符串中的转义序列,4 位十六进制,只能表示基本多文种平面(BMP,0-65535)的字符。U+XXXX 是 Unicode 码点表示法,可表示所有码点(含扩展平面,用 5-6 位十六进制,如 U+1F600)。emoji 等扩展字符需用 U+XXXX 或代理对。
emoji 怎么转换?
本工具完整支持 emoji。😀(U+1F600)超出 BMP,UTF-16 用代理对 \uD83D\uDE00 表示,UTF-8 是 4 字节 F0 9F 98 80。本工具会同时显示码点、UTF-8 字节、UTF-16 单元、JS 转义、HTML 实体五种表示,方便开发者选择。
为什么有些中文是 4 位 \u,有些是 5 位?
基本汉字(U+4E00—U+9FFF)能放进 4 位 \u,如 中 是 \u4E2D。但扩展汉字(CJK Extension B/C/D/E,古籍生僻字)超出 BMP,码点如 U+20000—U+2A6DF,需用代理对(两个 4 位 \u)或 U+XXXXX 表示。
能转代理对(surrogate pair)吗?
能。本工具自动识别代理对:输入 \uD83D\uDE00 会正确还原为 😀。反向转换 emoji 时会输出代理对(JavaScript 风格)和码点(U+1F600 风格)两种表示,方便你按语言规范选用。

HyperGrad 生态还有这些站