UTF-8文件的Unicode签名BOM(Byte Order Mark)问题记录（EF BB BF）

背景

楼主测试的批量发送信息功能上线之后，查看后台运行日志，发现存在少量的ERROR日志，提示手机号码格式不正确。

之前没有出现过这样的问题，找运营要了上传的txt发送列表，发现格式是要求的UTF-8，且号码是符合规则的，反复查看未发现异常。

因为博主还有别的需求，所以直接反馈给了开发，让开发定位。

定位过程

两天之后，开发给了我两个文件，问我有没有办法找出这两个文件的不同。我看了一下，文件内容完全相同。

后来使用软件beyond compare进行十六进制对比终于发现了区别，

其中一个第一行多了三个字节“EF BB BF”，如下图

原因

多方查证得知是UTF-8有无BOM的区别。

BOM(Byte Order Mark)，是UTF编码方案里用于标识编码的标准标记，在UTF-16里本来是FF FE，变成UTF-8就成了EF BB BF。这个标记是可选的，因为UTF8字节没有顺序，所以它可以被用来检测一个字节流是否是UTF-8编码的。微软做这种检测，但有些软件不做这种检测，而把它当作正常字符处理。

微软在自己的UTF-8格式的文本文件之前加上了EF BB BF三个字节, windows上面的notepad等程序就是根据这三个字节来确定一个文本文件是ASCII的还是UTF-8的, 然而这个只是微软暗自作的标记, 其它平台上并没有对UTF-8文本文件做个这样的标记。

也就是说一个UTF-8文件可能有BOM，也可能没有BOM

解决方法

使用Notepad++编辑，转换为UTF-8无BOM格式即可

参考资料：EF BB BF

原文地址：https://www.cnblogs.com/Detector/p/8483010.html

时间： 2024-10-07 18:23:14

UTF-8文件的Unicode签名BOM(Byte Order Mark)问题记录（EF BB BF）

背景

定位过程

原因

多方查证得知是UTF-8有无BOM的区别。

解决方法

UTF-8文件的Unicode签名BOM(Byte Order Mark)问题记录（EF BB BF）的相关文章

什么是BOM（Byte Order Mark）？

字节顺序标记——BOM，Byte Order Mark

PHP 下载文件时自动添加bom头的方法

理解字节序 [Understanding Big and Little Endian Byte Order]

python unicode和string byte

【分享】Android Studio专用文件转换工具：把ANSI文件批量另存为无BOM的UTF-8文件

[C/C++标准库]_[读写中文路径的文件--写入unicode字符串]

[Android Pro] 查看 keystore文件的签名信息和检查apk文件中的签名信息

檢查php文件中是否含有bom的php文件