结论其实很明确:file -i最多只能做个大致判断,真要想更稳妥,还是得看enca -L zh(针对中文文件)或者直接用iconv -f XXX -t UTF-8手动试错;至于:set fileencoding,它显示的是 Vim 推测出来的编码,不是文件的真实编码,不能拿它当依据。

file -i 只能粗略判断,真正靠谱的是 enca -L zh(中文文件)或 iconv -f XXX -t UTF-8 手动试错**。别信 :set fileencoding? 显示的结果——那是 Vim 猜的,不是文件真实编码。
用 file -i 快速看 MIME 编码,但别全信
file -i 这类判断本质上还是看 BOM 或字节特征,所以一旦遇到没有 BOM 的 GBK/GB2312 文件,基本就不太靠得住了,返回结果里经常会出现 charset=iso-8859-1,或者干脆是 charset=unknown-8bit。
- 执行
file -i filename.txt,只关注charset=后面的值 - 若输出
charset=utf-8且文件有中文,再用head -c 3 filename.txt | hexdump -C确认是否含ef bb bf(UTF-8 BOM) - 若输出
charset=unknown-8bit,说明它完全没识别出来,必须换工具
用 enca -L zh 精准识别中文文本编码
enca 是专为东亚语言设计的检测工具,对 GBK、GB2312、UTF-8 混合内容识别更稳,但需先安装:
- Debian/Ubuntu:
sudo apt install enca - CentOS/RHEL:
sudo yum install enca - 运行
enca -L zh filename.txt,典型输出如:Chinese National Standard; GBK或Universal transformation format 8 bits; UTF-8 - 如果报
Unrecognized encoding,大概率是文件混了多种编码,或存在损坏字节,这时得靠iconv试
用 iconv -f XXX -t UTF-8 手动验证源编码
iconv 不检测,但能“反向验证”:转换不报错 + 输出可读,基本就是对的。这是最可靠的兜底方法。
- 先试常见中文编码:
iconv -f GBK -t UTF-8 filename.txt > /dev/null 2>&1 && echo "GBK OK" - 再试
GB2312、CP936(Windows 下的 GBK 别名)、ISO-8859-1(常被误判为 Latin1 的乱码文件) - 对通过的编码,加
| head -n 3看实际输出是否中文正常,比如:iconv -f GBK -t UTF-8 filename.txt | head -n 3 - 遇到
iconv: illegal input sequence或Invalid or incomplete multibyte or wide character,说明-f写错了,立刻换下一个
在 Vim 里用 :e ++enc=xxx 实时比对显示效果
Vim 的 :set fileencoding? 显示的是当前加载所用的编码,不是原始编码;但它支持强制重读,适合肉眼验证。
- 打开文件后,依次执行:
:e ++enc=gbk、:e ++enc=utf-8、:e ++enc=latin1 - 哪次中文显示正常、标点不碎、无方块/问号,就基本锁定源编码
- 注意:
:set fileencoding=utf-8只是改保存时用的编码,不改变已加载内容——要真转码,得先:e ++enc=gbk再:set fileencoding=utf-8然后:w
LANG 是否匹配**——哪怕编码转对了,LANG=C 下照样显示为 。