UnicodeDecodeError 表明文件编码与Python默认解码方式不匹配,常见于Windows下GBK编码文件被UTF-8解码;应显式指定encoding='gbk'(兼容GB2312/GB18030)并加errors='ignore'容错,避免依赖chardet误判。

遇到 UnicodeDecodeError 说明文件确实是 GBK 编码,但 Python 默认按 UTF-8 读取
常见报错长这样:UnicodeDecodeError: 'utf-8' codec can't decode byte 0xc4 in position 0: invalid continuation byte。这基本能锁定是 GBK(或 GB2312/GB18030)编码的文件被当成了 UTF-8 处理。不是所有“中文乱码文件”都是 GBK,但 Windows 上用记事本另存为、旧版 Excel 导出、某些爬虫抓取的 HTML,大概率是 GBK 系列。
用 open() 手动指定编码转换最稳妥,别依赖 chardet 自动检测
chardet 对短文本、无 BOM 的 GBK 文件识别不准,容易误判成 ISO-8859-1 或直接失败;批量处理时一旦误判,就可能把文件内容写坏。直接按已知目标(GBK → UTF-8)硬转更可靠。
- 先用
open(file_path, 'r', encoding='gbk')读取('gbk'能兼容大部分 GB2312/GB18030) - 再用
open(file_path, 'w', encoding='utf-8')写入,Python 3 默认不加 BOM,符合通用 UTF-8 规范 - 务必加
errors='ignore'或errors='replace'防止个别字节异常中断流程,例如:open(..., encoding='gbk', errors='ignore')
处理目录下所有 .txt 和 .py 文件的脚本示例
import os
from pathlib import Path
<p>def convert_gbk_to_utf8(file_path):
try:
with open(file_path, 'r', encoding='gbk', errors='ignore') as f:
content = f.read()
with open(file_path, 'w', encoding='utf-8') as f:
f.write(content)
print(f"✅ {file_path}")
except Exception as e:
print(f"❌ {file_path} — {e}")</p><h1>只处理当前目录及子目录下的 .txt 和 .py</h1><p>for file_path in Path(".").rglob("*"):
if file_path.is_file() and file_path.suffix.lower() in {'.txt', '.py'}:
convert_gbk_to_utf8(str(file_path))
注意:Path(".").rglob("*") 会遍历所有层级,如果只想改当前目录,换成 os.listdir(".") 并过滤后缀即可。别对 .pyc、.git 目录或二进制文件(如 .jpg)运行这个逻辑——它们不是文本,强行转编码只会损坏文件。
Windows 记事本保存的文件可能带 BOM,而 Python 写出的 UTF-8 默认无 BOM
如果你后续要让其他工具(比如某些老旧的 Java 程序或特定编辑器)正常读取,才需要手动加 BOM。此时写入用:open(file_path, 'w', encoding='utf-8-sig')。utf-8-sig 会在开头自动写入 \ufeff,读取时也会自动跳过它。但绝大多数现代工具(VS Code、PyCharm、Linux 工具链)更欢迎无 BOM 的 UTF-8,加了反而可能引发奇怪问题,比如 # -*- coding: utf-8 -*- 前多出不可见字符导致语法错误。
立即学习“Python免费学习笔记(深入)”;
真正麻烦的是混合编码:一个目录里有的文件是 GBK,有的已经是 UTF-8,还有的可能是 BIG5。这种场景没法靠统一规则解决,得先做探测+分类,或者人工确认源环境。批量转之前,建议先抽样用 file -i filename(Linux/macOS)或 PowerShell 的 Get-Content -Encoding Byte 看前几个字节,比盲目跑脚本安全得多。


















