Python中按字节取反二进制文件需用bytearray配合异或0xFF,避免使用~运算符导致负值错误;大文件应分块处理(如8KB),不可全量加载;本质是固定密钥XOR,非安全加密。

直接读取二进制文件并按字节取反
Python 中没有内置的「按位取反整个文件」函数,但 bytearray 支持原地修改,配合 ~ 运算符就能逐字节取反。注意:~x 在 Python 中对有符号整数会返回负值(如 ~0 是 -1),而二进制文件需要的是无符号 8 位取反(即 255 - x 或 x ^ 0xFF)。
正确做法是用异或:byte ^ 0xFF。示例:
with open('input.bin', 'rb') as f:
data = bytearray(f.read())
for i in range(len(data)):
data[i] ^= 0xFF
with open('output.bin', 'wb') as f:
f.write(data)- 必须用
bytearray(不是bytes),因为后者不可变 - 避免用
~b,它会把0xFF变成-256,写入时抛出ValueError: byte must be in range(0, 256) - 大文件慎用全量加载;可分块处理(见下一条)
分块读写避免内存溢出
处理 GB 级二进制文件时,一次性读入会爆内存。关键是控制块大小,并确保每次写入前已完成该块的按位运算。
推荐块大小为 8192(8KB)或 65536(64KB),兼顾 I/O 效率和内存占用:
立即学习“Python免费学习笔记(深入)”;
chunk_size = 8192
with open('input.bin', 'rb') as fin, open('output.bin', 'wb') as fout:
while True:
chunk = fin.read(chunk_size)
if not chunk:
break
# 转为 bytearray 并取反
ba = bytearray(chunk)
for i in range(len(ba)):
ba[i] ^= 0xFF
fout.write(ba)-
fin.read()返回bytes,必须转bytearray才能改写 - 不要在循环内重复创建大对象(比如每次 new 一个 list 存 chunk)
- 块大小不是越大越好:超过几 MB 后 I/O 增益趋缓,但内存压力陡增
简单异或加密(XOR cipher)与密钥管理
按位取反本质是固定密钥 0xFF 的 XOR 加密。扩展为可变密钥 XOR,只需将密钥字节循环应用到每个数据字节上。
常见错误是直接用字符串密钥(如 'secret')去 XOR —— 必须先编码为 bytes:
key = b'mykey' # 必须是 bytes,不是 str
with open('input.bin', 'rb') as fin, open('output.enc', 'wb') as fout:
i = 0
while True:
b = fin.read(1)
if not b:
break
# 单字节 XOR,密钥循环
encrypted_byte = b[0] ^ key[i % len(key)]
fout.write(bytes([encrypted_byte]))
i += 1- 密钥不能是
str,否则b[0] ^ 'k'会报TypeError - 密钥越短越不安全;单字节密钥(如
b'\x1a')等价于移位,极易被频次分析破解 - 这种 XOR 不是加密标准,仅适合临时混淆,不可用于敏感数据
为什么不能用 codecs 或 base64 处理二进制取反
codecs 模块设计用于文本编解码(如 utf-8、rot13),其 encode/decode 接口隐含字符语义,传入任意 bytes 可能触发解码失败或静默截断。
例如:codecs.encode(b'\xff\x00', 'rot13') 会抛出 UnicodeDecodeError,因为 rot13 内部尝试先 decode 成 str。
-
base64是编码(encoding),不是加密,且会膨胀体积约 33%,和按位操作目标相悖 - 所有「看起来像加解密」但底层走文本路径的模块(如
quopri、hex)都不适用于原始二进制位运算 - 真要加解密,请用
cryptography库的 AES/GCM,而不是自己拼 XOR
真正需要按位操作时,就老老实实读 bytes → 转 bytearray → 逐字节 ^ → 写回。中间任何抽象层都可能引入意外解释或转换。


















