
本文介绍一种基于进制转换的无损压缩方法,将37字符集(a–z、0–9、.)的输入字符串,以接近理论极限的效率映射为62字符集(a–z、a–z、0–9)的输出字符串,典型实现为8字符输入→7字符输出,压缩率达87.5%。
本文介绍一种基于进制转换的无损压缩方法,将37字符集(a–z、0–9、.)的输入字符串,以接近理论极限的效率映射为62字符集(a–z、a–z、0–9)的输出字符串,典型实现为8字符输入→7字符输出,压缩率达87.5%。
在字符集受限但要求紧凑编码的场景中(如URL短链后缀、嵌入式标识符、协议载荷优化),直接使用通用压缩算法(如gzip)往往得不偿失——输入太短、无重复模式,反而引入开销。此时,数学意义上的确定性进制映射成为更优解:将输入视为以37为基数的整数,再将其等价表示为以62为基数的整数,最后按位查表映射为目标字符。
核心原理:基数转换与空间填充率优化
设输入符号集大小为 $b_i = 37$,输出符号集大小为 $b_o = 62$。若每次处理 $n$ 个输入符号,则其可表示的总状态数为 $37^n$;若用 $m$ 个输出符号承载全部信息,则需满足: $$ 37^n \leq 62^m $$ 理想情况下,我们希望比值 $\frac{37^n}{62^m}$ 尽可能接近 1(即输出空间利用率最大化)。经穷举搜索,最小有效解为:
- $n = 8$, $m = 7$
- $37^8 = 3{,}512{,}479{,}453{,}921$
- $62^7 = 3{,}521{,}614{,}606{,}208$
- 利用率 ≈ 99.74%,熵压缩率 $\log_{62}(37^8) / 7 \approx 0.99991$(几乎无信息损失)
这意味着:每8个输入字符严格对应7个输出字符,实现固定长度、无歧义、可逆的压缩。
实现步骤(以 JavaScript 为例)
1. 字符 ↔ 数字映射表
const INPUT_CHARS = 'abcdefghijklmnopqrstuvwxyz0123456789.'; const OUTPUT_CHARS = 'abcdefghijklmnopqrstuvwxyzABCDEFGHIJKLMNOPQRSTUVWXYZ0123456789'; const charToIndex = new Map( [...INPUT_CHARS].map((c, i) => [c, i]) ); const indexToChar = [...OUTPUT_CHARS];
2. 编码:8字符 → 7字符
function encode(input) {
const result = [];
for (let i = 0; i < input.length; i += 8) {
const chunk = input.slice(i, i + 8);
// 步骤1:转为 BigInt(base-37 整数)
let num = 0n;
for (let j = 0; j < chunk.length; j++) {
const idx = charToIndex.get(chunk[j]);
if (idx === undefined) throw new Error(`Invalid input char: ${chunk[j]}`);
num += BigInt(idx) * (37n ** BigInt(j));
}
// 步骤2:转为 base-62 的 7 位数字(低位在前)
const digits = Array(7).fill(0);
for (let k = 0; k < 7; k++) {
digits[k] = Number(num % 62n);
num /= 62n;
}
// 步骤3:查表生成字符(注意:digits[0] 是最低位,对应输出最右字符)
result.push(...digits.reverse().map(i => indexToChar[i]));
}
return result.join('');
}3. 解码:7字符 → 8字符(需额外传递原始长度模8)
由于末组可能不足8字符,必须在协议层约定或显式传输 input.length % 8(记为 padLen,范围 0–7)。解码时对最后一组7字符反向计算后,仅取前 padLen 个字符:
function decode(encoded, originalLengthMod8 = 0) {
const result = [];
const totalChunks = Math.ceil(encoded.length / 7);
const lastChunkSize = originalLengthMod8 || 8;
for (let i = 0; i < encoded.length; i += 7) {
const chunk = encoded.slice(i, i + 7);
// 转为 BigInt(base-62)
let num = 0n;
for (let j = 0; j < chunk.length; j++) {
const idx = OUTPUT_CHARS.indexOf(chunk[j]);
if (idx === -1) throw new Error(`Invalid output char: ${chunk[j]}`);
num += BigInt(idx) * (62n ** BigInt(6 - j)); // 高位在左,需反转索引
}
// 转回 base-37,提取最多8位
const digits37 = [];
for (let k = 0; k < 8 && num > 0n; k++) {
digits37.push(Number(num % 37n));
num /= 37n;
}
// 补零至8位(用于中间块),末块仅取 originalLengthMod8 个
while (digits37.length < 8) digits37.push(0);
const actualCount = (i + 7 >= encoded.length) ? lastChunkSize : 8;
result.push(...digits37.slice(0, actualCount).map(i => INPUT_CHARS[i]));
}
return result.join('');
}注意事项与最佳实践
- ✅ 确定性 & 无损:该方案是双射(bijection),无任何信息丢失,适用于校验敏感场景。
- ⚠️ 长度元数据不可省略:因采用分块固定长度编码,接收方必须知晓原始输入长度(至少模8),否则末块解码会错误补零。建议将
originalLength % 8作为前导字节或独立字段传输。 - ⚠️ JavaScript 精度安全:
62^7 ,故使用 <code>Number进行中间计算在绝大多数情况下安全;但为绝对严谨,推荐全程使用BigInt(如示例所示)。 - ? 不适用场景:输入含非法字符(非
[a-z0-9.])、长度动态且无法协商元数据、或要求流式/增量编码时,需改用其他方案(如 Base64 变种或自定义 Huffman)。
此方法以极简数学逻辑达成近似香农极限的编码效率,是字符集约束下轻量级无损压缩的经典范例。

















