Java中按字节截断字符串需基于UTF-8编码处理字符边界:先转字节数组,再从maxBytes位置向前跳过续字节(0x80–0xBF),找到合法字符起始点后截取并重建字符串,避免乱码。

Java 中按指定字节长度截断字符串,关键在于明确编码(如 UTF-8),因为不同字符占的字节数不同(英文 1 字节,中文通常 3 字节)。直接用 String.substring() 是按字符数截,不是字节数,容易乱码或超长。
先转字节数组,再截取再还原
这是最稳妥的方式:把字符串按指定编码转成字节数组 → 截取前 N 个字节 → 再用相同编码构造新字符串。注意处理边界:如果在多字节字符中间截断,最后几个字节可能无法解码,需向后退直到找到合法字符边界。
- 用
str.getBytes(StandardCharsets.UTF_8)获取 UTF-8 字节数组 - 若目标长度 ≥ 字节数组长度,直接返回原字符串
- 否则从截断位置向前查找最后一个完整字符的起始位置(跳过 UTF-8 的后续字节:以
0x80–0xBF开头的字节是 continuation byte,需跳过) - 用
new String(bytes, 0, validLen, StandardCharsets.UTF_8)构造结果
用 Apache Commons Lang 简化操作
如果你项目已引入 commons-lang3(推荐版本 3.12+),可直接用 StringUtils.abbreviateMiddle(str, "", maxBytes) 的变体思路,但更推荐自定义工具方法。它本身不提供纯字节截断,不过你可以借助 CharsetEncoder 或封装上述逻辑。
- Maven 依赖:
<artifactId>commons-lang3</artifactId><version>3.14.0</version> - 建议自己写一个
truncateByBytes(String str, int maxBytes, Charset charset)方法复用
避免乱码的关键细节
UTF-8 中,一个字符可能占 1~4 字节。如果在某个中文字符的第 2 字节处硬截,解码会失败抛 MalformedInputException 或显示 。所以不能简单取前 N 字节,必须“对齐字符边界”。
Java项目代码review工具。分析Git变更+完整调用链路上下文,推断业务需求,进行多维度评分和分类汇总,生成完整PRD文档。包含细粒度Java代码审查清单(Null安全、异常处理、Streams、并发、equals/hashCode、资源管理、API设计、性能、MyBatis/ORM、事务边界、SQL/DD...
立即学习“Java免费学习笔记(深入)”;
- 判断字节是否为 continuation byte:
(b & 0xC0) == 0x80 - 判断是否为 2 字节字符开头:
(b & 0xE0) == 0xC0 - 判断是否为 3 字节字符开头:
(b & 0xF0) == 0xE0 - 截断时从
maxBytes - 1往前扫描,跳过所有 continuation byte,找到上一个字符起始点
简单可用的参考实现
以下是一个安全、无依赖的 UTF-8 字节截断方法:
public static String truncateByUtf8Bytes(String str, int maxBytes) {
if (str == null || maxBytes <= 0) return "";
byte[] bytes = str.getBytes(StandardCharsets.UTF_8);
if (bytes.length <= maxBytes) return str;
<pre class='brush:java;toolbar:false;'>int len = maxBytes;
// 向前找字符边界
while (len > 0 && (bytes[len] & 0xC0) == 0x80) {
len--;
}
return new String(bytes, 0, len, StandardCharsets.UTF_8);}

















