可靠基准测试需预热、批量测量、多轮采样剔异并隔离干扰:预热1–50万次确保JIT稳定;每轮执行1,000–100,000次后取nanoTime均值;至少10–30轮,剔除首尾10%或取中位数;用volatile保留结果、单核绑定并关闭节能。

用 System.nanoTime() 做基准测试,不是记个开始时间、结束时间再相减那么简单。真正可靠的结果依赖于对 JVM 行为、硬件特性和统计噪声的系统性控制。
预热必须做够,且要针对性完成
JVM 在首次执行方法时会经历类加载、解释执行、C1 编译、C2 编译甚至去优化,这些阶段耗时远超稳态性能。不预热,测出来的根本不是“算法耗时”,而是“JIT 编译耗时”。
- 对简单方法(如纯计算),预热 1–10 万次足够;对含对象分配或复杂分支的方法,建议 50 万次以上
- 预热期间不能混入测量逻辑,应单独循环调用目标方法,确保 JIT 完全稳定
- 可配合
HotSpotDiagnosticMXBean.getCompilationTime()或 JFR 事件确认 C2 编译已完成
每次测量必须包裹批量调用,而非单次
单次 System.nanoTime() 调用开销约 20–50 ns,若被测方法本身只耗 10 ns,那测出来全是噪声——大量结果为 0,少数跳变到 40–80 ns,毫无统计意义。
- 每轮测量执行 1,000–100,000 次目标操作,仅在整批前后各调一次
nanoTime() - 总耗时除以次数,得到单次均值(单位纳秒),再除以 1000 得微秒级结果
- 避免在循环体内写日志、创建对象、触发 GC;所有中间变量尽量复用
采样需多轮独立,剔除极值比取平均更关键
一次 Full GC、一个 TLB miss、一次 CPU 频率降频,都可能让某轮耗时暴涨几十毫秒,拉垮整个平均值。算术平均对异常值极度敏感,而中位数或截尾均值能有效抵抗这类污染。
- 至少运行 10–30 轮独立测量(每轮含批量调用),获得一组“每轮总耗时”样本
- 剔除首尾各 10% 的样本(例如 20 轮就去掉最高/最低各 2 个),剩余取算术平均
- 更稳健的做法是直接取中位数——它不依赖分布假设,对毛刺天然鲁棒
必须切断 JIT 优化干扰和外部污染
如果计算结果没被使用,JIT 可能在编译期直接删掉整段逻辑;如果两个待对比算法共用缓存或对象,彼此会相互影响,测出的不是真实差异。
- 用
volatile字段接收并保留计算结果(如volatile int sink;),或将其作为返回值参与后续不可省略的逻辑 - 对比 A 和 B 时,各自预热、各自测量,对象实例完全隔离,不复用任何状态
- Linux 下用
taskset -c 0绑定单核,关闭 CPU 节能:cpupower frequency-set -g performance

















