Linux下分支预测命中率需手动计算为1−(branch-misses÷branches),必须同时采集二者;perf stat需指定branches,branch-misses事件,配合perf_event_paranoid调优权限,并注意CPU微架构兼容性及采样窗口选择。

Linux 下没有“分支预测命中率”这个现成指标,只有 branch-misses 和 branches 两个硬件事件可采集;所谓“命中率”必须手动算:1 − (branch-misses ÷ branches),且必须同时采集二者,缺一不可。
perf stat 必须同时指定 branches 和 branch-misses
单独跑 perf stat -e branch-misses 或只看 branches 都没意义——前者是绝对计数,后者是总分支数,脱离比值无法解释实际预测效果。
-
perf stat -e branches,branch-misses -p <pid></pid>(监控已有进程) -
perf stat -e branches,branch-misses -- ./your_program(启动新程序) - 输出里找两行:
130,082,139,921 cpu_core/branches/和17,389 cpu_core/branch-misses/,然后算17389.0 / 130082139921 ≈ 0.0000134,即失败率 ≈ 0.00134%,命中率 ≈ 99.99866% - 若用
-k 1包含内核态分支,注意内核分支行为更难预测,命中率通常显著低于用户态
不同 CPU 微架构需显式指定事件前缀
Intel Core 系列默认用 cpu_core/,但 Atom、Alder Lake 混合架构或某些 ARM64 平台可能返回 0 或报 Operation not supported。
Linux系统管理专家,覆盖12大模块:用户权限、SSH、存储、网络、systemd、防火墙、日志监控、备份恢复、TLS证书、Ansible、容器、IaC。提供配置、验证、加固、监控、备份、自动化、故障排查、回滚闭环。关键词:useradd、sudo、sshd_config、chmod、SEL...
- 查当前 CPU 支持的 PMU 驱动:
dmesg | grep -i pmu,看到类似core: cpu_core PMU driver才能放心用cpu_core/branches - Alder Lake 上可能需改用
cpu_atom/branches监控 E-core 分支行为 - 为规避兼容性问题,推荐用 raw event 编码:
perf stat -e r00c4,r00c5 -- ./prog(Intel Skylake+ 中0x00c4= BR_INST_RETIRED.ALL_BRANCHES,0x00c5= BR_MISP_RETIRED.ALL_BRANCHES)
权限和内核参数是第一个拦路虎
普通用户直接运行会卡在 Permission denied,这不是 perf 问题,而是内核对 PMU 访问的硬限制。
- 临时放行:
echo 1 | sudo tee /proc/sys/kernel/perf_event_paranoid(值 ≤1 即可,-1 更宽松但不推荐) - 不要长期用
sudo perf—— 子进程继承 perf fd 可能污染统计,且提权带来安全风险 - 该设置重启失效,如需持久化,写入
/etc/sysctl.d/99-perf.conf:kernel.perf_event_paranoid=1
C++ 实时读取要靠 mmap + perf_event_open
想在程序内部每 10ms 刷新一次命中率?不能靠反复调 perf stat,必须用系统调用直连 PMU。
- 必须开两个
perf_event_open()fd:一个 forPERF_COUNT_HW_BRANCH_INSTRUCTIONS(分母),一个 forPERF_COUNT_HW_BRANCH_MISSES(分子) - 务必启用
PERF_FORMAT_GROUP,并用 group leader fd 调read(),否则无法保证原子读取两个计数器 - mmap 映射后只读
struct perf_event_mmap_page的data_head和计数器偏移,别用read(fd, ...)——触发内核拷贝,延迟飙升 - 计数器是 uint64_t,溢出后回绕,两次读取做无符号减法:
auto delta = counter_now - counter_prev;
真正麻烦的不是怎么算,而是“什么时候算”——分支预测行为高度依赖指令序列局部性,短时间窗口(如 10ms)内采样可能剧烈抖动;长窗口(如 1s)又掩盖瞬时尖峰。实际部署时,建议先用 perf stat 跑 5–10 秒确认基线,再决定 C++ 侧采样粒度。

















