Linux无法直接获取进程在每核的CPU时间,需通过高频采样线程stat、affinity掩码及perf工具推断;perf可生成按核区分的火焰图,C++中推荐libpfm4而非解析/proc。

Linux下用/proc/[pid]/stat只能拿到总CPU时间,没法拆到每核
直接读/proc/self/stat里的utime和stime加起来是进程在所有核上累计的jiffies,完全不反映分布。想画每核占用图,得换思路——Linux内核本身不提供“这个进程在core 3跑了多久”这种粒度的数据,必须靠采样+推断。
常见误区是以为sched_getcpu()或pthread_getaffinity_np()能给出历史负载,其实它们只返回当前瞬时状态,对统计毫无帮助。
- 真正可用的是
/proc/[pid]/task/[tid]/stat里每个线程的utime/stime,再结合/proc/[pid]/status里的Cpus_allowed_list判断线程被调度到哪些核上 - 但注意:线程可能跨核迁移,单次读取只能反映快照,必须高频采样(比如100ms间隔)才能拟合趋势
- 如果进程用了
pthread_setaffinity_np()绑核,那线程的Cpus_allowed_list就固定了,统计才可靠;否则得依赖taskset -p [pid]查默认掩码,再配合perf sched record做精确追踪(代价高)
用perf命令行快速生成每核火焰图
不用写C++代码也能拿到带核信息的详细统计——perf内建支持按CPU采样。执行:
perf record -e cycles:u -C 0,1,2,3 -p $(pidof your_program) -- sleep 5
其中-C 0,1,2,3指定监控前4个逻辑核,cycles:u只抓用户态周期(避免内核干扰),-- sleep 5控制采集时长。结束后:
立即学习“C++免费学习笔记(深入)”;
perf script | awk '{print $1,$3,$4}' | sort | uniq -c | sort -nr能粗略看出各线程在不同CPU上的样本数。更直观的是生成火焰图:
- 先
perf script > perf.out - 用
FlameGraph工具链:./stackcollapse-perf.pl perf.out | ./flamegraph.pl --cpus 4 > cpu_flame.svg - 输出SVG里每个栈帧宽度代表该函数在对应CPU上被采样的次数,颜色区分CPU编号
C++里调用libpfm4做实时每核性能计数
如果必须嵌入到C++程序里实时获取,libpfm4比自己解析/proc靠谱得多。它封装了perf_event_open()系统调用,支持按CPU绑定计数器:
struct perf_event_attr attr = {};
attr.type = PERF_TYPE_HARDWARE;
attr.config = PERF_COUNT_HW_CPU_CYCLES;
attr.disabled = 1;
attr.exclude_kernel = 1;
attr.exclude_hv = 1;
attr.pinned = 1;
attr.wakeup_events = 1;
<p>int fd = perf_event_open(&attr, 0, cpu_id, -1, 0); // cpu_id=0,1,2...
if (fd != -1) {
ioctl(fd, PERF_EVENT_IOC_RESET, 0);
ioctl(fd, PERF_EVENT_IOC_ENABLE, 0);
// ...采集后read(fd, &count, sizeof(count))
}关键点:
- 必须为每个目标CPU单独打开一个
perf_event_open()fd,不能复用 -
attr.pinned = 1确保计数器绑定到指定CPU,否则可能被调度器迁移走 - 用户态程序需有
CAP_SYS_ADMIN能力,或echo 1 > /proc/sys/kernel/perf_event_paranoid(开发机可设,生产环境慎用)
别指望std::this_thread::get_id()能帮你关联CPU
线程ID和CPU核心号之间没有映射关系。std::this_thread::get_id()返回的是C++运行时分配的抽象ID,syscall(SYS_gettid)返回内核线程ID(TID),而CPU核心号是调度器动态决定的。三者完全独立。
常见错误写法:
// ❌ 这段代码毫无意义
auto tid = syscall(SYS_gettid);
int cpu = sched_getcpu(); // 只返回当前时刻所在核,不是历史占用
printf("TID %d on CPU %d\n", tid, cpu); // 下一微秒就可能迁到别的核真要关联线程与核占用,唯一可靠路径是:
- 用
pthread_getaffinity_np()查线程允许运行的CPU掩码 - 用
/proc/[pid]/task/[tid]/stat持续读utime并记录时间戳 - 结合
/sys/devices/system/cpu/cpu*/topology/core_id确认物理核编号(避免超线程混淆)
实际工程中,超过80%的需求用perf采样就够了;非要C++内嵌,优先考虑libpfm4而非手撕/proc解析——后者在容器、cgroup环境下极易失效。


















