confusion_matrix默认按类别索引升序排列,需显式传入labels参数确保行列顺序与业务理解一致;seaborn.heatmap中xticklabels和yticklabels必须与labels严格匹配,归一化时需同步设置fmt和cbar_kws。

直接用 confusion_matrix + seaborn.heatmap 就能搞定,但默认输出的矩阵顺序和热力图标签容易对不上,这是最常踩的坑。
为什么 confusion_matrix 的结果看起来“反了”?
Scikit-learn 的 confusion_matrix 默认按类别索引升序排列:第 0 行是真实标签为 class 0 的样本预测分布,第 1 行是真实标签为 class 1 的……不是按你传入的 y_true 原始顺序。如果你的类别是字符串(比如 ['cat', 'dog']),它会自动映射为 0→'cat'、1→'dog',但矩阵本身不带标签。
- 必须显式传入
labels=参数才能控制行列顺序,否则可能和你的业务理解不符 - 如果没指定
labels,且y_true/y_pred中类别不连续(比如跳过 0 直接从 1 开始),矩阵维度会出错 - 二分类时,默认把正类当作 label=1,所以 TN 在左上、TP 在右下——这和多数论文图示一致,但初学者常误以为左上是 TP
怎么让热力图坐标轴显示真实类别名?
用 seaborn.heatmap 画图时,xticklabels 和 yticklabels 必须和 confusion_matrix 的 labels 严格一致,否则行列错位。
快速生成专业的 Python 脚本和应用代码。一键创建完整项目结构,支持CLI、API、爬虫、Bot、Django等多种项目类型,包含完整的项目结构、配置文件、依赖管理、测试、README和文档。
- 推荐写法:
labels = ['negative', 'positive']→cm = confusion_matrix(y_true, y_pred, labels=labels)→heatmap(cm, xticklabels=labels, yticklabels=labels) - 别用
np.unique(y_true)动态推导 labels,顺序不可控;尤其当某类在测试集里完全没出现时,unique会漏掉该行/列 - 如果类别是数字但你想显示文字(如 0→'Low', 1→'High'),先用字典映射
y_true_str,再统一转成pd.Categorical并指定categories
画图时数值格式和颜色范围怎么调才靠谱?
默认热力图用绝对频次,但模型评估更关心比例(如每个真实类里的预测占比),这时得用 normalize='true' 或 'pred',且 fmt 要同步改成 '.2f'。
立即学习“Python免费学习笔记(深入)”;
-
normalize='true':每行加起来是 1.0(召回率视角);normalize='pred':每列加起来是 1.0(精确率视角);normalize='all':全矩阵归一到 1.0 - 加
cbar_kws={'format': '.2f'}防止颜色条显示科学计数法 - 避免用
annot=True却不设fmt:整数矩阵配'.d',归一化矩阵配'.2f',否则小数点后位数混乱 - 字体大小建议设
annot_kws={'size': 10},不然小图里数字糊成一团
真正麻烦的是多分类场景下类别太多——热力图挤成一条色带,此时得考虑用 plt.figure(figsize=(8,6)) 手动调尺寸,或改用 plotly 做交互式缩放。另外,如果训练/验证集类别分布极不均衡,光看热力图容易忽略低频类,得配合 classification_report 一起看。

















