KMeans直接聚类原始RFM值不可行,因量纲差异导致M主导距离;需先过滤有效订单(如status='completed')、正确计算Recency、标准化用StandardScaler并保持参数一致性、调整R方向使高价值与聚类逻辑一致;肘部法则失效时应优先看轮廓系数,小簇需合并,聚类结果须结合业务映射具体运营动作。

直接用 KMeans 对原始 RFM 值聚类,结果基本不可用——量纲差异太大,R 是天数(常为个位到三位),F 是次数(多为 1–50),M 是金额(常为百到万级),不标准化就聚类,M 会完全主导距离计算。
RFM 指标计算必须过滤无效订单
电商订单表里混着“已取消”“已退款”“待支付”等状态,直接按 user_id 统计会高估 F 和 M。实操中必须先筛选出真实贡献订单:
- 只保留
order_status == 'completed'或'paid'等业务确认完成的状态(具体字段名依数据源而定,如actual_payment > 0更稳妥) -
Recency计算要用max(order_date),但必须确保该日期来自有效订单;否则一个用户有 100 笔取消单 + 1 笔完成单,max()仍可能取到取消单时间 - 常见坑:用
pd.to_datetime()解析order_date时遇到空值或格式混乱(如'2023/01/01'与'2023-01-01 14:30:00'并存),建议加errors='coerce'并检查isna()后再参与计算
标准化必须用 StandardScaler,不能手写 (x - mean) / std
看似等价,但 StandardScaler 的 fit_transform 会保存训练集的 mean_ 和 scale_,后续新增用户做预测时才能复用同一套参数。手写公式容易在上线后漏掉这个一致性保障:
scaler = StandardScaler() rfm_scaled = scaler.fit_transform(rfm_df[['recency', 'frequency', 'monetary']]) # 后续新用户进来: new_user_scaled = scaler.transform(new_user_rfm.reshape(1, -1))
另外注意:recency 越小价值越高,但聚类默认按数值大小算距离,会导致“R 小”和“R 大”的点被强行拉近。解决方法不是反转 R,而是用 1 / (recency + 1) 或直接对 R 取负(-recency),让高价值方向与聚类逻辑一致。
立即学习“Python免费学习笔记(深入)”;
肘部法则失效时,优先看轮廓系数而非 K=3
业务上总想分“高/中/低”三档,但数据未必支持。实际中常见:
-
silhouette_score在 K=2 时最高(0.42),K=3 反而降到 0.31 ——说明用户天然更倾向分成两极:活跃付费者 vs 沉默长尾 - 肘部图拐点模糊,K=4 和 K=5 的 SSE 下降幅度接近 ——此时应结合业务场景选 K=4(比如拆出“高 R+低 F”这类流失预警群)
- 聚类后某簇样本量<总用户 1%,基本无运营意义,需合并或重新审视指标定义(例如是否把试用账号、测试订单混入了)
真正难的是把聚类结果映射回业务动作:同一簇里 R 相近但 M 差 10 倍的用户,运营策略可能完全不同;而跨簇但 F 和 M 都高的用户,也许该统一进 VIP 通道——模型输出只是起点,不是终点。


















