讲师中心 微信公众号
AI工具推荐 视频效率加速

提取客户首次与末次非直连渠道(跳过“Direct”)的完整教程

星墨姑娘_2741

星墨姑娘_2741

发布时间:2026-05-08 13:52:46

|

740人浏览过

|

来源于php中文网

原创

提取客户首次与末次非直连渠道(跳过“Direct”)的完整教程

本文介绍如何在Pandas中为每位客户准确提取其访问记录中首个和最后一个非“Direct”渠道(若全为“Direct”则回退取“Direct”),并按时间顺序正确处理,适用于归因分析与用户路径建模。

本文介绍如何在pandas中为每位客户准确提取其访问记录中首个和最后一个**非“direct”渠道**(若全为“direct”则回退取“direct”),并按时间顺序正确处理,适用于归因分析与用户路径建模。

在用户行为分析中,识别客户“首次接触渠道”(First Touch)和“最终转化前渠道”(Last Non-Direct Touch)至关重要——但需排除干扰性的“Direct”访问(如手动输入网址、书签访问等),除非所有记录均为 Direct。本教程提供一种高效、可复用的 Pandas 实现方案,无需显式 for 循环,完全基于向量化操作与分组聚合,兼顾性能与逻辑严谨性。

✅ 核心步骤解析

  1. 日期标准化与排序:确保时间顺序正确是前提。将 Date 列转为 datetime 类型,并按时间升序排列(sort_values(by="Date")),否则 first()/last() 将失去业务意义。

  2. 智能过滤逻辑设计:

    • 若某客户所有渠道均为 "Direct" → 保留全部记录(用于 fallback);
    • 否则 → 仅保留 "Channel" != "Direct" 的记录(跳过所有 Direct)。
      这一逻辑通过 groupby().transform() 配合布尔条件实现,避免逐行循环,高效且可读。
  3. 分组聚合与结果合并:
    对筛选后的数据按 Customer ID 分组,分别调用 .first()(取最早非-Direct 记录的 Channel)和 .last()(取最晚非-Direct 记录的 Channel),再通过 pd.merge() 关联输出。

? 完整可运行代码

import pandas as pd

# 示例数据(请替换为您的实际 DataFrame)
df = pd.DataFrame({
    "Customer ID": [1, 1, 1, 2, 2, 2, 3, 3, 3, 3],
    "Date": ["1/1/24", "1/2/24", "1/3/24", "1/5/24", "1/6/24", "1/7/24", "1/8/24", "1/9/24", "1/10/24", "1/11/24"],
    "Channel": ["Email", "Search", "Direct", "Direct", "Paid", "Email", "Direct", "Direct", "Direct", "Direct"]
})

# 步骤 1:日期转换与排序(关键!)
df["Date"] = pd.to_datetime(df["Date"], format="%m/%d/%y")
df = df.sort_values(by=["Customer ID", "Date"]).reset_index(drop=True)

# 步骤 2:构建分组级布尔掩码
# condition_i: 每个客户是否「全部为 Direct」
condition_i = df.groupby("Customer ID")["Channel"].transform(lambda x: (x == "Direct").all())

# condition_ii: 每个客户存在非 Direct 记录时,标记其非 Direct 行(注意:此处需重写以确保逻辑正确)
mask_non_direct = df["Channel"] != "Direct"
condition_ii = df.groupby("Customer ID")[mask_non_direct].transform("any") & mask_non_direct

# 步骤 3:统一筛选(满足「全 Direct」或「非 Direct 行」)
filtered = df[condition_i | condition_ii]

# 步骤 4:分组聚合
first_df = (filtered
            .groupby("Customer ID", as_index=False)
            .first()
            .rename(columns={"Channel": "First Channel"}))

last_df = (filtered
           .groupby("Customer ID", as_index=False)
           .last()
           .rename(columns={"Channel": "Last Channel"}))

# 步骤 5:合并结果
result = pd.merge(first_df[["Customer ID", "First Channel"]], 
                  last_df[["Customer ID", "Last Channel"]], 
                  on="Customer ID", how="inner")

print(result)

✅ 输出:

   Customer ID First Channel Last Channel
0            1         Email       Search
1            2          Paid        Email
2            3        Direct       Direct

⚠️ 注意事项与最佳实践

  • 日期格式务必匹配:示例中使用 format="%m/%d/%y",若您的日期为 "YYYY-MM-DD" 或 "DD/MM/YYYY",请同步调整 pd.to_datetime() 的 format 参数,或省略 format 让 Pandas 自动推断(但自动推断可能出错,建议显式指定)。
  • 空值处理:若 Channel 列含 NaN,需提前用 df.dropna(subset=["Channel"]) 或 df["Channel"].fillna("Unknown") 处理,避免影响 == "Direct" 判断。
  • 性能优化:对百万级数据,transform + 布尔索引比 apply + 自定义函数快 5–10 倍;如需进一步加速,可考虑 polars 替代方案。
  • 扩展性提示:该逻辑可轻松泛化至其他排除渠道(如 "Internal"、"Referral"),只需修改字符串比较条件即可。

掌握此方法,您不仅能精准提取首末有效触点,更建立起一套可复用于多场景的渠道归因预处理范式——让数据真正驱动增长决策。

本站声明:本文内容由网友自发贡献,版权归原作者所有,本站不承担相应法律责任。如您发现有涉嫌抄袭侵权的内容,请联系admin@php.cn

热门AI工具

更多
Loomy
Loomy Hot

一款AI工具,主要用于科大讯飞发布的桌面级 AI 助理,比 OpenClaw 更易用、更安全!,适合需要提升相关任务效率的用户。

WorkBuddy

一款AI办公效率工具,主要用于腾讯云推出的AI原生桌面智能体工作台,适合需要提升相关任务效率的用户。

音述AI
音述AI Hot

一款AI音频处理工具,主要用于音述AI是一个以“用声音述说故事”为核心的 AI 音乐创作与声音分享社区,适合需要提升相关任务效率的用户。

AionClaw
AionClaw Hot

AionClaw是一款面向办公、创作和编程任务的AI桌面智能体。

超级简历WonderCV

一款AI办公效率工具,主要用于免费求职简历模版下载制作,应届生职场人必备简历制作神器,适合需要提升相关任务效率的用户。

豆包大模型

豆包大模型是一款由字节跳动推出的企业级大语言模型服务平台。

SkildArt
SkildArt Hot

SkildArt是一款AI文本写作工具,一站式 AI 视觉创作平台。

VibeKnow
VibeKnow Hot

一款AI视频创作工具,主要用于全球首个AI知识视频创作平台,文档、文章、网页,一键生成视频,适合需要提升相关任务效率的用户。

DeepSeek

DeepSeek是一款面向对话、写作、编程和推理场景的AI大模型工具。

相关专题

更多
python打包成可执行文件
python打包成可执行文件

本专题为大家带来python打包成可执行文件相关的文章,大家可以免费的下载体验。

1671

2023.07.20

python能做什么
python能做什么

python能做的有:可用于开发基于控制台的应用程序、多媒体部分开发、用于开发基于Web的应用程序、使用python处理数据、系统编程等等。本专题为大家提供python相关的各种文章、以及下载和课程。

4144

2023.07.25

format在python中的用法
format在python中的用法

Python中的format是一种字符串格式化方法,用于将变量或值插入到字符串中的占位符位置。通过format方法,我们可以动态地构建字符串,使其包含不同值。php中文网给大家带来了相关的教程以及文章,欢迎大家前来阅读学习。

1669

2023.07.31

python教程
python教程

Python已成为一门网红语言,即使是在非编程开发者当中,也掀起了一股学习的热潮。本专题为大家带来python教程的相关文章,大家可以免费体验学习。

23977

2023.08.03

python环境变量的配置
python环境变量的配置

Python是一种流行的编程语言,被广泛用于软件开发、数据分析和科学计算等领域。在安装Python之后,我们需要配置环境变量,以便在任何位置都能够访问Python的可执行文件。php中文网给大家带来了相关的教程以及文章,欢迎大家前来学习阅读。

2927

2023.08.04

python eval
python eval

eval函数是Python中一个非常强大的函数,它可以将字符串作为Python代码进行执行,实现动态编程的效果。然而,由于其潜在的安全风险和性能问题,需要谨慎使用。php中文网给大家带来了相关的教程以及文章,欢迎大家前来学习阅读。

2967

2023.08.04

scratch和python区别
scratch和python区别

scratch和python的区别:1、scratch是一种专为初学者设计的图形化编程语言,python是一种文本编程语言;2、scratch使用的是基于积木的编程语法,python采用更加传统的文本编程语法等等。本专题为大家提供scratch和python相关的文章、下载、课程内容,供大家免费下载体验。

1143

2023.08.11

python合并两个列表
python合并两个列表

Python是一种强大的编程语言,具有许多方便的功能和工具。在Python中,有多种方法可以合并两个列表。php中文网给大家带来了相关的教程以及文章,欢迎大家前来学习阅读。

596

2023.08.10

LLVM自定义Pass怎么写
LLVM自定义Pass怎么写

本专题聚焦LLVM自定义Pass开发,整理Pass类结构、run()方法、PreservedAnalyses、CMake构建、插件注册、-load-pass-plugin加载和测试用例编写流程。

80

2026.09.30

热门下载

更多
网站特效
/
网站源码
/
网站素材
/
前端模板

精品课程

更多
热门推荐
/
最新课程
关于我们 免责申明 举报中心 意见反馈 讲师合作 广告合作 最新更新
php中文网:公益在线php培训,帮助PHP学习者快速成长!
关注服务号
PHP中文网订阅号
每天精选资源文章推送

Copyright 2014-2026 https://www.php.cn/ All Rights Reserved | php.cn