讲师中心 微信公众号
AI工具推荐 视频效率加速

怎么在SQL中利用聚合函数实现留存率漏斗模型统计

小芳同学_8488

小芳同学_8488

发布时间:2026-09-21 08:42:48

|

214人浏览过

|

来源于php中文网

原创

SQL多日留存核心是锁定新用户基准池后用COUNT(DISTINCT)+CASE WHEN偏移判断,分母必须为同日新用户数;ClickHouse宜用retention函数或uniqCombined替代JOIN;漏斗分母始终为首日新用户数,时间窗口需严格对齐。

怎么在sql中利用聚合函数实现留存率漏斗模型统计

用 COUNT(DISTINCT) + CASE WHEN 算多日留存

直接在 GROUP BY 日期后,对每个用户首次登录日(first_date)做偏移判断,是 SQL 实现留存漏斗最通用、兼容性最强的方式。关键不是“漏斗有多层”,而是“每层是否来自同一新用户池”。

常见错误是把不同日期的活跃用户混在一起算,比如用 COUNT(DISTINCT user_id) 统计某天所有登录用户,再除以当天注册用户——这算的是“活跃渗透率”,不是留存率。

  • 必须先用子查询或 CTE 提取每个用户的 first_date,锁定新用户基准池
  • 再用 LEFT JOINJOIN 关联后续行为表,确保只统计该池中人在第1/3/7天是否出现
  • CASE WHEN date_diff(login_date, first_date) = 1 THEN user_id END 包裹后再 COUNT(DISTINCT ...),避免 NULL 干扰计数
  • 别忘了把分母也限定为同一天的 COUNT(DISTINCT user_id),否则分母会随 JOIN 膨胀

GROUP BY first_date 后不能直接套用 LEAD() 做滚动留存

LEAD() 是窗口函数,适合分析单个用户的连续行为路径(比如“注册后第2天是否登录”),但它无法天然支持“以天为粒度聚合留存率”。如果强行在 GROUP BY first_date 后用 LEAD(),会出现窗口定义错位:每个分组里只剩一个用户 ID,LEAD() 失去意义。

真正需要滚动留存(如“注册后第1/2/3天都活跃的用户占比”)时,得换思路:

  • MIN(login_date) 定义首次活跃日
  • MAX(login_date)MIN(login_date) 差值判断连续活跃天数
  • 或者用 arrayJoin(range(1, 8))(ClickHouse)或递归 CTE(PostgreSQL)生成偏移序列再 JOIN

ClickHouse 里别硬写多表 JOIN 做留存漏斗

在 ClickHouse 中,对十几亿行行为日志做 JOIN + GROUP BY + COUNT(DISTINCT),很容易 OOM 或超时。这不是语法问题,是引擎设计使然——它不擅长高基数去重关联。

更可行的路径是预计算或换函数:

  • 优先用 retention(v1, v2, v3):传入布尔表达式,例如 retention(toDate(first_date) = '2025-01-01', toDate(login_date) = '2025-01-02', toDate(login_date) = '2025-01-04'),返回数组 [1,1,0] 表示该用户在第1/3天有行为
  • uniqCombined(user_id) 替代 COUNT(DISTINCT user_id),内存更友好
  • 如果要复用结果,提前按 first_datelogin_date - first_date 分区建物化视图

漏斗各环节的分母必须一致且不可替换

很多人误以为“浏览 → 收藏 → 加购 → 下单”这个漏斗,每一层的分母都可以是上一层的分子。但在留存+漏斗混合场景下(比如“新用户7日内完成加购的占比”),分母永远是第一天的新用户数,不是第7天还活跃的人数。

容易被忽略的一点是:时间窗口和行为定义必须对齐。例如“7日留存”指注册后第7天当天登录,不是7天内任意一天登录;而“7日内加购”才是只要在7天区间内发生过即可。这两个指标底层逻辑不同,不能共用同一段 CASE WHEN 判断。

热门AI工具

更多
Laper
Laper Hot

Laper是专为编剧、导演和制片人推出的 AI 原生剧本创作工具。

Atoms
Atoms Hot

Atoms是一款AI智能体工具,第一支自动构建真实业务的 AI 团队。

LibLibAI
LibLibAI Hot

一款AI视频创作工具,主要用于国内领先的AI创意平台,以海量模型、低门槛操作与“创作-分享-商业化”生态,让小白与专业创作者都能高效实现图文乃至视频创意表达,适合需要提升相关任务效率的用户。

Loomy
Loomy Hot

一款AI工具,主要用于科大讯飞发布的桌面级 AI 助理,比 OpenClaw 更易用、更安全!,适合需要提升相关任务效率的用户。

豆包大模型

豆包大模型是一款由字节跳动推出的企业级大语言模型服务平台。

WorkBuddy

一款AI办公效率工具,主要用于腾讯云推出的AI原生桌面智能体工作台,适合需要提升相关任务效率的用户。

切问学术

切问学术是一款AI论文写作工具,复旦大学NLP团队推出的AI学术智能体。

AionClaw
AionClaw Hot

AionClaw是一款面向办公、创作和编程任务的AI桌面智能体。

DeepSeek

DeepSeek是一款面向对话、写作、编程和推理场景的AI大模型工具。

相关专题

更多
大数据分析工具有哪四个
大数据分析工具有哪四个

大数据分析的四个工具分别是rapidminer、Hpcc、Hadoop和Pentaho bi。大数据分析用于从各种来源生成的原始数据中提取有价值的数据。这些数据帮助我们获得有意义的见解、隐藏的模式、未知的相关性、市场趋势等等,具体取决于行业。大数据分析的主要动机是提供有价值的见解,以便为未来做出更好的决策。php中文网为大家带来了大数据分析的相关教程、以及相关文章等内容,供大家免费下载使用。

3936

2023.06.21

Java 大数据处理基础(Hadoop 方向)
Java 大数据处理基础(Hadoop 方向)

本专题聚焦 Java 在大数据离线处理场景中的核心应用,系统讲解 Hadoop 生态的基本原理、HDFS 文件系统操作、MapReduce 编程模型、作业优化策略以及常见数据处理流程。通过实际示例(如日志分析、批处理任务),帮助学习者掌握使用 Java 构建高效大数据处理程序的完整方法。

1189

2025.12.08

大数据专业学习教程
大数据专业学习教程

本专题整合了大数据专业学习相关教程,阅读专题下面的文章了解更多详细内容。

203

2026.01.05

python处理大数据合集
python处理大数据合集

本专题整合了python处理大数据相关教程,阅读专题下面的文章了解更多详细内容。

426

2026.01.05

数据分析工具有哪些
数据分析工具有哪些

数据分析工具有Excel、SQL、Python、R、Tableau、Power BI、SAS、SPSS和MATLAB等。详细介绍:1、Excel,具有强大的计算和数据处理功能;2、SQL,可以进行数据查询、过滤、排序、聚合等操作;3、Python,拥有丰富的数据分析库;4、R,拥有丰富的统计分析库和图形库;5、Tableau,提供了直观易用的用户界面等等。

3683

2023.10.12

SQL中distinct的用法
SQL中distinct的用法

SQL中distinct的语法是“SELECT DISTINCT column1, column2,...,FROM table_name;”。本专题为大家提供相关的文章、下载、课程内容,供大家免费下载体验。

771

2023.10.27

SQL中months_between使用方法
SQL中months_between使用方法

在SQL中,MONTHS_BETWEEN 是一个常见的函数,用于计算两个日期之间的月份差。想了解更多SQL的相关内容,可以阅读本专题下面的文章。

949

2024.02.23

SQL出现5120错误解决方法
SQL出现5120错误解决方法

SQL Server错误5120是由于没有足够的权限来访问或操作指定的数据库或文件引起的。想了解更多sql错误的相关内容,可以阅读本专题下面的文章。

5441

2024.03.06

Vibeknow在线使用入口合集
Vibeknow在线使用入口合集

本专题汇总了Vibeknow在线创作视频的官方入口及网页版使用教程,涵盖PPT、PDF、Word等文档一键转讲解视频的核心操作,并整理了免费版水印规则与手机端浏览器访问指南,助你快速将知识内容视频化。

0

2026.09.21

热门下载

更多
网站特效
/
网站源码
/
网站素材
/
前端模板

精品课程

更多
相关推荐
/
热门推荐
/
最新课程
关于我们 免责申明 举报中心 意见反馈 讲师合作 广告合作 最新更新
php中文网:公益在线php培训,帮助PHP学习者快速成长!
关注服务号
PHP中文网订阅号
每天精选资源文章推送

Copyright 2014-2026 https://www.php.cn/ All Rights Reserved | php.cn