讲师中心 微信公众号
AI工具推荐 视频效率加速

如何在Spark SQL中使用HyperLogLog近似聚合海量UV?

秋静姑娘_8243

秋静姑娘_8243

发布时间:2026-09-03 12:18:17

|

1009人浏览过

|

来源于php中文网

原创

Spark SQL原生不支持HLL函数,需通过spark-hyperloglog UDAF实现;其返回Array[Byte]需用hll_get_count解包,支持merge与跨系统兼容,而approx_count_distinct不满足HLL需求。

如何在spark sql中使用hyperloglog近似聚合海量uv?

Spark SQL里没有内置HLL函数,得靠UDAF或第三方库

Spark SQL原生不支持HLL(HyperLogLog)聚合函数,COUNT(DISTINCT user_id)在十亿级UV场景下会触发大量shuffle和内存溢出。直接写SQL跑不动,必须引入近似算法能力。

主流可行路径只有两条:
– 用spark-hyperloglog(Scala/Java UDAF,需注册为临时函数)
– 或升级到Spark 3.4+,用内置的approx_count_distinct(但它是基于KMV,不是HLL,精度和内存行为不同)

如果你明确要HLL(比如需要合并多个HLL sketch、做增量union),别碰approx_count_distinct——它不支持merge,也不兼容Redis/Hive的HLL序列化格式。

用spark-hyperloglog注册UDAF时必须注意JAR加载和类型对齐

GitHub上aggregatefunction/spark-hyperloglog项目提供HLLAgg UDAF,但容易卡在类加载失败或数据类型不匹配:

  • 确保打包时把net.agilemind.hyperloglog依赖设为compile(不是provided),否则spark-submitClassNotFoundException
  • HLLAgg只接受StringLong输入;传Int会静默转成Long,但传Null会导致整个分区失败,务必提前WHERE user_id IS NOT NULL
  • 注册函数名建议用hll_agg而非hll,避免和某些旧版UDF冲突

注册示例:

spark.sql("CREATE TEMPORARY FUNCTION hll_agg AS 'com.github.aggregatefunction.hll.HLLAgg'")

HLL结果是二进制sketch,不能直接SELECT,得用getCount()解包

调用hll_agg(user_id)返回的是Array[Byte](即HLL sketch字节数组),直接SELECT只会看到乱码或空值。必须配套提供解包UDF:

  • 用同一库的HLLGetCount UDF反解:hll_get_count(hll_agg(user_id))
  • 如果要做多天UV合并(比如今天HLL + 昨天HLL),要用HLLMerge UDF,输入两个Array[Byte],输出合并后的sketch,再套一层hll_get_count
  • 注意:sketch大小固定约12KB(默认p=14),但getCount()结果是Long,别误以为还能继续聚合

典型用法:

SELECT hll_get_count(hll_agg(user_id)) AS uv FROM events WHERE dt = '2024-06-01'

精度和误差控制得看p参数,别盲目信默认值

spark-hyperloglog默认用p = 14(约12KB/sketch,标准误差0.8%),但实际误差受数据分布影响极大:

  • 当UV COUNT(DISTINCT)
  • 若业务能容忍±2%误差且UV > 1亿,可降到p = 12(1.5KB/sketch),内存减8倍,但误差升到1.6%
  • 修改p必须重编译UDF(改HLLAgg构造函数里的new HLL(p)),无法运行时传参

真正关键的不是“怎么调用HLL”,而是确认你的数据稀疏度、误差预算、下游是否需要merge——这些决定了你该不该用HLL,以及用哪个p。

热门AI工具

更多
立刻MV
立刻MV Hot

立刻MV是一款AI文本写作工具,AI 音乐视频(MV)创作工具。

UP简历
UP简历 Hot

一款AI办公效率工具,主要用于基于AI技术的免费在线简历制作工具,适合需要提升相关任务效率的用户。

Atoms
Atoms Hot

Atoms是一款AI智能体工具,第一支自动构建真实业务的 AI 团队。

豆包大模型

豆包大模型是一款由字节跳动推出的企业级大语言模型服务平台。

WorkBuddy

一款AI办公效率工具,主要用于腾讯云推出的AI原生桌面智能体工作台,适合需要提升相关任务效率的用户。

DeepSeek

DeepSeek是一款面向对话、写作、编程和推理场景的AI大模型工具。

火山引擎

火山引擎是一款面向企业的云计算与AI服务平台。

Laper
Laper Hot

Laper是专为编剧、导演和制片人推出的 AI 原生剧本创作工具。

超级简历WonderCV

一款AI办公效率工具,主要用于免费求职简历模版下载制作,应届生职场人必备简历制作神器,适合需要提升相关任务效率的用户。

相关专题

更多
大数据分析工具有哪四个
大数据分析工具有哪四个

大数据分析的四个工具分别是rapidminer、Hpcc、Hadoop和Pentaho bi。大数据分析用于从各种来源生成的原始数据中提取有价值的数据。这些数据帮助我们获得有意义的见解、隐藏的模式、未知的相关性、市场趋势等等,具体取决于行业。大数据分析的主要动机是提供有价值的见解,以便为未来做出更好的决策。php中文网为大家带来了大数据分析的相关教程、以及相关文章等内容,供大家免费下载使用。

3956

2023.06.21

Java 大数据处理基础(Hadoop 方向)
Java 大数据处理基础(Hadoop 方向)

本专题聚焦 Java 在大数据离线处理场景中的核心应用,系统讲解 Hadoop 生态的基本原理、HDFS 文件系统操作、MapReduce 编程模型、作业优化策略以及常见数据处理流程。通过实际示例(如日志分析、批处理任务),帮助学习者掌握使用 Java 构建高效大数据处理程序的完整方法。

1189

2025.12.08

大数据专业学习教程
大数据专业学习教程

本专题整合了大数据专业学习相关教程,阅读专题下面的文章了解更多详细内容。

203

2026.01.05

python处理大数据合集
python处理大数据合集

本专题整合了python处理大数据相关教程,阅读专题下面的文章了解更多详细内容。

426

2026.01.05

数据分析工具有哪些
数据分析工具有哪些

数据分析工具有Excel、SQL、Python、R、Tableau、Power BI、SAS、SPSS和MATLAB等。详细介绍:1、Excel,具有强大的计算和数据处理功能;2、SQL,可以进行数据查询、过滤、排序、聚合等操作;3、Python,拥有丰富的数据分析库;4、R,拥有丰富的统计分析库和图形库;5、Tableau,提供了直观易用的用户界面等等。

3703

2023.10.12

SQL中distinct的用法
SQL中distinct的用法

SQL中distinct的语法是“SELECT DISTINCT column1, column2,...,FROM table_name;”。本专题为大家提供相关的文章、下载、课程内容,供大家免费下载体验。

771

2023.10.27

SQL中months_between使用方法
SQL中months_between使用方法

在SQL中,MONTHS_BETWEEN 是一个常见的函数,用于计算两个日期之间的月份差。想了解更多SQL的相关内容,可以阅读本专题下面的文章。

949

2024.02.23

SQL出现5120错误解决方法
SQL出现5120错误解决方法

SQL Server错误5120是由于没有足够的权限来访问或操作指定的数据库或文件引起的。想了解更多sql错误的相关内容,可以阅读本专题下面的文章。

5461

2024.03.06

Vibeknow在线使用入口合集
Vibeknow在线使用入口合集

本专题汇总了Vibeknow在线创作视频的官方入口及网页版使用教程,涵盖PPT、PDF、Word等文档一键转讲解视频的核心操作,并整理了免费版水印规则与手机端浏览器访问指南,助你快速将知识内容视频化。

0

2026.09.21

热门下载

更多
网站特效
/
网站源码
/
网站素材
/
前端模板

精品课程

更多
相关推荐
/
热门推荐
/
最新课程
SQL快速入门课程
SQL快速入门课程

共7课时 | 1.2万人学习

SQL优化与排查(MySQL版)
SQL优化与排查(MySQL版)

共26课时 | 3.1万人学习

关于我们 免责申明 举报中心 意见反馈 讲师合作 广告合作 最新更新
php中文网:公益在线php培训,帮助PHP学习者快速成长!
关注服务号
PHP中文网订阅号
每天精选资源文章推送

Copyright 2014-2026 https://www.php.cn/ All Rights Reserved | php.cn