讲师中心 微信公众号
AI工具推荐 视频效率加速

如何使用Python评估推荐系统模型的Recall与NDCG指标?

千芳大大_8824

千芳大大_8824

发布时间:2026-09-10 10:35:27

|

925人浏览过

|

来源于php中文网

原创

Recall@K 应手动实现:对每个用户,用真实物品集与模型top-K推荐列表求交集大小除以真实正样本数;sklearn的recall_score因不考虑排序而错误。

如何使用python评估推荐系统模型的recall与ndcg指标?

Recall@K 在 Python 中怎么算才对?

Recall@K 衡量的是:用户真实喜欢的物品中,有多少落在了模型推荐的前 K 个结果里。关键不是“推荐对了多少”,而是“漏掉了多少真实正样本”。

常见错误是直接用 sklearn.metrics.recall_score —— 它默认按二分类标签计算,不考虑排序和截断,结果完全不对。

正确做法是手动实现:

  • 对每个用户,拿到其真实交互物品集合(如测试集中的 user_items)
  • 拿到模型输出的 top-K 推荐列表(topk_items,按预测分数降序)
  • 计算交集大小除以该用户真实正样本总数
def recall_at_k(y_true_set, y_pred_topk):
    if len(y_true_set) == 0:
        return 0.0
    hits = len(set(y_pred_topk) & y_true_set)
    return hits / len(y_true_set)
<h1>示例:用户真实有 {1,3,5,7},推荐 [3,8,1,9,2](K=5)</h1><p>recall_at_k({1,3,5,7}, [3,8,1,9,2])  # 返回 2/4 = 0.5</p><p><span>立即学习</span>“<a href="https://pan.quark.cn/s/00968c3c2c15" style="text-decoration: underline !important; color: blue; font-weight: bolder;" rel="nofollow" target="_blank">Python免费学习笔记(深入)</a>”;</p>

注意:如果用户在测试集中没任何正样本(冷启动用户),跳过或返回 0,别让分母为 0。

NDCG@K 必须带 ranking score 才有意义

NDCG@K 不只看“是否命中”,还惩罚位置靠后的相关项。ndcg_score(来自 sklearn.metrics)要求你提供每个候选 item 的“相关性得分”,不能只给 0/1 标签。

Python Packaging
Python Packaging

深度Python打包工作流——pyproject元数据、依赖与可选额外项、构建后端、wheel、版本控制、发布及CI发布规范……

下载

典型误区:把 top-K 推荐列表直接喂给 ndcg_score(y_true=[1,0,0,1,0], y_score=[0.9,0.8,0.7,0.6,0.5]) —— 这里 y_true 必须是对所有候选 item 的相关性标注(比如测试集全量 item),而不仅是 top-K。

更实用的做法是自己实现,只处理 top-K:

  • 构建长度为 K 的 relevance 列表:命中真实 item 就标 1,否则 0
  • 计算 DCG:sum( rel[i] / log2(i+2) ),i 从 0 开始
  • 计算 IDCG:把 relevance 排序成降序再算一次 DCG
  • NDCG = DCG / (IDCG or 1e-8)
import numpy as np
def ndcg_at_k(relevance_list, k):
    dcg = sum((2 ** r - 1) / np.log2(i + 2) for i, r in enumerate(relevance_list[:k]))
    idcg = sum((2 ** r - 1) / np.log2(i + 2) for i, r in enumerate(sorted(relevance_list, reverse=True)[:k]))
    return dcg / (idcg or 1e-8)

用 1/0 相关性时,(2 ** r - 1) 等价于 r,可简化;但若后续支持多级相关性(如 0/1/2/3),这个形式能直接复用。

LightFM、Implicit、Surprise 这些库怎么取 top-K?

不同训练框架输出格式差异大,容易卡在“怎么拿到推荐列表”这步:

  • LightFM:用 model.predict(user_id, item_ids, user_features=..., item_features=...) 手动打分,再 np.argsort(...)[::-1][:K]
  • Implicit:调 model.recommend(userid, user_items, N=K),注意 user_items 是 CSR 矩阵中该用户的行(即训练时交互过的 items),否则推荐结果含训练数据
  • Surprise:没有内置 top-K 接口,得遍历所有 item 调 algo.predict(uid, iid).est,再排序——线上不可行,仅用于离线评估

统一建议:

  • 测试时,对每个用户,只在未训练过的 item 上预测(即 train-test split 后的 test set candidate)
  • 避免用 model.get_all_ratings() 类接口(不存在),别幻想一键导出全量排序

为什么 batch 评估时 Recall 和 NDCG 结果忽高忽低?

这不是随机性问题,大概率是以下三个原因:

  • 用户级指标未加权平均:有的用户有 100 个测试正样本,有的只有 1 个,直接对所有用户 recall_at_k 取算术平均,会偏向小样本用户。应按真实正样本数加权
  • NDCG 分母 IDCG 为 0:当用户真实正样本数 < K,且 relevance_list 全为 0(即一个都没命中),IDCG=0,NDCG 未定义。需显式跳过或设为 0
  • 推荐列表去重没做:模型可能对同一 item 输出多个近似分数,argsort 后取 top-K 包含重复 item ID,导致分母虚高。务必在取索引后用 np.unique(..., return_index=True) 或 Python dict.fromkeys() 去重

最常被忽略的一点:评估必须严格隔离训练/测试 item。哪怕只混入一个训练 item 到测试推荐池,Recall 就会虚高 5%~20%,尤其在稀疏数据上。

热门AI工具

更多
超级简历WonderCV

一款AI办公效率工具,主要用于免费求职简历模版下载制作,应届生职场人必备简历制作神器,适合需要提升相关任务效率的用户。

AionClaw
AionClaw Hot

AionClaw是一款面向办公、创作和编程任务的AI桌面智能体。

讯飞智作

讯飞智作是一款AI视频创作工具,AI文本配音工具,数字人课程、营销视频制作。

立刻MV
立刻MV Hot

立刻MV是一款AI文本写作工具,AI 音乐视频(MV)创作工具。

DeepSeek

DeepSeek是一款面向对话、写作、编程和推理场景的AI大模型工具。

LibLibAI
LibLibAI Hot

一款AI视频创作工具,主要用于国内领先的AI创意平台,以海量模型、低门槛操作与“创作-分享-商业化”生态,让小白与专业创作者都能高效实现图文乃至视频创意表达,适合需要提升相关任务效率的用户。

豆包大模型

豆包大模型是一款由字节跳动推出的企业级大语言模型服务平台。

墨刀AI
墨刀AI Hot

一款AI图像与设计工具,主要用于产品经理的专属智能体,适合需要提升相关任务效率的用户。

WorkBuddy

一款AI办公效率工具,主要用于腾讯云推出的AI原生桌面智能体工作台,适合需要提升相关任务效率的用户。

相关专题

更多
python打包成可执行文件
python打包成可执行文件

本专题为大家带来python打包成可执行文件相关的文章,大家可以免费的下载体验。

1611

2023.07.20

python能做什么
python能做什么

python能做的有:可用于开发基于控制台的应用程序、多媒体部分开发、用于开发基于Web的应用程序、使用python处理数据、系统编程等等。本专题为大家提供python相关的各种文章、以及下载和课程。

3844

2023.07.25

format在python中的用法
format在python中的用法

Python中的format是一种字符串格式化方法,用于将变量或值插入到字符串中的占位符位置。通过format方法,我们可以动态地构建字符串,使其包含不同值。php中文网给大家带来了相关的教程以及文章,欢迎大家前来阅读学习。

1609

2023.07.31

python教程
python教程

Python已成为一门网红语言,即使是在非编程开发者当中,也掀起了一股学习的热潮。本专题为大家带来python教程的相关文章,大家可以免费体验学习。

22157

2023.08.03

python环境变量的配置
python环境变量的配置

Python是一种流行的编程语言,被广泛用于软件开发、数据分析和科学计算等领域。在安装Python之后,我们需要配置环境变量,以便在任何位置都能够访问Python的可执行文件。php中文网给大家带来了相关的教程以及文章,欢迎大家前来学习阅读。

2727

2023.08.04

python eval
python eval

eval函数是Python中一个非常强大的函数,它可以将字符串作为Python代码进行执行,实现动态编程的效果。然而,由于其潜在的安全风险和性能问题,需要谨慎使用。php中文网给大家带来了相关的教程以及文章,欢迎大家前来学习阅读。

2767

2023.08.04

scratch和python区别
scratch和python区别

scratch和python的区别:1、scratch是一种专为初学者设计的图形化编程语言,python是一种文本编程语言;2、scratch使用的是基于积木的编程语法,python采用更加传统的文本编程语法等等。本专题为大家提供scratch和python相关的文章、下载、课程内容,供大家免费下载体验。

1103

2023.08.11

python合并两个列表
python合并两个列表

Python是一种强大的编程语言,具有许多方便的功能和工具。在Python中,有多种方法可以合并两个列表。php中文网给大家带来了相关的教程以及文章,欢迎大家前来学习阅读。

596

2023.08.10

Buffalo框架数据库开发全教程
Buffalo框架数据库开发全教程

本专题围绕Buffalo框架数据库开发,讲解database.yml多环境配置、soda与fizz迁移生成回滚、模型结构体标签、增删改查与条件查询、一对多与多对多关联、数据校验、回调钩子、事务处理及原生SQL执行能力。

160

2026.09.23

热门下载

更多
网站特效
/
网站源码
/
网站素材
/
前端模板

精品课程

更多
相关推荐
/
热门推荐
/
最新课程
关于我们 免责申明 举报中心 意见反馈 讲师合作 广告合作 最新更新
php中文网:公益在线php培训,帮助PHP学习者快速成长!
关注服务号
PHP中文网订阅号
每天精选资源文章推送

Copyright 2014-2026 https://www.php.cn/ All Rights Reserved | php.cn