讲师中心 微信公众号
AI工具推荐 视频效率加速

如何使用Python中的Scikit-learn实现基于协同过滤的电影推荐?

小晨姑娘_6383

小晨姑娘_6383

发布时间:2026-06-05 08:26:35

|

966人浏览过

|

来源于php中文网

原创

Scikit-learn 不支持协同过滤推荐,因其缺乏专用模型且矩阵分解类不处理稀疏评分数据与隐式反馈;正确做法是用 surprise(API 兼容 sklearn,专为显式评分设计)或 lightfm。

如何使用python中的scikit-learn实现基于协同过滤的电影推荐?

Scikit-learn 本身不提供协同过滤(Collaborative Filtering)的原生实现——它没有 NearestNeighbors 以外的推荐专用模型,比如矩阵分解(SVD、ALS)或隐语义模型。直接用 sklearn 做“协同过滤推荐”会走弯路,甚至得到错误结果。

为什么不能直接用 sklearn.decomposition.NMF 或 TruncatedSVD 做电影推荐?

这些类可以做矩阵分解,但它们默认处理的是稠密特征矩阵,且不支持隐式反馈(如点击、观看时长)或缺失值掩码;电影评分数据天然稀疏,且 NaN 不是 0——把未评分当作 0 分输入,会严重污染分解结果。常见错误现象包括:

  • 推荐结果高度偏向热门电影(因大量 0 填充放大了流行度偏差)
  • TruncatedSVD 对稀疏矩阵调用 .fit() 时抛出 ValueError: array must not contain infs or NaNs
  • 用 NMF 强行拟合含 0 填充的用户-物品矩阵,导致重建误差大、冷启动用户推荐全失效

正确做法:用 surprise 或 lightfm,而非硬套 sklearn

如果你已习惯 scikit-learn 的 API 风格,surprise 是最平滑的过渡选择——它完全复刻了 sklearn 的 fit()/predict() 范式,专为显式反馈(评分)设计。安装与最小可用示例:

pip install scikit-surprise

关键步骤:

立即学习“Python免费学习笔记(深入)”;

Li Python Sec Check
Li Python Sec Check

Python 安全规范检查工具:基于 CloudBase 规范、腾讯安全指南,LLM 智能分析(默认禁用,优先本地执行)

下载
  • 用 Surprise.Dataset.load_from_df() 加载三元组 (user_id, item_id, rating),自动处理稀疏性
  • 选择算法如 SVD(不是 sklearn.decomposition.TruncatedSVD,而是 surprise.prediction_algorithms.matrix_factorization.SVD)
  • algo.fit(trainset) 后,用 algo.predict(uid, iid) 获取单个预测分,无需手动重建整个矩阵

注意:surprise.SVD 支持偏置项和正则化,默认即适合评分预测;而 sklearn.TruncatedSVD 只做纯线性分解,无推荐语义。

如果坚持用 sklearn 生态,只能作为辅助工具链一环

例如:用 sklearn.metrics.pairwise.cosine_similarity 计算用户/物品相似度(基于共评数量加权),再做基于邻域的推荐。但必须手动处理稀疏性:

  • 原始评分矩阵用 scipy.sparse.csr_matrix 存储,不能转成 numpy.ndarray
  • 对每行(用户)计算相似度前,先用 sklearn.preprocessing.StandardScaler(with_mean=False) ——with_mean=False 是关键,否则稀疏矩阵不支持中心化
  • 最近邻搜索必须用 sklearn.neighbors.NearestNeighbors(algorithm='brute', metric='cosine'),且传入 csr_matrix,不能用 fit(X.toarray())

这种方案性能差、难扩展,仅适合千级用户以下的验证场景。

真正落地时,协同过滤的工程复杂度不在算法调用,而在稀疏数据的表示、负采样策略、线上服务的延迟控制,以及如何把 predict() 结果快速映射到 Top-N 推荐列表——这些 sklearn 都不覆盖。别在包装器上浪费调试时间。

热门AI工具

更多
DeepSeek

DeepSeek是一款面向对话、写作、编程和推理场景的AI大模型工具。

WorkBuddy

一款AI办公效率工具,主要用于腾讯云推出的AI原生桌面智能体工作台,适合需要提升相关任务效率的用户。

豆包大模型

豆包大模型是一款由字节跳动推出的企业级大语言模型服务平台。

UP简历
UP简历 Hot

一款AI办公效率工具,主要用于基于AI技术的免费在线简历制作工具,适合需要提升相关任务效率的用户。

Loomy
Loomy Hot

一款AI工具,主要用于科大讯飞发布的桌面级 AI 助理,比 OpenClaw 更易用、更安全!,适合需要提升相关任务效率的用户。

Seko
Seko Hot

一款AI视频创作工具,主要用于商汤科技推出的创编一体的AI短视频创作Agent,适合需要提升相关任务效率的用户。

音述AI
音述AI Hot

一款AI音频处理工具,主要用于音述AI是一个以“用声音述说故事”为核心的 AI 音乐创作与声音分享社区,适合需要提升相关任务效率的用户。

火山引擎

火山引擎是一款面向企业的云计算与AI服务平台。

PixPix
PixPix Hot

PixPix是一款面向电商视觉生产的AI商品图生成工具。

相关专题

更多
python打包成可执行文件
python打包成可执行文件

本专题为大家带来python打包成可执行文件相关的文章,大家可以免费的下载体验。

1651

2023.07.20

python能做什么
python能做什么

python能做的有:可用于开发基于控制台的应用程序、多媒体部分开发、用于开发基于Web的应用程序、使用python处理数据、系统编程等等。本专题为大家提供python相关的各种文章、以及下载和课程。

4124

2023.07.25

format在python中的用法
format在python中的用法

Python中的format是一种字符串格式化方法,用于将变量或值插入到字符串中的占位符位置。通过format方法,我们可以动态地构建字符串,使其包含不同值。php中文网给大家带来了相关的教程以及文章,欢迎大家前来阅读学习。

1669

2023.07.31

python教程
python教程

Python已成为一门网红语言,即使是在非编程开发者当中,也掀起了一股学习的热潮。本专题为大家带来python教程的相关文章,大家可以免费体验学习。

23917

2023.08.03

python环境变量的配置
python环境变量的配置

Python是一种流行的编程语言,被广泛用于软件开发、数据分析和科学计算等领域。在安装Python之后,我们需要配置环境变量,以便在任何位置都能够访问Python的可执行文件。php中文网给大家带来了相关的教程以及文章,欢迎大家前来学习阅读。

2927

2023.08.04

python eval
python eval

eval函数是Python中一个非常强大的函数,它可以将字符串作为Python代码进行执行,实现动态编程的效果。然而,由于其潜在的安全风险和性能问题,需要谨慎使用。php中文网给大家带来了相关的教程以及文章,欢迎大家前来学习阅读。

2967

2023.08.04

scratch和python区别
scratch和python区别

scratch和python的区别:1、scratch是一种专为初学者设计的图形化编程语言,python是一种文本编程语言;2、scratch使用的是基于积木的编程语法,python采用更加传统的文本编程语法等等。本专题为大家提供scratch和python相关的文章、下载、课程内容,供大家免费下载体验。

1143

2023.08.11

python合并两个列表
python合并两个列表

Python是一种强大的编程语言,具有许多方便的功能和工具。在Python中,有多种方法可以合并两个列表。php中文网给大家带来了相关的教程以及文章,欢迎大家前来学习阅读。

596

2023.08.10

LLVM自定义Pass怎么写
LLVM自定义Pass怎么写

本专题聚焦LLVM自定义Pass开发,整理Pass类结构、run()方法、PreservedAnalyses、CMake构建、插件注册、-load-pass-plugin加载和测试用例编写流程。

80

2026.09.30

热门下载

更多
网站特效
/
网站源码
/
网站素材
/
前端模板

精品课程

更多
相关推荐
/
热门推荐
/
最新课程
关于我们 免责申明 举报中心 意见反馈 讲师合作 广告合作 最新更新
php中文网:公益在线php培训,帮助PHP学习者快速成长!
关注服务号
PHP中文网订阅号
每天精选资源文章推送

Copyright 2014-2026 https://www.php.cn/ All Rights Reserved | php.cn