词向量在推荐系统内容召回中,通过将标题等文本切分为词序列并训练词向量,再聚合为物品向量,实现语义相似的i2i召回;可结合行为建模(如Session Embedding、DSSM)提升准确性,并需关注分词、归一化、负采样和更新机制等工程细节。
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

词向量(Word Embedding)在推荐系统的内容召回中,核心是把“内容”转化为可计算的向量,再通过向量相似性快速匹配用户兴趣。它不依赖人工打标或关键词硬匹配,而是从用户行为序列中自动学习语义关联,让标题相似、主题相近、用途一致的商品/文章天然靠近。
用词向量构建物品表征
推荐系统里没有现成的“词”,但有可构造的序列:比如用户浏览过的商品标题、点击过的新闻标题、搜索过的query、甚至购买过的SKU名称。把这些文本按空格或分词工具切开,就得到类似自然语言的token序列。然后像训练word2vec一样,用CBOW或Skip-gram建模——目标不是预测下一个词,而是让共现频繁的词(如“iPhone”和“充电器”、“显卡”和“散热器”)在向量空间里靠得更近。
训练完成后,每个词都有一个向量;再对单个物品(如一条新闻)的所有词向量取平均(或加权平均、用LSTM/Transformer聚合),就能得到该物品的Item Embedding。这个向量就代表了它的内容语义。
- 例如,“无线蓝牙降噪耳机” → 分词为[无线、蓝牙、降噪、耳机] → 各自查向量 → 平均后得到一个50维向量
- 同理,“主动降噪TWS耳机”也会生成一个接近的向量,即使用词不完全重合
- 而“运动水壶”的向量则会明显远离,欧氏距离或余弦相似度可量化这种差异
基于物品相似性的i2i召回
i2i(item-to-item)是词向量最直接的内容召回方式:不涉及用户建模,只关注物品之间是否语义相关。上线时,先把全量物品的Embedding离线算好、存入向量库(如Faiss或Milvus);线上收到用户行为(如刚点击一篇《PyTorch入门教程》),立即查出与其Embedding最相似的Top-K篇技术类文章,作为召回结果。
将 LaTeX(.tex)学术论文转换为 Word(.docx),支持可编辑的 OMML 公式、原生 Word 表格、嵌入图形、IEEE 双栏排版及参考文献
这种方式响应快、可解释性强——推荐理由可以直观写成“因为你看了A,所以推荐相似的B、C”。它特别适合冷启动物品:只要标题能分词,就有向量;无需历史交互数据。
- 适合场景:资讯App的“猜你喜欢”、电商详情页的“看了又看”、视频平台的“相关推荐”
- 关键点:物品粒度要一致(不能把整篇长文和单个tag混在一起建模)
- 优化方向:引入品类权重(科技类词比停用词权重更高)、过滤低频噪声词
融合文本与行为的混合召回
纯文本向量容易忽略用户真实偏好。比如用户搜“苹果”,可能是水果也可能是手机——仅靠标题向量无法区分。这时可把词向量作为特征输入更复杂的模型,例如DSSM(Deep Structured Semantic Model):一边用CNN/BiLSTM编码用户Query的词向量,另一边编码候选物品标题的词向量,最后用余弦相似度输出匹配分。
或者,在Item2vec基础上升级为Session-based Embedding:把用户一次会话中连续点击的多个物品ID当作“句子”,训练物品ID向量。这样学出的相似性既包含内容共性(如都含“显卡”),也隐含行为模式(如“先看评测→再比价格→最后下单”)。
- DSSM类模型输出的是user-query与item之间的匹配分,可直接用于多路召回的打分融合
- Session Embedding更适合行为密集、session边界清晰的场景(如淘宝搜索、小红书刷帖)
- 注意避免ID稀疏性问题:新物品没出现在任何session里,就得靠文本向量兜底
工程落地的关键细节
词向量召回不是训练完模型就完事。实际部署中,几个细节决定效果上限:
- 分词质量直接影响向量语义:电商需识别品牌词(“AirPods Pro”不能拆成“Air”“Pods”)、缩写(“GPU”)、数字型号(“RTX4090”);中文还需处理未登录词和新词发现
- 向量归一化不可少:原始词向量长度差异大,做内积前必须L2归一化,否则相似度会被模长主导
- 负样本设计影响泛化能力:训练时若总拿热门物品当负例,模型会偏向打压长尾内容;建议按曝光频次采样,或用batch内负采样
- 定期更新机制:新上架商品、热搜话题、季节性词(如“防晒霜”“羽绒服”)需要增量训练或微调,避免向量空间滞后

















