词向量不直接做实体链接,而是为提及和候选实体提供语义表示基础;通过映射到同一向量空间并计算相似度完成匹配与消歧,辅以先验概率、上下文共现和类型约束缓解歧义。
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

词向量本身不直接做实体链接,但它为实体链接提供了关键的语义表示基础。真正起作用的是把文本提及(mention)和知识库中候选实体的描述、类型、上下文等信息都映射到同一向量空间,再通过相似度计算完成匹配与消歧。
用词向量表征文本提及
对原始文本中的待链接片段(比如“苹果”、“乔布斯”),先做分词或子词切分,再用预训练词向量(如Word2Vec、GloVe)或上下文嵌入模型(如BERT)获取其向量表示。如果是上下文相关模型,同一个词在不同句子中会得到不同向量,这对处理歧义非常有用。
- 简单场景可用平均词向量:把提及中每个词的向量加总后归一化
- 更优做法是用句子级嵌入:输入整句(如“苹果公司发布了新款iPhone”),让模型输出提及所在位置的上下文向量
- 提及边界信息可作为额外特征拼接进向量,提升定位准确性
用词向量表征知识库实体
知识图谱里的实体本身没有原始文本,需借助其结构化信息生成向量。常见方式包括:
- 用实体名称+别名+摘要文本作为输入,过一遍BERT类模型,取[CLS]向量作为实体表征
- 结合知识图谱嵌入(KGE):如TransE、RotatE,将实体和关系共同建模为向量,再与文本向量对齐
- 混合策略:把名称向量、类型向量、邻居实体向量加权融合,构成更鲁棒的实体表示
向量空间对齐与匹配
当提及向量和候选实体向量都在同一语义空间后,链接就变成一个检索或分类任务:
- 计算余弦相似度,选Top-1或Top-k最接近的实体作为预测结果
- 用双塔结构(Dual Encoder)分别编码提及和候选实体,离线预计算实体向量,支持快速在线检索
- 引入判别式模型:把(mention, entity)对送入交叉编码器(Cross-Encoder),输出是否匹配的概率,精度更高但速度慢
缓解歧义的关键补充手段
纯向量相似度容易混淆同名实体(如“苹果”指水果还是公司),所以实际系统常叠加以下信号:
- 实体先验概率:维基百科中“Apple Inc.”被链接的频次远高于“apple (fruit)”
- 上下文共现:若句子中同时出现“iOS”“Mac”,则倾向链接到科技公司
- 类型约束:利用DeepType思路,先预测提及应属的类型(ORG vs. FRUIT),再在对应类型实体中检索


















