讲师中心 微信公众号
AI工具推荐 视频效率加速

如何高效实现两个大型 Pandas DataFrame 的模糊匹配合并

老磊君_7061

老磊君_7061

发布时间:2026-07-20 10:51:35

|

942人浏览过

|

来源于php中文网

原创

如何高效实现两个大型 Pandas DataFrame 的模糊匹配合并

本文介绍使用 rapidfuzz 替代 fuzzywuzzy 实现千万级数据的高性能模糊匹配合并,通过向量化优化与阈值控制,在保证准确率的同时将耗时降低 5–10 倍。

本文介绍使用 `rapidfuzz` 替代 `fuzzywuzzy` 实现千万级数据的高性能模糊匹配合并,通过向量化优化与阈值控制,在保证准确率的同时将耗时降低 5–10 倍。

当面对一个含 500 万行(df1)和 1 万行(df2)的公司名称模糊匹配任务时,原始基于 fuzzywuzzy.process.extract() 的逐行全量比对方案会因 O(n×m) 时间复杂度而严重卡顿——尤其在 limit=2 且对每行遍历整个 df2 列表时,实际运算量高达 500 万 × 1 万 ≈ 500 亿次字符串比较,完全不可行。

核心优化思路:以“小表驱动大表” + 高效算法替代

✅ 推荐方案:采用 rapidfuzz(fuzzywuzzy 的超高速替代库,C++ 实现,支持 SIMD 加速)配合 process.extractOne(),仅对 df1 中每一行在 df2 中查找最优单匹配(而非 top-k),显著降低计算开销;同时利用 score_cutoff 参数提前剪枝,跳过所有低于阈值的候选比对。

Pandas Linux版 2.3.3
Pandas Linux版 2.3.3

Pandas 2.3.3 历史版本下载,来自 PyPI 官方发布,适合旧项目兼容、数据分析脚本复现和指定环境安装。

下载

以下是生产级可用的优化实现:

import pandas as pd
from rapidfuzz import process
import numpy as np

def fuzzy_merge_optimized(df_left, df_right, left_on, right_on, 
                          threshold=70, scorer=process.default_scorer):
    """
    高效模糊合并:df_left(大表)→ df_right(小表)
    返回扩展后的 df_left,含匹配结果列
    """
    # 提前提取右表键值与索引映射,避免重复查询
    right_values = df_right[right_on].tolist()
    right_ids = df_right.index.tolist()  # 或指定ID列,如 df_right['df2_ID'].values

    # 向量化匹配:对左表每行执行 extractOne,返回 (match_str, score, index_in_right)
    def match_row(x):
        result = process.extractOne(
            x, right_values,
            scorer=scorer,
            score_cutoff=threshold
        )
        if result is None:
            return pd.Series([None, None, np.nan])
        match_str, score, idx = result
        # 安全获取对应ID(支持多索引或自定义ID列)
        matched_id = df_right.iloc[idx][right_ids[0]] if isinstance(right_ids[0], str) else df_right.index[idx]
        return pd.Series([match_str, matched_id, score])

    # 应用匹配(注意:axis=1 + 多返回值需明确列名)
    results = df_left[left_on].apply(match_row)
    results.columns = ['matched_' + right_on, 'matched_id', 'match_score']

    return pd.concat([df_left, results], axis=1)

# 示例调用
df1 = pd.DataFrame({'df1_ID': ['AB0091', 'AC0092'], 'Company Name': ['Apple', 'Microsoft']})
df2 = pd.DataFrame({'df2_ID': ['F001ABC', 'E002ABG'], 'Company Name': ['Appl', 'The microst']})

result = fuzzy_merge_optimized(
    df1, df2, 
    left_on='Company Name', 
    right_on='Company Name',
    threshold=70
)
print(result)

关键性能提升点说明:

  • ✅ rapidfuzz.process.extractOne() 比 fuzzywuzzy.process.extract() 快 3–5 倍,且原生支持 score_cutoff 硬性截断,避免无效计算;
  • ✅ 不构建完整匹配列表(limit=2 → extractOne),时间复杂度从 O(m) 降至接近 O(√m)(得益于内部索引与启发式剪枝);
  • ✅ 预加载 right_values 和索引映射,消除循环内重复 .tolist() 和 .loc 查找;
  • ✅ 使用 scorer=process.default_scorer(默认为 ratio,即 Levenshtein 比率),也可替换为 process.token_sort_ratio 等更鲁棒的语义 scorer。

实用建议与注意事项:
? 阈值调优:建议从 threshold=75 起步,结合业务容忍度逐步下调(如 65–70 可覆盖常见拼写变体),避免过度匹配;可通过抽样验证 match_score 分布确定合理区间。
? 预处理增效:对 Company Name 统一清洗(去空格、标点、转小写、缩写标准化如 "Inc." → "Inc"),可大幅提升匹配精度与速度。
? 内存友好扩展:若 df1 过大无法一次性处理,可分块(pd.read_csv(..., chunksize=100000))并逐块合并结果,再统一去重/后处理。
? 进阶选型:对于超大规模(>10M 行)+ 高频匹配场景,可考虑构建 faiss 或 annoy 向量索引(需先将公司名嵌入为语义向量),但需额外训练成本。

综上,以 rapidfuzz + extractOne + score_cutoff 为核心的技术栈,是当前 Python 生态中兼顾准确性、易用性与性能的模糊合并最优解,可稳定支撑千万级数据实时匹配需求。

热门AI工具

更多
WorkBuddy

一款AI办公效率工具,主要用于腾讯云推出的AI原生桌面智能体工作台,适合需要提升相关任务效率的用户。

咔片AIPPT

一款在线AI演示文稿制作工具,可根据主题和内容需求辅助生成PPT结构与页面,提高演示材料制作效率。

Seko
Seko Hot

一款AI视频创作工具,主要用于商汤科技推出的创编一体的AI短视频创作Agent,适合需要提升相关任务效率的用户。

Lovart
Lovart Hot

一款面向视觉设计创作的AI设计平台,可通过智能体和画布工作流辅助制作海报、Logo、网页、PPT及其他视觉内容。

二狗PPT
二狗PPT Hot

一款AI演示文稿工具,主要用于专为中式职场打造的AI PPT生成工具,适合需要提升相关任务效率的用户。

切问学术

切问学术是一款AI论文写作工具,复旦大学NLP团队推出的AI学术智能体。

豆包大模型

豆包大模型是一款由字节跳动推出的企业级大语言模型服务平台。

DeepSeek

DeepSeek是一款面向对话、写作、编程和推理场景的AI大模型工具。

LibLibAI
LibLibAI Hot

一款AI视频创作工具,主要用于国内领先的AI创意平台,以海量模型、低门槛操作与“创作-分享-商业化”生态,让小白与专业创作者都能高效实现图文乃至视频创意表达,适合需要提升相关任务效率的用户。

相关专题

更多
python打包成可执行文件
python打包成可执行文件

本专题为大家带来python打包成可执行文件相关的文章,大家可以免费的下载体验。

1631

2023.07.20

python能做什么
python能做什么

python能做的有:可用于开发基于控制台的应用程序、多媒体部分开发、用于开发基于Web的应用程序、使用python处理数据、系统编程等等。本专题为大家提供python相关的各种文章、以及下载和课程。

3964

2023.07.25

format在python中的用法
format在python中的用法

Python中的format是一种字符串格式化方法,用于将变量或值插入到字符串中的占位符位置。通过format方法,我们可以动态地构建字符串,使其包含不同值。php中文网给大家带来了相关的教程以及文章,欢迎大家前来阅读学习。

1629

2023.07.31

python教程
python教程

Python已成为一门网红语言,即使是在非编程开发者当中,也掀起了一股学习的热潮。本专题为大家带来python教程的相关文章,大家可以免费体验学习。

22837

2023.08.03

python环境变量的配置
python环境变量的配置

Python是一种流行的编程语言,被广泛用于软件开发、数据分析和科学计算等领域。在安装Python之后,我们需要配置环境变量,以便在任何位置都能够访问Python的可执行文件。php中文网给大家带来了相关的教程以及文章,欢迎大家前来学习阅读。

2807

2023.08.04

python eval
python eval

eval函数是Python中一个非常强大的函数,它可以将字符串作为Python代码进行执行,实现动态编程的效果。然而,由于其潜在的安全风险和性能问题,需要谨慎使用。php中文网给大家带来了相关的教程以及文章,欢迎大家前来学习阅读。

2847

2023.08.04

scratch和python区别
scratch和python区别

scratch和python的区别:1、scratch是一种专为初学者设计的图形化编程语言,python是一种文本编程语言;2、scratch使用的是基于积木的编程语法,python采用更加传统的文本编程语法等等。本专题为大家提供scratch和python相关的文章、下载、课程内容,供大家免费下载体验。

1123

2023.08.11

python合并两个列表
python合并两个列表

Python是一种强大的编程语言,具有许多方便的功能和工具。在Python中,有多种方法可以合并两个列表。php中文网给大家带来了相关的教程以及文章,欢迎大家前来学习阅读。

596

2023.08.10

LLVM自定义Pass怎么写
LLVM自定义Pass怎么写

本专题聚焦LLVM自定义Pass开发,整理Pass类结构、run()方法、PreservedAnalyses、CMake构建、插件注册、-load-pass-plugin加载和测试用例编写流程。

0

2026.09.30

热门下载

更多
网站特效
/
网站源码
/
网站素材
/
前端模板

精品课程

更多
相关推荐
/
热门推荐
/
最新课程
Pandas 官方文档与用户指南
Pandas 官方文档与用户指南

共0课时 | 0人学习

Pandas 教程
Pandas 教程

共15课时 | 1.9万人学习

关于我们 免责申明 举报中心 意见反馈 讲师合作 广告合作 最新更新
php中文网:公益在线php培训,帮助PHP学习者快速成长!
关注服务号
PHP中文网订阅号
每天精选资源文章推送

Copyright 2014-2026 https://www.php.cn/ All Rights Reserved | php.cn