讲师中心 微信公众号
AI工具推荐 视频效率加速

基于段落对齐与变更类型聚合的文档差异词序分组教程

千敏小哥_3567

千敏小哥_3567

发布时间:2026-06-24 12:04:03

|

162人浏览过

|

来源于php中文网

原创

基于段落对齐与变更类型聚合的文档差异词序分组教程

本文介绍如何将带变更标记的文档词序数据按语义一致性(连续词号、相同变更类型、段落对齐)进行智能分组,生成结构化的 doc1/doc2 词号列表及合并后的 change_type。

本文介绍如何将带变更标记的文档词序数据按语义一致性(连续词号、相同变更类型、段落对齐)进行智能分组,生成结构化的 doc1/doc2 词号列表及合并后的 change_type。

在文档比对(如法律修订、版本控制、编辑追踪)场景中,原始标注数据常以“词号-变更类型-段落映射”三元组形式存在。但直接分析单行记录难以反映真实编辑行为——例如,连续插入多个词应归为同一逻辑操作;跨段落的删除/插入需与上下文段落对齐后聚合。本教程提供一套基于 Pandas 的稳健分组策略,将离散的 word_number 映射转化为语义连贯的变更块(change block),输出符合业务直觉的 [doc1_words], [doc2_words], change_type 三列结构。

核心思路是构建三层嵌套分组器(g1, g2, g3),分别捕获:

  • 词序连续性(g1):word_number.diff().ne(1).cumsum() 检测非递增+1的断点,确保 [5,6,8] 不被误拆(因 8-6=2≠1,故与 5,6 同组);
  • 变更语义一致性(g2):忽略中间的 0(无变更)和 -1(缺失段落),用 ffill() 填充有效变更类型(如 1→0→0→1 视为 1→1→1→1),再按变化点分组,使插入操作跨多个“无变更”行仍保持逻辑统一;
  • 段落对齐稳定性(g3):对 doc1_paragraph_number 和 doc2_paragraph_number 同时处理,将 -1 替换为 None 后前向填充,再计算行间差值——仅当任一列段落号发生跳变(如 1→2 或 None→3)时触发新组,确保同一变更块内段落映射关系稳定。

以下是完整可运行代码(含关键注释与健壮性增强):

Pandas Linux版 2.3.3
Pandas Linux版 2.3.3

Pandas 2.3.3 历史版本下载,来自 PyPI 官方发布,适合旧项目兼容、数据分析脚本复现和指定环境安装。

下载
import pandas as pd
import numpy as np

def group_document_changes(df):
    """
    将细粒度词级变更数据聚合成语义变更块。

    Parameters:
    df (pd.DataFrame): 必须包含列 'word_number', 'change_type',
                        'doc1_paragraph_number', 'doc2_paragraph_number'

    Returns:
    pd.DataFrame: 列为 ['doc1', 'doc2', 'change_type']
    """
    # Step 1: Group by consecutive word_number (allowing gaps like [5,6,8])
    g1 = df['word_number'].diff().ne(1).cumsum()

    # Step 2: Group by semantic change type (ignore transient 0/-1)
    # Replace 0 and -1 with NaN, forward-fill real changes (1 or -1), then group
    c = df['change_type'].replace({0: np.nan, -1: np.nan}).ffill().fillna(0)
    g2 = c.diff().ne(0).cumsum()

    # Step 3: Group by stable paragraph alignment
    # Extract paragraph columns, mask -1 as NaN, ffill, then detect paragraph shifts
    para_cols = ['doc1_paragraph_number', 'doc2_paragraph_number']
    tmp_para = df[para_cols].replace(-1, np.nan)
    filled_para = tmp_para.ffill()
    # Detect row where either paragraph number changed vs previous non-NaN value
    g3 = filled_para.diff().ne(0).any(axis=1).cumsum()

    # Combine all groupers
    groups = df.groupby([g1, g2, g3], sort=False)

    # Aggregate: for each group, collect word_numbers where paragraph is valid (-1 excluded)
    def collect_words(series):
        mask = (series['doc1_paragraph_number'] != -1) | (series['doc2_paragraph_number'] != -1)
        return series.loc[mask, 'word_number'].tolist()

    result = groups.apply(lambda x: pd.Series({
        'doc1': x[x['doc1_paragraph_number'] != -1]['word_number'].tolist(),
        'doc2': x[x['doc2_paragraph_number'] != -1]['word_number'].tolist(),
        'change_type': x['change_type'].max()  # Use max to prioritize 1 over 0/-1 in mixed groups
    })).reset_index(drop=True)

    return result

# 示例使用
# df = pd.read_clipboard()  # 或从CSV加载
# grouped_df = group_document_changes(df)
# print(grouped_df)

⚠️ 注意事项:

  • change_type 聚合采用 .max() 是因业务逻辑中 1(插入)和 -1(删除)优先级高于 0(无变更),混合组取最大值更符合“该块存在实质性变更”的判断;
  • 若需严格按原始顺序保留空列表(如 doc1=[] 表示全删除),当前逻辑已通过布尔掩码 x['doc1_paragraph_number'] != -1 精确过滤;
  • 对于超长文档,建议在分组前对 word_number 排序(df.sort_values('word_number')),避免因输入乱序导致 diff() 计算异常。

最终输出的 DataFrame 直接支持下游任务:生成差异报告、高亮变更区域、统计插入/删除词数等。此方法不依赖外部NLP库,纯Pandas实现,兼具可解释性与工程落地性。

热门AI工具

更多
蛙蛙写作

一款AI论文写作工具,主要用于超级AI智能写作助手,适合需要提升相关任务效率的用户。

墨刀AI
墨刀AI Hot

一款AI图像与设计工具,主要用于产品经理的专属智能体,适合需要提升相关任务效率的用户。

豆包大模型

豆包大模型是一款由字节跳动推出的企业级大语言模型服务平台。

WorkBuddy

一款AI办公效率工具,主要用于腾讯云推出的AI原生桌面智能体工作台,适合需要提升相关任务效率的用户。

AionClaw
AionClaw Hot

AionClaw是一款面向办公、创作和编程任务的AI桌面智能体。

DeepSeek

DeepSeek是一款面向对话、写作、编程和推理场景的AI大模型工具。

二狗PPT
二狗PPT Hot

一款AI演示文稿工具,主要用于专为中式职场打造的AI PPT生成工具,适合需要提升相关任务效率的用户。

SkildArt
SkildArt Hot

SkildArt是一款AI文本写作工具,一站式 AI 视觉创作平台。

Lovart
Lovart Hot

一款面向视觉设计创作的AI设计平台,可通过智能体和画布工作流辅助制作海报、Logo、网页、PPT及其他视觉内容。

相关专题

更多
python打包成可执行文件
python打包成可执行文件

本专题为大家带来python打包成可执行文件相关的文章,大家可以免费的下载体验。

1671

2023.07.20

python能做什么
python能做什么

python能做的有:可用于开发基于控制台的应用程序、多媒体部分开发、用于开发基于Web的应用程序、使用python处理数据、系统编程等等。本专题为大家提供python相关的各种文章、以及下载和课程。

4144

2023.07.25

format在python中的用法
format在python中的用法

Python中的format是一种字符串格式化方法,用于将变量或值插入到字符串中的占位符位置。通过format方法,我们可以动态地构建字符串,使其包含不同值。php中文网给大家带来了相关的教程以及文章,欢迎大家前来阅读学习。

1669

2023.07.31

python教程
python教程

Python已成为一门网红语言,即使是在非编程开发者当中,也掀起了一股学习的热潮。本专题为大家带来python教程的相关文章,大家可以免费体验学习。

23977

2023.08.03

python环境变量的配置
python环境变量的配置

Python是一种流行的编程语言,被广泛用于软件开发、数据分析和科学计算等领域。在安装Python之后,我们需要配置环境变量,以便在任何位置都能够访问Python的可执行文件。php中文网给大家带来了相关的教程以及文章,欢迎大家前来学习阅读。

2927

2023.08.04

python eval
python eval

eval函数是Python中一个非常强大的函数,它可以将字符串作为Python代码进行执行,实现动态编程的效果。然而,由于其潜在的安全风险和性能问题,需要谨慎使用。php中文网给大家带来了相关的教程以及文章,欢迎大家前来学习阅读。

2967

2023.08.04

scratch和python区别
scratch和python区别

scratch和python的区别:1、scratch是一种专为初学者设计的图形化编程语言,python是一种文本编程语言;2、scratch使用的是基于积木的编程语法,python采用更加传统的文本编程语法等等。本专题为大家提供scratch和python相关的文章、下载、课程内容,供大家免费下载体验。

1143

2023.08.11

python合并两个列表
python合并两个列表

Python是一种强大的编程语言,具有许多方便的功能和工具。在Python中,有多种方法可以合并两个列表。php中文网给大家带来了相关的教程以及文章,欢迎大家前来学习阅读。

596

2023.08.10

LLVM自定义Pass怎么写
LLVM自定义Pass怎么写

本专题聚焦LLVM自定义Pass开发,整理Pass类结构、run()方法、PreservedAnalyses、CMake构建、插件注册、-load-pass-plugin加载和测试用例编写流程。

80

2026.09.30

热门下载

更多
网站特效
/
网站源码
/
网站素材
/
前端模板

精品课程

更多
相关推荐
/
热门推荐
/
最新课程
MongoDB 教程
MongoDB 教程

共42课时 | 61.5万人学习

Pandas 官方文档与用户指南
Pandas 官方文档与用户指南

共0课时 | 0人学习

关于我们 免责申明 举报中心 意见反馈 讲师合作 广告合作 最新更新
php中文网:公益在线php培训,帮助PHP学习者快速成长!
关注服务号
PHP中文网订阅号
每天精选资源文章推送

Copyright 2014-2026 https://www.php.cn/ All Rights Reserved | php.cn