文本对比工具怎么用:逐行差异与整段替换两种视图的取舍
常见的文本对比工具主要有两种视图,差别首先在差异单位:一种以「行」为单位,一种以「整块」为单位。搞清楚这两种视图分别看什么、适合什么场景,再决定该用哪一种。
两种视图分别指什么、各自适合什么场景
| 视图 | 看什么 | 适合场景 |
|---|---|---|
| 逐行差异 | 以行为单位,对照旧行与新行。 | 定位同一段文字中的局部增删。 |
| 整段替换 | 把一整块内容显示为删除或新增。 | 只核对某段内容整体是否被替换。 |
本站提供的是哪一种视图
本站虽然按行扫描,但遇到编号标记就会另起一条条款。因此它的输出单位是「条款」,不是「行」,严格说提供的是条款对照视图,而不是逐行视图。
另一类工具所说的「整段替换」,在本站对应整条的删除或新增:两边的条款编号不必一致,对不上时按相似度择优配对;配不上的旧条款记「删除」,只在新版里的条款记「新增」。已经配成一对的条款再出现局部改动时,显示到字符级,不会只记成整段替换。
格式噪音为什么像真实改动
从 PDF 复制的文本常带断行和多余空格。这些排版残留进入字面比对后,会让同一份文件显示出大量并非正文变化的差异,看上去像改了很多,实际一字未动。
有编号标记时,本站会在比对前把条款正文中的换行和连续空白压成单个空格。这能消除常见的换行、空格噪音,但断字、断词造成的差异压不掉。
噪音从哪来、怎么在比对前消掉
- 断行与多余空格:有编号标记时本站会自动归一,这一类噪音多数能消掉。
- 断字、断词:PDF 复制常见,本站压不掉,比对前要自己把词恢复完整。
- 没有编号标记:不要指望条款内空白归一化生效,应先自行把文本整理成带编号的条款格式。
整理后再看统计
旧版条数、新版条数,以及新增、修改、删除、沿用四项,可以作为复核差异范围的基线。一字未动的条款会折叠不列,只在末尾给出「另有 N 条一字未动」。
本站只比两份文本的字面差异,不判断哪份有效,不解释法律含义,也不提供法律意见。差异清单是待核清单,不是结论。