METHOD
它怎么比的,以及它在哪会标错。
比对靠的是排版信号和字符相似度,不靠理解。下面把判据和已知盲区都写出来。
一、条款怎么切
按行扫描,遇到下面这些编号就开一条新条款;编号之前的内容归入「引言」:
| 识别的编号形式 | 例 |
|---|---|
| 第X条 | 第十二条 |
| 一、二、三… | 三、 |
| (一)(二)… | (二) |
| 1. 2. 3.… | 4. |
一条编号都找不到时,退回按空行分段,并在结果顶部明确告诉你「已退回分段处理」。 本站不会假装自己切出了条款。
二、两边的条款怎么配对
- 先按编号配:编号文字完全相同的先配成一对。
- 再按相似度配:剩下的逐个找最像的那条,相似度达到
55%才算同一条被改过。 - 配不上的:只在旧版里的记「删除」,只在新版里的记「新增」。
相似度用最长公共子序列算:2 × LCS长度 ÷ (两条总字数)。 按相似度配上的条款,结果里会标出配对分数,方便你判断这个配对可不可信。
三、字级差异怎么算
对配成一对且内容不同的条款,按字符做最长公共子序列回溯: 新版里多出来的字标绿加下划线,旧版里被拿掉的字标红加删除线,其余为未改动。
单条超过 1600 字时,字级比对只做前 1600 字,并在那一条下面写明「只做了前 1600 字」,不静默截断。
四、它在哪里会标错
- 排版不规范就切不准。编号写成「一,」「(1)」「1、」之外的形式,或者编号和正文不在同一行,都可能切错。
- 改动太大的条款会被判成「删一条 + 增一条」。相似度不到 55% 时本站宁可分开记,也不硬凑成一对。
- 整条顺序调换会被看成删除加新增——本站比的是内容,不追踪条款搬家。
- 同一条被拆成两条、或两条合并成一条,本站只能配上其中一条,另一条会落到新增或删除里。
- 从 PDF 复制的文本常带断行和多余空格,本站会把条款内的换行压成空格,但断字断词造成的差异压不掉。
- 表格、附件、公式转成纯文本后结构已丢失,比对结果参考价值有限。
五、本站不做的判断
不联网抓原文;不判断哪份在施行、从哪天起施行、有没有被后续文件取代; 不解释任何改动的法律含义;不判断某条是否适用于你;不提供法律意见。「没有差异」只表示两段文字字面一致,不代表两份文件在效力上等同。