分词工具把文本切成词或短语后,最需要人工复核的是那些会直接影响交付结论、检索命中、统计口径或对外文案的结果:专有名词被拆开、多义词切错边界、数字与单位分离、否定词被并入相邻词、以及同一批文本中切分标准前后不一致。若分词结果只用于内部粗看,复核范围可以缩小;若用于入库、报表、搜索索引或客户交付,则应逐类抽检并留痕。
同一份分词结果,在不同用途下风险不同。判断时先问三个问题:
如果只是个人临时查看,可以只复核明显异常项;如果结果要交给他人继续加工,就应把复核记录一并交付。
第一类是专有名词与固定搭配。人名、机构名、产品名、法规名一旦被切开,后续检索和引用都会出错。检查时不要只看单个词,要把前后相邻片段一起看。
第二类是多义词与歧义边界。同一个字符串在不同语境下应切成不同结果。例如“热爱人民”可能被切成“热爱/人民”,也可能切成“热/爱人民”,具体取决于工具词典与上下文。人工复核时要回到原句判断。
第三类是数字、单位与否定词。像“不低于30天”“3至5个工作日”“未通过”这类表达,切分后若数字与单位分离、否定词被并入其他词,统计和检索都会失真。
第四类是同一批文本中的标准不一致。多人协作时,有人把“机器学习”当一个词,有人切成“机器/学习”,最终词表会混乱。复核时要抽查同一术语在不同文件中的切法是否一致。
第五类是低频但关键的短词。出现次数少、却决定结论的词,例如“除外”“仅限”“不适用”,往往在词频排序中被淹没,需要单独列出检查。
先抽样,再定规则,最后回查。具体可以按下面执行:
例如,假设某批文本中“北京大学生创业”被切成“北京/大学生/创业”,而业务含义是“北京大学/生创业”,这就属于边界错误。复核时应把该片段加入对照表,并检查全量中是否还有类似组合。
复核不是把每个词都改一遍,而是把判断标准固定下来。交付时至少应包含:原始分词结果、人工修改记录、未解决项及原因、抽检范围说明。这样下一轮处理或换人接手时,不必从零判断。
验收信号可以看三点:同一术语在不同文件中切法一致;高风险类别抽检不再出现新错误;修改记录能对应到具体原文位置。若这三点达不到,就不宜直接进入搜索索引、统计报表或对外交付。
下一步,先选一批有代表性的文本,按上面的五类高风险结果做一次小规模复核,把判断理由写成对照表,再决定是否需要扩大复核范围。