分词工具,哪些结果需要人工复核

📍 WDQWDWQD987AAAAA:216.73.216.206
📱 Mozilla/5.0 AppleWebKit/537.36 (KHTML, like Gecko; compatible; ClaudeBot/1.0; +claudebot@anthropic.com)
🔗 /a2be135272ce.html
📄

分词工具,哪些结果需要人工复核

分词工具把文本切成词或短语后,最需要人工复核的是那些会直接影响交付结论、检索命中、统计口径或对外文案的结果:专有名词被拆开、多义词切错边界、数字与单位分离、否定词被并入相邻词、以及同一批文本中切分标准前后不一致。若分词结果只用于内部粗看,复核范围可以缩小;若用于入库、报表、搜索索引或客户交付,则应逐类抽检并留痕。

先判断分词结果的用途,再决定复核范围

同一份分词结果,在不同用途下风险不同。判断时先问三个问题:

如果只是个人临时查看,可以只复核明显异常项;如果结果要交给他人继续加工,就应把复核记录一并交付。

五类高风险结果必须人工复核

第一类是专有名词与固定搭配。人名、机构名、产品名、法规名一旦被切开,后续检索和引用都会出错。检查时不要只看单个词,要把前后相邻片段一起看。

第二类是多义词与歧义边界。同一个字符串在不同语境下应切成不同结果。例如“热爱人民”可能被切成“热爱/人民”,也可能切成“热/爱人民”,具体取决于工具词典与上下文。人工复核时要回到原句判断。

第三类是数字、单位与否定词。像“不低于30天”“3至5个工作日”“未通过”这类表达,切分后若数字与单位分离、否定词被并入其他词,统计和检索都会失真。

第四类是同一批文本中的标准不一致。多人协作时,有人把“机器学习”当一个词,有人切成“机器/学习”,最终词表会混乱。复核时要抽查同一术语在不同文件中的切法是否一致。

第五类是低频但关键的短词。出现次数少、却决定结论的词,例如“除外”“仅限”“不适用”,往往在词频排序中被淹没,需要单独列出检查。

可执行的人工复核步骤

先抽样,再定规则,最后回查。具体可以按下面执行:

  1. 分层抽样:按文本来源、长度、语言混用情况各抽一批,不要只抽开头几段。
  2. 建立对照表:列出原文片段、工具切分结果、人工判断结果、判断理由。对照表是多人协作时减少返工的关键。
  3. 标记三类问题:边界错误、遗漏未切、过度切分。每类给出一个短例子,方便后续统一。
  4. 回查全量:用已确认的错误词去全量结果中搜索,看是否还有同类问题。
  5. 记录验收信号:当抽检批次中高风险类别不再出现新错误,且不同处理人对同一术语判断一致时,可以认为本轮复核通过。

例如,假设某批文本中“北京大学生创业”被切成“北京/大学生/创业”,而业务含义是“北京大学/生创业”,这就属于边界错误。复核时应把该片段加入对照表,并检查全量中是否还有类似组合。

复核后的交付与验收

复核不是把每个词都改一遍,而是把判断标准固定下来。交付时至少应包含:原始分词结果、人工修改记录、未解决项及原因、抽检范围说明。这样下一轮处理或换人接手时,不必从零判断。

验收信号可以看三点:同一术语在不同文件中切法一致;高风险类别抽检不再出现新错误;修改记录能对应到具体原文位置。若这三点达不到,就不宜直接进入搜索索引、统计报表或对外交付。

下一步,先选一批有代表性的文本,按上面的五类高风险结果做一次小规模复核,把判断理由写成对照表,再决定是否需要扩大复核范围。

图1 图2

nginx