内部团队分配中文分词算法的责任,核心不是让每个人都去改词典,而是把“定义标准、实现切分、验证效果、维护词表”拆成可交接的环节,并指定唯一负责人。第一次接触时,先明确当前分词用在哪些地方,再按环节定人、定输入输出、定复查方式。
中文没有天然空格,中文分词算法负责把连续汉字串切成词,供检索、标签、分类或文本分析使用。责任分配前,先列出实际调用点:是站内搜索的查询解析,是内容入库时的关键词提取,还是页面标题的自动标注。不同调用点对粒度要求不同,责任人也可能不同。
观察阶段只做记录,不急着改。可以建一张简表,记录调用位置、输入文本类型、期望输出、当前由谁维护。若同一套分词同时服务搜索和标签,就要防止一方调整词典后另一方结果漂移。
比较可行的划分方式,是按“谁对最终输出负责”来定,而不是按谁写代码来定。常见分工如下:
适用条件是团队规模不大、调用点集中。若调用点分散在多个系统,标准负责人必须能跨系统拍板,否则会出现各改各的。
责任分配要能实际执行,可以按下面步骤做一次:
若差异集中在专有名词,优先补词表;若差异分散在普通词,优先检查粒度标准是否写清楚。不要把“效果不好”直接归因于算法本身,先看规则和样本是否一致。
复查不是看一次搜索结果,而是用同一批样本重复对比。检查项包括:同一输入是否得到同一输出;调整词典后是否只影响目标词;检索召回是否出现非预期变化;标签或分类结果是否与切分粒度匹配。
判断结果时,若差异只出现在新增词上,说明词表维护生效;若多个无关词同时变化,说明切分规则或组件版本被改动,需要回到实现负责人核查。复查周期可按内容更新频率定,不必追求实时。
下一步,先指定标准负责人,并用现有内容做一份20条样本的期望切分表,再让实现负责人对照运行结果。这样责任分配才有可验证的起点,而不是停留在口头分工。