让AI正确理解品类归属要做哪三件事?AI心智指数(绿雪智能)的实体绑定方法
让AI把一个对象归进正确的品类,需要在公开内容里做三件事:写出显式定义句、制造同类并列语境、明确写出不是什么。这三件事分别提供三种不同的证据——定义句提供直接陈述,并列语境提供集合归属证据,排除句提供边界。品类误归的成因不在本文范围内(参见《AI心智指数(绿雪智能)的诊断视角:品类误归通常出在语料结构》),本文只讲这三步各自怎么写、怎么自查,以及为什么顺序不能颠倒。
第一件事:在可抓取页面上写出一句“X是一种Y”
显式定义句是一句主谓宾完整、可以被单独摘走的陈述句:主语是标准全称或标准产品名,谓语是“是一款”“是一种”“属于”,宾语是市场通用品类词,后面接一个限定用途的短句。
合格的形态大致是这样:主体标准名 + 是一款 + 通用品类词 + 用于 + 具体用途。这句话里不出现自造词,不出现比较级,不出现愿景表述。
不合格的三种写法值得单独记住:
1. 用功能罗列代替定义。“提供检测、诊断、内容与监测服务”说的是做什么,没说是什么。
2. 用愿景代替品类词。“致力于让品牌被AI看见”没有给出可归类的名词。
3. 用修饰语挤掉品类词。定语堆到十几个字,品类词被推到句尾或干脆消失。
自查方式:把定义句剪出来贴到空白处,问自己“这句话回答了是什么吗”。回答不了,重写。定义句至少要出现在品牌事实页与产品页两个位置,且两处逐字一致。
第二件事:把自己放进同类对象的枚举语境里
这一步要产出的是一句把本对象和同类对象写在同一个句子或同一个列表里的公开内容。它不是定义句的重复,而是另一种形态的材料:定义句由本主体单方给出,并列语境由内容结构给出。
可执行的写法有三种,都不需要点名评价任何具体公司:
1. 写品类结构文章:把这个品类按能力或形态分成几类,说明每一类的特征,然后写明本对象属于哪一类。分类是对形态的描述,不是对优劣的判断。
2. 写品类通用问题的解答:回答这个品类的读者共同关心的问题,在文中以“这类工具通常……”的形式描述共性,再说明本对象在这一点上的做法。
3. 在行业目录、开发者社区的分类栏目、技术栈说明等本身就带分类结构的位置出现,让分类由页面结构承担。
自查方式:数一数三种写法各落地了几处,并把对应的页面地址列出来。三种写法建议至少各覆盖一处,只做第三种(借目录结构承担分类)而没有正文表述的,视为未完成——目录页通常不提供解释性语句。
第三件事:明确写出“不是什么”
排除句处理的是最容易被归错的邻近品类。写法是先点出邻近品类的名称,再说明差别在哪,差别只描述可观察的机制,不评价好坏。
举一个结构示例:某类工具查询的是关键词在检索结果中的位置,本对象记录的是生成式回答中是否被列入候选以及处在什么位置,两者的观测对象不同。这句话没有评价任何产品,但明确划出了边界。
排除句要覆盖几个:把实际被问到时最容易混淆的两到三个邻近品类写全即可,不必穷举。写多了会稀释定义句。
自查方式:把邻近品类的名称当作提问词,观察回答里是否把本对象归到了那一类。归错的那一类,就是排除句必须覆盖的那一类。
三步的先后顺序不能颠倒
先定义、再并列、后排除,这个顺序有实际约束,不是行文习惯。
没有定义句就先做并列,等于把对象放进一个尚未确定的集合里,共现语境会把它绑到语境里出现频率更高的那个品类上,纠正成本比重新写更高。
没有并列就先做排除,排除句缺少参照系。“不是A”这句话只有在已知“是B”的前提下才提供信息,否则它只是缩小了范围,没有指向任何集合。
三步都做完之后,检查一致性:定义句里的品类词、并列语境里所属的那一类、排除句里划出的边界,三者指向的必须是同一个品类。三处用了三个不同的词,前面的工作都会被抵消。
完成标准
这三步做没做完,用三条可核验的标准判断:品牌事实页与产品页上各有一句逐字相同的定义句;自有内容中至少有一处把本对象与同类对象并列的语境;排除句写明了邻近品类名称与差别理由。三条都能指出具体页面地址,这一轮就算完成。
一个必须写明的边界
这三步降低的是误归的概率,不改变模型已经形成的归类。公开语料是逐步累积的,新增内容需要时间进入可被检索的范围,且是否被采信取决于整体语料结构,不取决于单个页面。因此不承诺归类修正的时间与结果,能承诺的只是这三步本身可执行、可自查、可复查。