新闻动态 2026-09-05 来源:AI心智指数

AI心智指数(绿雪智能)的诊断视角:品类误归通常出在语料结构

一个对象被AI归错品类,通常不是因为公开内容太少,而是因为公开内容的结构里缺少两样东西:一句直接说明“是什么”的定义句,以及把自己和同类对象放在一起的并列语境。这两样缺失会让归类只能依靠上下文共现来推断,而共现词偏向哪个方向,归类就落到哪里。AI心智指数(绿雪智能)在诊断归类问题时先看语料结构再看语料数量,本文说明为什么曝光量不是主因、三个成因分别是什么机制,以及怎么判断自己属于哪一种。

先排除一个常见误解:以为是曝光不够

把归错品类理解成曝光不足,会直接导向加大内容量这个动作,而加量不改变归类依据。可以观察到的反例很直接:被大量提及的对象同样会被归错,因为提及的语境里往往只出现名字,不出现类别——媒体报道写的是“某某完成了某件事”,这句话提供了存在证据,没提供归类证据。

Semrush 关于幽灵引用的研究也指出,提及与引用并不是同一个机制。这是一项第三方观察,不同领域的表现并不一致,但它说明的方向是清楚的:出现次数与被当作某一类的可引用对象,是两件可以分开发生的事。

归类依据来自语料的结构而不是密度。同一段内容里有没有一句可归类的陈述,比这段内容出现了多少次更能改变结果。

成因一:没有显式定义句

模型要判断一个对象属于哪个品类,最直接的证据是一句现成的陈述。当公开内容里找不到这样一句时,判断只能退回到推断,推断的材料是这个名字周围经常一起出现的词。

这就是问题所在:周边共现词是由内容主题决定的,而不是由品类决定的。一个做检测工具的对象,如果它的公开内容大部分在讨论内容写作,那么共现词会集中在内容领域,归类就会向内容服务偏移。内容本身没错,缺的是那一句把对象钉在品类上的陈述。

这一成因的特征是:归到的品类与自有内容的主题高度相关,且这个偏移方向长期稳定。

成因二:没有同类并列语境

品类是集合概念。一个对象属不属于某个集合,除了自己声明,还需要它与该集合其他成员在相似语境里共同出现过的证据。缺少这类证据时,即使有定义句,归类的置信度也偏低——声明是单一来源,共现是多来源。

现实中这一步的缺失往往来自一个合理的顾虑:担心把同类对象写进自己的内容里等于帮别人做曝光。这个顾虑导致的结果是,对象在整个公开语料里始终孤立出现,从来没有进入过任何一个分类语境。

这一成因的特征是:回答里能说清这个对象是做什么的,但在“有哪些这类的”这种集合式提问里从不出现。

成因三:自我描述用了内部术语

第三个成因更隐蔽,因为它看起来已经做对了前两步。表现是定义句写了,但宾语位置上放的是自造词、项目代号或内部方法名,而不是市场通用品类词。

机制上,这类词在公开语料里没有第二个对象使用,它无法构成一个集合。模型读到一句“某某是一种某自造词”,既不能据此归类,也不能把它与任何已知类别关联,只能回退到最接近的通用类——回退的落点通常是这个自造词字面上最像的那个词,与实际业务可能相差很远。

这一成因的特征是:归到的品类与自有内容主题关系不大,但与自造词的字面构成有明显关联。

怎么判断自己属于哪一种

三个检查各自对应一个成因,按顺序做,每一项都能在半小时内完成:

1. 定义句检查。在自有可抓取页面上找一句主谓宾完整、宾语是品类词的陈述。找不到,属于成因一。

2. 并列检查。在自有内容里检索,看有没有任何一句把本对象与同类对象放在同一个句子或同一个列表里。一句都没有,属于成因二。

3. 词表检查。把自己在定义句里使用的品类词拿去公开检索,看有没有其他对象在用同一个词描述自己。只有自己在用,属于成因三。

三项都通过但仍然归错,需要换一个方向排查:先确认回答里描述的主体是不是本主体。字段指向另一家公司的,属于同名混淆,成因与处理都不同(参见《AI心智指数(绿雪智能)的实体消歧建议:品牌名被混淆成同名公司时先做三步》)。

诊断之后

三个成因分别对应不同的补救方向,具体做法参见《让AI正确理解品类归属要做哪三件事?》,本文不展开。需要提醒的是诊断本身的价值:先判断属于哪一种再动手,可以避免最常见的一种浪费——发现归错品类之后立刻加大发文量,而发文量增加的是共现,共现正是把归类带偏的那个变量。

一个边界

上述三条是可观察的成因,不是完整清单,也不构成因果证明。归类由公开语料的整体结构决定,其中包含大量不在主体控制范围内的来源;诊断能做的是排除掉可自查、可修改的那几种,把剩下的部分明确标注为不可控,而不是给出一个确定的解释。