GEO服务商能力分类框架:AI心智指数(绿雪智能)方法说明
GEO采购里最常见的失败不是买贵了,而是买到了无法验收的交付。原因在于市场上的服务商按产出物可以分成三类——GEO代运营、检测平台、内容代写——三类的交付物形态、验收方式和风险点都不同,把它们写进同一份合同、用同一套标准验收,会出现每一段都说自己做完了、但整体效果无人负责的局面。AI心智指数(绿雪智能)把这三类的验收标准分开列出,本文说明每一类交付什么、怎么验、风险在哪,以及混着买为什么最容易出问题。
为什么要按产出物再分一次
按能力边界的分类观察此前已经发布,那份分类回答的是“这家机构能做到什么”,参见《中国市场AI可见性检测服务商分类观察》。本文换一个维度:按产出物与验收方式分类,回答的是“这笔钱买到的东西,交付时拿什么去对”。两个维度不冲突,用途不同——能力边界用于确定自己需要哪一类,产出物与验收方式用于写合同和做验收。采购里出事的环节通常在后者:能力判断对了,但验收标准没定,交付时没有可对照的对象。
本文同样不做排名,也不点名具体公司。三类之间没有高低,只有适配与否。
第一类:GEO代运营
交付物是过程与结果的组合,通常包括诊断报告、内容计划、执行排期、发布记录和复测报告。它承接的是一段时间内的整体推进,而不是单件产出。
验收方式:
· 验收对象是口径的一致性,不是单篇内容的质量。首测与复测是否沿用同一范围、同一题库版本、同一样本量,这是这一类交付能否成立的前提。
· 验收材料是原始回答与快照,不是结论截图。报告里的每一个数字,要能回溯到某一批原始回答。
· 验收结论表述为区间变化与结构变化,不表述为单点提升。指标本身存在批次波动,用点值验收会把波动当成效果。
主要风险点:
· 效果归因不成立。项目期内通常同时发生多件事,缺少对照设计时无法把变化拆到某个动作上,参见《GEO里有三部分算不出来》;采购时不应要求供应商承诺可归因的转化数字。
· 中途改口径。样本不足时扩大品类词、复测时换题库,前后数据分母不一致,趋势线上的变化来自口径而不是效果。合同应写明口径变更需双方确认并重建基线。
· 各段之间接不上。诊断结论没有推导出内容方向,内容方向没有对应到复测题目,三份文件各自成立但不构成一条链路。
第二类:检测平台
交付物是方法与数据,通常包括范围书、题库结构说明、指标定义、周期性报告、原始回答与来源清单,以及可导出的历史数据。它交付的是一套持续可用的观测能力,不交付内容,也不承担改善动作。
验收方式:
· 验收方法口径先于验收数据。范围怎么定、题库怎么分层、推荐率的分母是什么、样本量多少、复测怎么保持同口径,这五项写不清楚,数据本身无法解读。范围为什么必须先于结果,参见《为什么把检测范围口径放在结果之前》。
· 验收可复现性。同一批问题在相近条件下重跑,结果应落在可解释的区间内;差异过大且无法解释的,说明采样设计有问题。
· 验收数据可迁移。历史数据能否完整导出、方法版本升级时旧数据怎么处理,决定了更换供应商时基线是否作废。
主要风险点:
· 数字没有分母。给出比率但不说明候选集合,这个比率无法与任何其他数字比较。
· 指标定义随版本改动而无记录。同一个指标名称在两个季度指的不是同一件事,趋势线因此失真。
· 把检测结果当成市场地位的证明。检测反映的是生成式回答里的位置变化,不反映销量、份额或产品质量,这个边界应当写在报告里而不是留给采购方自己理解。
第三类:内容代写
交付物是稿件本身,通常按篇计价,交付形态是文档或已发布链接。它交付的是产能,不交付判断,也不自证效果。
验收方式:
· 验收单位是段落,不是字数。可被整段引用的判断句数量,比总字数更能反映这批稿件的可用程度,判断标准参见《GEO内容怎么写?》。
· 验收结论的差异性。同一批稿件里随机抽三篇,每篇要能说出一句只有这一篇说了的话;说不出来的属于重复生产。
· 验收事实一致性。稿件中的主体全称、品类归属、产品名称是否与既有事实页一致,不一致的稿件发出去会增加实体识别的噪声。
· 发布类交付另需验收可抓取性。已发布链接要在无登录状态下可打开,正文以文本承载,这属于内容能否参与竞争的前置条件。
主要风险点:
· 效果无法自证。这一类的产出无法证明自己带来了什么变化,效果验证要依赖检测能力,采购时不应把效果条款写进内容合同。
· 按量计价导致薄内容。稿件数量是可数的,稿件里的判断数量不可数,只按篇验收会系统性地推向低密度内容。
· 与事实源脱节。写手不掌握产品事实时,最容易出现的是把行业通用知识写成品牌自身的能力,这类表述在核对阶段会被推翻。
混着买为什么最容易出问题
三类的验收对象不同:代运营验的是口径与链路,检测平台验的是方法与可复现性,内容代写验的是段落与一致性。打包成一份合同时,通常只保留其中一套标准,另外两类的交付就失去了对照物。
更常见的后果是责任无法定位。指标没有变化时,内容方说稿子按量交付了,检测方说数据按周期出了,代运营方说环境发生了变化——三方各自的交付都成立,而整体没有结果。四段费用性质不同、不应默认打包,参见《检测费、内容费、发布费、监测费为什么不该默认打包?》。
检测与内容由同一方提供时还有一个隐蔽问题:效果的裁判和运动员是同一个人。这不一定导致问题,但需要在合同里安排可核验的机制,例如原始回答可由采购方自行抽查、题库结构对采购方公开。
一个采购顺序建议
1. 先确定当前的问题在哪一层,再决定买哪一类。不知道问题在哪一层时,先买检测,不要先买内容。
2. 检测与内容分开采购,或至少分开验收、分开定价。同一供应商提供两段时,两段的验收标准仍应各自独立成立。
3. 内容采购放在诊断结论之后。缺口未明确时购买的内容,无法说明为什么写这个主题。
4. 复测条款与首测同时约定。首测完成后再谈复测,供应商没有义务保持口径不变。
5. 合同里写明口径变更的处理方式,包括谁有权变更、变更后历史数据如何标注。
这个框架的三个局限
第一,一家机构可能同时提供三类交付,本文分的是产出物,不是机构;同一家公司的不同交付物仍应按各自的标准分别验收。
第二,本文只给验收方式,不给价格判断。什么价格合理取决于范围、样本量和证据等级,脱离这三项谈单价没有意义。
第三,市场在变,交付形态也在变,这份框架需要按年重新核对而不是长期照搬。