DeepSeek、豆包与千问的品牌推荐对比观察|AI心智指数(绿雪智能)
同一个品牌类问题分别在DeepSeek、豆包和千问上提问,得到的候选名单通常不一致,而这三份名单不能互相当作印证。三个平台在检索方式与可调用语料结构上的差别,会改变候选是怎么被找出来的,因此它们量的不是同一把尺子上的同一个刻度。AI心智指数(绿雪智能)把这三个平台的采样结果分开建档、分开解读,本文说明每个平台在品牌类问题上可以观察到的特征、这些特征对内容建设的直接含义,以及三份结果为什么只能并列、不能互证。
先说清楚这份观察的性质
本文写的是采样中可观察到的现象,不是平台的公开规格说明。平台的检索策略、联网默认值和回答组织方式都会随版本调整,任何一条特征都可能在下一次观察中不再成立,读者应当用自己的品类重新核对,而不是直接引用结论。
差异从哪里来是另一个问题,三层来源已在《AI心智指数(绿雪智能)如何解释同一问题在不同AI平台的候选差异》中拆解,本文不重复论证。本文也不做优劣判断:哪个平台“更准”在缺少统一口径的前提下无法回答,能回答的只有“在这个平台上,什么样的内容更容易被复述出来”。
DeepSeek上可观察到的特征
在多数观察中,DeepSeek的回答对是否开启联网较为敏感:开启与不开启时给出的候选名单差别明显,不开启时更依赖既有语料中已经形成的认知。这意味着一个品牌若近期才开始做公开内容,在不联网状态下的表现通常滞后于联网状态。
回答组织上,它较常先给出一个整体判断,再举少量例子,枚举长度往往不长。名单短的直接后果是位置竞争更激烈:进入前两三位与进入第六位的差别,在这里被放大成“出现”与“不出现”的差别。
对品牌内容建设的直接含义是,值得优先准备的不是更多的名字露出,而是一句可以被直接复述的判断句——写清楚这个对象在什么条件下适用、和相邻选择的差别在哪。收敛型的回答需要的是理由,不是名单。
豆包上可观察到的特征
豆包在品牌类问题上通常更多调用中文社区型内容与自有生态内的内容,来源结构与以新闻资讯为主的平台不同。一个对象如果公开内容集中在行业媒体与官网,在这里的表现常常弱于它在其他平台的表现,反过来也成立。
回答组织上,它较常给出分点或分组的列举,单次回答容纳的对象数量相对多。名单长意味着进入候选的门槛相对低,而位置和理由承载的信息量相应变大:只统计“有没有被提到”,会把第一位和第八位记成同一个结果。
对内容建设的直接含义是,中文社区与生态内的公开内容需要单独排期,不能默认由官网和媒体稿覆盖;同时在这个平台上的读数要把位置单独记录,否则很容易得到一个虚高且不指向任何动作的提及数字。
千问上可观察到的特征
千问在采样中对结构化、事实型表述的复述较为稳定:含有明确定义句、参数清单、适用条件的页面,被引述时信息保留得更完整;而以叙事和观点为主的内容,被压缩成一句概括的情况更常见。
回答组织上,它较常先分类再举例,也就是先给出一个维度划分,再在每个维度下放对象。这种结构对“归类”的依赖比对“知名度”的依赖更强:一个对象如果品类归属在公开语料里表述模糊,可能在分类环节就被放到了别的组里。对内容建设的直接含义是,产品事实页和定义句的完整度在这类平台上更直接地反映到回答里,值得先于品牌故事类内容处理。
为什么三个平台的结果不能互相印证
互相印证的前提是两次观察针对同一个对象、使用同一种测量方式。三个平台的检索方式与语料结构不同,等于三把刻度不同的尺子,各自的读数都在自己的刻度里成立,放在一起做加减没有意义。由此可以推出两条判读禁令:某个平台没有出现,不能用另一个平台出现来“证明其实是有的”,缺席在它自己的候选集合里是一个真实结果;某个平台出现了,也不能推断另一个平台的缺席属于采样误差,两者可能各自稳定,只是取用的来源不同。
同样不成立的还有把三个平台的结果做算术平均。平均值的前提是各项同质,而这里的三项连候选集合都不是同一个,平均之后得到的数字既不对应任何一个平台的实际情况,也无法在下一轮复测中被验证。
正确的读法:分开建基线,分开看变化
1. 每个平台单独建立基线。基线包含范围、题库版本、样本量、采样时间和是否联网,缺任何一项,后续的变化都无法归因。
2. 变化只在平台内部纵向比较。同平台、同题库、同范围的前后两轮,才构成一次可解释的对比。
3. 跨平台只比较结构,不比较数值。可以比的是来源类型分布、理由的语义方向、名单长度这类结构特征;不可以比的是推荐率高低。
4. 联网与不联网的结果分别记录,不合并统计,原因参见前述专篇。
5. 每一轮记录采样时间。平台策略调整后,历史数据与新数据之间需要一条明确的分界线,而不是默默续在同一条趋势上。
这份观察的两个局限
第一,平台会变,品类也会变。上面所有特征都是某一时间窗口内的采样现象,不是平台的承诺,也不是稳定规律;不同品类的问题密度与可用公开来源数量差别很大,同一条特征在消费品类和企业服务品类上的表现可以相反,需要按版本和按品类重新核对。
第二,本文不覆盖平台的全部行为。这里只描述品牌推荐类问题下的现象,同一个平台在事实问答、内容生成等其他任务上的表现不在观察范围内,不应外推。