报告是有限次提问的结果
一次诊断围绕一批提问样本,在几家大模型上各跑若干轮,把回答原文和引用来源记录下来做统计。它的性质就是抽样:样本覆盖到的意图里说得清楚,样本之外说不出。所以报告里任何一个百分比,完整表述都是「在这批提问、这几个平台、这次时间窗口内」的比例,去掉这三个限定词,它就不再是那个意思。
写清边界,数字才可用
抽样的价值不在给出绝对值,在于给出可对比的基线。同一套提问样本、同一组平台,过一段时间再跑一次,两次的差值才有解释空间。反过来,一次结果就被拿来承诺「三个月内全网首推」,那个数字已经超出了它能支撑的结论范围——这种话我们不建议客户拿去内部汇报,也很难在复盘时对上。
模型侧本来就在动
大模型的算法和索引持续更新,来源结构也会调整。某一家这次跑出来没有提到,不代表永远没有。这是我们保留原始回答、并且鼓励客户自己复现的原因:报告是一段时间的取样,不是判决书。
那这份报告用来做什么
三件具体的事,都不依赖绝对值大小:找出被引说法里失实的那几处,先去更正;找出几家平台共用的引用来源,优先补同一类型的供给;把提问样本按意图排开,看哪一类问题最影响成交、而官网上没有对应页面。这三件事的结论不会因为抽样局限而失效,也是诊断阶段真正该产出的东西。