单次结果为什么会抖
大模型的回答不是数据库查询。提问措辞的细微差异、检索当时命中的页面、模型侧索引的更新,都会让名单变化。跑一次拿到「未提及」,能确定的信息很有限:可能真的没进它采信的来源,也可能这一轮它引的三篇刚好没覆盖这个品类。
能对比的前提是样本不动
今天用「打标机哪家好」,明天改成「金属打标设备推荐」,两组数字放在一起没有意义。提问样本要从真实成交链路里挑出来,覆盖选型、对比、价格、售后、本地服务几类意图,定下来一段时间不改。改了就得重新起算,之前的记录只能当历史看。
看走势,也看每次读了谁
除了品牌有没有出现、排在第几,还要记下当次的参考来源。两种抖动要分开处理:名单在抖但来源结构稳定,问题多半在内容供给;来源结构本身大幅变动,说明这个品类的语料就不稳定,判断依据得另找。
每条结论都要能翻回原文
提问指令、AI 回答全文、引用列表、判定依据,这几样要一起存下来,报表上的数字才有地方可查。这一步听起来像工程细节,实际是信任问题:客户自己复现一遍对不上,前面的结论就全部作废。导出的监测记录里带着判定理由这一列,就是为这个留的。