一、能不能被别的来源印证
模型不会因为你自己的官网写了就相信。它看到的是「除了你自述,还有没有别人这么说、说法是否一致」。所以同一套事实出现在行业媒体、测评内容、问答社区、目录型站点上,并且口径统一,可信度才成立。反过来,只在自家页面出现的信息,权重接近于零。
这也是为什么单靠一篇通稿解决不了问题:交叉印证需要的是分布在不同性质来源上的同口径内容。
二、结构能不能被摘出来
模型在生成答案时会摘录片段。一段把适用范围、参数区间、限制条件、验证方式写清楚的文字,很容易被整段摘走;一段只讲「行业领先」「品质卓越」的文字,摘出来没有任何信息量,也就不会被摘。
可操作的检查方法很朴素:把段落的第一句单独拿出来看,它是否是一个能独立成立的结论。如果第一句必须靠上下文才能读懂,这段文字对模型不友好。
三、时间上够不够新
产品迭代、价格调整、资质换证之后,旧语料仍然留在模型能读到的来源里。如果新内容没有出现在权重更高的位置,模型会继续引用旧版本——很多「AI 说我们的信息是错的」的投诉,实际是自家更新没跟上。定期回看关键事实在各来源上的时间戳,是维护阶段的基本动作。
四、和提问场景是否贴得上
用户不会用你的产品全称提问。他会说用途、说预算、说约束:「车间要检金属件表面划痕,用什么设备合适」。内容里如果没有把这些约束写进去,模型很难判断你和这个问题有关。挖掘提问场景这件事,比铺关键词更费力,但它是命中率的直接来源。
四条之间是乘法关系
不是补一条就够。缺印证会让模型不敢引;结构乱会让它摘不出;过期会让它引错;和场景不贴会让它想不到你。诊断的价值正在于此——把这四项分别打分,才知道该修的到底是哪一项。