业务、位置、服务、联系方法、描述。检验AI能否正确建立品牌实体。
METHODOLOGY · REPRODUCIBLE BY DESIGN
我们怎么测
把一个会波动的AI回答,转化成可重复、可追溯、可比较的观测实验。这里公开问题设计、采样、缓存、实体识别、指标计算与证据边界。
01 · EXPERIMENT UNIT
先定义实验单位,避免把调用次数做大却没有信息增量
B/C/D公共问题不包含商户维度;同一回答同时提取所有出现的商户。
新增一家店只补品牌识别,不重跑整个行业公共问题。
02 · QUESTION TAXONOMY
20个问题,覆盖从“知道名字”到“准备做决定”
区域+品类的无品牌问题。检验商户是否进入自然候选集合。
推荐、比较、性价比和怎么选。检验高商业意图回答中的提及。
价格、周期、风险和差异原因。观察AI依赖的行业信息源。
03 · SAMPLING & VARIANCE
重复采样不是重复劳动,而是在估计生成式回答的方差
独立调用
B/C/D每题每平台执行3次,避免把一次偶然输出当成稳定结果。
商户集合重合率
用交集÷并集比较同题三次出现的商户集合,衡量答案稳定性。
平台拆分
豆包方舟与千问联网检索分别统计,不用一个平均数抹掉平台差异。
时间快照
模型、搜索索引与页面都会变化,所以每条结果保存UTC时间和模型名称。
04 · ENTITY RESOLUTION
实体解析:从自然语言回答中识别具体商户
以标准商户名为主键,aliases记录简称、旧名和常见写法;连锁品牌按“品牌主体+具体门店后缀”拆分。先做最长名称匹配,再处理简称,降低“薇拉”误命中其他文本的概率。同名、异地门店和旧地址仍进入人工复核。
canonical 天籁婚纱摄影
alias 天籁摄影
branch 武汉光谷店
guard 城市+地址+主体
05 · METRICS
指标公式与解释边界
正确识别的A类回答 ÷ A类成功调用衡量直接问品牌时能否正确识别,不代表主动推荐。
B类出现次数 ÷ B类成功调用衡量区域和品类问题中的自然出现。
C类出现次数 ÷ C类成功调用衡量强商业意图问题中的候选机会。
出现时位次总和 ÷ 出现次数只统计B/C,避免品牌问题天然靠前造成偏差。
06 · PROVENANCE
证据链:每个数字都能回到原始回答
保存原始回答、原始JSON、引用标题与网址、模型、轮次、搜索是否执行和费用信息。只有API原生返回的来源才标记为引用;正文里普通网址不伪装成原生引用。
07 · VALIDITY
有效性、偏差与人工抽检
固定问题、平台、模型、轮次和缓存身份,使同一实验内部可比较。
6家婚纱摄影样本中有的可能属于头部,不能外推为整个武汉行业规律。
官方API不等于消费者App;账号、位置、系统提示和灰度版本均可能改变结果。
高曝光与数字资产同时出现,只能视为线索;需要真实干预和同题复测才能讨论变化。
REPRODUCIBILITY
复现原则
同一题池文件一旦锁定就不自动覆盖;成功调用只追加、不覆盖;中断后从成功缓存继续;未锁定的新行业题池禁止产生付费调用。消费者App抽检与API实验分表保存。
查看按此方法生成的公开报告 →