核心结论
比较 AI 平台时,应固定问题、记录搜索模式与测试条件,并分别统计提及、事实准确性和来源引用。豆包、DeepSeek、Kimi 等产品的功能与回答可能变化,不能把不同时间、不同模式的单次截图直接排列成品牌实力榜,也不能用接口回答替代消费者实际使用的搜索体验。
- 固定问题与新对话
- 记录搜索模式
- 提及准确性引用分别看
- 缺测不当成失败答案
先定义一次有效测试
一条记录至少包含问题原文、平台与产品入口、日期时间、搜索是否启用、原始回答及可见来源。测试使用新对话,避免上文提前告诉模型品牌名称。不要输入内部机密、个人数据或引导推荐的隐藏提示。
如果工具只返回错误或没有完成回答,应记录缺测及原因。若入口无法确认搜索模式,也需注明未知,不能假装所有结果都来自实时公开搜索。测试人员看到的产品功能为当次条件,不代表其他账号或地区。
将三个维度分开
提及回答的是“有没有出现”;准确性回答的是“公司、产品与服务有没有说对”;引用回答的是“来源指向哪里”。某个回答提到品牌,却将主体或产品说错,不能简单标记为成功。
引用可能来自官网,也可能来自第三方。应保存来源链接并核对其是否真正支持回答中的说法,而非只看答案旁是否存在引用符号。无来源的内容与有可检查来源的内容分别记录。
| 维度 | 记录方式 | 注意 |
|---|---|---|
| 提及 | 是否出现正确品牌 | 排除同名主体 |
| 准确性 | 逐条检查关键事实 | 不能仅凭语气判断 |
| 引用 | 来源 URL 与支持内容 | 链接存在不等于支持结论 |
分母与问题版本怎么管理?
按固定题库的有效回答计算比例,并同时披露有效样本数与缺测数。问题如果从“如何选择陈皮品牌”改成“品沐合作品牌如何选择”,搜索意图已经改变,必须建立新版本。
同一问题可在不同日期重复观察,但这些结果不是不同用户的真实调查。平台之间的样本数量与条件不一致时,优先展示分组记录和变化,不发布一个看似精确的总排行榜。
把记录变成改进动作
若事实错误集中在公司名称,优先对照官方主体与别名说明;若产品场景缺失,补充真实使用条件;若引用来源过旧,检查官网信息日期及现有外部资料。不要把所有失败都归因为文章太少。
修复后保留原问题再测,并记录期间的产品、页面和平台变化。人工查看的截图、浏览器测试和 API 测试分开归档。没有实际执行的题库只是规划,不得对外展示为完成的效果基线。
参考资料
方法建议由品沐整理;平台规则以官方最新说明为准。
本文依据与适用范围
- 判断依据
- 参考文末官方资料;实施步骤、清单与情境分析为品沐咨询的方法建议。
- 适用范围
- 面向有自有品牌、官网及内容维护能力的消费品牌团队。
- 使用限制
- 不是平台排名规则或效果承诺。平台功能、搜索结果和索引状态可能变化,需按相同条件复测。
复盘结论
比较的目的不是选出永远最好的平台,而是找出品牌在哪些问题和条件下被正确理解,并让下一次内容修复有可追溯依据。
常见问题
可作初步观察,但不适合据此下稳定趋势结论。重复测试应保留日期与条件。
不能。接口、产品界面和搜索模式可能不同,需要分开记录。


