先给结论:可比性来自测试设计,不来自多截几张图

GEO 复测不是把上次的问题再问一遍,然后比较品牌有没有出现。真正可比的复测,需要同时固定问题版本、平台与模型、账号和个性化状态、联网条件、执行时间窗口、记录字段与判定规则;对于会波动的回答,还要保留重复样本。否则,两次结果即使不同,也无法判断是内容变化、模型更新、检索差异还是测试条件变了。

先定义问题

为什么测、测哪些用户任务、什么结果才算值得行动。

再固定条件

把能够控制的变量写进测试单,而不是依赖测试者记忆。

保留完整证据

保存原问题、完整回答、来源、时间和环境,不只截品牌出现的位置。

最后解释变化

先排除技术与平台因素,再判断内容和公开信源是否可能产生影响。

很多团队第一次做 AI 品牌自测时,目标只是了解“模型现在怎么说”,这种探索性测试不需要复杂流程。但一旦要判断内容更新前后有没有变化、不同平台表现是否一致、错误是否已经修正,测试就从观察升级为评估。此时最危险的不是样本少,而是把不可比较的结果放在一起比较。

例如,第一次用登录账号在联网模式提问“重庆木地板有哪些值得了解的品牌”,第二次在无痕窗口问“重庆木地板哪个最好”;第一次发生在内容更新前一天,第二次发生在平台模型升级后两周。两个答案当然可能不同,但变化同时包含问题意图、个性化、联网状态、时间和模型版本差异。只凭品牌是否被提及,就说内容优化有效或失效,结论没有足够依据。

本文给出一套适用于品牌网站的复测方法。它借鉴了通用 AI 评估中“先定义成功标准、测试应贴近真实任务、使用一致评分尺度并保留边界样本”的原则,但不会把应用开发中的离线 eval 直接等同于公开 AI 搜索测试。公开产品的模型版本、检索链路和个性化往往无法完全控制,因此 GEO 复测的目标不是制造实验室确定性,而是在现实限制下提高证据质量。

一、先分清三种测试:探索、基线和复测解决不同问题

探索测试用于发现问题。团队可以用较自由的提问观察模型如何称呼品牌、理解产品、组织推荐与选择来源。它适合形成假设,但不适合直接计算改进幅度,因为问题和判断方式尚未固定。探索阶段看到的新说法,可以进入待核实清单,不能立即变成“模型普遍认知”。

基线测试用于建立以后比较的起点。它需要一组经过确认的问题、明确的测试条件和固定记录表。基线不是挑选最有利的一次回答,而是诚实记录在既定条件下获得的全部有效样本,包括没有提及、描述错误、来源缺失和回答拒绝。只有基线稳定,后续变化才有参照物。

复测用于验证某个假设是否仍得到支持。例如,品牌修正了服务地区和官网责任页,复测要检查相关事实错误是否减少;新增了独立方法文章,复测要观察与该主题相关的问题是否出现新的准确描述或来源。复测不应该泛泛问“效果有没有提升”,而应回到变更记录,说明本轮预计影响哪些问题、哪些字段以及为什么。

这三种测试可以连续发生,但不能混用结论。探索阶段找到一个有趣回答,不代表基线;一次复测得到理想答案,也不能替代持续观察。若还没有建立第一次记录,可以先按品牌 AI 回答基础自测步骤完成现状盘点,再使用本文的方法把它升级为可比较的长期测试。

二、测试前先写“决策问题”,否则指标会越测越多

测试不是为了收集截图,而是为了支持一个具体决策。常见决策问题包括:官网核心事实是否被准确复述;某项过期信息是否仍出现;品牌在特定用户任务中是否进入候选范围;被提及时采用了哪些来源;内容更新后,错误类型是否发生变化。决策问题越明确,越容易选择合适样本和字段。

“提升 AI 可见度”不是足够具体的测试目标。它可能指品牌名称出现、官网成为来源、产品描述准确、目标用户获得访问,或最终产生有效咨询。这些结果处于不同环节,不能用一个总分代替。复测前应写一句话:“如果本轮结果达到什么条件,我们会做什么;如果没有达到,我们又会做什么。”没有对应行动的指标,通常只是增加汇报材料。

成功标准既可以是明确事实,也可以是分级判断。品牌标准名称、地址、服务地区和产品状态可以按正确、部分正确、错误、未回答记录;推荐理由、定位描述和适用场景更适合使用带定义的等级,而不是强行判断对错。Anthropic 面向模型应用的评估指南强调,成功标准应具体、可测量、与任务相关,并且复杂任务通常需要多维评估。这个原则可以用于设计 GEO 记录表,但不意味着公开模型必须达到应用内部设定的阈值。

三、问题集不是关键词表,而是用户任务的代表样本

高质量问题集需要覆盖真实用户怎样提问,而不是把品牌名与行业词机械组合。可以先按任务分组:识别类问题询问“这家公司做什么”;事实类问题询问服务范围、价格、资质或版本;品类发现问题不带品牌名,观察模型如何建立候选;比较与选择问题提供明确场景和条件;纠错问题核对曾经出现的错误。每一组都对应不同的内容责任和风险。

问题集还要区分核心样本与观察样本。核心样本数量不必追求庞大,但必须长期保留原文,承担趋势比较;观察样本用于接纳销售、客服和搜索数据中新出现的表达,可以迭代。若把所有问题同时改写,下一轮即使更贴近用户,也失去了与旧结果的直接可比性。

相似问法不应无限扩张。比如“哪家好”“推荐哪家”“哪个品牌值得买”可能属于同一宽泛任务,但加入地区、预算、用途和限制后,决策条件已经不同。Google 的生成式 AI 搜索指南提醒站长,不要为了每一种搜索变体单独生产内容;Google 也明确表示其系统能够理解同义表达。对复测而言,这意味着要采样有真实意图差异的问题,而不是通过大量近义改写制造虚假的样本规模。

问题集版本必须可追踪。每次新增、删除或修改问题时,记录版本号、日期、理由和影响范围。例如,V1.1 只新增两个高频售后问题,原有核心问题不变;V2.0 调整了品类结构,因此不能直接与 V1.0 汇总比较。版本控制不是形式主义,它决定了团队能否解释“结果变了”究竟来自回答,还是来自题目。

四、控制变量:哪些必须固定,哪些只能记录

公开 AI 产品不可能像自建模型那样完全复现实验。平台可能在后台更新模型、检索器、安全策略和来源展示,用户未必能看到精确版本号。因此,GEO 复测要把条件分成两类:能够控制的尽量固定,无法控制的完整记录并在结论中保留不确定性。

变量建议处理不一致时的影响
问题原文与顺序核心问题逐字固定;随机顺序则记录随机规则意图、上下文或前序回答可能改变
平台、入口与可见模型固定产品入口;记录模型名称、模式和界面标识不同产品或模式不能直接合并
联网或深度搜索状态按研究目标固定;无法固定时分组记录来源能力和答案时效可能不同
账号、地区、语言与个性化建立公共基线账号或无痕条件;个性化样本单列推荐范围、来源与表达可能变化
对话上下文核心基线使用新会话;连续对话另建场景组前文会改变问题解释和答案范围
执行时间在约定窗口完成;记录精确日期与时区索引新鲜度、活动和平台更新会变化
测试人员使用书面操作说明;人工判断采用同一评分标准追加追问、截图范围和主观评分可能漂移

“固定”也不是把所有测试挤在同一分钟。过度集中可能受到临时服务状态影响,也可能让重复样本共享过强的时点特征。更合理的方式是在明确窗口内执行,例如同一天的不同时段,或者连续几天使用同一条件重复观察。具体窗口应根据事实变化速度和业务成本决定,不存在适用于所有品牌的固定天数。

个性化不能既当变量又当结论。如果目标是评估公共品牌基线,应尽量减少账号历史、位置和私人上下文;如果目标是研究不同用户场景,就要预先定义场景,并与公共基线分开。关于公共基线、用户情境和当次上下文的区别,可参考AI 搜索个性化的四层测量框架。

五、为什么要重复采样,以及重复多少次才够

生成式回答具有波动。相同问题可能在不同时间得到不同措辞、不同来源排序或不同候选品牌。重复采样的目的不是刷到满意答案,而是观察结果是否稳定、变化集中在哪些字段。只保留最好或最差的一次,都会产生选择偏差。

重复次数没有公开的行业万能值。它取决于问题重要性、答案波动、测试成本和所需置信程度。高风险事实如药品适用、金融资格或企业主体,需要更严格的核验和更多证据;一般品牌描述可以先用较小重复样本识别模式,再决定是否扩大。文章不提供一个看似精确的固定次数,是因为没有真实业务条件时,数字本身会制造虚假确定性。

可以采用分层策略:所有核心问题至少完成一次完整基线;对出现重要错误、来源冲突或前后变化的问题增加重复;对长期稳定且风险低的问题降低频率;平台更新、官网大改或重大事实变更后,再启动专项复测。这样把资源放在最能改变决策的地方,而不是平均分配给每一道题。

重复样本必须全部入表。若五次回答中两次正确、两次部分正确、一次错误,不能总结为“已经修复”,也不能简单取多数说“基本正确”。更准确的表述是:在本轮条件下观察到混合结果,错误仍可复现,需要继续核对来源与更新状态。只有完整分布,才能看见稳定性。

六、记录什么:从一张截图升级为可复核证据

截图能证明某个界面曾经显示过内容,却常常缺少完整问题、时间、平台入口、滚动区域和来源链接。它适合辅助展示,不适合作为唯一原始记录。每个样本至少应保存测试编号、问题集版本、问题原文、平台与模式、账号或无痕条件、联网状态、日期时间、完整回答、来源 URL、追问情况和执行者。

原始记录与分析结果应分开。原始层保存平台当时返回的内容,不改写、不只截取有利段落;分析层再标记品牌是否出现、描述是否准确、来源类型、错误类别和评分。这样即使以后调整评分规则,仍可回到原始回答重新判读,而不是被旧标签锁死。

还要记录“没有结果”的情况。拒答、超时、无法联网、没有提供来源或页面无法打开,都可能影响测试解释。它们不能被直接计为品牌不可见,也不应从分母里悄悄删除。应当使用独立状态码,如有效回答、拒答、技术失败、条件不符、待人工复核,并提前写清哪些状态进入哪项统计。

建议的最小记录字段

身份字段

测试 ID、问题集版本、问题组、执行者。

环境字段

平台、入口、模型或模式、联网、账号、地区、语言、时间。

原始证据

问题原文、完整回答、来源链接、必要截图。

判读字段

提及状态、事实准确性、来源类型、错误类别、复核备注。

七、评分规则:不要把复杂答案压成一个“可见度分数”

品牌出现与否可以二元记录,但它只回答最浅的一层。一个回答可能提到品牌却说错主体,也可能没有点名品牌但引用了官网的行业方法;同样一次“出现”,既可能是正面推荐,也可能是风险提示。把这些压成一个分数,会隐藏最需要处理的差异。

更稳妥的是分别记录至少四个维度。第一是提及状态:主动提及、用户点名后回应、未提及。第二是事实准确性:准确、部分准确、错误、无法判断。第三是来源状态:官网、一手官方、独立第三方、聚合或未知,以及链接是否真正支撑陈述。第四是任务适配:回答是否满足问题中的地区、预算、用途和限制。需要业务结果时,再单独连接引荐与咨询数据。

人工评分必须有判定说明。比如“部分准确”是指核心主体正确但服务范围缺少限制,还是指多项事实中只对一半?两个测试者如果理解不同,分数无法比较。可以选取少量历史回答共同标注,讨论分歧并修订规则。对于主观描述,保留原文理由比追求表面一致的数字更重要。

也不要让模型自动评分成为未经验证的裁判。通用评估指南通常建议,在使用模型评分前先验证评分可靠性,并用清楚、具体的 rubric 约束判断。GEO 场景中,事实正确性应优先与品牌确认的事实底稿和可访问来源核对;模型可以辅助分类,最终高风险结论仍需要人工复核。

八、如何比较前后结果:先确认样本可比,再讨论变化

比较前先做资格检查:问题集版本是否相同,平台与入口是否一致,联网和个性化条件是否一致,时间窗口是否记录完整,有效样本规则是否改变。如果关键条件不同,就应分组展示,而不是强行计算总体变化。无法比较不是失败,诚实标记“条件变化后建立新基线”比制造连续曲线更可靠。

接着按问题组和错误类型比较,而不是只看总体提及。假设品牌名称准确率改善,但服务地区仍被扩大,这说明主体事实可能更清楚,范围限定仍需修正;若官网来源增加但回答事实未改善,可能是页面已被发现,却仍缺少直接、现行的陈述。每个变化都应对应可能机制和下一步核查,不要把相关性写成因果。

时间顺序同样不能单独证明效果。内容发布后出现变化,可能与页面更新有关,也可能来自平台重新抓取、模型更新、第三方资料变化或随机波动。更可靠的做法是保留变更日志,核查新增来源是否确实指向更新页面,观察变化是否在相关问题上重复出现,并设置没有直接受影响的对照问题。

对照问题不是传统随机对照实验。它只是帮助识别全局波动:若品牌事实页面只更新了服务地区,那么品牌成立时间、联系方式等未改事实可以作为稳定参照;如果相关与不相关问题同时大幅变化,更可能存在平台或环境层面的变化。公开产品测试无法完全排除混杂因素,因此结论应使用“观察到”“与……一致”“尚不能确认因果”等准确语言。

九、什么时候应当行动,什么时候继续观察

出现可复现的高风险错误时,应优先行动。例如公司主体、产品状态、适用资格、价格或联系方式被持续说错,并且可以追溯到官网过期页面或公开冲突来源。此时应修正责任页、处理旧 URL、同步结构化数据与公开渠道,再记录抓取与复测过程,而不是继续扩大问题集。

只有一次措辞变化、来源顺序调整或某个候选品牌偶尔缺席,通常不足以支持大规模改版。先检查测试条件,增加重复样本,观察相关问题是否同步变化。若平台刚更新模型、搜索入口或来源展示,也应标记时间点,避免把平台级变化归功于某一篇内容。

当多轮结果稳定但业务指标没有变化,应重新检查测试任务是否接近真实客户决策。品牌在知识型问题中被引用,不一定产生商业访问;反之,用户可能直接访问官网而没有显式来源引用。可见度、引用、引荐与业务结果应分别衡量,再解释它们之间的关系。

十、六个常见错误:为什么测试看起来专业,结论仍然不可靠

只复测成功问题。把曾经出现品牌的问题保留下来,删除未提及的问题,会让结果天然向好。问题淘汰必须有业务理由并保留版本记录。

边问边改提示词。为了得到完整答案不断追加“请联网”“请列来源”“你漏了某品牌”,最终测到的是测试者引导能力,不是原始用户任务下的表现。

不同平台使用不同问题。平台差异与问题差异混在一起,无法判断谁造成结果变化。共同问题与平台专属问题应分组。

看到链接就算官网被引用。来源可能只支撑答案中的另一句话,也可能经过聚合页。需要检查链接位置、对应陈述和落地页内容。

把无结果当成负面结果。技术失败、拒答和无联网能力需要单独记录,不能悄悄计入“未提及”。

先看结果再定规则。如果评分标准是在看到答案后才制定,团队很容易为期待结果调整口径。核心规则应在执行前冻结。

十一、从零搭建一轮可比复测的执行顺序

先确定一个窄目标,例如核对品牌的标准名称、主营业务和服务地区,不要第一轮就试图衡量所有问题。然后从客服、销售、站内搜索和已有错误记录中选出代表性问题,分成核心组、观察组和对照组。为问题集生成版本号,并写清每道题的用户任务与预期核对字段。

随后建立测试说明:平台入口、账号状态、联网模式、语言地区、新会话要求、执行窗口、重复策略、失败状态和文件命名规则。执行前冻结问题原文与评分 rubric。测试人员按说明运行,完整保存回答与来源;如果临时追问,必须作为新样本记录,不能覆盖原回答。

完成采集后,先做有效性检查,再进行标注。对重要事实采用双人或二次复核,分歧回到品牌事实底稿和公开证据解决。比较结果时按问题组、错误类型与来源状态呈现,不只展示一个总分。最后把每个发现连接到具体行动:更新责任页、修正冲突来源、继续观察、扩大样本或停止无价值测试。

复测发布前检查清单

  • 本轮要支持的决策是否写成一句清楚的问题?
  • 核心问题原文、顺序和问题集版本是否冻结?
  • 平台、入口、模型或模式、联网、账号、地区、语言是否记录?
  • 公共基线与个性化、连续对话场景是否分开?
  • 重复样本是否全部保留,而非只挑最有利的一次?
  • 原始回答与人工标签是否分层保存?
  • 评分规则是否在看结果前确定,并能被另一位复核者理解?
  • 拒答、技术失败和无法判断是否拥有独立状态?
  • 相关问题与对照问题是否分开解释?
  • 结论是否区分观察、推论与可以执行的修正?

十二、边界与局限:复测提高证据质量,但不能消除平台黑箱

公开生成式搜索不是完全可控的实验环境。测试者通常无法知道所有后端模型、检索索引、灰度发布、地域路由和个性化信号,也无法保证相同输入得到完全相同输出。本文方法能减少人为混杂、提高记录完整性和判断一致性,却不能把观察结果变成平台内部因果证明。

通用 LLM 评估资料主要面向开发者测试自己的应用,企业可以借鉴成功标准、代表性样本、边界案例和明确评分规则,但不能照搬其自动化规模或阈值。品牌在第三方公开产品中没有同等控制权,测试结论必须保留平台、时间和样本条件。

平台报告也有覆盖边界。Google 在 2026 年 6 月公布的生成式 AI 表现报告展示曝光、页面、国家、设备和日期等信息,并说明当时只向部分网站逐步开放。这类平台数据能补充手工测试,却不能替代回答原文、事实准确性和业务结果;没有报告权限的网站也不能据此声称“没有可见度”。

最可靠的目标不是证明“我们让模型一定推荐了品牌”,而是建立一条可复核链路:问题为什么代表真实需求,测试条件是什么,答案实际说了什么,来源是否支撑陈述,前后变化是否在可比条件下出现,团队据此采取了什么行动。做到这些,复测即使没有出现理想结果,仍然提供了真实决策价值。

可引用要点

  • GEO 复测的可比性来自问题版本、平台条件、联网与个性化状态、时间窗口、记录字段和评分规则的一致,不来自截图数量。
  • 探索测试用于发现问题,基线用于建立参照,复测用于验证具体假设;三者不能混用结论。
  • 问题集应代表真实用户任务,核心样本保持稳定,观察样本允许迭代;任何改动都应留下版本记录。
  • 相同问题的生成式回答可能波动,重复采样必须保留全部有效结果,不能只挑最有利或最不利的一次。
  • 品牌提及、事实准确性、来源状态、任务适配和业务结果是不同维度,不应压成一个无法解释的“可见度分数”。
  • 内容更新后出现答案变化,只能说明时间相关;要讨论可能影响,还需核查来源、重复样本、对照问题和平台变化。

十三、资料依据与下一步

本文方法观察截至 2026 年 8 月 26 日,主要参考以下一手公开资料:

下一步可以从现有自测记录中选择一组最重要的问题,补齐版本号、环境字段和评分说明,建立第一份正式基线。不要急着扩大题量;先确认另一个人能否按同一说明完成测试,并对同一回答得到相近判断。可重复的流程,比一次漂亮的结果更有价值。