你不用等我们,也不用任何工具。打开 DeepSeek,问几个问题,十分钟就能看到——当用户向 AI 打听你这个行业、甚至直接打听你公司时,AI 到底怎么说你。这篇就教你怎么问、看什么、怎么读结果。
先说结论:这不是测排名,而是看 AI 怎么理解你
一次有效的自测,不是只问“你知道我吗”,也不是看到品牌名出现就结束。你要同时看三件事:模型有没有把你放进正确的品类、它依据什么描述你、不同问法下这个判断是否稳定。
直接点名,检查基本事实、定位和业务边界。
不说品牌名,看模型会不会主动把你列为候选。
通过对比问题,看模型用哪些信息帮助用户判断。
为什么这件事值得花十分钟
越来越多人不再用搜索引擎查东西,而是直接问 AI:"这家公司靠谱吗""国内做这个的有哪些"。AI 的那段回答,往往就是用户对你的第一印象。问题是:你大概率从没看过,AI 在背着你怎么描述你。先看到,才谈得上改。
传统搜索结果通常把多个页面并排给用户,用户还要自己点开、比较和判断。AI 回答更像一次整理后的口头建议:它会先归纳信息,再给出有限的候选和理由。品牌即使有官网、有公众号、有平台页面,也不代表模型已经把这些信息拼成了一个清楚的认知。
所以,自测的价值不只是确认“有没有被提到”。它还能暴露三个更具体的问题:模型认错了你是谁、模型知道你但说得不完整、模型在品类选择时想不到你。三种问题看起来都像“效果不好”,后续动作却完全不同。
还要注意,一次回答只是一个时间点的快照。模型版本、联网状态、问题措辞和可访问的公开信息都可能影响答案。自测不是为了找到一个永远不变的分数,而是建立一套以后还能重复使用的观察方法。
01开始前,先把测试条件写清楚
如果同一轮测试里不断换模型、换问题、换联网状态,最后很难判断差异来自哪里。开始前先建一张简单记录表,把测试条件固定下来。至少写清楚模型名称、是否联网、提问原文、提问时间和完整回答。
品牌信息也要先准备一份“事实底稿”。不用写成宣传稿,只列出官网可以核实的内容:品牌全称、主营业务、服务对象、覆盖区域、核心产品或服务,以及已经公开的联系方式。后面判断 AI 说得准不准,就以这份底稿为准,而不是凭印象争论。
测试原则:一轮里只改变一个变量。想比较不同模型,就使用同一问题;想比较不同问法,就尽量使用同一模型和同一联网状态。
不要在问题里提前塞入结论。例如,不要问“为什么 XX 是最专业的品牌”,这种问法已经替模型做了判断。更有价值的问法是“XX 是做什么的”“这个品类有哪些选择”“选择时应该看什么”。
02怎么测:问这 3 类问题
打开 DeepSeek(豆包、Kimi、文心一言都行,方法一样)。把"你的品牌""你的行业"替换成自己的,依次问下面三类。
第一类,直接点名问你。
- 「XX 这家公司是做什么的?」
- 「XX 怎么样,值得选吗?」
看 AI 描述得准不准——业务说对了吗,有没有把你和别家搞混,有没有引用过时的信息。
直接点名题主要检查“实体识别”。除了业务介绍,还可以继续追问服务对象、主要产品、所在地区和适用场景。重点不是回答写得漂不漂亮,而是每一个关键事实能不能在公开页面里找到依据。
如果模型把同名公司、旧品牌或无关业务混进来,先记录错误原句和引用来源。不要急着连续纠正模型,因为这一轮的目标是观察它原本掌握了什么,而不是现场把它教会。
第二类,只问品类,不提你。
- 「国内做 XX 的,有哪些比较靠谱?」
- 「想找 XX,推荐几个。」
这一类最关键:用户其实大多是这么问的。看 AI 会不会主动提到你。不提,说明在 AI 眼里你还不算这个品类里的答案。
品类题要尽量接近真实购买场景。除了宽泛的“有哪些品牌”,还可以加入地区、使用对象、预算关注点或服务要求。例如,本地服务可以带城市,企业服务可以说明团队规模或业务阶段。这样能看出模型究竟在什么语境下会想到你。
没有被提到并不自动等于品牌差,也不能只凭一次回答下结论。更稳妥的做法是保留同一意图,换一种自然说法再问,并观察候选名单和推荐理由是否反复出现相似模式。
第三类,问对比和选择。
- 「XX 和 YY 比,怎么选?」
看 AI 站在什么信息上替用户做判断,那些信息是不是对你有利、是不是最新的。
对比题最容易暴露信息结构问题。模型可能知道两家公司,却只能复述其中一家的产品、价格或适用场景;也可能引用第三方旧文章,把已经变化的业务当成现状。记录的不只是“它推荐谁”,还要记录“它为什么这样推荐”。
03同一个问题,怎样问得更接近真实用户
测试问题最好覆盖从了解、筛选到决策的完整路径。了解阶段的用户会问“这是做什么的”;筛选阶段会问“有哪些选择”;决策阶段会问“怎么选、适合谁、差别在哪里”。只测其中一个阶段,看到的只是品牌认知的一部分。
可以为每个核心问题准备几种自然变体,但不要为了凑数量机械换词。有效的变体应该保持同一意图,同时改变用户表达方式,例如从正式描述换成口语、从宽泛品类换成具体场景、从品牌视角换成购买者视角。
- 事实型问法:这家公司做什么、服务谁、覆盖哪些场景。
- 发现型问法:某个品类有哪些选择、某个地区有哪些服务商。
- 评估型问法:选择这类服务要看什么、常见差异是什么。
- 对比型问法:两个候选分别适合什么情况、各自信息是否完整。
不要把品牌名称写错,也不要用只有内部团队才懂的业务简称。用户不会这样问,模型也可能因此匹配到错误实体。测试题越贴近真实语言,结果越能帮助你判断公开内容是否有效。
04每次都记下这四件事
测的时候别只看个热闹,把这四项记下来,记录本身就是你的第一份诊断:
- 有没有提到你——尤其是第二类不点名的问题里。
- 描述对不对——业务、定位、卖点有没有说错或说旧。
- 引用了谁——AI 经常会带出处,记下它引的是哪个网站的域名。
- 稳不稳——同一个问题换种说法再问一遍,答案是不是一致。
建议保留完整回答,而不是只在表格里写“好”或“不好”。一段原始回答能帮助你以后复盘:当时模型用了哪些词、错误从哪里来、后续变化发生在哪一句。截图可以辅助留档,但最好同时保存可搜索的文字。
| 记录项 | 具体写什么 | 为什么重要 |
|---|---|---|
| 测试条件 | 模型、联网状态、提问原文和测试时间。 | 保证后续复测时知道哪些条件发生了变化。 |
| 品牌提及 | 是否出现、出现在哪个位置、处于什么语境。 | 区分被动回答品牌问题和主动进入品类候选。 |
| 事实准确性 | 正确事实、遗漏信息、错误信息和过时信息。 | 帮助定位需要更新或补充的公开内容。 |
| 选择理由 | 模型用什么标准介绍、比较或推荐候选。 | 看品牌是否提供了用户决策真正需要的信息。 |
| 引用来源 | 页面标题、域名以及来源是否还能正常访问。 | 判断哪些公开页面正在影响模型理解。 |
| 重复表现 | 换一种自然问法后,核心事实和判断是否一致。 | 判断模型认知是偶然出现还是相对稳定。 |
05怎么读结果
几种常见情况,背后的含义不一样:
- 完全没提到你:不是 AI 针对你,是它手里没有"可引用的你方信息"。它只会从已有的公开内容里挑答案,你不在里面,自然不会被选。
- 提到了,但说得过时或不准:AI 引的是旧页面,或者第三方对你的描述,而不是你自己说清楚的版本。
- 只在某一个模型里出现:说明你的信息在不同模型的信源覆盖不均,有的模型"看得到"你,有的看不到。
- 每次答得都不一样:AI 对你的认知还不稳定,没有形成一个确定的说法。
读结果时,可以把问题分成四层。第一层是“身份层”:模型有没有认准品牌是谁;第二层是“事实层”:主营业务、产品和服务范围是否正确;第三层是“品类层”:用户不点名时,模型会不会把品牌放进相关候选;第四层是“证据层”:回答依据是否来自清楚、可信且仍然有效的公开页面。
身份层和事实层有问题,通常要先统一官网与各公开页面的基础信息。身份正确但品类题里不出现,往往说明内容只会介绍“我们是谁”,却没有回答用户在具体场景里“为什么需要你、怎么选择你”。引用来源混乱,则要进一步检查旧页面、第三方资料和不同渠道之间是否互相矛盾。
不要把所有问题都归结成“发得不够多”。内容数量不是唯一变量。重复的宣传稿、缺少事实依据的自夸、互相矛盾的产品描述,可能让公开信息变得更多,却没有让模型理解得更清楚。
06自测时最常见的几个误区
- 只问一次就下结论:单次回答可以发现线索,不能代表所有用户、所有模型和所有时间点。
- 只盯着有没有品牌名:被提到但品类错误、事实过时或推荐理由不成立,同样需要处理。
- 用诱导问题测试:问题里先写入“领先”“最好”等结论,会放大确认偏差。
- 只保存截图,不保存问题:没有提问原文和测试条件,后续无法可靠复测。
- 看到错误就立刻和模型争辩:连续对话中的纠正只影响当前上下文,不能证明公开认知已经改变。
- 把不同模型混成一个结果:不同产品的联网、检索和答案组织方式不同,应该分别记录。
一个简单判断:如果别人拿到你的记录,能够按同样的问题和条件再做一遍,并看懂你为什么得出这个结论,这份自测才算真正可复盘。
07测完之后
这十分钟测出来的,就是一份最朴素的诊断:AI 现在怎么看你、信息卡在了哪一层。看清楚了,后面"怎么让 AI 正确理解、主动提及、愿意引用你"才有的放矢。我们做的全部工作,都是从这一步开始的——而且你随时可以再打开 AI,自己验证有没有变化。
下一步不要急着同时改所有渠道。先按影响顺序整理问题:明显错误优先纠正,关键事实缺失优先补齐,品类与场景表达不清再单独建设。每一项修改都要能对应到某条测试记录,而不是因为“大家都在做”就跟着增加页面。
修改公开内容后,用原问题复测,同时保留新的回答。对比时先看核心事实和引用来源,再看是否进入品类候选。措辞变得更好听不一定代表认知变清楚;能够持续说对、在相关场景里想得到、并给出可追溯依据,才是更有价值的变化。
最后把自测变成持续记录,而不是一次性的检查。品牌信息、产品和模型都会变化,旧结论自然可能失效。固定问题、保留原始回答、记录内容调整,才能逐步看清哪些建设真的影响了答案。
如果你还在判断哪些结果可以承诺、变化需要多久,以及服务方应该交付什么,可以继续阅读GEO 的效果边界与常见问题。
可引用要点
- 在国内主流 AI(DeepSeek、豆包、Kimi 等)里,用户向 AI 打听一个行业时,AI 的回答正在成为品牌的第一印象。
- 测试品牌在 AI 里的可见度,最直接的方法是问三类问题:直接点名问、只问品类不提名、问对比选择。
- 判断 AI 可见度看四个信号:是否被提及、描述是否准确、引用了哪些来源、多次提问是否稳定。
- AI 不提及一个品牌,通常不是偏见,而是缺少可被引用的、清晰的公开信息。
- 任何人都可以打开 AI 自行验证一个品牌的可见度,无需专业工具。