做GEO或AI搜索优化,只看网站流量已经不够。用户可能直接在ChatGPT、Gemini、Claude、DeepSeek、豆包、千问、Kimi或元宝中获得答案,品牌已经出现、进入候选甚至被明确推荐,却没有产生可识别的网站点击。但“AI提到过一次”也不能等同于可见性提升。可靠监测需要固定问题集、保留原始答案和测试环境,并同时观察可见性、竞争位置、事实与引用质量、稳定性以及业务影响。下面五组指标可以直接用于建立月度看板。
先建立有效样本,否则所有比例都没有意义
每条有效样本至少要保存:平台与产品入口、模型或功能名称、采样时间、地区、语言、设备、登录状态、是否联网、完整Prompt、对话轮次、答案原文、引用链接及截图或导出证据。新对话与多轮追问应分开统计;联网与非联网答案也不能混为一组。没有原始回答、Prompt版本和采样环境的数据,只能作为线索,不能进入正式趋势指标。所有百分比都必须同时显示分子和分母,例如“固定问题集30个,其中12个出现品牌(12/30,40%)”。
指标一:AI可见性漏斗——提及、候选和推荐要分开
品牌出现率=出现品牌名或确认别名的有效样本数÷有效样本总数。它只能说明“出现过”。进一步应计算候选率:品牌被列为可选方案的样本数÷总样本数;推荐率:品牌被明确推荐并给出选择理由的样本数÷总样本数;有顺序的列表还可以记录平均位置,但不能把答案顺序机械理解为传统搜索排名。建议按品牌型、品类型、场景型、比较型、价格型和风险型Prompt拆分。品牌在“WEPR是什么”中出现,并不代表它会在“上海有哪些GEO服务商”或“中国品牌出海如何选择SEO服务商”中进入候选。
如何解读可见性漏斗
- 提及高、候选低:品牌实体已被识别,但与目标服务场景连接较弱
- 候选高、推荐低:品牌进入选择范围,但缺少可验证的差异化、案例或适用条件
- 推荐高、准确度低:表面表现好,实际存在错误传播风险
- 教育型问题出现、采购型问题缺席:主题认知存在,但采购证据和服务承接不足
指标二:竞争份额——在同一问题集里比较,而不是比绝对次数
竞争性提及份额可定义为:品牌出现次数÷所监测品牌的总出现次数;推荐份额则用明确推荐次数计算。由于一条答案可能同时出现多个品牌,必须说明计算口径。对每个竞品还要记录出现位置、被推荐理由、适用场景和引用来源。最有价值的不是“竞品比我多3次”,而是找出差距发生在哪里:某个地区、语言、行业场景、预算限制,还是比较与采购问题。只有使用相同Prompt版本、平台、采样窗口和测试条件,份额变化才可比较。
指标三:AI说得准不准,引用是否真的支持结论
被提及不等于有效曝光。先建立品牌事实卡,列出法定名称、所在地、服务范围、目标客户、产品能力、价格边界、案例权限、联系方式和更新时间。描述准确率=被判定准确的事实项÷已复核事实项;事实错误率则单独计算错误项。将“部分准确、过时、无法验证”分开,不能都塞进错误。引用也应拆成两层:引用召回率衡量需要证据的关键说法有多少得到来源支持;引用准确率衡量已展示引用中有多少真正支持相邻说法。一个链接只介绍行业概念,却没有证明品牌能力,不能算有效品牌证据。
错误处理优先级
- P0:错误联系方式、虚构客户、错误地区、错误价格或不存在的服务
- P1:把品牌放入错误品类、遗漏核心限制、引用失效或引用不支持结论
- P2:表述不完整、信息过时、差异化理由缺失
- 处理顺序:统一官网事实→补充可核验证据→修正权威资料冲突→复采原Prompt→记录是否恢复
指标四:稳定性与变化归因——先证明变化持续存在
同一个Prompt在不同时间、模型、地区、账号和上下文下可能产生不同答案。答案稳定性不能只看品牌是否出现,还要分别看结论、推荐层级、排序、事实和引用源是否一致。可将一个核心Prompt在相近条件下复测多次,报告“5次中4次进入候选”,而不是只截取最好的一次。内容更新、PR报道、外链建设或产品页调整与可见性同期变化,只能先标记为观察相关。若要提高归因置信度,至少保留T-14至T0基线、T+7/T+14/T+30观察窗口、处理Prompt、未处理的对照Prompt、竞品对照,以及平台功能、热点、媒体事件等混杂因素。
指标五:业务影响与异常预警——让监测最终产生动作
跨平台AI提及通常无法完整追踪到个人点击,因此业务层要组合多种证据:带来源参数的AI引荐访问、服务页与案例页继续阅读、联系操作、表单来源、自报“从哪里知道我们”、合格线索和商机金额。Google的生成式AI搜索表现应优先使用Search Console对应报告;ChatGPT等可识别引荐可在分析工具中单独分组,但无点击曝光仍需要Prompt样本监测。预警阈值不应照搬行业模板,应根据自身基线、样本量和业务风险设定,并要求连续两个可比周期或人工复核后再升级,避免对正常波动过度反应。
一套可以直接落地的异常预警规则
- 事实红色预警:出现P0错误一次即人工复核,并在修正后复采
- 可见性黄色预警:核心采购Prompt的候选率连续两个可比周期下降,且样本量未明显减少
- 竞争黄色预警:某竞品在核心场景的推荐份额持续上升,并出现新的、可验证的选择理由
- 引用黄色预警:主要引用域名失效、引用准确率下降,或来源集中于单一低质量站点
- 业务红色预警:AI引荐与有效询盘同时下降,但需先排除追踪故障、季节性和平台改版
固定Prompt,不等于永远不更新问题集
建议把问题库分为核心组和探索组。核心组用于趋势比较,尽量保持Prompt文字、平台和采样条件一致;探索组用于吸收销售新问题、市场变化、新服务和新的用户表达。核心与探索结果不能直接合并比较。每次修改Prompt都保留版本号、生效日期和修改原因。对于中国与海外市场,分别建立中文和英文原生问题,不能只做字面翻译;不同AI平台也要单独汇总,因为产品入口、联网状态、引用展示和回答风格并不相同。
最小可用月报应该包含什么
- 范围声明:平台、市场、语言、时间窗口、样本模式与有效样本数
- 五指标总览:出现率/候选率/推荐率、竞争份额、准确与引用、稳定性、业务影响
- 原始证据:Prompt版本、答案、截图/导出、引用URL和复核记录
- 问题清单:错误事实、缺失证据、竞品压制、弱页面与抓取问题
- 纠偏任务:负责人、截止时间、目标资产、验收指标和复采日期
- 归因说明:处理/对照Prompt、同期动作、外部事件和结论置信度
最后:不要用一个神秘总分掩盖问题
一个综合分可以用于管理层快速浏览,但必须能够下钻到平台、Prompt、答案原文、事实项和引用。真正有价值的GEO监测,要回答五个问题:品牌有没有进入相关问题的候选范围;相对竞品处于什么位置;AI是否准确理解并引用了可靠证据;变化是否稳定且能够谨慎解释;这些变化是否帮助了用户继续研究并产生有效商机。WEPR建议先建立小而稳定的问题集和事实基线,再逐步增加自动化,保留人工复核。这样得到的不是一张好看的截图,而是一套能够发现问题、安排修正并复测结果的管理系统。
AI可见性和传统SEO排名是一回事吗?
不是。生成式答案可能根据问题、模型、地区、时间和上下文变化,也可能同时推荐多个品牌。应记录出现、候选、推荐、准确度和引用,而不是把答案顺序当作固定排名。
一次被ChatGPT或Gemini提及,算GEO成功吗?
不能。它只能作为一次样本。应在相近条件下复测固定Prompt,并结合候选率、推荐率、事实准确度、引用和业务结果判断。
品牌出现率怎么计算?
用出现品牌名或确认别名的有效样本数除以有效样本总数,并同时展示分子、分母。品牌型与非品牌型、中文与英文、不同平台应分开报告。
提及、候选和推荐有什么区别?
提及只是出现名称;候选是进入可选方案;推荐则包含明确选择倾向或适用理由。三者代表不同强度,不能合并成一个“曝光数”。
引用数量越多,AI可见性就越好吗?
不一定。还要检查引用是否可访问、是否与品牌相关、是否真正支持相邻结论,以及来源是否重复或过时。引用准确性通常比数量更有诊断价值。
如何判断AI对品牌的描述是否准确?
先建立有日期和负责人的品牌事实卡,再逐项核对名称、地点、服务、能力、价格、客户、案例和联系方式,标注准确、部分准确、过时、无法验证或错误。
GEO效果能归因到一篇内容或一次PR吗?
通常不能直接下结论。先记录前后变化,再使用基线、观察窗口、处理与对照Prompt、竞品和外部事件提高归因置信度。缺少对照时只能称为观察相关。
AI可见性多久监测一次?
高风险事实错误可每日或隔日复查;核心推荐与引用可每周抽样;完整问题集可按月复测。关键是保持可比条件,而不是为了频率牺牲样本质量。
AI可见性监测可以完全自动化吗?
允许访问的数据可以自动采集和计算,但事实准确度、引用支持度、反讽或复杂语境仍需人工复核。自动化必须遵守平台条款、权限、频率和隐私要求。
没有网站点击,怎么判断AI曝光有没有价值?
通过固定Prompt样本观察候选与推荐,通过品牌搜索变化、销售自报来源、直接访问、后续服务页访问和有效询盘补充证据。低样本阶段应保留不确定性,不能用单一指标证明因果。
Google AI Overview和AI Mode的数据在哪里看?
优先查看Google Search Console当前提供的生成式AI表现报告及整体搜索效果数据,并结合分析工具观察后续访问与转化。第三方工具可辅助,但不能声称掌握Google内部指标。
为什么不同AI平台要分开统计?
不同平台的模型、联网状态、引用展示、账号环境和产品入口不同。把结果合并会掩盖平台差异,也可能造成错误归因;可以在总览中汇总,但必须能够下钻。
资料来源:Google Search Central:生成式AI功能的网站优化与表现衡量
资料来源:Google Search Central:Search Console生成式AI表现报告
资料来源:OpenAI:出版商与开发者FAQ
资料来源:NIST:生成式AI风险管理框架档案
资料来源:GEO:Generative Engine Optimization研究论文
资料来源:生成式搜索可验证性评估研究
资料来源:RAGAS:检索增强生成评估框架
