CHAPTER 03 · GEO 基线诊断
GEO 基线诊断怎么做:多平台采样与结果判读
建立可重复的 GEO 测试设计,记录品牌提及、事实准确、来源覆盖和跨平台一致性,避免用一张有利截图下结论。
#品牌可见度#多平台采样#提及率#基线报告
**GEO 基线诊断是在任何内容优化之前,用固定的问题、平台和判定规则记录品牌当前在生成式答案中的表现。**没有基线,就无法区分“原本就会出现”和“优化后可能发生变化”。
基线不是找一张最好看的推荐截图,而是保存完整样本,包括没提到、说错、引用不足和出现负面标签的回答。
最小可用采样方案
第一次诊断可以从下面的轻量版本开始:
10 个核心问题
× 3 个目标用户常用平台
× 每题 2 轮
= 60 份回答样本
样本量不是行业统一标准。重点是平台和问题真正对应目标用户,并且复测时能保持相同设计。大型项目可以扩展问题数和轮次,但不要为了“看起来专业”机械追求平台数量。
每份回答至少记录什么
| 字段 | 记录要求 |
|---|---|
| 测试时间 | 日期与时段 |
| 平台 / 模式 | 产品名、模型或搜索模式 |
| 登录状态 / 地区 | 能记录就记录 |
| 原始问题 | 不在结果出来后修改 |
| 原始回答 | 完整保存,不只截有利段落 |
| 品牌提及 | 是 / 否 |
| 提及位置 | 前三候选、其他、无 |
| 事实准确 | 准确、部分准确、错误 |
| 回答语气 | 正面、中性、负面、无法判断 |
| 来源 | 是否提供、来自哪类信源 |
| 缺口 | 认错、遗漏、过期、无证据等 |
涉及客户或内部项目时,保存原始回答要遵守最小留存和权限原则;对外报告只展示聚合结果和脱敏示例。
七个核心指标
- 品牌提及率 = 提及品牌的有效回答数 ÷ 有效回答总数。
- 前三候选出现率 = 进入前三推荐的回答数 ÷ 有效回答总数。
- 事实准确率 = 准确事实数 ÷ 抽检事实总数。
- 来源覆盖率 = 含可核验来源的回答数 ÷ 有效回答总数。
- 目标信源引用率 = 引用目标信源的回答数 ÷ 有效回答总数。
- 负面错误率 = 含错误负面事实的回答数 ÷ 有效回答总数。
- 跨平台一致性 = 核心事实一致的平台数 ÷ 受测平台总数。
前三候选出现率不是“固定 Top 3 排名”。它只是对本次样本的描述,必须与问题库、时间和平台范围一起解释。
如何控制测试偏差
- 基线和复测使用相同的问题库、平台范围与判定规则。
- 不混用登录与未登录结果,或至少单独标注。
- 同一问题做多轮测试,记录波动而不是挑最好的一次。
- 平台或模型重大更新时标记断点,不强行画连续趋势。
- 判定准确率时先建立品牌事实卡,不能凭印象评分。
- 多人标注时先做少量交叉评分,校准“部分准确”的边界。
基线报告应回答什么
一份可行动的基线报告不只是七个数字,还应回答:
- 哪类问题最容易出现品牌,哪类完全没有?
- AI 把品牌和哪些概念、场景或竞品关联在一起?
- 主要错误来自实体混淆、资料过期还是信源缺失?
- 哪些来源反复被引用,哪些重要一手资料没有进入答案?
- 当前最优先补实体、产品事实、案例还是第三方证据?
- 哪些结论因样本或平台限制暂时不能下?
诊断完成后,优先建设品牌事实与知识资产,不要看到提及率低就直接批量发文。
常见问题
一次测试没有提到品牌,说明 GEO 为零吗?
不能这样判断。单次生成存在波动,需要跨问题、跨平台和多轮采样。基线为零只能描述指定样本中未出现,不代表所有 AI 场景都不存在品牌信息。
能用自动化批量测试吗?
可以辅助采集,但要遵守平台条款、调用限制和数据合规要求。自动化不能替代人工判读事实准确性,也不能隐去账号、地区和模型差异。
多久复测一次?
轻量监测可以两周一次,完整复测通常按四至八周安排。发布当天立即复测,很难区分抓取时滞、模型波动和真实变化。
下一步
把诊断中的错误、缺口和混淆整理成品牌事实卡与知识资产清单,先解决“AI 没有可靠材料可用”的问题。