广告增长 · 2026-09-19
GEO 效果里的三个假象:你搜到自己排第一,可能是假的
登录态记忆会造出假排名,自动化发布会造出假成功,倍数表达会掩盖低基数。三个假象的识别动作——体系化的验收指标和复测纪律见 GEO 专栏第 7 章。
一句话
完整的验收指标体系、复测纪律和归因边界,写在 GEO 专栏第 7 章。这篇只补一件事:三个即使你按流程做了复测、也可能骗过你的假象。
它们的共同特征是——你看到的结果是真的,但它不代表别人也能看到。
| 假象 | 表现 | 识别动作 |
|---|---|---|
| 登录态假排名 | 自己搜排第一,换个人搜不到 | 无痕 / 多设备 / 多轮,只看比例 |
| 发布假成功 | 发布日志成功率接近 100%,平台上找不到 | 跳作品列表页按标题反查 |
| 倍数假增长 | ”AI 曝光增长几十倍” | 要求给出绝对值和基数 |
假象一:登录态记忆造出来的”第一名”
表现:你在豆包里搜自己的品牌,排第一。换个同事用他的账号搜,搜不到。
复测纪律里通常会写一句”检查登录状态是否一致”,但很少解释为什么这条如此关键。
机制:主流 AI 助手都会结合历史对话调整回答。你反复搜过自己的品牌、反复点开过自己的内容,模型在你这个账号的上下文里已经建立了偏向。你看到的”第一名”是你个人的第一名。
这是 GEO 行业里最普遍的自欺,也是最容易被拿来交差的证据——一张排名截图,伪造成本为零。
“不混用登录与未登录结果""同一问题多轮测试”这些操作纪律,第 3 章的偏差控制里有完整清单,照做即可。
这里只补一个经验水位:非登录状态下,同一批词的提及率能稳定在 60%-70%,才算真的做上去了;低于这个数,说明还在靠运气。
这个数字不是标准,是量级参考——不同类目的竞争密度差很多,强竞争类目做到 40% 可能已经很好。严谨的指标口径以专栏第 7 章的七个指标为准。
假象二:发布成功 ≠ 内容真的存在
这个坑不来自 GEO 方法论,来自一个交付自动化项目。
当时做多平台批量分发,第一版跑通后数据很好看:发布成功率接近 100%。实际去平台上翻,很多文章根本不存在。
原因很朴素:程序判断”成功”的依据是点到了发布按钮。点击之后平台可能拦截、可能审核不通过、可能因为页面动态变化落进了草稿箱。按钮点到了,内容没出去。
这件事的杀伤力在于,它会污染整条验收链:内容层的数据是假的,后面所有基于”我已经发了 N 篇”做的效果归因,都建立在不存在的内容上。
识别动作:
- 发布完跳转到作品列表页
- 按标题匹配,确认文章真实存在
- 不存在就标记失败,进重试队列
原则是:验证信号必须独立于执行信号。用”我执行了”来证明”我成功了”,等于没验证。
这不只适用于 GEO。任何涉及批量操作的交付——批量建计划、批量上素材、批量发内容——都该假设执行日志不可信,单独做一次存在性检查。
顺带一个经验:每接一个新平台,先手动把流程走一遍画出操作地图,再让 AI 按地图写模块。平台差异、动态参数、定时发布误触这些坑,手动走一遍全会暴露。
假象三:倍数表达掩盖的低基数
行业里流传的 GEO 案例,常见表述是”AI 推荐曝光增长几十倍”。
问题在于 GEO 的基线普遍极低,低基数天然会产生好看的倍数。从 2 次提及涨到 20 次是”增长 10 倍”,但绝对量仍然可以忽略。
我自己复盘过的一个案例,提及率从 1.7% 做到 35%,写成”增长 20 倍”完全没错,但那是误导。有意义的表达是绝对值加测量口径:多少个词、问了多少次、被提及多少次、在什么登录状态下测的。
同理,多数流传的效果数据是案例作者自述,没有第三方验证,也没有说明测量方法。转述时要标注这一点,更不能拿去当对客承诺。
识别动作:看到倍数,先问三个问题——基数是多少?词表是哪些?什么状态下测的?
这三个问题答不上来的效果汇报,基本可以当作没有。
这三个之外
体系化的东西专栏里都有,不重复:
- 验收指标和复测纪律 → 第 7 章:效果怎么验收
- 供应商验收清单、合规红线 → 第 8 章:合规边界与 8 周路线图
- 基线怎么测 → 第 3 章:基线诊断
如果想看这套东西在一个真实项目里跑出来是什么样,我写过一篇 8 周的复盘:把 AI 提及率从 1.7% 做到 35%。
FAQ
Q:非登录状态测,AI 回答每次都不一样怎么办? A:这是正常的,生成式回答本身有随机性。所以指标要用”多次提问里被提及的比例”,而不是”排第几”。同一个词问 3-4 次,跨 4 个以上平台,取占比。
Q:服务商只给截图,可以接受吗? A:单张截图不能作为验收证据。需要的是完整原始回答、时间、平台、登录状态和引用来源的记录——这几项在专栏第 7 章的复测纪律里有完整列表。
Q:自己做 GEO,怎么避免假象二? A:只要涉及批量发布,就假设”发布成功”的日志不可信,单独做一次存在性检查。人工抽检也行,关键是检查动作和发布动作分开。
Q:60%-70% 这个水位适用所有类目吗? A:不适用。本地决策词和泛行业词的难度差很多,强竞争类目达到 40% 可能已经很好。这个数字只作量级参考,具体目标要基于自己的基线来定。