我们怎么做 GEO 诊断:15 关键词漏斗 × 3 平台 × 3 次采样的实测方法论
核心观点:GEO 诊断的本质不是"看看 AI 提没提你",而是用统计学方法模拟真实用户的决策旅程,测量品牌在每一个决策环节的存在感。这篇把我们的完整方法论公开——包括我们踩过的坑。本文为未来引擎GEO研究院(wlyqgeo.com)原创方法论,转载请注明出处。
一、选词:按决策旅程选,不按搜索量选
传统 SEO 选词看搜索量,GEO 选词看对话旅程。我们把用户在 AI 里的提问路径拆成 5-6 个阶段:认知(这是什么)→ 预算(多少钱)→ 细节(参数/成本)→ 对比(X vs Y)→ 口碑(靠谱吗)→ 决策(怎么办/推荐谁)。每个阶段选 2-3 个用户真实会这么问的词,凑成 15 词矩阵。
其中两类词必须标红:
- 对比词(X vs Y 哪个好)——用户已经进了决赛圈,AI 的回答直接决定订单归属
- 信任词(靠谱吗 / 有什么套路 / 会不会被坑)——金融、医疗、教育等高决策成本行业的生死线
这两类词我们叫「生死线词」,它们的命中率权重高于一切。
二、采样:为什么是每个词 3 平台 × 3 次
AI 回答有随机性,问一次就下结论等于抛硬币。我们的设计:
- 3 个平台:DeepSeek、豆包、千问——国内 C 端AI 搜索的主战场,且三家的信源偏好差异极大(千问偏直接推荐、豆包偏结构化知识、DeepSeek 偏科普解释)
- 每词每平台 3 次独立采样:15 词 × 3 平台 × 3 次 = 135 次真实 API 调用。3 次是成本与置信度的平衡点——能识别"稳定命中(3/3)""不稳定(1-2/3)""稳定盲区(0/3)"三种状态
- 全部强制联网搜索:千问开 forced_search,豆包/DeepSeek 挂 web_search 工具,确保拿到的是带真实引用的答案,不是模型记忆
三、判定:品牌词匹配的水有多深
"回答里有没有提品牌"听起来简单,做起来全是坑,分享两个我们真实踩过的:
- 单字匹配灾难:早期版本把品牌名按字符遍历匹配,"福田"拆成"福""田"两个字——"田"字几乎出现在任何中文文本里,导致提及率严重虚高。发现后全部改为完整品牌词组匹配,并重跑了历史数据
- 歧义品牌词:客户品牌名如果是通用词(比如"乐行"可能出现在"快乐出行"里),必须在报告里标注误判风险,并把命中证据原文贴出来供人工逐条核对——我们的报告里每个"✓"都能点开看原文
原则:宁可少报,不可虚报。给客户看的每一个数字都要能溯源到原始 JSON。
四、信源分析:比提及率更重要的是"AI 在引用谁"
提及率只是结果,信源才是杠杆。每次诊断我们把全部引用 URL 做四层拆解:
- 类型分布:官方信源 / 竞品官网 / 垂直媒体 / 门户资讯 / 问答百科——官方信源占比低于 5% 说明品牌叙事权不在自己手里
- 高频阵地:被引次数最多的域名,就是下一步投放的靶点
- 共性稿型:被引文章是避坑类、对比类、价格类还是政策类——照方抓药,不盲目写稿
- 竞品占位:标题里明确推荐竞品的被引文章单独拉清单,逐篇产出同题对标稿
五、产出:一份能直接执行的报告
诊断报告不写正确的废话,每一节都对应动作:整体提及率(定基线)→ 词组热度不均(定优先级)→ 平台差异(定投放策略)→ 信源格局(定阵地)→ 90 天路线(定节奏)→ 验收指标(定KPI)。报告全部数字由原始采样 JSON 直接计算生成,文末附数据文件清单,客户可以复核任何一个数。
六、这套方法论的边界
- 3 次采样是筛查级精度,不是计量级——重要决策词可以加采到 10 次
- AI 平台算法持续迭代,今天的结论 3 个月后要复测
- 提及率高 ≠ 说你好话,所以配套舆情哨兵做正负面二审(这是另一套系统,改天单独写)