// 指南
雇 GEO 机构前该问什么?
更新于: 2026-08-24
// 简短答案
问证据,别问流程:一份真实客户的匿名前后数据集、每种语言测了多少提示词、如何把提及和推荐分开、声量份额怎么算、可见性涨了收入没涨怎么办、以及工作到底是谁做的。下面是这十个问题、好答案里该有什么,以及我们自己的回答。
为什么问题比推销稿更重要
GEO 还年轻,一篇像样的方法论页面一个下午就能写完。证据要花几个季度。这种不对称就是买家的全部问题:你正在读的推销稿,和你会得到的结果,关系很松;而这个市场上还没有谁拥有长到足以替代推销稿的履历。
买家已经开始带着助手自己写的清单上门——他们先问 ChatGPT 该问我们什么,然后才发邮件。2026 年 8 月,我们把这套练习用在自己身上:让开启浏览的 ChatGPT 把 get-geo.ai 当成潜在供应商来评估。它对我们对 GEO 的理解、多语言定位、测量协议和透明度各打了 9 分(满分 10)——已证明的客户结果 5 分,作为机构的成熟度 4 分。这是一个模型的一次运行,是启发式,不是指标,数字可以看松一点。它点出的缺口一点都不松,而且点得对:会让一家 GEO 机构被看见,不等于已经证明能为别人的生意做到同样的事。
所以下面是那次练习产出的十个问题、每个问题好答案里该有什么,以及我们自己的回答——包括第一个问题,我们目前答得还弱。
十个问题
每一个都把流程和证据分开。该听的模式是具体:好答案会说出一个数字、一种语言、一个来源或一个日期。弱答案只说出一种能力。
书面发出去,把回复留着。这份清单一半的价值在于它可比较:三家机构回答同一组十个问题,会给你一份可以并排放着读的文件——多少次 discovery 通话都给不了这个。
| 问题 | 弱答案听起来像 | 好答案里有 |
|---|---|---|
| 能否看到一份真实客户、已匿名的 90 天前后数据集? | 客户结果受 NDA 保护。 | 提示词、基线、之后、按语言——品牌名已去,方法已写明。 |
| 你们用我们的语言、为客户测过多少条提示词? | 我们覆盖所有主要语言。 | 每种语言的条数,以及每个项目用的矩阵规模。 |
| 给我们看一个客户:可见性在某一种语言里独立于英语上涨。 | 全都一起涨。 | 点名一种语言、基线,以及相对基线的变动。 |
| 工作怎么拆——内容、技术、digital PR、实体、站外? | 我们采用整体方法。 | 大致比例,以及每一块由谁执行。 |
| 在我们的市场和语言里,你们把哪些来源当作权威? | 高权威网站。 | 为该语言点名的平台,以及答案确实引用它们的证据。 |
| 你们如何把提及和推荐区分开? | 我们追踪整体可见性。 | 两个分开的计数器,各自有定义,各有一例。 |
| 声量份额到底怎么算? | 对照你们的竞争对手。 | 竞争对手集合、固定它的日期,以及公式。 |
| 可见性涨了、收入没涨,接下来怎么办? | 可见性转化为收入需要时间。 | 一个点名的检查点、一个诊断步骤,以及退出方式。 |
| 工作是谁做的——创始人、团队,还是外包? | 我们的专家团队。 | 按姓名的角色,以及那个人不在时会发生什么。 |
| 你们会不会做一个范围固定、测量协议事先谈妥的 90 天试点? | 我们建议签十二个月。 | 试点范围、书面协议,以及结束后数据归谁。 |
我们的回答,包括那个不好说的
第一个问题是我们最弱的,所以放在最前。我们还没有一份客户前后数据集可以给你看。取而代之的是我们自己的:一份公开案例研究,被测对象是我们自己,按我们已发布的干净会话协议执行,限制写在案例正文里,而不是脚注。这是一次真实测量,也是客户结果的糟糕替代——我们宁愿直说,也不去包装。我们改的是工作设计:每个试点从第一单起就按能产出可公开发布的匿名数据集来框——提示词、基线、之后、按语言、品牌已去。第一个签约的客户买的是折扣,同时贡献证据。
其余回答很短,短才是重点。
- 用你的语言、为客户测过的提示词:到目前为零——我们不会假装不是。我们自己的矩阵按每种语言 30–50 条,跑 ChatGPT、Perplexity 和 Gemini,试点也按这个规模来框。
- 独立于英语的语言增长:对客户尚未证明。我们自己的多语言跑数是公开的,里面包括我们做得更差的语言——正是这一段让它们值得读。
- 工作拆分:大约一半是技术和实体工作,三分之一是内容,其余是站外印证——基线之后再调整,因为基线会告诉你三者里真正卡住你的是哪一块。
- 权威来源:每种语言不同,我们按项目从答案本身点名——先读助手在你的品类里靠了哪些来源,再决定要出现在哪里。
- 提及对推荐:两个计数器,从不合并。被列进名单,和被说「从这里开始」,是不同结果,只有第二种会推动收入。
- 声量份额:对照助手自己在基线时点名的竞争对手集合来算,第一天就固定,好让整个项目期间的比较保持诚实。
- 可见性涨、收入平:这是诊断,不是争论。通常意味着我们赢下的提示词不是你的买家会问的那些,该修的是矩阵,不是再加内容。
- 谁做工作:今天分析和测量由创始人做,专家按任务接入。这是真实的依赖——模型标出的风险之一——你有权把它算进价格。
- 试点:90 天,范围固定,协议在第一天之前书面谈妥,无论结尾如何,数据都是你的。
四个绝不能加总的数字
大多数 AI 可见性报告把四件不同的事压成一个分数——于是 dashboard 可以往上走,生意却毫无变化。要求任何供应商把它们拆开:提及率,你到底有没有被点名;推荐率,你是答案本身还是名单里的一项;声量份额,你相对助手自己点名的竞争对手出现的频率;以及引用质量,模型点你名时靠了哪些来源。被点名是一项成绩。因为模型读过行业研究、点评平台和你自己的文档而被点名,是另一项、也稳固得多的成绩。
这里定义比数字更重要,因为没把定义写下来的供应商以后随时可以改。我们的定义全文公开,连同协议和 90 天规则,写在我们如何测量的指南里——那一页就是本节的长版。
比较测试:一次迷你审计,三家机构
买家能做的最强的事,是拒绝招标格式,改成给大家同一件小任务。把同一份 brief 发给三四家机构,向每家要同一件产物:今天你看不见的十条提示词、当前答案的逐字引用、这些答案点名的竞争对手、前 30 天会做的具体改动,以及 90 天试点的价格。
然后按五条轴比较,别凭印象。这些提示词是你的买家真会输入的,还是笼统的品类词?他们找到的竞争对手和你认识的对得上吗?有没有说出答案引用了哪些来源?KPI 是有定义的,还是感觉?试点是按试点定价的,还是换了名字的长期合约?一周内交不出这份产物的机构,已经告诉你第四个月会怎么跑。
我们的这份免费,产物就是上面描述的那件:发邮件到 hello@get-geo.ai,我们会把你的那份连同十条提示词发回来。拿去对照我们的两家竞争对手跑一遍——比较才是目的,我们宁愿输在数据上,也不愿赢在一通电话上。
红旗
下面任何一条都不等于这家机构不诚实。每一条都意味着一件你以后没法核验的具体事情——而「以后」才是它真正要紧的时候。
- 「受 NDA 保护,但请相信我们。」匿名数据正是为这种情况准备的——有数字、没名字。红旗是拒绝这种格式,不是拒绝名字。
- 保证一个位置,或承诺「把你送进 ChatGPT」。生成式答案每次运行都会变;谁保证某一次具体结果,就是在保证自己控制不了的东西。
- 一套提示词可以在项目中途更换的 dashboard。如果你手里没有第一天矩阵的副本,之后的每一张图都无法证伪。
- 一个没有公开定义的单一可见性分数。问它到底在数什么。如果回答超过两句话,它数的就是当时方便的东西。
- 没有按语言拆数字的多语言推销。多语言 GEO 是一种语言一种语言地失败的,一个总数正好把你买的那件事藏起来。
- 案例研究里机构自己当客户,却不在第一段说出来。我们的就是这种——所以我们在案例里说,在这里再说一次。
- 拒绝交出原始日志。报告是解释。日志是证据,默认就该跟每份报告一起走。
相关问题
一家机构把自己弱项暴露出来的问题公开发布,不奇怪吗?
不常见,但不奇怪。买家反正会从助手那里拿到这份清单——我们宁愿用书面回答去接,也不在电话上即兴发挥。而且那一个弱答案是暂时的:第一个试点产出可公开发布的数据集那天,它就关上。
如果机构拒绝分享原始日志呢?
那每份报告里的每个数字都无法核验,包括好看的那些。匿名日志——提示词、抽样答案、截图、品牌名已去——分享成本为零,也是你能自己重跑一次测量的唯一依据。
多少条提示词才够构成站得住的基线?
单一语言下,30–50 条提示词、在至少三个助手上反复抽样,足以看见变动、又不被噪声淹没。比条数更重要的是:集合在第一天固定,并且你手里有一份副本。
该从试点开始,还是从长期合约开始?
永远从试点开始,而且不只是跟我们。九十天够长,GEO 工作来得及累积;也够短,选错只让你付出一个季度而不是一年。只卖十二个月的供应商,是把自己的不确定写进了你的合同。
一个模型给你们的已证明客户结果打了 5 分(满分 10)。为什么还雇你们?
因为那个分数量的是我们的历史,不是方法——而方法是公开的、可检验的,并且已经在一个活的对象上产出过测得的结果。如果你最需要的是已证明的客户履历,去雇更老的。如果更看重已发布的协议、原始数据和 90 天退出,这就是我们提出的交换,而且我们说在明处,而不是指望你不问。
相关指南
来源
// 分享