什么是 GEO?为什么品牌需要在意 AI 给出的答案
当用户开始直接向 AI 提问而不是翻搜索结果页,品牌信息的第一落点已经从「十个蓝色链接」变成了「一段生成答案」。本文说明 GEO 要解决的问题与基本方法。
要判断品牌在 AI 回答里的提及情况,第一步是从回答文本中抽取出实体名。
这一步很容易踩坑。比如模型回答:
该领域常见的技术手段包括超声波检测、机器视觉和激光测量。
如果我们不加区分地把「超声波检测」当成一个品牌收录, 它就会出现在报告里,让客户以为市场上有一家叫这个名字的竞品。
我们在真实采集数据里反复遇到的是这三类:
| 类型 | 例子 | 为什么会被误判 | | --- | --- | --- | | 技术手段 | 超声波检测、智慧停车系统 | 是完整的名词短语,形态和品牌名很接近 | | 通用概念 | 上市公司、行业地位 | 高频出现,频次统计会把它推到前排 | | 句子碎片 | 易受环境影响 | 从句子里切出来的片段,本身不是实体 |
最开始的实现里有一条经验规则:名字超过 4 个字就认为是品牌。
理由是"品牌名一般都不短"。这条规则带来的问题是, 上面三类噪声里有大量都是 4 字以上的短语 —— 它们全都绕过了频次门槛,只要出现两次就能进报告。
长度是一个当时的经验相关性,不是结构性证据。
品牌名可以很短(西贝、海底),噪声词可以很长(智慧停车系统)。
我们后来把这条规则删掉,改成按"是否含企业后缀""是否有专名信号" 来分级设置频次门槛 —— 有信号的走低门槛,没信号的要出现更多次才收录。
运营在后台标注了一个噪声词,是希望它在所有地方都不出现。
但实际系统里,"输出品牌列表"的入口往往有多个: 报告服务一个、API 一个、看板统计一个。 如果词表只在其中一处被读取,就会出现"后台标了、报告里还有"的情况。
正确的做法是把词表读取和过滤收进一个函数, 所有输出入口都调它,而不是各自写各自的查询。
每个输出入口都必须自己查一遍并应用
当用户开始直接向 AI 提问而不是翻搜索结果页,品牌信息的第一落点已经从「十个蓝色链接」变成了「一段生成答案」。本文说明 GEO 要解决的问题与基本方法。