AI 答案里的「噪声词」:为什么你的行业词会被误认成品牌

问题从哪来

要判断品牌在 AI 回答里的提及情况,第一步是从回答文本中抽取出实体名

这一步很容易踩坑。比如模型回答:

该领域常见的技术手段包括超声波检测、机器视觉和激光测量。

如果我们不加区分地把「超声波检测」当成一个品牌收录, 它就会出现在报告里,让客户以为市场上有一家叫这个名字的竞品。

三类典型的误判

我们在真实采集数据里反复遇到的是这三类:

| 类型 | 例子 | 为什么会被误判 | | --- | --- | --- | | 技术手段 | 超声波检测、智慧停车系统 | 是完整的名词短语,形态和品牌名很接近 | | 通用概念 | 上市公司、行业地位 | 高频出现,频次统计会把它推到前排 | | 句子碎片 | 易受环境影响 | 从句子里切出来的片段,本身不是实体 |

一个反直觉的结论:长度不是证据

最开始的实现里有一条经验规则:名字超过 4 个字就认为是品牌

理由是"品牌名一般都不短"。这条规则带来的问题是, 上面三类噪声里有大量都是 4 字以上的短语 —— 它们全都绕过了频次门槛,只要出现两次就能进报告。

长度是一个当时的经验相关性,不是结构性证据
品牌名可以很短(西贝、海底),噪声词可以很长(智慧停车系统)。

我们后来把这条规则删掉,改成按"是否含企业后缀""是否有专名信号" 来分级设置频次门槛 —— 有信号的走低门槛,没信号的要出现更多次才收录。

另一件容易忽略的事:词表要"到处都生效"

运营在后台标注了一个噪声词,是希望它在所有地方都不出现。

但实际系统里,"输出品牌列表"的入口往往有多个: 报告服务一个、API 一个、看板统计一个。 如果词表只在其中一处被读取,就会出现"后台标了、报告里还有"的情况。

正确的做法是把词表读取和过滤收进一个函数, 所有输出入口都调它,而不是各自写各自的查询。

小结

每个输出入口都必须自己查一遍并应用

← 返回资讯列表

相关阅读