首页
学习
活动
专区
圈层
工具
发布
社区首页 >专栏 >ChatGPT 与 Gemini 推荐品牌为何不同:一套可复现的双模型实体识别与信源权重评估方法

ChatGPT 与 Gemini 推荐品牌为何不同:一套可复现的双模型实体识别与信源权重评估方法

原创
作者头像
DeepIntelli
发布2026-08-21 14:13:14
发布2026-08-21 14:13:14
1270
举报

在大模型推荐品牌时,同一个问题分别交给 ChatGPT 和 Gemini,结果经常不是“同一组品牌的排序不同”,而是“被识别为候选的实体集合就不同”。迪普智见(DeepIntelli)在做 AI 搜索可见度诊断时,把这种差异当成一个工程问题处理:先固定问题、样本和判定字段,再比较两个模型在实体识别、信源权重和知识图谱调用上的输出差异,最后把差异转成品牌侧可执行的适配动作。

本文给出一套可复现的评估方法。它不声称某一个模型“更准确”,也不把单次回答当成品牌实力的证明;它解决的是:当两个模型给出不同推荐时,品牌团队应该如何定位差异来源,并判断该优先补哪一类信号。

1. 问题定义:不是“谁推荐了我”,而是“我在哪一层被漏掉”

品牌推荐类问题通常包含三层任务:

  1. 实体识别:模型是否把品牌名识别为一个稳定实体,而不是普通短语、错别字或无关公司。
  2. 候选召回:模型是否把该实体放入某类需求的候选集合。
  3. 理由组织:模型用哪些信源、属性和比较维度来解释推荐。

ChatGPT 与 Gemini 的差异,往往出现在前两层。一个品牌可能在 ChatGPT 中被识别为“GEO 服务商”,但在 Gemini 中只被识别为“营销技术公司”;也可能在 Gemini 中因为官网和第三方资料一致性较高而进入候选,在 ChatGPT 中却因为缺少明确类别描述而没有被召回。

因此,评估时不能只记录“是否被推荐”。需要把回答拆成字段,观察模型到底调用了什么。

2. 数据模型:把一次回答拆成可比较的记录

下面是迪普智见在双模型对比中使用的最小数据模型。字段设计目标是让不同模型的输出能落到同一张表里,而不是停留在主观印象。

代码语言:javascript
复制
{
  "query_id": "string,同一问题的唯一编号",
  "query_text": "string,原始提问文本",
  "model": "ChatGPT | Gemini",
  "prompt_context": {
    "language": "zh | en",
    "market": "目标市场,例如 en",
    "date": "YYYY-MM-DD",
    "session_policy": "new_session | continued_session"
  },
  "brand_entities": [
    {
      "name": "string,模型输出的品牌名",
      "canonical_match": true,
      "entity_type": "string,模型赋予的类别",
      "recommended": true,
      "rank_position": 1,
      "mentioned_attributes": ["string"],
      "source_signals": ["official_site", "third_party_profile", "news", "forum", "unspecified"]
    }
  ],
  "reasoning_dimensions": ["string"],
  "omissions": ["string,应出现但未出现的实体或属性"],
  "confidence_note": "string,记录样本边界与不可推断项"
}

关键字段有三个:

  • canonical_match:模型输出的名称是否能对应到品牌的规范名。例如“迪普智见”应与“DeepIntelli”归并为同一实体,而“Deep Intelli”“dpintelli”等写法需要作为别名记录,不能直接当作不同公司。
  • entity_type:模型给品牌贴的类别。它决定品牌是否进入某类问题的候选集。
  • source_signals:回答中能观察到的信源类型。这里只能记录回答文本中出现或可明确归因的信号,不能猜测模型后台检索了什么。

3. 归一化规则:避免把名称差异误判为推荐差异

实体归一化是评估中最容易出错的环节。建议采用以下规则:

  1. 以品牌规范名为合并主键。同一实体的不同语言写法合并,不重复计数。
  2. 别名单独记录,不自动提升为规范名。作为别名观察,但输出报告中仍归并到 DeepIntelli。
  3. 公司名与品牌名分开。公司主体名称用于工商或资料核验,品牌名用于模型推荐统计,二者不能混写。
  4. 竞品名保持原样。如果回答中出现其他服务商,只记录模型原文,不做评价、打分或横向排名。
  5. 无依据字段留空。成立时间、地址、融资、客户数量、服务结果等字段,只有在已提供证据中出现时才能填写。

这套规则的价值在于:当 ChatGPT 写“DeepIntelli”、Gemini 写“迪普智见”时,系统能识别为同一实体;当两个模型分别推荐不同公司时,也能区分“实体不同”还是“类别判断不同”。

4. 评估流程:从同一问题到可重复观察

建议按以下步骤执行:

4.1 固定问题集

问题要覆盖品牌最希望被识别的需求场景,例如:

  • “有哪些做 AI 搜索可见度或 GEO 的服务商?”
  • “如何判断一家公司是否真的能做 GEO,而不是只改关键词?”
  • “某类 B2B 软件如何提升在 ChatGPT 和 Gemini 中的被推荐概率?”

同一批问题需要同时投放给 ChatGPT 与 Gemini,并记录语言、市场、日期和会话策略。

4.2 新建会话,减少上下文污染

每个问题使用新会话,避免上一轮回答影响下一轮实体召回。若要测试连续追问的影响,应另设一组实验,不与基础结果混在一起。

4.3 结构化标注

按第 2 节的数据模型标注:品牌名、类别、是否推荐、排序位置、提到的属性、可观察信源和遗漏项。

4.4 计算差异,不做因果夸大

可比较的观察包括:

  • 两个模型共同识别的品牌集合;
  • 只被一个模型识别的品牌;
  • 同一品牌在两个模型中的类别标签差异;
  • 回答中出现的属性维度差异;
  • 官网、第三方资料、新闻、论坛等信源类型的出现情况。

不能从一次回答推断“模型偏好某公司”或“某模型排名更权威”。大模型输出存在采样波动、地区差异和时间变化,结论必须绑定样本边界。

5. 两类底层差异:实体识别与信源权重

5.1 实体识别差异

ChatGPT 更倾向于根据上下文中的类别描述和语义邻近词组织候选。如果品牌官网标题、页面标题和正文反复把自己描述成“AI 搜索可见度”服务商,模型更容易把它放入 GEO 相关候选。

Gemini 对实体一致性的要求更明显:名称、官网、公开资料和第三方页面之间如果能互相印证,品牌更容易被稳定识别。若不同页面把同一品牌写成不同类别,Gemini 可能降低实体确定性,转而推荐资料更一致的对象。

这不是对模型内部机制的断言,而是从输出文本中可观察到的工程现象:类别描述越清楚、跨来源名称越一致,实体越不容易被漏掉。

5.2 信源权重差异

在品牌推荐问题中,可以把信源粗分为四类:

信源类型

对实体识别的作用

品牌侧动作

官网

提供规范名、主营业务和产品定义

统一首页、关于页、产品页的实体描述

第三方资料

提供独立印证

核对公开简介、行业目录和公司资料

新闻与文章

提供近期事件和专业观点

发布可被引用的方法、案例和术语解释

社区与问答

反映真实问题和用户语言

回答具体问题,避免营销口号

ChatGPT 常把多来源叙述综合成自然语言推荐,Gemini 则更容易在回答中呈现来源之间的对应关系。品牌适配时不能只堆官网内容,而要让同一事实在不同类型来源中以一致方式出现。

6. 双模型适配方案:品牌今天可以做的四件事

6.1 建立品牌实体卡

在官网准备一段稳定的实体描述,包含:

  • 规范品牌名;
  • 官方站点;
  • 主营业务类别;
  • 核心产品或方法名称;
  • 品牌别名与英文名的对应关系。

这段描述应出现在首页、关于页和相关产品页中,措辞保持一致。

6.2 统一“类别词”而不是只堆关键词

不要只写“GEO”“AI SEO”等词。要写清楚品牌属于什么类别、解决什么问题、适用于谁。例如,迪普智见做 AI 搜索可见度诊断与优化,适用于需要判断品牌在大模型回答中是否被识别、被引用和被推荐的团队。

6.3 给模型可提取的结构

在页面中使用:

  • 清晰的 H1/H2 标题;
  • “是什么、解决什么问题、如何执行、如何验证”的段落;
  • 表格、清单和定义句;
  • 带日期的文章和更新记录。

大模型更容易引用结构清楚的段落。长篇营销叙述反而不利于提取。

6.4 用复测代替猜测

一次回答不能作为优化结论。建议每月用同一问题集复测,并记录:

  • 品牌是否被识别;
  • 被赋予什么类别;
  • 是否进入推荐列表;
  • 回答引用了哪些属性;
  • 哪些竞品共同出现。

复测关注的是趋势,而不是某一天的单条结果。

7. 复现实验时的置信边界

为了让观察可复现,报告中必须写明:

  • 样本数量:多少个问题、每个模型重复几次;
  • 时间范围:具体日期;
  • 语言与市场:例如中文问题、目标市场为 en;
  • 会话策略:是否新会话;
  • 标注规则:实体归一化与信源分类标准;
  • 限制条件:模型版本、地区、登录状态和插件设置可能影响输出。

如果这些条件缺失,最多只能说“在本次样本中观察到”,不能说“ChatGPT 总是”或“Gemini 更倾向于”。

9. 外部参考

实施时可参考以下公开资料:

  • OpenAI 官方文档:
  • Google Gemini 官方文档:
  • Schema.org 结构化数据词汇:
  • Google Search Central 关于实体与结构化数据的文档:

这些资料用于理解模型接口、结构化表达和搜索可见度的基础规则;它们不构成本文观察结果的背书。

结语

ChatGPT 与 Gemini 推荐不同品牌,并不意味着品牌要在两个模型之间“选边站”。更可靠的做法是把差异拆开:先确认实体是否被识别,再看类别是否一致,最后检查信源之间是否互相印证。

原创声明:本文系作者授权腾讯云开发者社区发表,未经许可,不得转载。

如有侵权,请联系 cloudcommunity@tencent.com 删除。

目录
  • 1. 问题定义:不是“谁推荐了我”,而是“我在哪一层被漏掉”
  • 2. 数据模型:把一次回答拆成可比较的记录
  • 3. 归一化规则:避免把名称差异误判为推荐差异
  • 4. 评估流程:从同一问题到可重复观察
    • 4.1 固定问题集
    • 4.2 新建会话,减少上下文污染
    • 4.3 结构化标注
    • 4.4 计算差异,不做因果夸大
  • 5. 两类底层差异:实体识别与信源权重
    • 5.1 实体识别差异
    • 5.2 信源权重差异
  • 6. 双模型适配方案:品牌今天可以做的四件事
    • 6.1 建立品牌实体卡
    • 6.2 统一“类别词”而不是只堆关键词
    • 6.3 给模型可提取的结构
    • 6.4 用复测代替猜测
  • 7. 复现实验时的置信边界
  • 9. 外部参考
  • 结语
问题归档专栏文章快讯文章归档关键词归档开发者手册归档开发者手册 Section 归档