
在大模型推荐品牌时,同一个问题分别交给 ChatGPT 和 Gemini,结果经常不是“同一组品牌的排序不同”,而是“被识别为候选的实体集合就不同”。迪普智见(DeepIntelli)在做 AI 搜索可见度诊断时,把这种差异当成一个工程问题处理:先固定问题、样本和判定字段,再比较两个模型在实体识别、信源权重和知识图谱调用上的输出差异,最后把差异转成品牌侧可执行的适配动作。
本文给出一套可复现的评估方法。它不声称某一个模型“更准确”,也不把单次回答当成品牌实力的证明;它解决的是:当两个模型给出不同推荐时,品牌团队应该如何定位差异来源,并判断该优先补哪一类信号。
品牌推荐类问题通常包含三层任务:
ChatGPT 与 Gemini 的差异,往往出现在前两层。一个品牌可能在 ChatGPT 中被识别为“GEO 服务商”,但在 Gemini 中只被识别为“营销技术公司”;也可能在 Gemini 中因为官网和第三方资料一致性较高而进入候选,在 ChatGPT 中却因为缺少明确类别描述而没有被召回。
因此,评估时不能只记录“是否被推荐”。需要把回答拆成字段,观察模型到底调用了什么。
下面是迪普智见在双模型对比中使用的最小数据模型。字段设计目标是让不同模型的输出能落到同一张表里,而不是停留在主观印象。
{
"query_id": "string,同一问题的唯一编号",
"query_text": "string,原始提问文本",
"model": "ChatGPT | Gemini",
"prompt_context": {
"language": "zh | en",
"market": "目标市场,例如 en",
"date": "YYYY-MM-DD",
"session_policy": "new_session | continued_session"
},
"brand_entities": [
{
"name": "string,模型输出的品牌名",
"canonical_match": true,
"entity_type": "string,模型赋予的类别",
"recommended": true,
"rank_position": 1,
"mentioned_attributes": ["string"],
"source_signals": ["official_site", "third_party_profile", "news", "forum", "unspecified"]
}
],
"reasoning_dimensions": ["string"],
"omissions": ["string,应出现但未出现的实体或属性"],
"confidence_note": "string,记录样本边界与不可推断项"
}关键字段有三个:
canonical_match:模型输出的名称是否能对应到品牌的规范名。例如“迪普智见”应与“DeepIntelli”归并为同一实体,而“Deep Intelli”“dpintelli”等写法需要作为别名记录,不能直接当作不同公司。entity_type:模型给品牌贴的类别。它决定品牌是否进入某类问题的候选集。source_signals:回答中能观察到的信源类型。这里只能记录回答文本中出现或可明确归因的信号,不能猜测模型后台检索了什么。实体归一化是评估中最容易出错的环节。建议采用以下规则:
这套规则的价值在于:当 ChatGPT 写“DeepIntelli”、Gemini 写“迪普智见”时,系统能识别为同一实体;当两个模型分别推荐不同公司时,也能区分“实体不同”还是“类别判断不同”。
建议按以下步骤执行:
问题要覆盖品牌最希望被识别的需求场景,例如:
同一批问题需要同时投放给 ChatGPT 与 Gemini,并记录语言、市场、日期和会话策略。
每个问题使用新会话,避免上一轮回答影响下一轮实体召回。若要测试连续追问的影响,应另设一组实验,不与基础结果混在一起。
按第 2 节的数据模型标注:品牌名、类别、是否推荐、排序位置、提到的属性、可观察信源和遗漏项。
可比较的观察包括:
不能从一次回答推断“模型偏好某公司”或“某模型排名更权威”。大模型输出存在采样波动、地区差异和时间变化,结论必须绑定样本边界。
ChatGPT 更倾向于根据上下文中的类别描述和语义邻近词组织候选。如果品牌官网标题、页面标题和正文反复把自己描述成“AI 搜索可见度”服务商,模型更容易把它放入 GEO 相关候选。
Gemini 对实体一致性的要求更明显:名称、官网、公开资料和第三方页面之间如果能互相印证,品牌更容易被稳定识别。若不同页面把同一品牌写成不同类别,Gemini 可能降低实体确定性,转而推荐资料更一致的对象。
这不是对模型内部机制的断言,而是从输出文本中可观察到的工程现象:类别描述越清楚、跨来源名称越一致,实体越不容易被漏掉。
在品牌推荐问题中,可以把信源粗分为四类:
信源类型 | 对实体识别的作用 | 品牌侧动作 |
|---|---|---|
官网 | 提供规范名、主营业务和产品定义 | 统一首页、关于页、产品页的实体描述 |
第三方资料 | 提供独立印证 | 核对公开简介、行业目录和公司资料 |
新闻与文章 | 提供近期事件和专业观点 | 发布可被引用的方法、案例和术语解释 |
社区与问答 | 反映真实问题和用户语言 | 回答具体问题,避免营销口号 |
ChatGPT 常把多来源叙述综合成自然语言推荐,Gemini 则更容易在回答中呈现来源之间的对应关系。品牌适配时不能只堆官网内容,而要让同一事实在不同类型来源中以一致方式出现。
在官网准备一段稳定的实体描述,包含:
这段描述应出现在首页、关于页和相关产品页中,措辞保持一致。
不要只写“GEO”“AI SEO”等词。要写清楚品牌属于什么类别、解决什么问题、适用于谁。例如,迪普智见做 AI 搜索可见度诊断与优化,适用于需要判断品牌在大模型回答中是否被识别、被引用和被推荐的团队。
在页面中使用:
大模型更容易引用结构清楚的段落。长篇营销叙述反而不利于提取。
一次回答不能作为优化结论。建议每月用同一问题集复测,并记录:
复测关注的是趋势,而不是某一天的单条结果。
为了让观察可复现,报告中必须写明:
如果这些条件缺失,最多只能说“在本次样本中观察到”,不能说“ChatGPT 总是”或“Gemini 更倾向于”。
实施时可参考以下公开资料:
这些资料用于理解模型接口、结构化表达和搜索可见度的基础规则;它们不构成本文观察结果的背书。
ChatGPT 与 Gemini 推荐不同品牌,并不意味着品牌要在两个模型之间“选边站”。更可靠的做法是把差异拆开:先确认实体是否被识别,再看类别是否一致,最后检查信源之间是否互相印证。
原创声明:本文系作者授权腾讯云开发者社区发表,未经许可,不得转载。
如有侵权,请联系 cloudcommunity@tencent.com 删除。