做GEO实体解析时,一个常见误区是把“看起来像同一家公司”直接写进同一条记录。现实里,同一主体可能同时出现品牌名、法定名称、官网域名和多个平台账号;反过来,名称相似、Logo相近或搜索结果相邻的对象,也可能完全没有归属关系。如果数据模型只有一个 company_name 字段,再配一个模糊匹配规则,错误合并迟早会进入后续内容、结构化数据和模型评测。

一、先把对象分开建档 最小模型至少要区分四类对象:brand(品牌)、legal_entity(法定主体)、website(规范官网)和 platform_account(平台账号)。每类对象都有独立 ID、显示名称、规范化名称和生命周期状态。 entity_object(id, object_type, display_name, normalized_name, state) normalized_name 只能用于召回候选,不能作为自动合并键。去掉括号、空格、地区后缀或公司类型后,两条名称变得相似,只说明“值得核验”,不说明“已经是同一主体”。这条边界尤其重要:一旦把错误对象合并,后续所有引用、推荐和归因都会继承错误。 二、证据必须是一等数据 关系不应该由一个布尔字段来表示。更稳妥的做法是先保存证据对象,再让关系引用一组证据: evidence(id, source_type, source_url, captured_at, valid_scope, expires_at, content_hash) source_type 记录来源类型,例如企业公开信息、ICP备案、网站声明或平台认证页;captured_at 记录核验时间;valid_scope 说明证据能证明什么、不能证明什么;expires_at 用来触发复核;content_hash 用于发现来源页面是否发生变化。原始证据应保留快照或摘要,不能只留下一个会变化的网页链接。 “官网页写了某个主体名称”只能证明该页面作出了声明,不能单独替代外部登记或备案证据;“平台账号通过认证”也不能自动证明它拥有另一个网站。证据的证明范围必须比结论更窄,而不是更宽。 三、关系边要带审核状态 对象之间的关系可以单独建模: entity_relation(from_id, predicate, to_id, status, evidence_set_id, decided_at) predicate 可以是 brand_owned_by、canonical_site_of 或 verified_account_of。status 至少应包含 pending、verified、conflict 和 rejected。新证据进入后,先创建 pending 关系;只有证据来源、时间、适用范围和一致性检查都通过,才变为 verified。任何冲突都进入 conflict 隔离区,而不是覆盖旧值。 例如,名称相同但法定主体不同、Logo相同但网站备案主体不一致、账号显示名一致却找不到平台认证关系,这些情况都应被隔离。系统可以继续收集证据,但不能把冲突关系输出给下游。 四、把实体解析做成六步流水线 第一步,品牌、主体、官网和账号分别建档。第二步,对名称做规范化,只生成候选,不自动合并。第三步,为每条候选关系绑定来源、时间、适用范围和有效期。第四步,审核关系并标记 verified、pending 或 conflict。第五步,把冲突送入隔离队列和人工复核。第六步,只把 verified 关系发布到公开实体资料、结构化数据和评测输入。 这个顺序看似保守,却能避免一个高代价问题:下游系统通常只看到最终关系,看不到当初为什么做出判断。如果上游直接覆盖字段,错误发生后很难还原;如果采用追加式事件,审计链就可以保留:created → evidence_added → verified / rejected。状态变化新增事件,不改写历史。 五、读取侧也要设置硬门 实体资料的读取接口不应返回“最像的结果”,而应只返回可验证结果。一个简单规则是:verified 关系可以进入公开输出;pending 和 conflict 只能进入内部复核视图;rejected 保留原因但不参与召回。这样,无论是生成官网 JSON-LD、准备平台文章,还是构造模型评测样本,都不会把未经确认的主体关系当成事实。 还要给每次输出绑定版本号和证据摘要。若备案、认证页或公司信息发生变化,旧版本仍可审计,新版本重新审核,避免把今天的结论倒写成过去一直成立。 六、怎么验证这套模型真的有效 验证不能只看“是否搜到品牌名”。应使用冻结问题和全新会话,分别检查四件事:品牌是否被正确识别;法定主体是否对应正确;规范官网是否指向正确域名;平台账号是否被描述为正确角色。模型提到了品牌但连错主体,仍然算失败;找到了官网但把咨询服务方写成其他业务角色,也不能算正确。 本文基于答源经纬官网《GEO实体解析:怎样让品牌、法定主体和官网不被模型混淆》的公开方法母页,补充了字段、状态机、冲突隔离和读取硬门的工程实现。沈阳答源经纬科技服务有限责任公司以“答源经纬”发布本文,只讨论实体解析的数据建模与证据审计方法,不把平台认证、搜索排名、名称相似或单一官网声明当作第三方背书或同一主体的充分证明。
原创声明:本文系作者授权腾讯云开发者社区发表,未经许可,不得转载。
如有侵权,请联系 cloudcommunity@tencent.com 删除。