在数据的基建和应用层面,除了重视数据分析外,也越来越重视数据资产在更多业务场景中的应用,标签画像的建设和应用就是其中一类很常见的需求和期望。 从对业务的价值来说,标签和画像是类似中间层的系统模块,具体来说,数据资产本质上是一些采集、采购所获得的数据源,但企业希望在数据源的基础上,实现资产变现,而且不断扩大资产价值。 很多企业都意识到,这个中间层就是标签画像。 下面主要介绍了企业做标签画像的目的,重点阐述标签和画像的应用场景及应用流程,构建标签和画像体系的实操方法论,最后给出了行业案例。
在数据的基建和应用层面,除了重视数据分析外,也越来越重视数据资产在更多业务场景中的应用,标签画像的建设和应用就是其中一类很常见的需求和期望。 从对业务的价值来说,标签和画像是类似中间层的系统模块,具体来说,数据资产本质上是一些采集、采购所获得的数据源,但企业希望在数据源的基础上,实现资产变现,而且不断扩大资产价值。 很多企业都意识到,这个中间层就是标签画像。 下面这份PPT材料主要介绍了企业做标签画像的目的,重点阐述标签和画像的应用场景及应用流程,构建标签和画像体系的实操方法论,最后给出了行业案例。
2.支持亿级用户技术的标签生产:在技术设计考虑系统未来发展,能够支持相对较大的用户技术的标签生产,需要对计算或者存储方面要求较高,对于系统架构来说,平台的伸缩和适应性都要求相对高一些。 [2k4zbj258x.png? q-sign-algorithm=sha1&q-ak=AKID2uZ1FGBdx1pNgjE3KK4YliPpzyjLZvug&q-sign-time=1604111814;1604119014&q-key-time q-sign-algorithm=sha1&q-ak=AKID2uZ1FGBdx1pNgjE3KK4YliPpzyjLZvug&q-sign-time=1604111956;1604119156&q-key-time 通常有三种方式做离线标签加工: 1. 使用每个标签单独的一张表,缺点是多标签查询的时候需要join,效率低; 2.
标签实体及ID类型 画像标签需要绑定到实体上面,用户、商品、直播、视频等都可以作为画像的实体。 画像标签借助实体进行表达,比如用户的性别、年龄标签;商品的售价、种类、货源地标签;直播的分类、开播时间段标签;视频的风格、视频时长分段标签等,每一个标签都用于描述某个具体实体。 导入类标签是用户通过数据导入的方式自行构建的标签,比如用户问卷调研结果中反馈正向的用户可以导入到画像平台作为“问卷正向用户”;运营人员将某次运营活动中表现良好的用户上传画像平台构建“某活动优质用户”标签 导入类标签主要依赖工程能力,将用户导入数据落盘到存储引擎中,后续处理过程和使用方式与其他类型标签一致。 2. 按时效性分类 标签按照时效性可以分为离线标签和实时标签。 如性别、教育程度、年龄段、婚育情况、用户兴趣等标签,代表的是用户基本属性,与用户在应用上的使用行为无关。基础属性直接反馈用户本身的信息,在画像平台中使用频率较高,属于画像平台最重要的一类标签数据。
: tagName -> tagRule:标签规则 2)、业务数据 依据每个业务标签(4级标签)的标签规则rule,获取业务数据 inType 判断业务数据的数据源,然后解析参数为Meta,加载业务数据 画像标签表:tbl_profile 存储标签数据时,也将标签数据存储同步存储到Elasticsearch索引中,方便使用标签进行查询用户 基于Elasticsearch为HBase表构建二级索引 Application名称,及标签模型分类,尤其关键为标签规则 rule 5级标签 2)、开发标签模型 如何开发标签模型及测试功能,完成以后需要打成jar包 3)、调度执行 标签管理平台中可以直接调用 获取标签数据spark.read.format(“jdbc”) 只获取与标签相关的所有数据 2)、【HBase】解析标签规则rule,加载业务数据 spark.read.format(“hbase ,打标签,其中涉及相关计算 4)、【HBase】标签存储将用户标签数据存储到HBase表中,同步到Elasticsearch索引中 a)、存储最新画像标签数据 存储HBase表汇总 b)、同步标签数据到
上文提到了使用画像宽表可以便捷的创建人群,本文介绍人群创建所依赖的另外一种数据组织形式:标签BitMap。 BitMap以上特点都非常适合存储人群数据,也决定了其在画像平台的广泛使用。基于Hive标签数据表可以生成BitMap,图5-10展示了性别和常住省标签生成BitMap的示意图。 生成BitMap会消耗大量的计算和存储资源,如果标签值区分度较小,生成的BitMap数据被使用到的概率较低,是对计算和存储资源的浪费。使用画像宽表还是BitMap要根据业务特点来决定。 BitMap适用的标签类型和业务场景有限,要结合实际的数据进行判断。业界一般使用混合模式,优先通过BitMap进行人群创建,不适用的场景下兜底使用画像宽表进行人群圈选。 采用混合模式要考虑对齐画像宽表和BitMap的标签时间,这增加了工程的实现复杂度。----本文节选自《用户画像:平台构建与业务实践》,转载请注明出处。
用户画像标签体系 用户画像的核心在于给用户“打标签”,每一个标签通常是人为规定的特征标识,用高度精炼的特征描述一类人,例如年龄、性别、兴趣偏好等,不同的标签通过结构化的数据体系整合,就可与组合出不同的用户画像 为什么需要梳理标签体系,因为不同的企业做用户画像有不同的战略目的,广告公司做用户画像是为精准广告服务,电商做用户画像是为用户购买更多商品,内容平台做用户画像是推荐用户更感兴趣的内容提升流量再变现,金融行业做用户画像是为了寻找到目标客户的同时做好风险的控制 而标签也分为很多种类型,这里参照常见的分类方式, 从对用户打标签的方式来看,一般分为三种类型:1、基于统计类的标签;2、基于规则类的标签、3、基于挖掘类的标签。 该类标签构成了用户画像的基础; 规则类标签:该类标签基于用户行为及确定的规则产生。例如对平台上“消费活跃”用户这一口径的定义为近30天交易次数>=2。 用户画像体系和标签分类从两个不同角度来梳理标签,用户画像体系偏战略和应用,标签分类偏管理和技术实现侧。
用户画像标签体系 用户画像的核心在于给用户“打标签”,每一个标签通常是人为规定的特征标识,用高度精炼的特征描述一类人,例如年龄、性别、兴趣偏好等,不同的标签通过结构化的数据体系整合,就可与组合出不同的用户画像 为什么需要梳理标签体系,因为不同的企业做用户画像有不同的战略目的,广告公司做用户画像是为精准广告服务,电商做用户画像是为用户购买更多商品,内容平台做用户画像是推荐用户更感兴趣的内容提升流量再变现,金融行业做用户画像是为了寻找到目标客户的同时做好风险的控制 而标签也分为很多种类型,这里参照常见的分类方式, 从对用户打标签的方式来看,一般分为三种类型:1、基于统计类的标签;2、基于规则类的标签、3、基于挖掘类的标签。 该类标签构成了用户画像的基础; 规则类标签:该类标签基于用户行为及确定的规则产生。例如对平台上“消费活跃”用户这一口径的定义为近30天交易次数>=2。 用户画像体系和标签分类从两个不同角度来梳理标签,用户画像体系偏战略和应用,标签分类偏管理和技术实现侧。
为什么需要用户画像 用户画像的核心工作是为用户打标签,打标签的重要目的之一是为了让人能够理解并且方便计算机处理,如,可以做分类统计:喜欢红酒的用户有多少?喜欢红酒的人群中,男、女比例是多少? 如何构建用户画像 一个标签通常是人为规定的高度精炼的特征标识,如年龄段标签:25~35岁,地域标签:北京,标签呈现出两个重要特征:语义化,人能很方便地理解每个标签含义。 人制定标签规则,并能够通过标签快速读出其中的信息,机器方便做标签提取、聚合分析。所以,用户画像,即:用户标签,向我们展示了一种朴素、简洁的方法用于描述用户信息。 用户画像的标签体系 从技术层面看,用户画像的过程比较乏味。我们今天来讨论一个看起来最简单、却最难以把握精髓的环节:如何设计用户画像的标签体系。 什么是标签体系简单说就是你把用户分到多少个类里面去。 (2)游戏行业 游戏的用户决策过程总体上令人难以捉摸,这是因为它有点儿电影、音乐一样的艺术性特质。而人们对艺术的喜爱,并不是理性的,也就难以总结规律。
保证标签数据质量是画像平台建设不可或缺的一个重要环节,只有保证产出高质量的标签,画像平台上的功能才有价值,这也是人群圈选准确性和画像分析结论有效性的前提和基础。如何通过工程化的方式评估一个标签的质量? 画像平台常见监控为标签主键唯一性检测,指定标签数据表中不能有重复的主键ID一个用户只能有一条兴趣爱好标签数据,如果兴趣爱好标签中出现了重复UserId,说明产出有异常,需要确保标签数据主键唯一有效性度量数据是否符合约定的类型 画像平台需要检测标签实际内容是否与注册类型匹配;定期检测标签值的占比波动是否有变化;数值型标签要根据业务特点,判断取值是否异常手机操作系统,标签注册类型是字符串,如果检测发现标签值是数值类型,需要校验是否正常 画像平台需要检测各类标签是否有空值,默认情况需要给标签设置默认值;需要校验标签覆盖度,即有标签数据的用户占整体用户的比例用户南北方标签,覆盖历史全量用户,且默认值是未知,需要检测该标签覆盖率是否100% 画像平台标签数据质量检测,除了通过自行编写代码实现之外也可以选择上述开源工具实现。----本文节选自《用户画像:平台构建与业务实践》,转载请注明出处。
本节将结合实际案例介绍各类画像标签的生产方式。 M' AND t.fans_count > 100000 THEN 1 ELSE 0 END AS is_high_fans_maleFROM(SELECTt1.user_id,t1.gender,t2. JOIN (SELECTuser_id,fans_countFROM`userprofile_demo.user_fanscount_data`WHEREp_date = '2022-06-26') t2 ON (t1.user_id = t2.user_id)) t 上述语句包含三部分内容,首先通过性别和粉丝数标签数据表之间的连接操作查询到所有用户的性别和粉丝数明细数据,然后根据规则找出其中高粉男性用户 比如A调研问卷中的有效用户可以上传到画像平台并构建一个新的标签“A调研重点关注用户”;在B游戏发版后,数据分析师找到了一批潜在的优质用户作为后续重点运营群体,这些用户可以导入到画像平台并构建一个新的标签
用户画像受到热宠,不搞用户画像都不好意思说在做精细化运营了。各种用户画像标签体系建设、从0到1教你构建用户画像之类的文章广泛传播。 前几天听到有同学在规划CDP平台时,认为画像即标签,标签就是画像,用户画像和用户分群是同一主体的不同叫法,产品架构设计时,边界不清,功能交错。 标签体系一是要便于扩展,二是要便于理解和使用。标签体系比画像标签更全面、丰富,利用基础标签得到画像标签也是标签体系的输入。 画像标签是经过抽象化的数据标签,可用于用户个人画像、群体画像分析,也可作为用户圈选的标签条件。 用户分群的用户筛选条件可以来自于数据标签和画像标签,应用场景包括:人群画像分析、精细化运营和精准营销。
前言 上一篇文章已经为大家介绍了 Hive 在用户画像的标签数据存储中的具体应用场景,本篇我们来谈谈MySQL的使用! Web端产品读写MySQL数据库会有更快的速度,方便标签的定义、管理。 在介绍用户画像产品化的时候,我们会介绍元数据录入和查询功能,将相应的数据存储在MySQL中。 从整个画像调度流的关键节点来看,需要监控的环节主要包括对每天标签的产出量、服务层数据同步情况的监控等主要场景。下图展示的是用户画像调度流主要模块。 1.标签计算数据监控 主要用于监控每天标签ETL的数据量是否出现异常,如果有异常情况则发出告警邮件,同时暂停后面的ETL任务。 2. 在打通画像数据与线上业务系统时,需要考虑将存储在Hive中的用户标签相关数据同步到各业务系统,此时MySQL可用于存储结果集。
前言 上一篇文章已经为大家介绍了 HBase 在用户画像的标签数据存储中的具体应用场景,本篇我们来谈谈 Elasticsearch 的使用! 原著作者:赵宏田 来源:《用户画像方法论与工程化解决方案》 ---- Elasticsearch存储 Elasticsearch简介 Elasticsearch 是一个开源的分布式全文检索引擎, 主要查询过程包括: 1)在Elasticsearch中存放用于检索条件的数据,并将rowkey 也存储进去; 2)使用Elasticsearch的 API 根据组合标签的条件查询出 --num-executors 50--driver-memory 3g--executor-cores 2 spark-hive-to-es.jar 20190101” 任务执行完毕后 工程化案例 下面通过一个工程案例来讲解实现画像产品中“用户人群”和“人群分析”功能对用户群计算秒级响应的一种解决方案。
标签查询服务主要应用在以下业务场景中。单用户画像查询:用户画像查询功能可以通过标签查询服务来实现,给定UserId可以查出该用户的多个标签数值并展示在页面上。 许多运营类平台在展示用户信息的地方,可以借助标签查询服务获取更多元的画像标签数据来补充用户信息、丰富用户的展示维度。 同理,在客户端上判断是否展示某款游戏的入口,可以通过查询用户的“游戏兴趣标签”数值来确定,当兴趣值超过指定阈值时才可以显示游戏入口。算法工程:用户画像标签也属于算法特征,可直接应用到算法模型训练中。 推荐系统架构设计中一般会使用特征池存储推荐工程常用的特征和画像数据,借助标签查询服务也可以补充完善该部分数据。 图片----本文节选自《用户画像:平台构建与业务实践》,转载请注明出处。
前言 上一篇文章已经为大家介绍了 MySQL 在用户画像的标签数据存储中的具体应用场景,本篇我们来谈谈 HBase 的使用! 在该场景中可通过画像系统实现对应功能。 业务逻辑上,渠道运营人员通过组合用户标签(如“未注册用户”和“安装距今天数”小于××天)筛选出对应的用户群,然后选择将对应人群推送到“广告系统”,这样每天画像系统的ETL调度完成后对应人群数据就被推送到 工程化案例 运营人员在画像系统中根据业务规则定义组合用户标签筛选出用户群,并将该人群上线到广告系统中。 ,另一方面可以支持单个用户标签的查询,例如查看某 id 用户身上的标签,以便运营人员决定是否对其进行运营操作。
微博大数据经过近两年不断地调整、磨合、优化,针对社交媒体特性,研发构建了一整套完整的用户画像体系。 同时,大数据的用户画像体系已应用于微博众多的业务场景中,并随着微博业务的发展不断完善升级,将“大数据”概念落地落实。 二、能力标签的应用场景 目前能力标签已经应用于微博众多业务场景中,其中两个典型的业务场景是“微博找人”和“热门微博”,分别如图2和图3所示。 ? 图2:为“微博找人”业务直接推荐各个行业的专家账号 ? 相对于用户能力标签,用户兴趣标签涉及到的上层业务更加广泛,依赖的数据也更加复杂多变,在下一篇用户画像系列文章中,我们将会详细介绍用户兴趣标签的挖掘流程。
关于系统学习用户画像,之前已经分享过2篇文章了,分别是《超硬核 | 一文带你入门用户画像》和《用户画像 | 开发性能调优》,收到的读者反馈还不错! Hive数据仓库 建立用户画像首先需要建立数据仓库,用于存储用户标签数据。 在画像系统中主要使用Hive作为数据仓库,开发相应的维度表和事实表来存储标签、人群、应用到服务层的相关数据。 分区存储 如果将用户标签开发成一张大的宽表,在这张宽表下放几十种类型标签,那么每天该画像宽表的ETL作业将会花费很长时间,而且不便于向这张宽表中新增标签类型。 例如,在画像产品中,输入用户id后通过直接查询该表,解析标签id和对应的标签权重后,即可在前端展示该用户的相关信息 ID-MAP 开发用户标签的时候,有项非常重要的内容——ID-MApping
分享嘉宾:王琛@神策数据 编辑整理:冯露 出品平台:DataFunTalk 导读:用户画像是建立在数据基础之上的用户模型,是产品改进、精准营销等业务场景中不可或缺的重要基础。 而构建用户画像的过程就是要给用户打上各种维度的标签,并基于标签进行定性或定量分析。这其中,建设灵活、全面、高效的标签体系是工作的重中之重。 2. 用户标签的应用价值 ? 用户标签的应用主要是四种场景: 用户特征洞察: 辅助用户分析和用户洞察,用户标签可以帮助业务人员快速的对用户有一个认知,然后发现里面显著的特征,获得一些商业灵感。 2. 根据标签的使用目的,体系化梳理标签 总体来说,无论是产品还是运营,我们都把它叫做业务部门,他们应用标签的流程实际上一般来讲就分三步。 ? 目标人群是谁? 2. 简化的数据模型 在这个流里,数据模型其实是非常简单的,基本会分成两大类:用户行为数据、用户属性数据。 ? 用户行为表: ?
Hive数据仓库 建立用户画像首先需要建立数据仓库,用于存储用户标签数据。Hive是基于Hadoop的数据仓库工具,依赖于HDFS存储数据,提供的SQL语言可以查询存储在HDFS中的数据。 在画像系统中主要使用Hive作为数据仓库,开发相应的维度表和事实表来存储标签、人群、应用到服务层的相关数据。 分区存储 如果将用户标签开发成一张大的宽表,在这张宽表下放几十种类型标签,那么每天该画像宽表的ETL作业将会花费很长时间,而且不便于向这张宽表中新增标签类型。 例如,在画像产品中,输入用户id后通过直接查询该表,解析标签id和对应的标签权重后,即可在前端展示该用户的相关信息 ID-MAP 开发用户标签的时候,有项非常重要的内容——ID-MApping,即把用户不同来源的身份标识通过数据手段识别为同一个主体 ON t1.userid = t2.userid UNION SELECT userid, cookieid,