尽管我在2016年就有知晓博雅大数据学院和数据酷客,但是由于种种原因没有深入接触。这次云实训项目是我的好友陈老师热心拉我入群才知道的。由于知晓的时候第一次课已经开始了,所以最后项目考勤少了第一次的考勤记录。但是,项目的主题是精准营销立刻吸引了我,执意要完成这个项目。作为营销专业的老师,课上总和学生说大数据在营销中有重大应用,但是究竟是如何应用的呢,其实心理也没有清楚的答案。这次无疑是一次向往已久的探索之旅。
本次实训项目针对某移动支付平台的367万条客户交易流水脱敏数据,经过从MySQL数据库进行数据读取与解析、数据预处理、客户交易行为分析等步骤,对客户数据完成清洗和初步的分析。接着参考电商平台客户标签体系构建的步骤,建立包括事实类、规则类、预测类和文本类四大类别的客户标签体系。基于客户标签体系,刻画用户画像,构建不同商品类别的客户兴趣排行榜以及自定义的客户筛选,实现精准营销。从我个人经验看,数据分析分为业务层、技术层和应用层。本项目6个环节涵盖了所有三个层次。我的收获也可以按这三个层次进行总结:
(一)业务层
在业务层面上,通过项目背景与目标环节,对大数据精准营销有了深入的理解。电商尤其是移动电商平台的普及和消费者网络购物偏好的养成,使得电商平台获得了前所未有的关于消费者的社会经济属性、消费偏好(包括品类和品牌偏好)、需求特征、地理位置信息等相关内容的大数据。这些大数据经过有效的数据挖掘,可以为电商平台提高了解客户群体的高价值信息。
自动化地根据客户全体的各种特征标签进行市场细分,并对不同的细分市场进行千人千面的个性化精准的营销。目前,智慧营销的一个趋势是将线下和线上营销场景打通,让线下零售实体也能通过新的人工智能技术如人脸识别技术,将客户的线下消费信息与线上注册和网购信息打通,形成更为完整和精确的用户画像,从而更为高效、智能地实现从过去人找商品服务到将来商品服务根据客户的需求和应用场景进行自动的商品和服务推送,简化提升消费的过程,提升消费体验的水平。
(二)技术层
在技术层面上,首先是对该类行业数据的标准处理流程的理解更为清晰。其次是对统计模型Logistic的理论和评价有了新的认识;再次,对Python语言的数据分析的能力和使用技巧有了提高。下面,我们从数据分析的流程环节,逐个展开:
(1)数据导入和整理
通过对数据的读取与转换、数据预处理的练习,提升了对交易流水数据的实际处理能力。本案例的交易流水数据只有客户ID、交易时间、交易金额、交易附言等不多的字段,但是涵盖了一般的分类数据、数值数据、时间数据和文本数据。这些不同类型数据在异常值、缺失值、重复项以及数据类型转换上有所不同。
在本部分的编程心得:Python的PyMySQL模块可以实现从SQL数据库的数据提取;Pandas模块是数据分析特别是表格数据处理的必备利器。
(2)数据的探索性分析
在得到整洁的流水数据后,开始进行客户交易行为分析。交易行为的分析可以通过三个维度进行:时间维度、交易属性维度和交易附言文本的关键词提取维度进行。在交易时间维度,探索交易次数的时间分布规律。在交易属性维度,交易次数和交易金额是分析的重点。用直方图、核密度图等可视化的方法来了解交易的次数和平均交易金额的分布。可以从总体的角度,了解客户群体的消费行为的概况。
此外,还有客户交易流入和流出次数和金额的可视化分析,可以进一步通过了解客户整体的流入和流出次数和金额,推测整体上客户群体的资金流动特征。
在本部分收获最大的是交易附言的文本分析。这是文本这种非结构化数据在电商领域的典型应用。交易附言的信息可信度极高,是比社交软件中的聊天文本更真实和有价值的文本。通过分词-过滤无效词-绘制词云图—关键词提取,可以获得客户关注的商品和交易类型等信息。在关键词提取,TF-IDF算法不仅考虑了单词的词频还考虑了该单词在该文本中的独特性(逆文档词频),因而能更好地挖掘关键词。
通过词云图和关键词分析,我们发现文本内容主要集中在消费、转账、购物等方向。所以在之后构建客户标签体系和画像时,我们应着重从这些方面对客户进行刻画,分析其中的规律。
在本部分的编程心得:Python的Pandas模块提供了分组-应用-组合等非常方便的数据整理和分析功能,还提供了与MatPlotlib绘图库的无缝接口,其独特的方法链式操作,让表格数据处理一气呵成;此外,Matplotlib和Seaborn模块为Python提供了可以与R语言竞争的绘图图表,如折线图、条图、带核密度曲线的直方图、热图等。
(3)数据建模和构建数据标签
结合结构化数据和非结构化文本数据,从交易属性、消费偏好、行为特征三大维度构建客户的事实、规则、文本标签体系。在事实标签方面,计算每个客户的交易次数、金额、转账次数、金额,结合交易附言判断交易的不同类型,对各类交易计算次数和金额等相关特征标签;然后,在事实标签的基础上进行推理和价值判断,建立规则类标签。主要的工作是判断否为休眠用户,是否为高价值客户。而在用户价值的评价上采用了营销领域的RFM模型。
在根据特征标签对客户是否为高价值客户的预测中采用了机器学习中的Logistic回归模型。该模型虽然简单,但在行业中因为其解释性好,速度快而广为应用。
之后,还对预测的客户价值等级与高端消费行为进行了相关性研究。最后,用词云图和客户的文本标签、数值标签来对典型用户进行特征画像,全面了解典型客户的社会属性、消费行为和消费偏好。
在本部分的编程心得:除了进一步了解了Python的Pandas模块数据分析功能,Matplotlib和Seaborn模块的绘图功能之外,还认识到Python机器学习必备模块Sklean的机器学习模型建立和应用的标准流程以及其在文本挖掘中的应用。
(三)应用层
在应用层面上,在客户历史数据的基础之上,通过客户之前的消费习惯来推测之后的消费倾向。通过分析前面构建的客户标签体系来个性化营销方案,具体有两种方式:第一种通过商品兴趣度排行榜的构建。即计算客户对某类商品的兴趣度,根据兴趣度的排名进行营销。第二种通过目标客户的筛选。根据客户标签体系,筛选满足固定特点的群体进行营销。前者,更适用于自动化推送;后者,则需要营销业务人员对目标客户的特征有深刻的认识和把控。关于更多的应用层面设计是可以进一步研究的方向
本次的实训也让我感受到了数据酷客云实训平台是国内支持学生学习数据科学理论与实践的良心之作。基于服务器后台安装后直接通过浏览器登录;填空式代码编程界面和知识点讲解相结合;教师的代码参考答案的展示,这些都使得教师和学生学习编程的难度大为降低。而闯关式任务安排,又能让学生以闯关夺宝的心态沉浸其中,激发学习兴趣。
通过本次实训,我更感受到了让学生能以较低的门槛享受的数据分析在行业中的作用和价值,可能是高校教育者开展数据科学类课程的重点任务。具体行业应用场景的针对性实训项目和易于上手的云实训平台,对学生的就业技能是非常有帮助的。对于以往没有接受过数据科学系统训练的教师,也是如此。
在本科实训课程开展上,我感觉6次课的内容密度过大。如果我开展实训,会将之扩展到15-20学时,增加相关理论和代码的深度讲解,以帮助学生能更全面地了解行业的背景和业务知识、机器学习模型、编程模块和编程技巧以及最后的数据分析报告的完成。
最后,提一提该平台可以做得更好的地方。
1.学生代码出现时,可以有相关知识点的提示;
2.对学生学习课程的学业预警;
3.平台使用老师能定制部分内容和学习任务;
4.更多的对就业有帮助的实训项目。
最后的最后,祝愿博雅大数据学院和各位同仁能为我国培养出更加的数据产业的精英。
本文作者朱振涛,南京工程学院教师。数据科学“云实训”项目训练营结业学员。| 数据科学云实训直播回放、课件 数据科学“云实训 ”第一课 :数据科学精准营销项目介绍 数据科学“云实训”第二课 :精准营销数据预处理 数据科学“云实训”第三课 :客户交易行为分析 数据科学“云实训”第四课 :事实类标签与规则类标签构建 数据科学“云实训”第五课 :预测类标签与文本类标签构建 数据科学“云实训”第六课 :典型客户分析与精准营销应用
