数据集简介

简介

本文主要介绍常见的几个数据集,包括

Retailrocket推荐系统数据集

  • 简介
    数据集由三个文件组成:一个包含行为数据的文件(events.csv),一个具有项目属性的文件(item_properties.сsv)和一个描述类别树的文件(category_tree.сsv)。数据是从真实世界的电子商务网站收集的。它是原始数据,即没有任何内容转换,但是,由于机密问题,所有值都被哈希化。发布的目的是激发具有隐式反馈的推荐系统领域的研究。
    我是数据集链接 获取数据集点我!

  • 数据集内容
    在这里插入图片描述
    在这里插入图片描述
    在这里插入图片描述在这里插入图片描述

  • 内容 (events.csv)
    这些行为数据包括点击,添加到购物车、交易等事件。访问者可以创建三种类型的事件,即“查看”、“添加购物车”或“交易”。
    一共有275 6101个事件,其中包括266 4312次查看,6 9332次添加到购物车,还有2 2457次交易,这些数据由140 7580个不同的访问者产生。大约90%的事件对应的属性可以在“item_properties”中找到。

  • For example:
    “1439694000000,1,view,100,” means visitorId = 1, clicked the item with id = 100 at 1439694000000 (Unix timestamp)
    “1439694000000,2,transaction,1000,234” means visitorId = 2 purchased the item with id = 1000 in transaction with id = 234 at 1439694000000 (Unix timestamp)

  • 对于item_properties.csv文件
    这是一个包含商品属性的文件,包括20 275 902行,即不同的属性,描述了417 053个唯一项目。由于文件大小的限制,文件分为2个文件。
    由于项目的属性可以随时间变化(例如,价格随时间而变化),因此文件中的每一行都有相应的时间戳。
    但是,如果项目的属性在观察期间内保持不变,则文件中将仅存在一个快照值,例如:原始数据如下
    在这里插入图片描述
    合并之后如下:
    在这里插入图片描述
    可以看出,对于只有时间不同而其他值全相同的记录,只保留了第一条数据记录。

  • 对于 category_tree .csv
    类别树文件有1669行。文件中的每一行都指定一个子类别ID和相应的父类别


filmtrust数据集

FilmTrust是2011年6月从整个FilmTrust网站上抓取的一个小型数据集。
1. rating.txt:35497个项目评分,格式:userId,movieId,movieRating
2. trust.txt:1853年定向信任评级,格式:trustorId,trusteeId,trustRating
获取数据集点这里!
获得相关论文点这里!


动漫推荐数据库

该数据集包含有关来自12,294动漫的73,516个用户的用户偏好数据的信息。每个用户都可以将动漫添加到他们的完整列表中并为其指定一个评分,并且该数据集是这些评分的汇总。
获取数据集点这里!

  • 内容
  1. Anime.csv
    anime_id:标识动漫的唯一ID。
    name -动漫的全名。
    genre -动漫的标签,用逗号隔开
    type -电影,TV,OVA等
    episodes -该节目中有多少集。(如果是电影则为1)。
    rating -该动画的平均评分(满分10分)。
    members -此动漫的“组”中的社区成员数。
  2. Rating.csv
    user_id -无法识别的随机生成的用户ID。
    anime_id-该用户已评分的动漫。
    rating -该用户已指定的评分(满分10分)(如果观看了该评分但未分配评分,则为-1)。
    在这里插入图片描述在这里插入图片描述

Steam Video Games

该数据集是用户行为的列表,其列为:用户ID,游戏标题,行为名称,值。包括的行为是“购买”和“玩耍”。该值表示行为的执行程度-在“购买”的情况下,该值始终为1;在“玩游戏”的情况下,该值表示用户玩游戏的小时数。
在这里插入图片描述

Netflix奖项数据集

Netflix数据集包含了1999.12.31-2005.12.31期间匿名客户提供的超过一亿部电影平级。这个数据集大约给出了480189个用户和17770部电影评级。
training set的评分数量为100480507。probe set是training set的子集,包含1408395个评分。Netflix大赛的目标是预测qualifying set。
我是数据集下载网址
我是数据集详解博客网址

  • 包含的文件
  1. movie_titles.txt 包含电影的信息,格式是:Movie ID,Year Of Release,标题
    注:
    MovieID的顺序范围为1到17770。
    CustomerID范围从1到2649429。 有480189位用户。
    评级为1到5的五星级(整数)。
    日期的格式为YYYY-MM-DD。

     	例如:
     		1,2003,Dinosaur Planet
     	    2,2004,Isle of Man TT 2004 Review
    
  2. training_set 训练集,

     格式是:
    		MovieID:
    		CustomerID1,评级,日期    
    		CustomerID2,评级,日期...
    
    	例如:
    		1:
    		1488844,3,2005-09-06
    		822109,5,2005-05-13
    		885013,4,2005-10-19
    		30878,4,2005-12-26
    		823519,3,2004-05-03
    		893988,3,2005-11-17
    		124105,4,2004-08-05
    
  3. probe set(探测集)
    格式如下:

     MovieID1:
     	CustomerID11
     	CustomerID12
     	…
     	MovieID2:
     	CustomerID21
     	CustomerID22
    
  4. qualifying_data(测试集)
    格式如下:

     MovieID1:
     	CustomerID11,Date11
     	CustomerID12,Date12
     	…
     	MovieID2:
     	CustomerID21,Date21
     	CustomerID22,Date22
    

参赛者需根据训练集中的信息来预测客户在测试集中为电影提供的所有评级。提交的预测文件的格式遵循电影ID、客户ID和日期顺序


版权声明:本文为qq_39210964原创文章,遵循CC 4.0 BY-SA版权协议,转载请附上原文出处链接和本声明。