背景描述

该数据集包含了1,600,000条从推特爬取的推文,可用于情感分析相关的训练。

数据说明

该数据集包含两个数据文件:测试集(test)和训练集(training)数据文件没有包含heading,从左到右分别是:


  • 推文标注(polarity): 0 = 负面,2 = 中立,4 = 正面
  • 推文的id
  • 时间:Sat May 16 23:58:44 UTC 2009
  • Query (lyx),如果没有query,数值为NO_QUERY.
  • 发推的用户:robotickilldozr
  • 推文内容

相关论文中有更多数据解释:https://cs.stanford.edu/people/alecmgo/papers/TwitterDistantSupervision09.pdf

数据来源

数据来自Sentiment 140 官网,由斯坦福学生Alec Go, Richa Bhayani, Lei Huang 创建。

问题描述

发布者罗列了许多有待解决的问题:

  • 创建一个推文分类器来分辨“主观”和“客观”的推文:哪些推文更感性?
  • 区分哪些内容是与某个名词相关的:给定一段推文,自动检测推文是否与某个名词相关
    • 例如:关于名词“Google”“I love Google” 这条推文是关于“Google”的“You should Google that”这条推文中的Google是动词,与名词Google无关
  • 给推文按照不同的主题分类,比如自动检测某个推文属于哪个主题
  • 标签云
  • 这里有更多