分享
供社交数据挖掘练习使用,推特收集于2016年5月约240,000条推特关于时美国总统候选人的推特
该数据集分为测试集和训练集合两部分,提供围绕特定主题的英语文章文本数据——可用于NLP的训练和学习
using machine learning to analyze it and be able to produce meaningful outcome.
本次比赛使用的数据来自Coswara1数据集。包括1276位受试者,按3:1比例分为训练集和测试集。每个测试人提供四条信息:id、covid_status、性别、年龄,都显示在文件名中。id格式用文件名前的数字表示,例如9_Negative_male_26_cough.wav表示id为9。covid_status分为positive和negative两类,分别表示新冠检测阳性和阴性。每人提供一个咳
Speech commands for AI bots and Humans Speech to Speech communications.
AISHELL-4是一个通过麦克风阵列实录的八通道中文普通话会议场景语音数据集。该数据集共包含211场会议,每场会议4至8人,数据集共120小时左右。该数据集旨在促进实际应用场景下多说话人处理的研究。AISHELL-4数据包括了实际会议场景下各种重要特性,例如停顿、重叠、说话人轮转、噪声等。同时数据集提供了准确的音字转写文本及时间戳信息,方便研究者进行诸如前端处理、语音识别、说话人分割等单独任务,
GigaSpeech是一个不断发展的、多领域英语语音识别语料库。它拥有10000小时的高质量标注音频,适用于有监督训练任务;以及33000小时的总音频,适用于半监督和无监督训练任务。
THUOCL是由清华大学自然语言处理与社会人文计算实验室整理推出的一套高质量的中文词库,词表来自主流网站的社会标签、搜索热词、输入法词库等
