我的资源
共 246 个数据集
美国总统竞选Tweet数据集
Natural Language Processing
美国总统竞选Tweet数据集

供社交数据挖掘练习使用,推特收集于2016年5月约240,000条推特关于时美国总统候选人的推特

1 下载 · 0 赞获取 →
英文作文写作文本数据
Natural Language Processing
英文作文写作文本数据

该数据集分为测试集和训练集合两部分,提供围绕特定主题的英语文章文本数据——可用于NLP的训练和学习

2 下载 · 1 赞获取 →
女性用户网购服装反馈数据集
Natural Language Processing
女性用户网购服装反馈数据集

该数据集包含23000个顾客的网购评论及评价,基于真实的消费记录。

1 下载 · 0 赞获取 →
Depression Analysis
Speech Recognition
Depression Analysis

using machine learning to analyze it and be able to produce meaningful outcome.

2 下载 · 1 赞获取 →
新冠肺炎声音诊断挑战赛数据集
语音识别声纹识别
新冠肺炎声音诊断挑战赛数据集

本次比赛使用的数据来自Coswara1数据集。包括1276位受试者,按3:1比例分为训练集和测试集。每个测试人提供四条信息:id、covid_status、性别、年龄,都显示在文件名中。id格式用文件名前的数字表示,例如9_Negative_male_26_cough.wav表示id为9。covid_status分为positive和negative两类,分别表示新冠检测阳性和阴性。每人提供一个咳

2 下载 · 1 赞获取 →
Speech commands classification
Speech Recognition
Speech commands classification

Speech commands for AI bots and Humans Speech to Speech communications.

1 下载 · 1 赞获取 →
LibriSpeechQuickLM
Speech Recognition
LibriSpeechQuickLM

Quick language model task for Librispeech

1 下载 · 0 赞获取 →
Free Spoken Digit Dataset
Speech Recognition
Free Spoken Digit Dataset

Think MNIST for audio.

1 下载 · 0 赞获取 →
AISHELL-4 多通道中文会议开源语音数据库
语音增强语音分离
AISHELL-4 多通道中文会议开源语音数据库

AISHELL-4是一个通过麦克风阵列实录的八通道中文普通话会议场景语音数据集。该数据集共包含211场会议,每场会议4至8人,数据集共120小时左右。该数据集旨在促进实际应用场景下多说话人处理的研究。AISHELL-4数据包括了实际会议场景下各种重要特性,例如停顿、重叠、说话人轮转、噪声等。同时数据集提供了准确的音字转写文本及时间戳信息,方便研究者进行诸如前端处理、语音识别、说话人分割等单独任务,

0 下载 · 2 赞获取 →
GigaSpeech:10000小时多领域英语开源数据集发布
Speech Recognition
GigaSpeech:10000小时多领域英语开源数据集发布

GigaSpeech是一个不断发展的、多领域英语语音识别语料库。它拥有10000小时的高质量标注音频,适用于有监督训练任务;以及33000小时的总音频,适用于半监督和无监督训练任务。

0 下载 · 0 赞获取 →
THUOCL-清华大学thunlp中文词库
Natural Language Processing
THUOCL-清华大学thunlp中文词库

THUOCL是由清华大学自然语言处理与社会人文计算实验室整理推出的一套高质量的中文词库,词表来自主流网站的社会标签、搜索热词、输入法词库等

5 下载 · 0 赞获取 →
肠道微生物与免疫BIO标注数据集
Natural Language Processing
肠道微生物与免疫BIO标注数据集

肠道微生物与免疫BIO标注数据集

2 下载 · 0 赞获取 →