背景描述

聊天机器人(Chatterbot)是经由对话或文字进行交谈的计算机程序,其能够模拟人类对话,通过图灵测试。“Eliza”和 “Parry”是早期非常著名的聊天机器人。它试图建立这样的程序:至少暂时性地让一个真正的人类认为他们正在和另一个人聊天。本数据集包含了从原始电影脚本提取的大量元数据丰富地虚构对话集合,涉及10,292对电影角色之间的220,579次会话交换、617部电影中的9035个字符,共304713个词语,用户可使用该数据建立LSTM模型,以建立自己的聊天机器人。


数据说明

  • 文件列表

    1. movie_lines.txt——每次对话的实际文本
    2. movie_conversations.txt——对话文本之间的关系
  • 数据集整体特征


  • 属性描述

  • 数据示例

数据分析

  • 模型建立参考

    1. LSTM和Encoder-Decoder框架LSTM(Long Short-Term Memory)是长短期记忆网络,是一种时间递归神经网络,适合于处理和预测时间序列中间隔和延迟相对较长的重要事件。

      Encoder-Decoder是Seq2Seq的基础框架,包括Encoder、Decoder以及连接两者的中间状态向量;Encoder通过学习输入,将其编码成一个固定大小的状态向量S,继而将S传递给Decoder,Decoder再通过对状态向量S进行学习来进行输出,如下图所示:


数据使用

点击查看读取示例

数据来源

康奈尔大学计算机科学系

相关研究

【1】Github(easy_seq2seq)

【2】Greff K, Srivastava R K, Koutník J, et al. LSTM: A Search Space Odyssey[J]. IEEE Transactions on Neural Networks & Learning Systems, 2015, 28(10):2222-2232.

【3】Gers F A, Schmidhuber J, Cummins F. Learning to forget: continual prediction with LSTM[C]// Ninth International Conference on Artificial Neural Networks ICANN. IET, 2002:850-855.

【4】Sriram A, Jun H, Satheesh S, et al. Cold Fusion: Training Seq2Seq Models Together with Language Models[J]. 2017.