DeepShip数据集是一个大规模的真实世界水下录音数据集,专门用于水下声学研究,包括船只分类和噪声检测。
DeepShip数据集规格
以下是对DeepShip数据集规格的详细总结:
数据集规模和多样性
包含47小时和4分钟的真实世界水下录音。
录音涵盖了265艘不同的船只,分为四个类别:油轮(Oil Tanker)、拖船(Tug)、客轮(Passenger Ship)和货轮(Cargo Ship)。
录音条件
录音在一年中的不同时间进行,包括不同的海况和噪声水平。
录音地点位于太平洋西北海岸最繁忙的航道之一,靠近加拿大最繁忙的港口——温哥华。
数据收集
使用Ocean Sonics icListen AF水听器进行数据收集,该设备具有高灵敏度和宽频带特性。
录音以32 kHz的采样率保存,并以wav文件格式提供,以确保与机器学习和深度学习社区使用的平台/库兼容。
数据标注
利用自动识别系统(AIS)数据来获取船只的位置和时间戳,确保数据集的准确性。
只包括在水听器2公里半径内单独船只发出的信号。
数据集结构
数据集分为四个类别的文件夹,每个类别包含两种类型的文件:.wav音频数据文件和包含录音信息的元数据文件(如cargo-metafile, tug-metafile等)。
元数据文件提供了诸如船只ID、录音ID、船只名称、录音日期和时间、录音时长以及船只与传感器之间的距离等信息。
数据集可用性
数据集可以在GitHub的特定仓库下载,但由于文件大小和存储空间限制,只有部分数据集被上传到该仓库。
提供了详细的下载信息,以便用户可以下载完整的数据集。
数据集特点
提供了大规模的、高质量的、经过良好标注的水下录音数据,为水下声学分类任务提供了丰富的资源。
由于录音涵盖了不同的环境条件和船只类型,数据集具有很高的多样性和代表性。
数据集应用
可以用于训练和评估不同的机器学习和深度学习算法,以提高水下声学信号分类的准确性。
适用于军事目的以及商业用途,如海上交通管理、渔业和海洋环境保护。
数据集贡献
DeepShip数据集的提供,不仅有助于评估现有算法的性能,也将促进未来水下声学分类技术的发展。

预处理步骤
DeepShip数据集在用于训练和评估船只分类模型之前,经过了以下预处理步骤:
数据分割
将录音分割成多个时间段,每个时间段对应一个独立的数据样本。这是为了确保模型可以处理和学习不同时间段内的声学特征。
采样率调整
原始录音可能以不同的采样率进行,预处理中可能包括将所有录音重采样到统一的采样率,例如32 kHz,以便于处理和分析。
帧分割
将每个时间段的信号分割成短帧,并使用滑动窗口方法来提取帧。这些帧通常用于时频特征的提取。
特征提取
从分割得到的帧中提取时频特征,如梅尔频率倒谱系数(MFCC)、梅尔频谱图、小波包、伽马tone频率倒谱系数(GFCC)、恒定Q变换(CQT)和倒谱等。
数据格式化
将提取的特征转换为适合输入到机器学习和深度学习模型的格式,例如将时频特征转换为图像形式。
数据增强
尽管文档中没有明确提到,但数据增强是提高模型泛化能力的一个常见步骤,可能包括添加噪声、时间拉伸、频率偏移等技术。
数据标注
使用自动识别系统(AIS)数据来获取船只的位置和时间戳,以确保数据集的准确标注。
数据集划分
将数据集划分为训练集和测试集,以评估模型性能。通常一部分数据用于训练,另一部分用于测试。
数据平衡
确保训练和测试集中各类别样本的数量均衡,避免模型对某一类别的偏见。
归一化/标准化
可能对特征数据进行归一化或标准化处理,以消除不同特征量纲带来的影响,加速模型训练过程。
去除无关噪声
在某些情况下,可能需要去除录音中的非目标噪声,如环境噪声或其他非船只噪声。
数据集结构化
将数据组织成结构化的格式,如文件夹按船只类别分类,以及包含元数据的文件,以便于数据管理和访问。
这些预处理步骤为后续的特征学习和模型训练提供了干净、一致且格式正确的数据输入。
声纳性能指标
DeepShip表格提供了一个名为icListen Smart Hydrophone的智能水听器的主要规格和特性。以下是对表格中各项参数的翻译和解读:
Bandwidth (带宽):1 Hz to 12 kHz。这意味着水听器可以捕捉从1赫兹到12千赫兹的声波,覆盖了人耳听力范围之外的更广频率。
Dynamic Range (动态范围):120 dB。表示水听器能够处理的声音强度范围,120分贝的动态范围意味着它可以分辨非常微弱到非常响亮的声音。
Sensitivity (灵敏度):−170 dBV re. μPa。这指的是水听器对声波的敏感度,−170 dBV re. μPa是一个相对较高的灵敏度,意味着它可以检测到非常微小的声压变化。
Sampling frequency (采样频率):32 kHz。水听器每秒可以采样32000次,这为捕捉高频声音提供了足够的采样点。
Power Input (电源输入):12–24 Vdc, 0.8 W。水听器的电源输入范围是12到24伏特直流电,消耗功率为0.8瓦特。
Output Interface (输出接口):Ethernet。数据通过以太网接口传输,这是一种常见的网络传输方式,可以方便地与其他设备连接。
Internal Storage (内部存储):32 GB。水听器内置32GB的存储空间,用于保存录制的音频数据。
Case Material and Depth (外壳材料和深度):Engineered Plastic – 200 m, Titanium - 3500 m。水听器的外壳材料根据使用深度不同而有所区别,在200米深度以内使用工程塑料,在3500米深度以内使用钛金属,以适应不同的水下压力。
这个水听器是一个紧凑型的全合一仪器,设计用于实时处理采集到的数据,并能直接输出数字信号。它被设计用于在水下环境中长时间记录音频数据,适用于海洋生物观察、船舶交通监控以及其他水下声学研究。

数据收集处理流程
DeepShip数据集中的船只分类是基于水下声学信号的录音来进行的。关键因素包括:
声学特征
船只发出的声音信号包含了可以用于分类的特征,如发动机噪音、螺旋桨噪声等。
录音条件
数据集在不同的海况和季节条件下收集,确保了录音的多样性和代表性。
船只类型
数据集涵盖了不同类型的船只,包括油轮、拖船、客轮和货轮,每种类型的船只都有其独特的声学特征。
时间-频率特征
从录音中提取的特征包括梅尔频率倒谱系数(MFCC)、梅尔频谱图、小波包、伽马tone频率倒谱系数(GFCC)、恒定Q变换(CQT)和倒谱等,这些特征有助于揭示船只声音信号的不同方面。
自动识别系统(AIS)数据
使用AIS数据来获取船只的位置和时间戳,确保了录音数据的准确标注。
信号处理技术
应用各种信号处理技术来增强信号并提取有用的特征,如滤波、去噪等。
机器学习和深度学习算法
使用不同的机器学习和深度学习算法来训练模型,以识别和分类船只类型。这些算法包括支持向量机(SVM)、随机森林(RF)、K最近邻(KNN)、朴素贝叶斯等传统方法,以及卷积神经网络(CNN)、残差网络(ResNet)、Inception网络等深度学习方法。
特征可视化
使用t-SNE等数据可视化技术来分析和展示特征在高维空间中的分布,帮助理解不同类别船只声音信号的区分度。
性能评估
通过准确率、精确率、召回率和F1分数等指标来评估分类模型的性能。
统计测试
使用配对样本统计t-检验来分析分类结果的显著性,确保分类方法的有效性。
