COVID-19咳嗽音频分类数据集
摘要:COVID-19 CNN MFCC 分类数据集(COVID-19 CNN MFCC Classification Dataset)是一个使用梅尔频率倒谱系数(Mel-frequency cepstral coefficients, MFCC)和卷积神经网络(CNN)对 COVID-19 咳嗽进行高精度分类的数据集,特别适用于智能家居设备。
数据集简介
数据集概述
COVID-19 CNN MFCC 分类数据集(COVID-19 CNN MFCC Classification Dataset)是一个使用梅尔频率倒谱系数(Mel-frequency cepstral coefficients, MFCC)和卷积神经网络(CNN)对 COVID-19 咳嗽进行高精度分类的数据集,特别适用于智能家居设备。在家庭环境中早期诊断 COVID-19 可以通过智能家居设备实现,这些设备可以对咳嗽音频输入进行分类,并判断是否为 COVID-19。该领域的研究目前较为稀少,数据难以获取。然而,一些小型数据收集项目已经使音频分类研究能够应用不同的机器学习分类算法,包括逻辑回归(LR)、支持向量机(SVM)和卷积神经网络(CNN)。研究表明,使用将音频转换为 MFCC 频谱图图像作为输入的 CNN 可以实现高精度结果,验证数据分类准确率达到 97.5%,正确分类 COVID-19 和非 COVID-19 标记的音频。该工作提供了概念验证,证明小数据集也可以实现高精度,这在该领域具有重大影响。结果非常令人鼓舞,为学术界在这一重要主题上的研究提供了更多机会。
数据集包含 2 个类别:(1) COVID(COVID-19 咳嗽):患有 COVID-19 的人的咳嗽音频;(2) Not COVID(非 COVID-19 咳嗽):健康人或其他疾病的咳嗽音频。数据类型:咳嗽音频数据。特征提取方法:MFCC(梅尔频率倒谱系数):将音频转换为 MFCC 频谱图图像作为 CNN 输入。分类方法:使用卷积神经网络(CNN)进行二元分类,验证数据准确率达 97.5%。应用场景:智能家居设备中的实时 COVID-19 咳嗽检测。机器学习算法对比:数据集支持多种算法应用,包括逻辑回归(LR)、支持向量机(SVM)和卷积神经网络(CNN),CNN 表现最佳。
支持 COVID-19 早期诊断(家庭环境)、咳嗽音频分类(COVID vs 非 COVID)、智能家居设备应用(实时音频检测)、深度学习模型训练(CNN)、音频信号处理(MFCC 特征提取)、频谱图图像分类、计算机辅助诊断(CAD)系统、远程医疗诊断、公共卫生监测、疫情响应、医学音频分析、机器学习算法对比(LR/SVM/CNN)、小数据集高精度分类研究、概念验证、智能健康监测、非接触式诊断、临床决策支持。该数据集为在数据稀缺情况下实现高精度 COVID-19 咳嗽检测提供重要技术支持,特别是在智能家居设备的应用场景中,具有重大实用价值和社会意义。
数据集来源
由 Dunne, Robert(2020,曼彻斯特大学,DOI: 10.17632/ww5dfy53cw.1)创建,包含咳嗽音频,2 类(COVID/非 COVID),MFCC 频谱图 + CNN,验证准确率 97.5%,对比 LR/SVM/CNN(CNN 最佳),专为智能家居设备 COVID-19 咳嗽检测和家庭环境早期诊断设计。由张家梁(Bob)整理并于2026年在7zcode平台公开发布。
数据集信息
免责声明与引用
数据仅用于科研与教学用途。若用于商业场景,请自行核验数据许可。如需引用,请在论文或报告中注明数据集名称与版本号。
作者信息
作者:Bob (张家梁)
项目编号:Datasets-155
文件大小:90M
原创声明:本数据集为整理作品
