当前位置: 首页 > news >正文

多模态情感识别数据集

摘要:本数据集选用 CREMA-D 和 RAVDESS 两个公开多模态情感识别数据集作为实验数据来源。两个数据集均包含语音和视频信息,能够同时提供语音声学特征与面部视觉特征,适合用于多模态情感识别模型的训练、验证和性能评估。

数据集简介

数据集概述

CREMA-D 数据集包含 91 名演员录制的 7,442 个音视频片段,演员年龄范围为 20~74 岁,涵盖不同性别和族裔。数据集包含愤怒、厌恶、恐惧、快乐、中性和悲伤 6 类基本情绪,并设置低、中、高及未指定等不同情绪强度,具有较丰富的情感表达形式。

RAVDESS 数据集由 24 名专业演员录制,共包含 7,356 条数据,其中视频语音文件 2,880 个。数据集涵盖中性、平静、快乐、悲伤、愤怒、恐惧、厌恶和惊讶 8 类情绪,并设置正常和强烈两种情绪强度。其音视频数据同步性较好、类别标注清晰,可为多模态情感识别算法研究提供可靠的数据基础。

1. CREMA-D

CREMA-D 数据库(Cao 等,2014)包含 7,442 个视频片段,由 91 名演员参与录制,其中男性 48 名、女性 43 名,年龄范围为 20~74 岁。演员具有不同的族裔背景,包括非裔美国人、亚裔、白人、西班牙裔以及未注明族裔。

演员使用英语朗读 12 个语音平衡句子,并分别表达六种基本情绪:

愤怒(Anger)、厌恶(Disgust)、恐惧(Fear)、快乐(Happy)、中性(Neutral)和悲伤(Sad)。

每种情绪按照四种情绪强度进行表达:

低(Low)、中(Medium)、高(High)和未指定(Unspecified)。

文件名标注

CREMA-D 数据集中的 7,442 个文件均具有唯一的文件名。文件名由 5 个部分组成,例如:

1001_DFA_ANG_XX_01.mp4

这些标识符分别描述样本的不同属性。

演员编号(Actor ID)

演员编号范围为 1001~1091,分别对应 91 名演员。

语句(Statement)

IEO = “现在是十一点钟。”
TIE = “事情就是这样发生的。”
IOM = “我正在去开会的路上。”
IWW = “我想知道这是怎么回事。”
TAI = “飞机快坐满了。”
MTI = “也许明天会很冷。”
IWL = “我想要一个新的闹钟。”
ITH = “我想我预约了医生。”
DFA = “别忘了带一件夹克。”
ITS = “我想我以前见过这个。”
TSI = “表面很滑。”
WSI = “我们几分钟后就会停下来。”

情绪(Emotion)

ANG = 愤怒
DIS = 厌恶
FEA = 恐惧
HAP = 快乐
NEU = 中性
SAD = 悲伤

情绪强度(Emotional Intensity)

LO = 低强度
MD = 中等强度
HI = 高强度
XX = 未指定

性别(Gender)

2. RAVDESS

RAVDESS 数据库(Livingstone & Russo,2018)包含 7,356 条录制数据,其中用于**视频语音(Video-Speech)**的文件共有 2,880 个。

该数据集由 24 名专业演员参与录制,其中男性 12 名、女性 12 名。演员使用北美英语朗读或演唱两条中性语句,并表现八种不同的情绪:

愤怒(Angry)、平静(Calm)、厌恶(Disgust)、恐惧(Fearful)、快乐(Happy)、中性(Neutral)、悲伤(Sad)和惊讶(Surprise)。

情绪强度分为两个等级:

正常(Normal)和强烈(Strong)。

每个文件均提供分辨率为 1280×720 的高清视频,同时配有同步的 48 kHz、16 位音频,从而形成内容丰富且较为均衡的多模态情感数据集,可用于多模态情感识别等相关研究。

文件名标注

RAVDESS 的 2,880 个视频语音文件均具有唯一文件名。

文件名由 7 个部分组成,例如:

01-01-01-01-01-01-01.mp4

这些编号分别表示样本的不同属性。

模态(Modality)

01 = 完整音视频(Full Audio-Visual)
02 = 仅视频(Video-only)
03 = 仅音频(Audio-only)

发声通道(Vocal Channel)

01 = 语音(Speech)
02 = 歌唱(Song)

情绪(Emotion)

01 = 中性(Neutral)
02 = 平静(Calm)
03 = 快乐(Happy)
04 = 悲伤(Sad)
05 = 愤怒(Angry)
06 = 恐惧(Fearful)
07 = 厌恶(Disgust)
08 = 惊讶(Surprised)

情绪强度(Emotional Intensity)

01 = 正常(Normal)
02 = 强烈(Strong)

注意:中性情绪不存在“强烈”强度等级。

语句(Statement)

01 = “孩子们正在门边说话。”
02 = “狗正坐在门边。”

重复次数(Repetition)

01 = 第 1 次重复
02 = 第 2 次重复

演员(Actor)

演员编号范围为 01~24。

其中:

奇数编号演员为男性,偶数编号演员为女性。

01 = 男性
02 = 女性

数据集来源

本文实验所采用的数据主要来源于两个公开的多模态情感识别数据集:CREMA-D 和 RAVDESS。论文引用:Livingstone, S. R. 和 Russo, F. A.(2018). 瑞尔森情感语音与歌唱音视频数据库(RAVDESS):一个基于北美英语面部表情和声音情感表达的动态多模态数据集. 《PLoS ONE》,13(5),e0196391。

数据集信息

免责声明与引用

数据仅用于科研与教学用途。若用于商业场景,请自行核验数据许可。 如需引用,请在论文或报告中注明数据集名称与版本号。

作者信息

作者:Bob (张家梁)
项目编号:Datasets-6
文件大小:13.9G
原创声明:本数据集为整理作品

http://www.jsqmd.com/news/1300460/

相关文章:

  • React 受控输入框光标跳到末尾:格式化输入时的 selection 丢失 bug 与修复
  • oracle,安装oracle时,最后提示: 监听程序未启动或数据库服务未注册到该监听程序,如何解决
  • CodeCombat终极指南:5步开启免费游戏化编程学习之旅
  • 2026装修行业怎么做GEO推广?把握AI搜索趋势 解锁精准获客新通路
  • 高端瓜子品牌优选 洽洽全链品质铸就高端口碑 - 盈达新发现
  • 《聪明的投资者》系列②:什么是安全边际?为什么它至今仍是价值投资的核心原则?
  • 易货商城小程序系统(现成案例)
  • 蒸馏战争——当最好用的编程工具变成最危险的污染源
  • 抖音小店未来运营趋势分析!自动化发货是否会全面取代传统人工手动操作 - 抖掌柜
  • Agent 能完成一个任务,但它能持续追一个三个月的目标吗?
  • 分子与蛋白互作伯远生物分子与蛋白互作
  • 从Java开发到大模型工程师:零基础转型实战指南
  • Python字符串查找:find()方法原理、应用与性能优化全解析
  • Bilibili-Old:终极翻页评论区修复与旧版体验完整指南 [特殊字符]
  • 回溯法解子集问题:从原理到Python工程实践
  • TDR时域反射检测定位内层走线阻抗类故障
  • CST远场后处理模板:提升天线仿真效率的关键工具
  • 突破BIOS限制:FanControl如何实现Windows电脑散热控制的终极自由
  • 亲身实测 TOP9 MBTI 测评平台,完整八维免费看,无广告捆绑套路 - 时讯资讯
  • KMS_VL_ALL_AIO:智能激活Windows与Office的终极解决方案
  • 2026黄金回收行情震荡,个人闲置黄金变现避坑指南 - 大鱼奢侈品
  • macOS与Windows截图自动加水印:快捷指令与Python脚本实战指南
  • Source Sans 3字体完整指南:如何为你的项目选择最佳开源UI字体
  • TCP协议核心机制与网络工程师实战指南
  • 2026年贵阳阳台漏水检测机构推荐榜单:精准定位免砸砖,防水堵漏维修口碑优选! - 优企名品
  • 激光测距模块M01——激光测距仪方案
  • 181、噪声与动态范围评价:SNR、DR与视觉噪声模型的工程应用
  • C#单文件发布:将DLL嵌入EXE的原理与实战方法
  • 宝妈轻创业优选!绍兴私房蛋糕裱花培训班全域招生 - 烘焙行业测评
  • 多层板批量开短路-搭建电气类故障检测体系覆盖