当前位置: 首页 > news >正文

情绪识别、理解和共情为什么总被分开训练?4.5B 模型尝试把三种能力放进同一条推理链

现在的多模态情感大模型已经能识别人脸、语调和文本中的情绪,也开始学习讽刺、意图、共情回复和情绪支持。但这些能力大多被拆成不同任务分别训练:一个模型专门做情绪识别,另一个做开放词汇情绪理解,再单独训练一个模型负责共情回复。

问题在于,真实的人际互动并不是这样发生的。一个人说“我没事”,模型需要先看到表情和语气中的异常,再理解他为什么这样表达,最后决定是追问、安慰还是给建议。感知、理解和互动本来就是连续过程,把它们割裂训练,会损失本来可以相互促进的知识。

这篇论文提出OneEmo: A Unified Multimodal Reasoning Model for Emotion Perception, Understanding, and Interaction,希望训练一个统一的情感推理模型。作者构建了覆盖八类任务的 EmoWorld-130K,并提出 Emo-Chord 多任务强化学习策略。最终,一个 4.5B 模型在感知与理解任务上的综合平均分达到 71.22,与 310B 的 MiMo-v2.5 基本接近,同时在情绪支持对话中表现出较强的共情与拟人化交互能力。

这项工作的核心不是把八个情感任务简单塞进一个模型,而是尝试建立一条从“感知情绪”到“理解情绪”再到“做出合适回应”的统一学习路径。

Motivation

多模态情感计算的发展正在出现一个明显分化。

Emotion-LLaMA、AffectGPT 等模型主要解决情绪识别和解释;R1-Omni、AffectGPT-R1 开始利用强化学习提高情绪推理;另一条路线则关注 empathetic response generation 和 emotional support conversation,让模型学会如何回应用户。

这些任务之间其实高度相关:

1 2 3 4 5 6 7 8 9 10 11 看到表情和语气 ↓ 判断当前情绪 ↓ 理解情绪产生的原因和意图 ↓ 判断用户真正需要什么 ↓ 选择合适的回应策略 ↓ 生成共情或支持性回复

如果模型只接受情绪分类监督,它很难自然获得后续交互能力;如果只训练共情回复,又可能学会语言风格,却没有扎实的多模态情绪感知基础。

把所有任务混在一起训练也不是答案。

不同任务的输出空间差异很大:情绪识别可能只输出一个标签,讽刺理解需要解释语义冲突,情绪支持则需要建模多轮历史、用户状态和干预策略。直接进行联合强化学习时,不同任务产生的奖励尺度和优化方向容易冲突,甚至导致部分能力下降。

论文因此同时解决两个问题:如何构造一套贯穿感知、理解和互动的情感推理数据,以及如何让这些异构任务真正协同训练。

现象剖析:任务不会自动协同

“多任务训练”很容易被理解成把不同数据集放在一起训练。

论文的实验却显示,任务增加并不会自动带来能力互补。

当 SFT 从单纯的感知任务逐渐加入理解任务和交互任务后,正在训练的能力通常会上升,但一些没有被当前阶段重点优化的能力反而下降。也就是说,模型会出现明显的 task interference 和 catastrophic forgetting。

更有意思的是,强化学习也存在类似问题。

如果基础模型还没有形成稳定的多模态情绪表示,就直接同时优化多个 RL 奖励,MIR、幽默理解等复杂任务会明显退化;但如果 SFT 做得太充分再进入 RL,模型又会过早固化在监督数据形成的行为模式里,后续探索空间受到限制。

于是出现了一个很典型的矛盾:

1 2 3 4 5 6 7 8 9 10 SFT 太少 → 模型没有稳定情感能力 → RL 奖励噪声大、容易崩 SFT 太多 → 行为模式已经固化 → RL 很难探索新的推理策略 需要: 先建立能力,但不要把策略完全锁死

统一情感模型真正困难的不是任务数量,而是不同能力应该在什么阶段学习、以什么方式共享,又应该在什么时候允许模型继续探索。

核心解读:先建立世界,再统一优化

OneEmo 的方法可以分成两层:EmoWorld-130K 负责告诉模型“情绪应该怎样推理”,Emo-Chord 再解决这些任务怎样共同优化。

1 2 3 4 5 6 7 8 9 10 11 12 13 14 15 16 17 18 19 20 21 22 八类情感任务 ↓ 心理学理论约束推理过程 ↓ 生成结构化 reasoning trajectories ↓ 反向验证答案是否能由推理推出 ↓ 心理学背景标注者重新修正 ↓ EmoWorld-130K ↓ 两阶段 Curriculum SFT ↓ 建立感知与理解能力 但不过度固化策略 ↓ GRPO 探索 + SFT 专家数据回放 ↓ 统一优化感知、理解和互动 ↓ OneEmo

EmoWorld-130K 不只是把八个数据集合并。

数据覆盖三个能力层次:

  • • 情绪感知:多模态情感分析、基础情绪识别、开放词汇情绪识别;
  • • 情绪理解:意图识别、幽默理解、讽刺理解;
  • • 情绪互动:共情回复生成、情绪支持对话。

每个任务还被赋予不同的推理结构。基础情绪识别依据 Ekman 情绪理论,从表情和行为线索推出类别;幽默与讽刺强调预期与实际表达之间的不一致;情绪互动则按照“对话记忆 → 用户状态 → 情绪原因 → 回复目标”逐步推理。

数据生成后还要经过 reverse verification:只给推理轨迹,检查是否能够反推出原始 gold label。无法推出的样本进入人工修正,三名心理学研究生参与问题轨迹的重新标注。

Emo-Chord 的关键是没有把 SFT 和 RL 完全分开。

训练先经过有限的 curriculum SFT,使模型拥有基本情感能力,随后进入 GRPO。但 RL 阶段仍然持续回放专家 SFT 数据:

会从 0.5 逐渐下降到 0.02。训练早期更多依赖专家轨迹稳定模型,后期则逐渐把空间交给策略探索。

这种设计解决的是典型的 stability-plasticity 问题:模型既不能只模仿专家,也不能在没有约束的情况下依靠奖励自由探索。

奖励也不能只检查最后答对没有。

所有任务的奖励统一写成三个部分:

判断最终结果, 约束输出结构,真正连接不同任务的是 。

感知和理解任务检查视觉事实是否准确、推理是否与答案一致;交互任务则检查用户状态建模和回应策略是否合理。这样,不同任务虽然答案形式不同,却都可以在“推理过程是否合理”这一层获得统一监督。

简单情绪分类不需要写很长的分析,情绪支持又确实需要更完整推理。论文因此还加入 task-aware length decay,对不同任务设置不同推理长度范围,避免强化学习把所有任务都学成长篇 CoT。

图表深度解读

图2:数据构建与强化学习被放进同一个闭环

画面描述:左侧是 EmoWorld-130K 的构建流程,包括理论指导的轨迹蒸馏、反向验证和专家重新标注;右侧从 SFT 模型出发,通过奖励系统执行 GRPO,同时保留专家数据的 SFT 模仿分支。

深度解读:这张图说明模型能力并不是单靠 RL 得到的。高质量推理轨迹先建立稳定的情感认知结构,RL 再负责突破单纯模仿带来的能力上限。专家数据在强化阶段继续出现,则防止多任务探索把已经学会的能力破坏掉。

图6:把任务放在一起,不代表它们会互相帮助

画面描述:雷达图比较从 Vanilla 到不同 SFT 配置在八个任务上的能力。逐步增加 perception、understanding 和 interaction 数据时,不同维度的性能会出现明显此消彼长;两阶段 curriculum SFT 的整体分布更加均衡。

深度解读:这组实验直接支撑了论文的多任务动机。普通 joint training 会发生任务干扰,显式 reasoning trajectory 又明显优于不带思维过程的版本。统一模型的收益并不是来自“数据更多”,而是来自合理的数据组织顺序。

表2与表4:4.5B 模型已经能覆盖从识别到互动的完整能力链

画面描述:表2比较开源情感专用模型、通用多模态模型和商业模型在情绪感知与理解任务上的结果;表4使用三名心理学专业标注者,对共情生成和情绪支持进行盲评。

深度解读:表2验证的是“一个统一小模型能否同时做好很多任务”,表4则进一步检查 benchmark 分数能否转化成人实际感受到的交互质量。两部分共同避免了只在情绪分类上证明统一模型有效。

实验结果说明了什么?

OneEmo 使用 Qwen3.5-4B 作为主要骨干,总规模约 4.5B。

在感知与理解六类任务上,经过 Emo-Chord 后的综合平均分达到 71.22。GPT-5-mini 为 63.90,310B 的 MiMo-v2.5 为 71.42,Gemini-3.1-Pro 为 72.85。也就是说,它没有全面超过商业大模型,但已经把参数差距压缩到了很小的性能差距。

多任务强化学习带来的提升也非常明显。仅经过 curriculum SFT 时平均分为 67.92,加入 Emo-Chord 后提高到 71.22。基础情绪识别平均结果从 63.84 提升到 68.61,复杂意图识别平均结果从 60.67 提升到 64.47。

奖励消融进一步说明,仅看最终答案不够。完整奖励下,MSA、B-MER、OV-MER、MIR、MSU 和 MHU 分别达到 81.13、68.61、68.54、64.47、70.42 和 74.16;移除 thought reward 后,多项任务都会退化。作者统计,去掉 answer、format 和 thought reward,八个任务平均分别下降约 2.97、2.7 和 1.16 个点。

交互任务呈现出更复杂的结果。

自动评测中,OneEmo 在情绪支持对话的 Overall Effect 达到 4.67,GPT-5-mini 为 4.33,Gemini-3.1-Pro 为 4.65,MiMo-v2.5 为 4.52;但在共情回复生成中,商业模型在 informativeness 和 contextual coherence 上仍然占优。

人工评测也没有给出“全面领先”的结论。与 GPT-5-mini 比较时,OneEmo 在 ESC Overall 上有 57%的胜率,在 human-likeness 上达到 60.67%;面对 Qwen3.5-9B,ESC human-likeness 胜率达到 84.33%。但 ERG 的 empathy 指标仍落后于 GPT-5-mini 和 MiMo-v2.5,而与 MiMo-v2.5 的 ESC Overall 基本形成统计平局。

这些结果反而让论文的结论更可信:小模型已经可以在统一情感能力上接近大型商业模型,但开放式情绪互动仍然是最难追平的一层。

为什么这项研究值得关注?

OneEmo 推进的是“情感通用模型”这条路线。

过去情感计算很长时间都是按 benchmark 组织研究:表情识别一个模型,情感分析一个模型,讽刺检测一个模型,共情回复再训练另一个模型。MLLM 出现后,如果仍然沿用这种任务孤岛,很难真正利用大模型最擅长的知识迁移和统一推理。

这篇工作的价值在于把能力关系明确组织成:

1 2 3 4 5 6 7 8 Perception 我观察到了什么情绪线索 ↓ Understanding 这些线索为什么出现、意味着什么 ↓ Interaction 我现在应该怎样回应

这种结构比单纯追求某个情绪 benchmark 的 SOTA 更接近真正的情感智能。

论文也暴露了当前这条路线的边界。EmoWorld-130K 的任务分布并不均衡,ERG 占 43.6%,而 sarcasm understanding 只有约 0.4%;不少数据仍然来自影视或已有 benchmark,距离自然、跨文化、长期的人类情感交互还有明显差距。

情绪支持中的推理轨迹还使用 DSM、ICD-11、CBT 和 ACT 等心理学与临床框架。这能够提高结构性,却不能把模型等同于临床系统。论文自己也明确限制其用于无监督精神健康诊断和治疗。

更长期的问题也还没有覆盖。当前模型主要解决当前视频、当前对话和有限历史中的情绪状态,持续数周甚至数月的情绪变化、长期陪伴关系以及未来情绪预测仍然没有进入统一训练框架。

如果情感大模型最终要成为长期交互主体,它的目标不能停留在“识别得更准”,而应该形成从感知、理解到行动连续一致的情感能力。

研究脉络:从情绪识别走向统一情感推理

1. Emotion-LLaMA: Multimodal Emotion Recognition and Reasoning with Instruction Tuning

2024|NeurIPS

将多模态大语言模型引入情绪识别与解释,通过 instruction tuning 让模型从分类进一步走向可解释情感推理。

2. AffectGPT: A New Dataset, Model, and Benchmark for Emotion Understanding with Multimodal Large Language Models

2025|ICML

构建开放式多模态情绪理解体系,将情感计算从固定类别扩展到更加开放的情绪描述与理解。

3. R1-Omni: Explainable Omni-Multimodal Emotion Recognition with Reinforcement Learning

2025|研究论文

将强化学习引入多模态情绪识别,通过可验证奖励进一步激发模型的情绪推理能力。

4. VidEmo: Affective-Tree Reasoning for Emotion-Centric Video Foundation Models

2025|NeurIPS

尝试用统一的层级情感结构连接多种视频情绪任务,开始从单任务情绪模型走向 emotion-centric foundation model。

5. Nano-EmoX: Unifying Multimodal Emotional Intelligence from Perception to Empathy

2026|CVPR

进一步连接多模态情绪感知与共情能力,探索轻量模型中的统一情感智能。

6. OneEmo: A Unified Multimodal Reasoning Model for Emotion Perception, Understanding, and Interaction

2026|福建师范大学、同济大学等机构

将八类任务组织为感知、理解和互动三个层级,并通过结构化推理数据与多任务强化学习,让这些能力在同一模型中共同优化。

总结一下

过去的情感大模型大多是在“情绪识别”“意图理解”“共情回复”中的某一个环节做得更强。OneEmo 试图把这三层能力接起来,让同一个模型既能读取多模态情绪线索,也能理解背后的社会意图,再进一步生成合适的情感回应。

实现这件事的难点不是模型结构,而是训练。EmoWorld-130K 用心理学理论把八类任务改造成显式推理轨迹,Emo-Chord 则在有限 SFT 冷启动之后,同时保留 GRPO 探索和专家数据模仿,避免多任务 RL 在奖励冲突中失稳。

4.5B 模型在多个情绪感知和理解 benchmark 上已经接近体量远大的商业模型,情绪支持中的人类评价也表现出较强竞争力。不过,开放式互动、真实场景、文化差异和长期情绪变化仍然没有被完全解决。

这项研究给出的方向很清楚:情感智能不应该继续被拆成一组彼此孤立的任务,而应该让模型学会把“看见情绪、理解情绪、回应情绪”连接成同一个推理过程。

学AI大模型的正确顺序,千万不要搞错了

🤔2026年AI风口已来!各行各业的AI渗透肉眼可见,超多公司要么转型做AI相关产品,要么高薪挖AI技术人才,机遇直接摆在眼前!

有往AI方向发展,或者本身有后端编程基础的朋友,直接冲AI大模型应用开发转岗超合适!

就算暂时不打算转岗,了解大模型、RAG、Prompt、Agent这些热门概念,能上手做简单项目,也绝对是求职加分王🔋

📝给大家整理了超全最新的AI大模型应用开发学习清单和资料,手把手帮你快速入门!👇👇

学习路线:

✅大模型基础认知—大模型核心原理、发展历程、主流模型(GPT、文心一言等)特点解析
✅核心技术模块—RAG检索增强生成、Prompt工程实战、Agent智能体开发逻辑
✅开发基础能力—Python进阶、API接口调用、大模型开发框架(LangChain等)实操
✅应用场景开发—智能问答系统、企业知识库、AIGC内容生成工具、行业定制化大模型应用
✅项目落地流程—需求拆解、技术选型、模型调优、测试上线、运维迭代
✅面试求职冲刺—岗位JD解析、简历AI项目包装、高频面试题汇总、模拟面经

以上6大模块,看似清晰好上手,实则每个部分都有扎实的核心内容需要吃透!

我把大模型的学习全流程已经整理📚好了!抓住AI时代风口,轻松解锁职业新可能,希望大家都能把握机遇,实现薪资/职业跃迁~

这份完整版的大模型 AI 学习资料已经上传CSDN,朋友们如果需要可以微信扫描下方CSDN官方认证二维码免费领取【保证100%免费

http://www.jsqmd.com/news/1392835/

相关文章:

  • 2026大理电大中专/成人中专怎么报名?附报考流程+专业+学费! - 小张zc
  • 交换机配置总出错?彻底搞懂Access、Trunk、Hybrid三种端口模式
  • AI Gateway 是什么?为什么每个平台都在做
  • 十载匠心,智赢未来:GEO系统如何破解企业流量焦虑
  • 番茄小说离线下载全攻略:三分钟搭建专属阅读资料库
  • 2026年南京三日游口碑最好的旅行社**正规,正规本地地接社,暑期老人小孩出行纯玩无套路综合测评优选 - 跟我去旅游
  • Win11Debloat 上手教程:用开源系统瘦身工具给 Windows 11 减负,只需几分钟
  • Adafruit_NeoPixel库1.14.0版本发布:一文看懂PY32支持、Giga修复与性能全面提速
  • Th1/Th2细胞亚群的分化调控与功能互作:从细胞因子谱到代谢重编程
  • 上海松江黄金回收渠道怎么选?新规落地,连锁直营才是稳妥选择 - 大牌测评时报
  • Android反编译工具JADX上手指南:如何把APK还原成可读的Java源码
  • Linux系统与系统编程(13)——信号
  • 2026年北京房山长阳装修公司性价比TOP,评分类综合对比 - 2027品牌AI展
  • 知识学习APP有哪些适合长期订阅的选择?想持续学习可以先看帆书 - 新闻快传
  • 抓住AI搜索红利:十周年,带您玩转GEO
  • WinUtil 完整指南:一键完成 Windows 软件安装与系统优化
  • Agent应用指南:获取美宜佳全量门店,4万家看透便利店下沉与集聚
  • AI框架怎么零侵入打通企业现有系统,改造比重建务实在哪里
  • 第三章 Netty 协议设计与编解码实战:从基础概念到高可靠网络通信
  • 华硕笔记本性能控制轻量化指南:G-Helper如何用10MB替代500MB的Armoury Crate
  • 2026 朝阳奢包回收市场调研,3 个核心成色评估维度科普 - 大牌科普时报
  • 2026年房山城关装修公司怎么选?**与多维评分类请收藏 - 2027品牌AI展
  • RAG中的数据清洗与预处理:提升检索精度的关键
  • 于洪区适配政企园区的旗杆怎么选 - 拜了拜了
  • 【重磅发布】“祝融”(TEAP Agent):开启电力系统规划仿真新范式!核心功能使用示例及视频教程来啦!
  • 2026年8月葫芦岛屋顶漏水维修哪家好?正规防水修缮科普指南 - 聪居到家
  • 人工智能+行动落地实战:产业场景、技术架构与落地实施全流程
  • 河源源城区卫生间漏水,免砸砖和砸砖重做到底怎么选?一篇讲清两种方案的适用边界 - 超人防水
  • 安徽工贸职业技术学院单招复读班怎么样?值得报名吗?教学管理模式真实情况 - 教育为先
  • 猫抓插件使用教程:5分钟上手网页视频下载,浏览器资源嗅探一次搞定