情绪识别、理解和共情为什么总被分开训练?4.5B 模型尝试把三种能力放进同一条推理链
现在的多模态情感大模型已经能识别人脸、语调和文本中的情绪,也开始学习讽刺、意图、共情回复和情绪支持。但这些能力大多被拆成不同任务分别训练:一个模型专门做情绪识别,另一个做开放词汇情绪理解,再单独训练一个模型负责共情回复。
问题在于,真实的人际互动并不是这样发生的。一个人说“我没事”,模型需要先看到表情和语气中的异常,再理解他为什么这样表达,最后决定是追问、安慰还是给建议。感知、理解和互动本来就是连续过程,把它们割裂训练,会损失本来可以相互促进的知识。
这篇论文提出OneEmo: A Unified Multimodal Reasoning Model for Emotion Perception, Understanding, and Interaction,希望训练一个统一的情感推理模型。作者构建了覆盖八类任务的 EmoWorld-130K,并提出 Emo-Chord 多任务强化学习策略。最终,一个 4.5B 模型在感知与理解任务上的综合平均分达到 71.22,与 310B 的 MiMo-v2.5 基本接近,同时在情绪支持对话中表现出较强的共情与拟人化交互能力。
这项工作的核心不是把八个情感任务简单塞进一个模型,而是尝试建立一条从“感知情绪”到“理解情绪”再到“做出合适回应”的统一学习路径。
Motivation
多模态情感计算的发展正在出现一个明显分化。
Emotion-LLaMA、AffectGPT 等模型主要解决情绪识别和解释;R1-Omni、AffectGPT-R1 开始利用强化学习提高情绪推理;另一条路线则关注 empathetic response generation 和 emotional support conversation,让模型学会如何回应用户。
这些任务之间其实高度相关:
1 2 3 4 5 6 7 8 9 10 11 看到表情和语气 ↓ 判断当前情绪 ↓ 理解情绪产生的原因和意图 ↓ 判断用户真正需要什么 ↓ 选择合适的回应策略 ↓ 生成共情或支持性回复如果模型只接受情绪分类监督,它很难自然获得后续交互能力;如果只训练共情回复,又可能学会语言风格,却没有扎实的多模态情绪感知基础。
把所有任务混在一起训练也不是答案。
不同任务的输出空间差异很大:情绪识别可能只输出一个标签,讽刺理解需要解释语义冲突,情绪支持则需要建模多轮历史、用户状态和干预策略。直接进行联合强化学习时,不同任务产生的奖励尺度和优化方向容易冲突,甚至导致部分能力下降。
论文因此同时解决两个问题:如何构造一套贯穿感知、理解和互动的情感推理数据,以及如何让这些异构任务真正协同训练。
现象剖析:任务不会自动协同
“多任务训练”很容易被理解成把不同数据集放在一起训练。
论文的实验却显示,任务增加并不会自动带来能力互补。
当 SFT 从单纯的感知任务逐渐加入理解任务和交互任务后,正在训练的能力通常会上升,但一些没有被当前阶段重点优化的能力反而下降。也就是说,模型会出现明显的 task interference 和 catastrophic forgetting。
更有意思的是,强化学习也存在类似问题。
如果基础模型还没有形成稳定的多模态情绪表示,就直接同时优化多个 RL 奖励,MIR、幽默理解等复杂任务会明显退化;但如果 SFT 做得太充分再进入 RL,模型又会过早固化在监督数据形成的行为模式里,后续探索空间受到限制。
于是出现了一个很典型的矛盾:
1 2 3 4 5 6 7 8 9 10 SFT 太少 → 模型没有稳定情感能力 → RL 奖励噪声大、容易崩 SFT 太多 → 行为模式已经固化 → RL 很难探索新的推理策略 需要: 先建立能力,但不要把策略完全锁死统一情感模型真正困难的不是任务数量,而是不同能力应该在什么阶段学习、以什么方式共享,又应该在什么时候允许模型继续探索。
核心解读:先建立世界,再统一优化
OneEmo 的方法可以分成两层:EmoWorld-130K 负责告诉模型“情绪应该怎样推理”,Emo-Chord 再解决这些任务怎样共同优化。
1 2 3 4 5 6 7 8 9 10 11 12 13 14 15 16 17 18 19 20 21 22 八类情感任务 ↓ 心理学理论约束推理过程 ↓ 生成结构化 reasoning trajectories ↓ 反向验证答案是否能由推理推出 ↓ 心理学背景标注者重新修正 ↓ EmoWorld-130K ↓ 两阶段 Curriculum SFT ↓ 建立感知与理解能力 但不过度固化策略 ↓ GRPO 探索 + SFT 专家数据回放 ↓ 统一优化感知、理解和互动 ↓ OneEmoEmoWorld-130K 不只是把八个数据集合并。
数据覆盖三个能力层次:
- • 情绪感知:多模态情感分析、基础情绪识别、开放词汇情绪识别;
- • 情绪理解:意图识别、幽默理解、讽刺理解;
- • 情绪互动:共情回复生成、情绪支持对话。
每个任务还被赋予不同的推理结构。基础情绪识别依据 Ekman 情绪理论,从表情和行为线索推出类别;幽默与讽刺强调预期与实际表达之间的不一致;情绪互动则按照“对话记忆 → 用户状态 → 情绪原因 → 回复目标”逐步推理。
数据生成后还要经过 reverse verification:只给推理轨迹,检查是否能够反推出原始 gold label。无法推出的样本进入人工修正,三名心理学研究生参与问题轨迹的重新标注。
Emo-Chord 的关键是没有把 SFT 和 RL 完全分开。
训练先经过有限的 curriculum SFT,使模型拥有基本情感能力,随后进入 GRPO。但 RL 阶段仍然持续回放专家 SFT 数据:
会从 0.5 逐渐下降到 0.02。训练早期更多依赖专家轨迹稳定模型,后期则逐渐把空间交给策略探索。
这种设计解决的是典型的 stability-plasticity 问题:模型既不能只模仿专家,也不能在没有约束的情况下依靠奖励自由探索。
奖励也不能只检查最后答对没有。
所有任务的奖励统一写成三个部分:
判断最终结果, 约束输出结构,真正连接不同任务的是 。
感知和理解任务检查视觉事实是否准确、推理是否与答案一致;交互任务则检查用户状态建模和回应策略是否合理。这样,不同任务虽然答案形式不同,却都可以在“推理过程是否合理”这一层获得统一监督。
简单情绪分类不需要写很长的分析,情绪支持又确实需要更完整推理。论文因此还加入 task-aware length decay,对不同任务设置不同推理长度范围,避免强化学习把所有任务都学成长篇 CoT。
图表深度解读
图2:数据构建与强化学习被放进同一个闭环
画面描述:左侧是 EmoWorld-130K 的构建流程,包括理论指导的轨迹蒸馏、反向验证和专家重新标注;右侧从 SFT 模型出发,通过奖励系统执行 GRPO,同时保留专家数据的 SFT 模仿分支。
深度解读:这张图说明模型能力并不是单靠 RL 得到的。高质量推理轨迹先建立稳定的情感认知结构,RL 再负责突破单纯模仿带来的能力上限。专家数据在强化阶段继续出现,则防止多任务探索把已经学会的能力破坏掉。
图6:把任务放在一起,不代表它们会互相帮助
画面描述:雷达图比较从 Vanilla 到不同 SFT 配置在八个任务上的能力。逐步增加 perception、understanding 和 interaction 数据时,不同维度的性能会出现明显此消彼长;两阶段 curriculum SFT 的整体分布更加均衡。
深度解读:这组实验直接支撑了论文的多任务动机。普通 joint training 会发生任务干扰,显式 reasoning trajectory 又明显优于不带思维过程的版本。统一模型的收益并不是来自“数据更多”,而是来自合理的数据组织顺序。
表2与表4:4.5B 模型已经能覆盖从识别到互动的完整能力链
画面描述:表2比较开源情感专用模型、通用多模态模型和商业模型在情绪感知与理解任务上的结果;表4使用三名心理学专业标注者,对共情生成和情绪支持进行盲评。
深度解读:表2验证的是“一个统一小模型能否同时做好很多任务”,表4则进一步检查 benchmark 分数能否转化成人实际感受到的交互质量。两部分共同避免了只在情绪分类上证明统一模型有效。
实验结果说明了什么?
OneEmo 使用 Qwen3.5-4B 作为主要骨干,总规模约 4.5B。
在感知与理解六类任务上,经过 Emo-Chord 后的综合平均分达到 71.22。GPT-5-mini 为 63.90,310B 的 MiMo-v2.5 为 71.42,Gemini-3.1-Pro 为 72.85。也就是说,它没有全面超过商业大模型,但已经把参数差距压缩到了很小的性能差距。
多任务强化学习带来的提升也非常明显。仅经过 curriculum SFT 时平均分为 67.92,加入 Emo-Chord 后提高到 71.22。基础情绪识别平均结果从 63.84 提升到 68.61,复杂意图识别平均结果从 60.67 提升到 64.47。
奖励消融进一步说明,仅看最终答案不够。完整奖励下,MSA、B-MER、OV-MER、MIR、MSU 和 MHU 分别达到 81.13、68.61、68.54、64.47、70.42 和 74.16;移除 thought reward 后,多项任务都会退化。作者统计,去掉 answer、format 和 thought reward,八个任务平均分别下降约 2.97、2.7 和 1.16 个点。
交互任务呈现出更复杂的结果。
自动评测中,OneEmo 在情绪支持对话的 Overall Effect 达到 4.67,GPT-5-mini 为 4.33,Gemini-3.1-Pro 为 4.65,MiMo-v2.5 为 4.52;但在共情回复生成中,商业模型在 informativeness 和 contextual coherence 上仍然占优。
人工评测也没有给出“全面领先”的结论。与 GPT-5-mini 比较时,OneEmo 在 ESC Overall 上有 57%的胜率,在 human-likeness 上达到 60.67%;面对 Qwen3.5-9B,ESC human-likeness 胜率达到 84.33%。但 ERG 的 empathy 指标仍落后于 GPT-5-mini 和 MiMo-v2.5,而与 MiMo-v2.5 的 ESC Overall 基本形成统计平局。
这些结果反而让论文的结论更可信:小模型已经可以在统一情感能力上接近大型商业模型,但开放式情绪互动仍然是最难追平的一层。
为什么这项研究值得关注?
OneEmo 推进的是“情感通用模型”这条路线。
过去情感计算很长时间都是按 benchmark 组织研究:表情识别一个模型,情感分析一个模型,讽刺检测一个模型,共情回复再训练另一个模型。MLLM 出现后,如果仍然沿用这种任务孤岛,很难真正利用大模型最擅长的知识迁移和统一推理。
这篇工作的价值在于把能力关系明确组织成:
1 2 3 4 5 6 7 8 Perception 我观察到了什么情绪线索 ↓ Understanding 这些线索为什么出现、意味着什么 ↓ Interaction 我现在应该怎样回应这种结构比单纯追求某个情绪 benchmark 的 SOTA 更接近真正的情感智能。
论文也暴露了当前这条路线的边界。EmoWorld-130K 的任务分布并不均衡,ERG 占 43.6%,而 sarcasm understanding 只有约 0.4%;不少数据仍然来自影视或已有 benchmark,距离自然、跨文化、长期的人类情感交互还有明显差距。
情绪支持中的推理轨迹还使用 DSM、ICD-11、CBT 和 ACT 等心理学与临床框架。这能够提高结构性,却不能把模型等同于临床系统。论文自己也明确限制其用于无监督精神健康诊断和治疗。
更长期的问题也还没有覆盖。当前模型主要解决当前视频、当前对话和有限历史中的情绪状态,持续数周甚至数月的情绪变化、长期陪伴关系以及未来情绪预测仍然没有进入统一训练框架。
如果情感大模型最终要成为长期交互主体,它的目标不能停留在“识别得更准”,而应该形成从感知、理解到行动连续一致的情感能力。
研究脉络:从情绪识别走向统一情感推理
1. Emotion-LLaMA: Multimodal Emotion Recognition and Reasoning with Instruction Tuning
2024|NeurIPS
将多模态大语言模型引入情绪识别与解释,通过 instruction tuning 让模型从分类进一步走向可解释情感推理。
2. AffectGPT: A New Dataset, Model, and Benchmark for Emotion Understanding with Multimodal Large Language Models
2025|ICML
构建开放式多模态情绪理解体系,将情感计算从固定类别扩展到更加开放的情绪描述与理解。
3. R1-Omni: Explainable Omni-Multimodal Emotion Recognition with Reinforcement Learning
2025|研究论文
将强化学习引入多模态情绪识别,通过可验证奖励进一步激发模型的情绪推理能力。
4. VidEmo: Affective-Tree Reasoning for Emotion-Centric Video Foundation Models
2025|NeurIPS
尝试用统一的层级情感结构连接多种视频情绪任务,开始从单任务情绪模型走向 emotion-centric foundation model。
5. Nano-EmoX: Unifying Multimodal Emotional Intelligence from Perception to Empathy
2026|CVPR
进一步连接多模态情绪感知与共情能力,探索轻量模型中的统一情感智能。
6. OneEmo: A Unified Multimodal Reasoning Model for Emotion Perception, Understanding, and Interaction
2026|福建师范大学、同济大学等机构
将八类任务组织为感知、理解和互动三个层级,并通过结构化推理数据与多任务强化学习,让这些能力在同一模型中共同优化。
总结一下
过去的情感大模型大多是在“情绪识别”“意图理解”“共情回复”中的某一个环节做得更强。OneEmo 试图把这三层能力接起来,让同一个模型既能读取多模态情绪线索,也能理解背后的社会意图,再进一步生成合适的情感回应。
实现这件事的难点不是模型结构,而是训练。EmoWorld-130K 用心理学理论把八类任务改造成显式推理轨迹,Emo-Chord 则在有限 SFT 冷启动之后,同时保留 GRPO 探索和专家数据模仿,避免多任务 RL 在奖励冲突中失稳。
4.5B 模型在多个情绪感知和理解 benchmark 上已经接近体量远大的商业模型,情绪支持中的人类评价也表现出较强竞争力。不过,开放式互动、真实场景、文化差异和长期情绪变化仍然没有被完全解决。
这项研究给出的方向很清楚:情感智能不应该继续被拆成一组彼此孤立的任务,而应该让模型学会把“看见情绪、理解情绪、回应情绪”连接成同一个推理过程。
学AI大模型的正确顺序,千万不要搞错了
🤔2026年AI风口已来!各行各业的AI渗透肉眼可见,超多公司要么转型做AI相关产品,要么高薪挖AI技术人才,机遇直接摆在眼前!
有往AI方向发展,或者本身有后端编程基础的朋友,直接冲AI大模型应用开发转岗超合适!
就算暂时不打算转岗,了解大模型、RAG、Prompt、Agent这些热门概念,能上手做简单项目,也绝对是求职加分王🔋
📝给大家整理了超全最新的AI大模型应用开发学习清单和资料,手把手帮你快速入门!👇👇
学习路线:
✅大模型基础认知—大模型核心原理、发展历程、主流模型(GPT、文心一言等)特点解析
✅核心技术模块—RAG检索增强生成、Prompt工程实战、Agent智能体开发逻辑
✅开发基础能力—Python进阶、API接口调用、大模型开发框架(LangChain等)实操
✅应用场景开发—智能问答系统、企业知识库、AIGC内容生成工具、行业定制化大模型应用
✅项目落地流程—需求拆解、技术选型、模型调优、测试上线、运维迭代
✅面试求职冲刺—岗位JD解析、简历AI项目包装、高频面试题汇总、模拟面经
以上6大模块,看似清晰好上手,实则每个部分都有扎实的核心内容需要吃透!
我把大模型的学习全流程已经整理📚好了!抓住AI时代风口,轻松解锁职业新可能,希望大家都能把握机遇,实现薪资/职业跃迁~
