多模态AI看人熟不熟 视觉信息没帮上忙
有些产品功能,需要模型判断两个人的关系:会议软件分析参会者是不是熟人,社交产品判断该不该推荐破冰话题,客服系统识别用户和客服之间是否已经建立过沟通。过去这类判断主要靠文本和语音,现在多模态模型能同时看画面了——一段 20 秒的视频,两个人面对面聊天,模型能不能看出他们是熟人还是陌生人?
FriendBench 这个基准做的就是这件事,而且结论比预想的有意思:模型判断的准确率和人类没有显著差异,但在回答倾向上,模型和人类出现了系统性分歧。
准确率不输人类,倾向却不一样
基准用 20 秒的破冰对话视频作为素材,对比 26 个多模态大模型和人类群体在 96 个配对场景里的表现,测试覆盖文本、音频、视频三种模态。结果分成两层看。
准确率层面,模型和人类没有显著差异,都能从对话里提取出"熟不熟"的线索。但第二层结果暴露了差异:人类在回答时保持中立倾向,而最强的模型倾向于给出"陌生人"这个答案。也就是说,模型在拿不准的时候,默认往"不认识"那边靠。
这个偏置不是推理能力的问题。从测试设计来看,模型面对的是同样的信息,输出却系统性偏向一侧,更像是训练数据里"陌生人"样本占比更高,或者模型学到了"没有明确熟悉证据就判断为陌生"的保守策略。
视觉模态帮了人类,没帮模型
更值得琢磨的是第三个发现:多模态信息对人类的帮助比对模型大。人类在文本和音频之外加上视觉行为信息后,判断准确率明显提升——两个人说话时的眼神、身体姿态、距离感,这些画面信息对人类有用。但同样的视觉信息加给模型,准确率几乎没有变化。
这说明模型在处理社交场景时,视觉通道的信息并没有被真正利用起来。图像特征可能被提取了,但没有和"熟悉度"这个任务目标形成有效的映射。对做多模态产品的人来说,这是个提醒:模型接了视频输入,不等于它会用视频信息——视觉模态的接入成本和它对最终判断的实际贡献,可能是两回事。
对工程团队意味着什么
这类基准看起来偏研究,但对做社交、会议、客服类产品的团队有实际参考价值。模型在不确定场景下系统性偏向"陌生人",在真实产品里会产生累积效应:如果一个推荐系统反复把熟人关系判断成陌生人,用户感受到的就是功能失灵。而且这种偏置是隐性的——单次判断看不出问题,只有统计大量输出才能发现。
从工程角度看,缓解手段无非几种:在提示层面要求模型先判断证据强度再作答,或者在决策层面对"陌生人"结论设置更高的置信度门槛。但基准里没有给出模型训练数据的分布细节,也没有说明人类的中立倾向是否可以被模型模仿,这些手段能起多大作用,目前没有公开数据支撑。
一个值得跟踪的问题是:模型为什么在视觉模态上没有获益。如果是训练数据里社交场景样本太少,那么随着多模态训练数据的丰富,这个短板可能自动缓解;如果是视觉特征和任务目标之间的映射设计问题,那就需要架构层面的调整。两种情况,对应完全不同的投入方向。
关于维基框架
维基框架关注企业应用开发中的长期维护问题。在实际项目中,业务系统往往同时涉及权限、微服务、接口协议、部署环境等复杂因素,因此我们希望提供一套更容易扩展和维护的基础框架。
官网:framewiki.com
Gitee:gitee.com/wiki-framework
GitHub:github.com/wiki-framework
示例项目:gitee.com/cdkjframework/framewiki-example
📄 许可证:MulanPSL-2.0(木兰宽松许可证,第2版)
