摘要(译文):多模态大模型(MLLM)提升多模态情绪识别(MER)性能,但常伴随参数增大(至少 7B),高计算成本阻碍机器人/移动端实时部署。本文挑战"大模型必要"假设,提出轻量框架 Light-MER,通过知识蒸馏将强教师模型知识转移至亚十亿学生模型。两种新优化:①结合切片 Wasserstein 距离与隐状态对齐的最优传输损失;②基于 GRPO 平衡性能与效率的多奖励优化。九个基准上达 SOTA 且更高效。
作者:Kaiwen Zheng 等|发布:2026-07-14|原文:arxiv.org/abs/2607.12787
评论区