祝贺实验室博士研究生吴明辉论文被多媒体顶会ACM MM 2026接收
近日,北京大学智能计算与感知实验室博士研究生吴明辉同学作为第一作者投稿的论文“Learning Explainable Video Saliency Prediction from Reasoning-Annotated Eye-Tracking Supervision”被多媒体领域顶会ACM Multimedia(ACM MM)2026录用。实验室戴舒羽同学和张珏同学为共同第一作者,实验室指导老师为颜鲲特聘副研究员和王平教授。
视频显著性预测旨在根据动态场景内容预测观众最可能注视的区域,是视频理解、广告分析和人机交互等应用中的重要基础。现有视频眼动数据集通常只提供像素级显著图,能够回答观众“看哪里”,却缺少解释“为什么看”的显式监督;同时存在参与者规模有限,难以充分覆盖真实场景中多样化注意行为的局限性。针对上述问题,论文构建了大规模可解释视频注意力数据集SGI-ADV。该数据集包含486段来自不同类别的广告视频,汇集4600名参与者的真实眼动数据,每段视频由20至60名参与者自由观看,并将多帧视觉内容、显著图与注意力原因文本进行配对,为同时学习注意力定位与相应解释提供了新的监督形式。
在此基础上,论文提出SalDAR(Saliency Decoding with Attribution and Reasoning)模型,将多模态大语言模型与轻量级“推理引导视觉解码器”结合。模型输入连续视频帧和文本指令,在生成注意力解释文本的同时,引入专用的

实验结果表明,SalDAR在SGI-ADV数据集的各项指标上均取得最佳结果,同时在MVS和DHF1K两个公开数据集上同样表现出良好的迁移与泛化能力。消融实验进一步说明,多帧时序信息与推理文本监督都能够稳定提升显著性预测性能。该工作将真实眼动监督、自然语言解释和像素级预测统一起来,为可解释视频显著性预测及多模态视觉理解研究提供了新的数据基础和建模思路。
ACM MM(ACM International Conference on Multimedia,ACM国际多媒体会议)是多媒体领域的国际顶级学术会议,也是中国计算机学会(CCF)推荐的A类会议,在多媒体研究领域享有极高的学术声誉。ACM MM 2026将于2026年11月10日至14日在巴西里约热内卢举办。
