arXivDaily arXiv每日学术速递 周一至周五更新

期刊&会议

Conference on Empirical Methods in Natural Language Processing · 会议 · Natural Language Processing

2026-04-28 至 2026-04-28 共收录 3
2509.14837 2026-04-28 cs.CL

V-SEAM: Visual Semantic Editing and Attention Modulating for Causal Interpretability of Vision-Language Models

V-SEAM:视觉语义编辑与注意力调节用于视觉-语言模型的因果可解释性

Qidong Wang, Junjie Hu, Ming Jiang

机构 * Tongji University(同济大学) University of Wisconsin-Madison(威斯康星大学麦迪逊分校)

AI总结 本文提出V-SEAM框架,结合视觉语义编辑和注意力调节,提升视觉-语言模型的因果可解释性,通过多级语义分析增强模型性能。

Comments EMNLP 2025 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24052 2026-04-28 cs.CV cs.AI

QEVA: A Reference-Free Evaluation Metric for Narrative Video Summarization with Multimodal Question Answering

QEVA:一种基于多模态问答的无参考视频文本摘要评估指标

Woojun Jung, Junyeong Kim

机构 * Department of Artificial Intelligence, Chung-Ang University(Chung-Ang大学人工智能系)

AI总结 本文提出QEVA,一种无参考视频摘要评估指标,通过多模态问答直接评估候选摘要与源视频,从覆盖性、事实性和时间顺序三个维度进行评估,引入MLVU(VS)-Eval基准数据集,实验表明QEVA与人类判断的关联性更高。

Comments Accepted to Findings of EMNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.15957 2026-04-28 eess.AS cs.AI cs.CL cs.SD

Towards Holistic Evaluation of Large Audio-Language Models: A Comprehensive Survey

面向大音频-语言模型的全面评估:一项全面的调查

Chih-Kai Yang, Neo S. Ho, Hung-yi Lee

机构 * National Taiwan University(台湾大学) NTU Artificial Intelligence Center of Research Excellence (NTU AI-CoRE)(国立清华大学人工智能研究中心(NTU AI-CoRE))

AI总结 本文针对大音频-语言模型的评估进行全面调查,提出系统化的分类体系,从四个维度探讨其性能,揭示挑战与未来方向,为领域提供指导。

Comments EMNLP 2025 (Main). Project Website: https://github.com/ckyang1124/LALM-Evaluation-Survey

详情

展开后加载摘要…

URL PDF HTML 收藏