arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

University of California, Los Angeles(加州大学洛杉矶分校)

2026-02-12 至 2026-02-12 共收录 3
2602.10518 2026-02-12 cs.CV

MapVerse: A Benchmark for Geospatial Question Answering on Diverse Real-World Maps

MapVerse:一个用于在多样化真实世界地图上进行地理问答的基准测试

Sharat Bhat, Harshita Khandelwal, Tushar Kataria, Vivek Gupta

机构 * University of Southern California(南加州大学) University of California Los Angeles(加州大学洛杉矶分校) University of Utah(犹他大学) Arizona State University(亚利桑那州立大学)

AI总结 MapVerse是一个基于真实世界地图的大规模基准测试,用于评估地理问答任务中的多模态推理能力,揭示了当前VLMs在复杂空间推理任务上的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.17247 2026-02-12 cs.CL cs.CV

From Preferences to Prejudice: The Role of Alignment Tuning in Shaping Social Bias in Video Diffusion Models

从偏好到偏见:对齐调谐在视频扩散模型中塑造社会偏见的作用

Zefan Cai, Haoyi Qiu, Haozhe Zhao, Ke Wan, Jiachen Li, Jiuxiang Gu, Wen Xiao, Nanyun Peng, Junjie Hu

机构 * University of Wisconsin–Madison(威斯康星大学麦迪逊分校) University of California, Los Angeles(加州大学洛杉矶分校) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) University of California, San Diego(加州大学圣地亚哥分校) University of California, Santa Barbara(加州大学圣巴巴拉分校) Microsoft(微软公司)

AI总结 本文研究了对齐调谐在视频扩散模型中如何塑造社会偏见,提出VideoBiasEval框架以评估和缓解偏见,揭示了对齐调谐使偏见更稳定且刻板化的现象。

Comments TMLR

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.09210 2026-02-12 cs.CV cs.AI

MME-Emotion: A Holistic Evaluation Benchmark for Emotional Intelligence in Multimodal Large Language Models

MME-Emotion:多模态大语言模型情感智能的综合评估基准

Fan Zhang, Zebang Cheng, Chong Deng, Haoxuan Li, Zheng Lian, Qian Chen, Huadai Liu, Wen Wang, Yi-Fan Zhang, Renrui Zhang, Ziyu Guo, Zhihong Zhu, Hao Wu, Haixin Wang, Yefeng Zheng, Xiaojiang Peng, Xian Wu, Kun Wang, Xiangang Li, Jieping Ye, Pheng-Ann Heng

机构 * The Chinese University of Hong Kong(香港中文大学) Tongyi Lab(通义实验室) SZTU(深圳技术大学) Peking University(北京大学) Tongji University(同济大学) CASIA(中国科学院自动化所) Tencent(腾讯) UCLA(加州大学洛杉矶分校) Westlake University(西湖大学) NTU(国立大学)

AI总结 MME-Emotion是首个评估多模态大语言模型情感智能的综合基准,揭示当前模型在情感识别和推理上的不足,并通过多智能体框架提供混合指标分析。

详情

展开后加载摘要…

URL PDF HTML 收藏