arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-01-16 至 2026-01-16 共收录 9 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态评测 9 篇

2601.10513 2026-01-16 cs.CL cs.HC 83%

AEQ-Bench: Measuring Empathy of Omni-Modal Large Models

AEQ-Bench:衡量多模态大模型的共情能力

Xuan Luo, Lewei Yao, Libo Zhao, Lanqing Hong, Kai Chen, Dehua Tao, Daxin Tan, Ruifeng Xu, Jing Li

机构 * The Hong Kong Polytechnic University(香港理工大学) The Harbin Institute of Technology(哈尔滨工业大学) Huawei(华为) Hong Kong University of Science and Technology(香港理工大学) Shenzhen Loop Area Institute(深圳河套学院)

专题命中 多模态评测 :omni-modal(title,abstract);multi-modal(abstract);分类 cs.CL

AI总结 AEQ-Bench通过评估多模态大模型在情感识别和音频响应共情判断上的能力,揭示了音频输出能力对模型性能的影响及非语言表达评估的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.17116 2026-01-16 cs.MM cs.AI cs.CV cs.IR 82%

The CASTLE 2024 Dataset: Advancing the Art of Multimodal Understanding

CASTLE 2024数据集:推动多模态理解艺术的发展

Luca Rossetto, Werner Bailer, Duc-Tien Dang-Nguyen, Graham Healy, Björn Þór Jónsson, Onanong Kongmeesub, Hoang-Bao Le, Stevan Rudinac, Klaus Schöffmann, Florian Spiess, Allie Tran, Minh-Triet Tran, Quang-Linh Tran, Cathal Gurrin

机构 * Dublin City University(都柏林城市大学) JOANNEUM RESEARCH(JOANNEUM研究机构) University of Bergen(卑尔根大学) Reykjavik University(雷克雅未克大学) University of Amsterdam(阿姆斯特丹大学) Klagenfurt University(克雷克夫特大学) University of Basel(巴塞尔大学) VNU Ho Chi Minh University of Science(越南胡志明国家科学大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.AI、cs.MM

AI总结 CASTLE 2024数据集通过提供多视角视频和音频数据,推动多模态理解技术的发展。

Comments 7 pages, 6 figures, dataset available via https://castle-dataset.github.io/

Journal ref 2025 MM'25: Proceedings of the 33rd ACM International Conference on Multimedia (pp. 12629-12635)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10323 2026-01-16 cs.CV cs.CL 81%

ROMA: Real-time Omni-Multimodal Assistant with Interactive Streaming Understanding

ROMA: 实时多模态助手与交互式流式理解

Xueyun Tian, Wei Li, Bingbing Xu, Heng Dong, Yuanzhuo Wang, Huawei Shen

机构 * CAS Key Laboratory of AI Safety, Institute of Computing Technology, CAS, Beijing, China(中国科学院人工智能安全重点实验室,计算技术研究所,中国科学院,北京,中国) University of Chinese Academy of Sciences, Beijing, China(中国科学院大学,北京,中国) Tsinghua University, Beijing, China(清华大学,北京,中国)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.CL

AI总结 ROMA通过实时多模态处理和交互式流式理解,实现统一的反应性和主动性交互,展现强大的多模态处理能力。

Comments Our project page is available at https://eureka-maggie.github.io/ROMA_show

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09562 2026-01-16 cs.IR 78%

MM-BRIGHT: A Multi-Task Multimodal Benchmark for Reasoning-Intensive Retrieval

MM-BRIGHT: 一种多任务多模态基准用于推理密集型检索

Abdelrahman Abdallah, Mohamed Darwish Mounis, Mahmoud Abdalla, Mahmoud SalahEldin Kasem, Mostafa Farouk Senussi, Mohamed Mahmoud, Mohammed Ali, Adam Jatowt, Hyun-Soo Kang

专题命中 多模态评测 :multimodal(title,abstract)

AI总结 MM-BRIGHT是首个用于推理密集型检索的多模态基准,通过29个技术领域中的2,803个现实世界查询,评估了多模态检索模型在文本到文本、多模态到文本等任务上的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10165 2026-01-16 cs.CV 70%

Advancing Adaptive Multi-Stage Video Anomaly Reasoning: A Benchmark Dataset and Method

推动自适应多阶段视频异常推理:一个基准数据集和方法

Chao Huang, Benfeng Wang, Wei Wang, Jie Wen, Li Shen, Wenqi Ren, Yong Xu, Xiaochun Cao

机构 * School of Cyber Science and Technology, Shenzhen Campus of Sun Yat-sen University(中山大学计算机科学与技术学院(深圳校区)) Shenzhen Key Laboratory of Visual Object Detection and Recognition, Harbin Institute of Technology(哈尔滨工业大学深圳视觉目标检测与识别重点实验室)

专题命中 多模态评测 :multimodal(abstract);MLLM(abstract);分类 cs.CV

AI总结 本文提出视频异常推理任务及相应数据集,通过结构化思维链和自适应策略优化,提升多阶段视频异常推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10122 2026-01-16 cs.CL cs.AI cs.HC 62%

Role-Playing Agents Driven by Large Language Models: Current Status, Challenges, and Future Trends

由大型语言模型驱动的角色扮演代理:现状、挑战与未来趋势

Ye Wang, Jiaxing Chen, Hongjiang Xiao

机构 * Communication University of China(中国传媒大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CL、cs.AI

AI总结 本文系统回顾了由大型语言模型驱动的角色扮演代理的现状、挑战及未来趋势,探讨了关键技术路径与评估方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10687 2026-01-16 cs.CV 57%

A continental-scale dataset of ground beetles with high-resolution images and validated morphological trait measurements

大陆尺度的地面甲虫高分辨率图像数据集及经验证的形态学特征测量

S M Rayeed, Mridul Khurana, Alyson East, Isadora E. Fluck, Elizabeth G. Campolongo, Samuel Stevens, Iuliia Zarubiieva, Scott C. Lowe, Michael W. Denslow, Evan D. Donoso, Jiaman Wu, Michelle Ramirez, Benjamin Baiser, Charles V. Stewart, Paula Mabee, Tanya Berger-Wolf, Anuj Karpatne, Hilmar Lapp, Robert P. Guralnick, Graham W. Taylor, Sydne Record

机构 * Rensselaer Polytechnic Institute(伦斯勒理工学院) Virginia Tech(弗吉尼亚理工大学) The University of Maine(缅因大学) University of Florida(佛罗里达大学) The Ohio State University(俄亥俄州立大学) Vector Institute(向量研究所) University of Guelph(圭尔夫大学) National Ecological Observatory Network(国家生态观测网络)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 本研究通过高分辨率图像和验证的形态学特征测量,构建了一个大陆尺度的地面甲虫数据集,为自动化物种识别和特征研究提供了可靠的基础。

Comments 21 pages, 10 figures; Submitted to Nature Scientific Data

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09952 2026-01-16 cs.CV cs.RO 57%

OT-Drive: Out-of-Distribution Off-Road Traversable Area Segmentation via Optimal Transport

OT-Drive: 基于最优传输的离群分布越野可通行区域分割

Zhihua Zhao, Guoqiang Li, Chen Min, Kangping Lu

机构 * School of Mechanical Engineering, Beijing Institute of Technology(北京理工大学机械工程学院) Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) Shandong Pengxiang Automobile Co., Ltd(山东鹏翔汽车有限公司)

专题命中 多模态评测 :multi-modal(abstract);分类 cs.CV

AI总结 OT-Drive通过最优传输方法实现离群分布越野可通行区域分割,提升自动驾驶在复杂环境下的鲁棒性和泛化能力。

Comments 9 pages, 8 figures, 6 tables. This work has been submitted to the IEEE for possible publication. Code will be released upon acceptance

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02737 2026-01-16 cs.CV 57%

Unveiling and Bridging the Functional Perception Gap in MLLMs: Atomic Visual Alignment and Hierarchical Evaluation via PET-Bench

揭示和弥合MLLMs中的功能感知差距:通过PET-Bench实现原子视觉对齐和分层评估

Zanting Ye, Xiaolong Niu, Xuanbin Wu, Xu Han, Shengyuan Liu, Jing Hao, Zhihao Peng, Hao Sun, Jieqin Lv, Fanghu Wang, Yanchao Huang, Hubing Wu, Yixuan Yuan, Habib Zaidi, Arman Rahmim, Yefeng Zheng, Lijun Lu

机构 * School of Biomedical Engineering, Southern Medical University(生物医学工程学院,南方医科大学) School of Biomedical Engineering, Shanghai Jiaotong University(生物医学工程学院,上海交通大学) Department of Electronic Engineering, Chinese University of Hong Kong(电子工程系,中国香港大学) Faculty of Dentistry, The University of Hong Kong(牙科学院,香港大学) Department of Nuclear Medicine, The Second Affiliated Hospital of Guangzhou University of Chinese Medicine(核医学科,广州中医药大学第二附属医院) PET Center, Department of Nuclear Medicine, Guangdong Provincial People’s Hospital, Southern Medical University(PET中心,核医学科,广东省人民医院,南方医科大学) Department of Nuclear Medicine, Nanfang Hospital, Southern Medical University(核医学科,南芳医院,南方医科大学) Division of Nuclear Medicine and Molecular Imaging, Geneva University Hospitals(核医学与分子影像学部,日内瓦大学医院) Departments of Radiology, Physics, and Biomedical Engineering, The University of British Columbia(放射学、物理和生物医学工程系,不列颠哥伦比亚大学) Medical Artificial Intelligence Laboratory, Westlake University(医学人工智能实验室,西湖大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 本文提出AVA方法,通过原子视觉对齐解决MLLMs在功能成像中的感知差距,提升诊断准确性14.83%。

Comments 9 pages, 6 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏