arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 9176 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态评测 9176 篇

2603.00490 2026-03-03 cs.AI 79%

LifeEval: A Multimodal Benchmark for Assistive AI in Egocentric Daily Life Tasks

LifeEval: 一种面向日常生活中自体视角的多模态基准,用于辅助AI

Hengjian Gao, Kaiwei Zhang, Shibo Wang, Mingjie Chen, Qihang Cao, Xianfeng Wang, Yucheng Zhu, Xiongkuo Min, Wei Sun, Dandan Zhu, Guangtao Zhai

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Shanghai Jiao Tong University(上海交通大学) East China Normal University(华东师范大学) Shanghai University of Electric Power(上海电力大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.AI

AI总结 LifeEval 是一个面向日常生活中自体视角的多模态基准,用于评估实时任务导向的人机协作,揭示了在动态环境中实现有效交互的挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22339 2026-03-03 cs.CV 79%

CircuitSense: A Hierarchical MLLM Benchmark Bridging Visual Comprehension and Symbolic Reasoning in Engineering Design Process

CircuitSense: 一种层次化的MLLM基准,连接视觉理解和符号推理在工程设计过程

Arman Akbari, Jian Gao, Yifei Zou, Mei Yang, Jinru Duan, Dmitrii Torbunov, Yanzhi Wang, Yihui Ren, Xuan Zhang

机构 * Northeastern University(东北大学) Brookhaven National Laboratory(布鲁克海文国家实验室)

专题命中 多模态评测 :MLLM(title);multi-modal(abstract);分类 cs.CV

AI总结 CircuitSense提出一个层次化基准,评估工程设计中视觉理解与符号推理的能力,揭示闭源模型在符号推导上的不足,强调数学理解对电路综合的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00055 2026-03-03 cs.LG cs.AI 79%

M3-AD: Reflection-aware Multi-modal, Multi-category, and Multi-dimensional Benchmark and Framework for Industrial Anomaly Detection

M3-AD:面向工业异常检测的反思-aware 多模态、多类别和多维基准与框架

Chao Huang, Yanhui Li, Yunkang Cao, Wei Wang, Hongxi Huang, Jie Wen, Wenqi Ren, Xiaochun Cao

机构 * Shenzhen Campus of Sun Yat-sen University(中山大学深圳校区) Hunan University(湖南大学) Harbin Institute of Technology, Shenzhen(哈尔滨工业大学深圳学院)

专题命中 多模态评测 :multi-modal(title);multimodal(abstract);分类 cs.AI

AI总结 M3-AD提出了一种反思-aware 的多模态框架,通过RA-Monitor提升工业异常检测的鲁棒性和可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23980 2026-03-02 cs.CV 79%

Venus: Benchmarking and Empowering Multimodal Large Language Models for Aesthetic Guidance and Cropping

Venus: 多模态大语言模型在审美指导与裁剪中的基准测试与赋能

Tianxiang Du, Hulingxiao He, Yuxin Peng

机构 * Wangxuan Institute of Computer Technology, Peking University(北京大学计算机技术研究所)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 Venus通过两阶段框架提升多模态大语言模型的审美指导与裁剪能力,实现可解释的审美优化。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23777 2026-03-02 cs.AI 79%

Reasoning-Driven Multimodal LLM for Domain Generalization

基于推理的多模态大语言模型用于领域泛化

Zhipeng Xu, Zilong Wang, Xinyang Jiang, Dongsheng Li, De Cheng, Nannan Wang

机构 * Xidian University(西安电子科技大学) Microsoft Research Asia(微软亚洲研究院) National Engineering Laboratory for Integrated Aero-Space-Ground- Ocean Big Data Application(国家一体化空天地海大数据应用工程实验室)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.AI

AI总结 本文提出RD-MLDG框架,利用多模态大语言模型的推理能力,通过引入多任务交叉训练和自我对齐的推理正则化,提升领域泛化性能。

Comments Accepted at ICLR 2026 (Poster)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23632 2026-03-02 cs.AI 79%

MMKG-RDS: Reasoning Data Synthesis via Deep Mining of Multimodal Knowledge Graphs

基于多模态知识图谱的推理数据合成:通过深度挖掘多模态知识图谱进行推理数据合成

Lun Zhan, Feng Xiong, Huanyong Liu, Feng Zhang, Yuhui Yin

机构 * AI Research Institute, Qihoo 360(人工智能研究院,奇虎360)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.AI

AI总结 MMKG-RDS通过深度挖掘多模态知识图谱,提出灵活的推理数据合成框架,提升模型推理能力并生成高质量数据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22843 2026-02-27 cs.CV 79%

Breaking the Visual Shortcuts in Multimodal Knowledge-Based Visual Question Answering

打破多模态知识驱动视觉问答中的视觉捷径

Dosung Lee, Sangwon Jung, Boyoung Kim, Minyoung Kim, Sungyeon Kim, Junyoung Sung, Paul Hongsuck Seo

机构 * Korea University(韩国大学) KAIST(韩国科学技术院) Amazon(亚马逊)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 本研究通过RETINA基准和MIMIR方法,打破多模态知识驱动视觉问答中的视觉捷径问题,验证现有模型对捷径的依赖并展示改进效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.24449 2026-02-27 cs.CL 79%

When Large Multimodal Models Confront Evolving Knowledge: Challenges and Explorations

当大多模态模型面对不断演变的知识:挑战与探索

Kailin Jiang, Yuntao Du, Yukai Ding, Yuchen Ren, Ning Jiang, Zhi Gao, Zilong Zheng, Lei Liu, Bin Li, Qing Li

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CL

AI总结 本文提出MMEVOKE基准,探讨了多模态模型在动态演变知识注入中的挑战,并提出知识增强和保留方法以提升注入性能和缓解能力退化。

Comments ICLR 2026, Project Page: https://evoke-lmm.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21941 2026-02-26 cs.CL 79%

MERRY: Semantically Decoupled Evaluation of Multimodal Emotional and Role Consistencies of Role-Playing Agents

MERRY: 多模态情感与角色一致性评估的语义解耦框架

Zhenyu Wang, Xiaofen Xing, Yirong Chen, Xiangmin Xu

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CL

AI总结 MERRY提出一种语义解耦的评估框架,用于评估多模态角色扮演代理的情感与角色一致性,通过改进的指标和双向证据寻找任务提升评估效果。

Comments 11 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08645 2026-02-25 cs.CL 79%

A Parallel Cross-Lingual Benchmark for Multimodal Idiomaticity Understanding

一种平行的跨语言基准用于多模态隐喻性理解

Dilara Torunoğlu-Selamet, Dogukan Arslan, Rodrigo Wilkens, Wei He, Doruk Eryiğit, Thomas Pickard, Adriana S. Pagano, Aline Villavicencio, Gülşen Eryiğit, Ágnes Abuczki, Aida Cardoso, Alesia Lazarenka, Dina Almassova, Amalia Mendes, Anna Kanellopoulou, Antoni Brosa-Rodríguez, Baiba Saulite, Beata Wojtowicz, Bolette Pedersen, Carlos Manuel Hidalgo-Ternero, Chaya Liebeskind, Danka Jokić, Diego Alves, Eleni Triantafyllidi, Erik Velldal, Fred Philippy, Giedre Valunaite Oleskeviciene, Ieva Rizgeliene, Inguna Skadina, Irina Lobzhanidze, Isabell Stinessen Haugen, Jauza Akbar Krito, Jelena M. Marković, Johanna Monti, Josue Alejandro Sauca, Kaja Dobrovoljc, Kingsley O. Ugwuanyi, Laura Rituma, Lilja Øvrelid, Maha Tufail Agro, Manzura Abjalova, Maria Chatzigrigoriou, María del Mar Sánchez Ramos, Marija Pendevska, Masoumeh Seyyedrezaei, Mehrnoush Shamsfard, Momina Ahsan, Muhammad Ahsan Riaz Khan, Nathalie Carmen Hau Norman, Nilay Erdem Ayyıldız, Nina Hosseini-Kivanani, Noémi Ligeti-Nagy, Numaan Naeem, Olha Kanishcheva, Olha Yatsyshyna, Daniil Orel, Petra Giommarelli, Petya Osenova, Radovan Garabik, Regina E. Semou, Rozane Rebechi, Salsabila Zahirah Pranida, Samia Touileb, Sanni Nimb, Sarfraz Ahmad, Sarvinoz Sharipova, Shahar Golan, Shaoxiong Ji, Sopuruchi Christian Aboh, Srdjan Sucur, Stella Markantonatou, Sussi Olsen, Vahide Tajalli, Veronika Lipp, Voula Giouli, Yelda Yeşildal Eraydın, Zahra Saaberi, Zhuohan Xie

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CL

AI总结 本文提出XMPIE数据集,用于评估多语言多模态隐喻理解能力,包含34种语言和超过一万项内容,支持跨语言和跨模态的隐喻理解研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.00618 2026-02-25 cs.CV 79%

RegTrack: Simplicity Beneath Complexity in Robust Multi-Modal 3D Multi-Object Tracking

RegTrack: 复杂性之下蕴含的简洁性在鲁棒多模态3D多目标跟踪中

Lipeng Gu, Xuefeng Yan, Song Wang, Mingqiang Wei

机构 * School of Computer Science and Technology, Nanjing University of Aeronautics and Astronautics(计算机科学与技术学院,南京航空航天大学) Shenzhen Institute of Research, Nanjing University of Aeronautics and Astronautics(深圳研究院,南京航空航天大学) Collaborative Innovation Center of Novel Software Technology and Industrialization, Nanjing, China(新型软件技术与产业化协同创新中心,南京,中国) School of Computer Science and Control Engineering, Shenzhen University of Advanced Technology(计算机科学与控制工程学院,深圳大学先进技术学院)

专题命中 多模态评测 :multi-modal(title,abstract);分类 cs.CV

AI总结 RegTrack通过统一三 cue 编码器实现鲁棒、高效且通用的多模态3D多目标跟踪。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19723 2026-02-24 cs.CV 79%

Towards Personalized Multi-Modal MRI Synthesis across Heterogeneous Datasets

面向异质数据集的个性化多模态MRI合成

Yue Zhang, Zhizheng Zhuo, Siyao Xu, Shan Lv, Zhaoxi Liu, Jun Qiu, Qiuli Wang, Yaou Liu, S. Kevin Zhou

机构 * University of Science and Technology of China(中国科学技术大学) University of Electronic Science and Technology of China(电子科技大学) Capital Medical University(首都医科大学) Army Medical University(中国人民解放军陆军军医大学) China National Clinical Research Center for Neurological Diseases(中国国家神经疾病临床研究中心)

专题命中 多模态评测 :multi-modal(title,abstract);分类 cs.CV

AI总结 PMM-Synth通过个性化特征调制模块、模态一致批量调度器和选择性监督损失,实现跨异质数据集的多模态MRI合成,提升诊断准确性与实用性。

Comments 19 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19178 2026-02-24 cs.CV 79%

EMAD: Evidence-Centric Grounded Multimodal Diagnosis for Alzheimer's Disease

EMAD: 基于证据的多模态诊断框架用于阿尔茨海默病

Qiuhui Chen, Xuancheng Yao, Zhenglei Zhou, Xinyue Hu, Yi Hong

机构 * East China University of Science and Technology(东华大学) Shanghai Jiao Tong University(上海交通大学) Tencent(腾讯)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 EMAD通过多模态证据接地机制,生成结构化诊断报告,提升阿尔茨海默病诊断的透明度和临床一致性。

Comments Accepted by CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19170 2026-02-24 cs.CV 79%

BriMA: Bridged Modality Adaptation for Multi-Modal Continual Action Quality Assessment

BriMA:基于多模态适应的持续动作质量评估

Kanglei Zhou, Chang Li, Qingyi Pan, Liyuan Wang

机构 * Department of Psychological and Cognitive Sciences, 2 Department of Statistics and Data Science, Tsinghua University(1 心理学与认知科学系,2 统计学与数据科学系,清华大学)

专题命中 多模态评测 :multi-modal(title,abstract);分类 cs.CV

AI总结 BriMA通过桥接模态适应方法,在模态缺失条件下提升多模态持续动作质量评估的性能。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.17052 2026-02-24 cs.AI 79%

ViLBias: Detecting and Reasoning about Bias in Multimodal Content

ViLBias:检测和推理解多模态内容中的偏见

Shaina Raza, Caesar Saleh, Azib Farooq, Emrul Hasan, Franklin Ogidi, Haad Zahid, Maximus Powers, Marcelo Lotif, Anam Zahid, Karanpal Sekhon, Veronica Chatrath, Roya Javedi, Vahid Reza Khazaie, Zhenyu Yu

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.AI

AI总结 ViLBias通过多模态基准检测新闻中的偏见,利用LLM和VLMs提升推理准确率和忠实度,参数高效方法能恢复大部分微调性能。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18006 2026-02-23 cs.CV 79%

MUOT_3M: A 3 Million Frame Multimodal Underwater Benchmark and the MUTrack Tracking Method

MUOT_3M: 300万帧多模态水下基准及MUTrack跟踪方法

Ahsan Baidar Bakht, Mohamad Alansari, Muhayy Ud Din, Muzammal Naseer, Sajid Javed, Irfan Hussain, Jiri Matas, Arif Mahmood

机构 * Khalifa University(卡利法大学) Czech Technical University(捷克技术大学) Information Technology University(信息科技大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 MUOT_3M是首个包含300万帧的多模态水下目标跟踪基准,结合MUTrack方法提升水下跟踪性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2304.05826 2026-02-23 cs.HC cs.CV 79%

HaDR: Applying Domain Randomization for Generating Synthetic Multimodal Dataset for Hand Instance Segmentation in Cluttered Industrial Environments

HaDR:利用领域随机化生成合成多模态数据集用于 cluttered 工业环境中的手实例分割

Stefan Grushko, Aleš Vysocký, Jakub Chlebek, Petr Prokop

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 HaDR通过领域随机化生成合成多模态数据集,提升工业环境中手部实例分割的准确性和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17108 2026-02-20 cs.CL 79%

Projective Psychological Assessment of Large Multimodal Models Using Thematic Apperception Tests

基于主题知觉测试的大型多模态模型项目性心理评估

Anton Dzega, Aviad Elyashar, Ortal Slobodin, Odeya Cohen, Rami Puzis

机构 * Faculty of Computer and Information Science, Ben-Gurion University of the Negev(本·古里安大学计算机与信息科学学院) Department of Computer Science, Shamoon College of Engineering(沙莫恩工程学院计算机科学系) School of Education, Ben-Gurion University of the Negev(本·古里安大学教育学院) Department of Nursing Sciences, Ben-Gurion University of the Negev(本·古里安大学护理科学系)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CL

AI总结 本研究通过主题知觉测试评估大型多模态模型的人格特质,发现其在人际动态和自我概念理解上表现良好,但在攻击性感知和调节方面存在不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16742 2026-02-20 cs.LG cs.AI 79%

DeepVision-103K: A Visually Diverse, Broad-Coverage, and Verifiable Mathematical Dataset for Multimodal Reasoning

DeepVision-103K: 一种视觉多样、覆盖面广且可验证的数学数据集,用于多模态推理

Haoxiang Sun, Lizhen Xu, Bing Zhao, Wotao Yin, Wei Wang, Boyu Yang, Rui Wang, Hu Wei

机构 * Alibaba Group(阿里巴巴集团) Shanghai Jiao Tong University(上海交通大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.AI

AI总结 DeepVision-103K是一个用于多模态推理的视觉多样、覆盖面广且可验证的数学数据集,通过增强模型的视觉反思和推理能力推动多模态推理发展。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.17544 2026-02-19 cs.AI 79%

A Multimodal Conversational Assistant for the Characterization of Agricultural Plots from Geospatial Open Data

一种多模态对话助手,用于从遥感开放数据中表征农业地块

Juan Cañada, Raúl Alonso, Julio Molleda, Fidel Díez

机构 * Dept. AI \& Data Analytics CTIC Technology Center Gijón, Spain Dept. IT CTIC Technology Center Gijón, Spain Eng. University of Oviedo Gijón, Spain Dept. R \& D CTIC Technology Center Gijón, Spain

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.AI

AI总结 本研究提出一种多模态对话助手,通过自然语言交互整合遥感和农业数据,降低专业信息访问门槛,实现农业地块表征。

Comments Accepted at 2025 4th International Conference on Geographic Information and Remote Sensing Technology

Journal ref Proc. Int. Conf. GIRST 2025 (2025) 127-132

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15349 2026-02-18 cs.CV 79%

CREMD: Crowd-Sourced Emotional Multimodal Dogs Dataset

CREMD:众包情感多模态狗数据集

Jinho Baek, Houwei Cao, Kate Blackwell

机构 * dept. of Computer Science(计算机科学系) New York Institute of Technology(纽约理工学院)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 CREMD数据集通过众包方式探索不同多模态呈现模式对狗情绪识别的影响,揭示了情境、音频及标注者特征对情绪识别一致性的作用。

Comments Submitted to arXiv

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06288 2026-02-17 cs.CV 79%

Unsupervised MR-US Multimodal Image Registration with Multilevel Correlation Pyramidal Optimization

无监督的MR-US多模态图像配准与多级相关金字塔优化

Jiazheng Wang, Zeyu Liu, Min Liu, Xiang Chen, Xinyao Yu, Yaonan Wang, Hang Zhang

机构 * School of Artificial Intelligence and Robotics, Hunan University, Changsha, Hunan, China(人工智能与机器人学院,湖南大学,长沙,湖南,中国) National Engineering Research Center of Robot Visual Perception and Control Technology, Hunan University, Changsha, Hunan, China(机器人视觉感知与控制技术国家工程研究中心,湖南大学,长沙,湖南,中国) National University of Singapore(新加坡国立大学) Cornell University(康奈尔大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 本研究提出基于多级相关金字塔优化的无监督多模态图像配准方法,以解决术前与术中多模态图像的配准问题,实现了在ReMIND2Reg任务中的优异表现。

Comments first-place method of ReMIND2Reg Learn2Reg MICCAI 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.16505 2026-02-17 cs.CV 79%

PRISMM-Bench: A Benchmark of Peer-Review Grounded Multimodal Inconsistencies

PRISMM-Bench: 一种基于同行评审的多模态不一致基准

Lukas Selch, Yufang Hou, M. Jehanzeb Mirza, Sivan Doveh, James Glass, Rogerio Feris, Wei Lin

机构 * Johannes Kepler University Linz(约翰内斯·开普勒大学林茨分校) Interdisciplinary Transformation University Austria(跨学科转型大学奥地利) MIT CSAIL(麻省理工学院计算机科学与人工智能实验室) Stanford University(斯坦福大学) MIT-IBM Watson AI Lab(麻省理工-IBM沃森人工智能实验室)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 PRISMM-Bench是首个基于同行评审标记的多模态不一致基准,通过整理384个不一致点,设计三个任务评估模型跨模态检测和推理能力,揭示了多模态科学推理的挑战。

Comments Accepted at ICLR 2026. Project page https://da-luggas.github.io/prismm-bench/

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23522 2026-02-17 cs.CV cs.LG 79%

OmniEarth-Bench: Towards Holistic Evaluation of Earth's Six Spheres and Cross-Spheres Interactions with Multimodal Observational Earth Data

OmniEarth-Bench: 向全面评估地球六大球体及跨球体交互的多模态观测地球数据迈进

Fengxiang Wang, Mingshuo Chen, Xuming He, Yi-Fan Zhang, Yueying Li, Feng Liu, Zijie Guo, Zhenghao Hu, Jiong Wang, Jingyi Xu, Zhangrui Li, Junchao Gong, Di Wang, Fenghua Ling, Ben Fei, Weijia Li, Long Lan, Wenjing Yang

机构 * National University of Defense Technology, China(国防科技大学) Shanghai Artificial Intelligence Laboratory, China(上海人工智能实验室) Beijing University of Posts and Telecommunications, China(北京邮电大学) Zhejiang University, China(浙江大学) Shanghai Jiao Tong University, China(上海交通大学) Fudan University, China(复旦大学) Sun Yat-sen University, China(中山大学) Nanjing University, China(南京大学) University of Science and Technology of China(中国科学技术大学) Wuhan University, China(武汉大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 OmniEarth-Bench是首个全面评估地球六大球体及跨球体交互的多模态基准测试,通过29,855个标准化注释揭示了地球系统认知能力的系统性差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.09980 2026-02-17 cs.CV cs.RO 79%

V2V-LLM: Vehicle-to-Vehicle Cooperative Autonomous Driving with Multimodal Large Language Models

V2V-LLM:基于多模态大语言模型的车与车协同自动驾驶

Hsu-kuang Chiu, Ryo Hachiuma, Chien-Yi Wang, Stephen F. Smith, Yu-Chiang Frank Wang, Min-Hung Chen

机构 * NVIDIA Carnegie Mellon University(卡内基梅隆大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出基于多模态大语言模型的V2V-LLM,通过车与车协同感知提升自动驾驶安全性和性能。

Comments Accepted by ICRA 2026 (IEEE International Conference on Robotics and Automation). Project: https://eddyhkchiu.github.io/v2vllm.github.io/ Code: https://github.com/eddyhkchiu/V2V-LLM Dataset: https://huggingface.co/datasets/eddyhkchiu/V2V-GoT-QA

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12877 2026-02-16 cs.CV 79%

RoadscapesQA: A Multitask, Multimodal Dataset for Visual Question Answering on Indian Roads

RoadscapesQA: 一个用于印度道路视觉问答的多任务、多模态数据集

Vijayasri Iyer, Maahin Rathinagiriswaran, Jyothikamalesh S

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 RoadscapesQA数据集通过多任务多模态方法,为印度道路场景的视觉问答提供支持,包含9000张图像及手动标注的边界框,用于提升无结构环境下的视觉场景理解能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.10374 2026-02-16 cs.CV 79%

Class Balancing Diversity Multimodal Ensemble for Alzheimer's Disease Diagnosis and Early Detection

类平衡多样性多模态集成用于阿尔茨海默病诊断和早期检测

Arianna Francesconi, Lazzaro di Biase, Donato Cappetta, Fabio Rebecchi, Paolo Soda, Rosa Sicilia, Valerio Guarrasi

机构 * Unit of Computer Systems and Bioinformatics, Department of Engineering, Università Campus Bio-Medico di Roma(计算机系统与生物信息学单位,工程系,罗马生物医学大学) Operative Research Unit of Neurology, Fondazione Policlinico Universitario Campus Bio-Medico(神经学操作研究单位,大学医学研究院生物医学 Campus) Eustema S.p.A., Research and Development Centre(Eustema 公司,研发中心) Department of Diagnostic and Intervention, Radiation Physics, Biomedical Engineering, Umeå University(诊断与介入部门,辐射物理,生物医学工程,乌梅大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出IMBALMED方法,通过多模态数据和类平衡技术提升阿尔茨海默病的诊断和早期检测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11340 2026-02-13 cs.AI 79%

Bi-Level Prompt Optimization for Multimodal LLM-as-a-Judge

双层提示优化用于多模态LLM作为裁判

Bo Pan, Xuan Kan, Kaitai Zhang, Yan Yan, Shunwen Tan, Zihao He, Zixin Ding, Junjie Wu, Liang Zhao

机构 * Meta AI Emory University(埃默里大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.AI

AI总结 本文提出BLPO框架,通过双层优化提升多模态LLM在评估AI生成图像时的提示效果,解决上下文限制导致的优化瓶颈问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11124 2026-02-12 cs.CV 79%

PhyCritic: Multimodal Critic Models for Physical AI

PhyCritic:面向物理AI的多模态批评模型

Tianyi Xiong, Shihao Wang, Guilin Liu, Yi Dong, Ming Li, Heng Huang, Jan Kautz, Zhiding Yu

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 PhyCritic通过双阶段RLVR流程优化,提升物理AI任务中的感知和推理能力,实现对物理任务的高效评估和改进。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.11847 2026-02-12 cs.IR cs.AI cs.CY 79%

A Multimodal Manufacturing Safety Chatbot: Knowledge Base Design, Benchmark Development, and Evaluation of Multiple RAG Approaches

多模态制造安全聊天机器人:知识库设计、基准开发及多种RAG方法的评估

Ryan Singh, Austin Hamilton, Amanda White, Michael Wise, Ibrahim Yousif, Arthur Carvalho, Zhe Shan, Reza Abrisham Baf, Mohammad Mayyas, Lora A. Cavuoto, Fadel M. Megahed

机构 * Farmer School of Business, Miami University(Miami大学农业商学院) Department of Computer Science and Software Engineering, Miami University(Miami大学计算机科学与软件工程系) Department of Engineering Technology, Miami University(Miami大学工程技术系) Department of Mechanical and Manufacturing Engineering, Miami University(Miami大学机械与制造工程系) Department of Industrial and Systems Engineering, University at Buffalo(University at Buffalo工业与系统工程系)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.AI

AI总结 本文提出了一种多模态制造安全聊天机器人,通过RAG方法实现高准确率、低延迟和低成本的安全培训,展示了其在工业5.0环境中的应用价值。

Comments 25 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏