arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 9170 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态评测 9170 篇

2607.15205 2026-07-17 cs.SE cs.AI 新提交 79%

MM-IssueLoc: A Controlled Benchmark for Evaluating Visual Evidence in Multimodal Repository-Level Issue Localization

MM-IssueLoc:用于评估多模态仓库级问题定位中视觉证据的可控基准

Shaoxiong Zhan, Shi Hu, Boyu Feng, Hai Lin, Andrew Gong, Zhengda Zhou, Jiaying Zhou, Yunyun Hou, Hao Su, Hai-Tao Zheng

机构 * Tsinghua University(清华大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.AI

AI总结 研究针对仓库级问题定位多为文本任务,视觉证据作用不明的情况,引入MM-IssueLoc基准和评估协议,含多语言实例与标注等。评估LLM和检索系统,发现现有系统距可靠多模态定位有差距,该基准让视觉证据成评估变量,助于后续研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14683 2026-07-17 cs.AI 新提交 79%

InCarEmo: A Multimodal Dataset for In-Cabin Emotion Recognition and Driver State Monitoring

InCarEmo:用于车内情感识别和驾驶员状态监测的多模态数据集

Hao Yang, Yanyan Zhao, Kewei Zhao, Hongbo Zhang, Tian Zheng, Yusheng Liu, Xing Fu, Bichen Wang, Yu Zhang, Hao He, Zhen Wu, Xuda Zhi, Yongbo Huang, Bing Qin

机构 * Harbin Institute of Technology(哈尔滨工业大学) SERES(赛力斯)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.AI

AI总结 针对现有车内情感计算数据集局限,引入多模态InCarEmo数据集,整合多种数据支持情感识别、疲劳检测和分心监测等任务,构建中英文基准并给出基线结果,证明多模态融合优势,为车内情感理解奠基,推动人车交互发展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13800 2026-07-17 cs.CV 版本更新 79%

Beyond Medical Diagnostics: How Medical Multimodal Large Language Models Think in Space

超越医学诊断:医学多模态大语言模型如何在空间中思考

Quoc-Huy Trinh, Xi Ding, Yang Liu, Zhenyue Qin, Xingjian Li, Gorkem Durak, Halil Ertugrul Aktas, Andrea M. Bejar, Ulas Bagci, Min Xu

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出SpatialMed基准,通过自主合成空间视觉问答数据评估医学MLLMs的3D空间智能,发现现有模型在医学影像空间推理能力不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12278 2026-07-15 cs.CV cs.LG 新提交 79%

Auditing Data Leakage in Whole-Slide Image Multimodal Benchmarks

全切片图像多模态基准测试中的数据泄露审计

Wenhao Zhang, Zhongliang Zhou, John Kang, Sheng Li

机构 * University of Virginia(弗吉尼亚大学) Merck & Co., Inc.(默克公司)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 研究针对计算病理学中WSI VQA基准测试数据泄露问题,通过追踪标识符发现患者级和机构级泄露,证明其可从基础模型特征空间解码,导致准确率差距,当前评估无法区分推理与检索,最后给出无污染评估建议。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11459 2026-07-14 eess.SY cs.AI cs.SY 新提交 79%

A Multimodal Dataset for Large Language Model Applications in the Energy Domain

用于能源领域大语言模型应用的多模态数据集

Costas Mylonas, Magda Foti

机构 * UBITECH

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.AI

AI总结 介绍mAIEnergy多模态数据集,整合文本、图像、时间序列及地理空间等数据,统一为结构化格式并伴有元数据与工作流程,可作能源知识库,遵循FAIR原则,助力能源领域大语言模型应用的研究、建模和决策。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03740 2026-07-09 q-bio.QM cs.CV eess.IV 新提交 79%

Triple-Phase Multimodal Knowledge Aggregation Framework for Microbial Keratitis Subtype Diagnosis on Slit-Lamp Photography

基于裂隙灯摄影的微生物性角膜炎亚型诊断三相多模态知识聚合框架

Yiqing Wang, Maria A. Woodward, Ziyun Yang, N. Venkatesh Prajna, Chunming He, Leslie M. Niziol, Mercy Pawar, Ming-Chen Lu, Guillermo Amescua, Rachel Wozniak, Sejal Amin, Abinaya Krishnan, Prabhleen Kochar, Sina Farsiu

机构 * Department of Biomedical Engineering, Duke University(杜克大学生物医学工程系) Kellogg Eye Center, Department of Ophthalmology and Visual Sciences, University of Michigan(密歇根大学凯洛格眼科中心,眼科学与视觉科学系) Department of Cornea and Refractive Surgery Services, Aravind Eye Care System(阿瓦因眼科医疗系统角膜与屈光手术部) Bascom Palmer Eye Institute, Department of Ophthalmology, University of Miami Miller School of Medicine(迈阿密大学米勒医学院巴斯科姆·帕勒眼科研究所,眼科学系) Flaum Eye Institute, Department of Ophthalmology, University of Rochester Medical Center(罗切斯特大学医学中心弗劳姆眼科研究所,眼科学系) Department of Ophthalmology, Henry Ford Hospital(亨利福特医院眼科部) Duke Eye Center, Duke University School of Medicine(杜克大学医学院杜克眼科中心)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 针对传统微生物性角膜炎病原体鉴定慢、成本高的问题,提出融合多模态信息的三相框架实现角膜炎亚型分类,经多中心验证性能优异,跨站点泛化评估更具参考性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06285 2026-07-09 cs.CV 版本更新 79%

MMEarth-Bench: Global Model Adaptation via Multimodal Test-Time Training

MMEarth-Bench:通过多模态测试时训练进行全局模型适配

Lucia Gordon, Serge Belongie, Christian Igel, Nico Lang

机构 * Harvard University, USA(哈佛大学,美国) University of Copenhagen, Denmark(哥本哈根大学,丹麦)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 研究针对地理空间机器学习中现有基准数据集不足,引入含多模态任务的MMEarth-Bench,通过多模态测试时训练方法提升模型性能,改善地理泛化能力。

Comments Published at ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06196 2026-07-08 cs.CL cs.CY 新提交 79%

Pluralis v0.1: Towards a Multicultural, Multimodal, Multilingual Benchmark for AI Risk and Reliability

Pluralis v0.1:迈向用于人工智能风险与可靠性的多元文化、多模态、多语言基准测试

Alicia Parrish, Rajat Shinde, Sanket Badhe, Xinyi Bai, Sree Bhargavi Balija, Hua-Rong Chu, Emilio Ferrara, Armstrong Foundjem, Rajat Ghosh, Aakash Gupta, Xuanli He, Ong Chen Hui, Minji Jung, Madhangi Karimanal, Faiza Khan Khattak, Boryoung Kim, Eugenia Kim, Liliya Lavitas, Seok Min Lim, Victor Lu, Jim Moirangthem, Dhivya Nagasubramanian, Deepak Pandita, Sita Rajagopal, Geetha Raju, Evgeniia Razumovskaia, Aravind Reddy, Federico Ricciuti, Nobin Sarwar, Sungpil Shin, Sunayana Sitaram, Snehal Thorat, Tharindu Cyril Weerasooriya, Jasmijn Bastings, Joachim Baumann, Kongtao Chen, Murali Emani, Mariya Hendriksen, Jiho Jin, Jun Seong Kim, Younghoon Ko, Alicja Kwasniewska, Minjae Lee, Tom Wei-cyuan Lin Kashyap Ramanandula Manjusha, Junho Myung, Junyeong Park, Roma Patel, Shyam Ratan, Sudarsun Santhiappan, Priyanka Suresh, Tuesday, Ksheeraj Sai Vepuri Laura Amortegui-Ordonez, Claire Dennis, Minsuk Kahng, Chris Knotz, Alice Oh, Balaraman Ravindran, Soojung Ryu William Bartholomew, Hiwot Tesfaye, Lora Aroyo

机构 * Google DeepMind(谷歌DeepMind) University of Alabama in Huntsville(阿拉巴马大学亨茨维尔分校) Google(谷歌) University of Missouri Columbia(密苏里大学哥伦比亚分校) Chunghwa Telecom Laboratories(春木电信实验室) University of Southern California(南加州大学) Polytechnique Montreal(蒙特利尔理工学院) Nutanix ThinkEvolve Labs(ThinkEvolve实验室) UCL(伦敦大学学院) Infocomm Media Development Authority(信息通信媒体发展局) Monark Health(Monark健康) Seoul National University(首尔国立大学) Microsoft(微软) Centre for Responsible AI (CeRAI), Wadhwani School of Data Science and AI (WSAI), Indian Institute of Technology Madras(负责任人工智能中心(CeRAI)、瓦达威人工智能学校(WSAI)、印度理工学院马德拉斯分校) University of Maryland, Baltimore County(马里兰大学巴尔的摩县分校) Microsoft Research India(微软印度研究院) Stanford University(斯坦福大学) Argonne National Laboratory(阿贡国家实验室) University of Oxford(牛津大学) KAIST(韩国科学技术院) Yonsei University(延世大学) Amazon(亚马逊) UIUC(伊利诺伊大学香槟分校) Rochester Institute of Technology(罗切斯特理工学院) Xenoscube Inc.(Xenoscube公司) Korea AI Safety Institute (K-AISI)(韩国人工智能安全研究所(K-AISI)) MLCommons CommonGround Artifex Labs(Artifex实验室)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CL

AI总结 研究针对现有AI安全评估框架忽视文化差异问题,构建多语言多模态数据集Pluralis v0.1,从文化优先视角引入新评估范式,提出Judge - Pluralis集成,揭示特定地区失败模式,为多语言多元文化评估提供基础和创新起点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04628 2026-07-08 cs.CV 版本更新 79%

A Spatial-Spectral-Frequency Interactive Network for Multimodal Remote Sensing Classification

一种空间-光谱-频率交互网络用于多模态遥感分类

Hao Liu, Yunhao Gao, Wei Li, Mingyang Zhang, Maoguo Gong, Lorenzo Bruzzone

机构 * Department of Information Engineering and Computer Science, University of Trento(特伦托大学信息工程与计算机科学系) School of Information and Electronics, Beijing Institute of Technology(北京理工大学信息与电子学院) Beijing Key Laboratory of Fractional Signals and Systems, Beijing Institute of Technology(北京理工大学分数域信号与系统北京市重点实验室) School of Electronic Engineering, Xidian University(西安电子科技大学电子工程学院) Key Laboratory of Collaborative Intelligent Systems of Ministry of Education, Xidian University(西安电子科技大学教育部协同智能系统重点实验室) Academy of Artificial Intelligence, Inner Mongolia Normal University(内蒙古师范大学人工智能研究院)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出S$^2$Fin网络,通过空间、光谱和频率域的交互模块,提升多模态遥感图像分类性能,实验表明其在有限标注数据下表现优于现有方法。

Journal ref Pattern Recognition, Vol. 180, 2026, 114309

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.09696 2026-07-08 cs.CV 版本更新 79%

ZeroBench: An Impossible Visual Benchmark for Contemporary Large Multimodal Models

ZeroBench:当代大型多模态模型的一个不可能的视觉基准测试

Jonathan Roberts, Mohammad Reza Taesiri, Ansh Sharma, Akash Gupta, Samuel Roberts, Ioana Croitoru, Simion-Vlad Bogolin, Jialu Tang, Florian Langer, Vyas Raina, Vatsal Raina, Hanyi Xiong, Vishaal Udandarao, Jingyi Lu, Shiyang Chen, Sam Purkis, Tianshuo Yan, Wenye Lin, Gyungin Shin, Qiaochu Yang, Anh Totti Nguyen, David I. Atkinson, Aaditya Baranwal, Alexandru Coca, Mikah Dang, Sebastian Dziadzio, Jakob D. Kunz, Kaiqu Liang, Alexander Lo, Brian Pulfer, Steven Walton, Charig Yang, Kai Han, Samuel Albanie

机构 * University of Cambridge(剑桥大学) University of Alberta(阿尔伯塔大学) The University of Hong Kong(香港大学) University of Oxford(牛津大学) Northeastern University(东北大学) Astadeus College of Southern Maryland(马里兰州南部学院) University of Geneva(日内瓦大学) University of Oregon(俄勒冈大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 针对大型多模态模型在图像解释方面不足但在现有视觉基准测试中优势易逝的问题,引入通过对抗过滤策划的ZeroBench基准测试,评估多个模型,展现其潜力并公开测试内容,为模型视觉能力评估提供长期有效的新基准。

Comments Accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04330 2026-07-07 cs.CV 新提交 79%

Framework and Multi-modal Dataset for Roadwork Zone Detection and Geo-localization

道路施工区域检测与地理定位的框架和多模态数据集

Zhiran Yan, Yutong Xin, S Shyam Shenoi, Rui Song, Gordon Elger

机构 * Institute of Innovative Mobility (IIMo), Technical University Ingolstadt of Applied Sciences(应用科学英戈尔施塔特技术大学创新移动研究所) Fraunhofer Institute for Transportation and Infrastructure Systems IVI(弗劳恩霍夫交通与基础设施系统研究所IVI) Technical University of Munich(慕尼黑工业大学)

专题命中 多模态评测 :multi-modal(title);multimodal(abstract);分类 cs.CV

AI总结 针对自动驾驶中高清地图缺乏道路施工区域等半静态信息的问题,提出包含模拟和真实数据的多模态数据集及检测与地理定位管道,经实验验证该方法在检测及坐标转换上效果良好。

Comments Accepted to IEEE IV25. The RZDG dataset and code can be found at: https://github.com/chrisyan/RZDG

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03934 2026-07-07 cs.CV 新提交 79%

EgoInertia-MI: A Multimodal Egocentric Vision and IMU Benchmark for Motor Impairment Assessment

EgoInertia-MI:用于运动障碍评估的多模态自我中心视觉与惯性测量单元基准测试

Fatemah Alhamdoosh, Pietro Pala, Abduallah Mohamed, DK Arvind

机构 * University of Florence(佛罗伦萨大学) Meta Reality Labs(元现实实验室) University of Edinburgh(爱丁堡大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 研究针对运动障碍评估,结合自我中心视觉与惯性测量单元信号创建EgoInertia-MI数据集,设动作识别等任务并评估基线,发现多模态融合性能最佳,凸显两者结合用于运动评估的潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02692 2026-07-07 cs.CV 新提交 79%

An Automated Multimodal Glaucoma Detection Framework Using ViT and a Stacking-Based Ensemble

使用ViT和基于堆叠的集成方法的自动多模态青光眼检测框架

Ishrat Jahan, Muhammad E. H Chowdhury, Murugappan Murugappan, Kanchon Kanti Podder, Tawsifur Rahman, Shrestha Datta, Md Sakib Abrar Hossain, Md Mosarrof Hossen, Yosra Magdi Salih Mekki, Sanjiban Sekhar Roy

机构 * Department of Computer Science and Engineering, Shahjalal University of Science and Technology(肖哈尔大学科学与技术学院计算机科学与工程系) Department of Electrical Engineering, Qatar University(卡塔尔大学电气工程系) Department of Electronics and Communication Engineering, Kuwait College of Science and Technology(科威特科学与技术学院电子与通信工程系) Department of Interdisciplinary Engineering, Kennesaw State University(肯尼斯州立大学跨学科工程系) Department of Biomedical Engineering, School of Medicine, Johns Hopkins University(约翰霍普金斯大学医学院生物医学工程系) Department of Biomedical Engineering, University of Oxford(牛津大学生物医学工程系) Department of Computer Science and Engineering, Vellore Institute of Technology(维洛雷理工学院计算机科学与工程系)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 研究在样本级和患者级设置下的青光眼检测,提出整合眼底图像与临床数据的自动多模态框架,用ViT提取特征,经典机器学习模型分类,堆叠集成优化性能,实验验证其高性能并部署为网络平台。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24155 2026-07-07 cs.CL 新提交 79%

MedBench v5: A Dynamic, Process-Oriented, and Hallucination-Aware Benchmark for Clinical Multimodal Models

MedBench v5:面向临床多模态模型的动态、过程导向且幻觉感知的基准

Jinru Ding, Chuchu Jiang, Lu Lu, Wenrao Pang, Mouxiao Bian, Zhuangzhi Gao, Jiangyuan Chen, Xinwei Peng, Ruiyao Chen, Sijie Ren, Renjie Lu, Yun Zhong, Bin Han, Meiling Liu, Jie Xu

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CL

AI总结 提出MedBench v5,通过双维框架、可切换信息流压力源、动态过程审计协议和幻觉传播监控,实现临床多模态模型的动态过程评估与幻觉检测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30673 2026-07-07 cs.CL 版本更新 79%

TeachObs: A Human-Validated Benchmark for Multimodal Teaching Observation and Model Evaluation

TeachObs:多模态教学观察与模型评估的人工验证基准

Yeil Jeong, Youngjin Yoo, Jiyoung Bae, Seobin Sohn, Hyejin Han, Jinseo Lee, Howard Scott, Unggi Lee

机构 * Indiana University Bloomington(印第安纳大学布卢明顿分校) Pai Chai University(培才大学) Seoul National University(首尔国立大学) Ewha Womans University(成均馆大学) University of Wolverhampton(沃尔夫汉普顿大学) Korea University Sejong Campus(韩国大学世宗校区)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CL

AI总结 提出TeachObs基准,包含30节公开课视频的5158个15秒场景,由7名研究者标注39个二值观察码,并评估5个前沿视觉大语言模型在三种任务上的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22867 2026-07-07 cs.CV cs.RO 版本更新 79%

MUSON: A Reasoning-oriented Multimodal Dataset for Socially Compliant Navigation in Urban Environments

MUSON:用于城市环境中社会合规导航的面向推理的多模态数据集

Zhuonan Liu, Xinyu Zhang, Zishuo Wang, Runji Cai, Tomohito Kawabata, Qianyi Li, Xuance Peng, Tianze Yu, Zhen Xiong, Xuesu Xiao, Ling Xiao

机构 * Graduate School of Information Science and Technology, Hokkaido University(北海道大学信息科学研究生院) Graduate School of Computer Science, George Mason University(乔治·马歇尔大学计算机科学研究生院)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 研究社会合规导航问题,利用视觉语言模型,引入含10110个自我中心样本的多模态数据集MUSON,采用五步注释框架,为推进该导航提供有效基准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20272 2026-07-07 cs.CV 版本更新 79%

VKnowU: Evaluating Visual Knowledge Understanding in Multimodal LLMs

VKnowU:评估多模态语言模型中的视觉知识理解

Tianxiang Jiang, Sheng Xia, Yicheng Xu, Linquan Wu, Xiangyu Zeng, Limin Wang, Yu Qiao, Yi Wang

机构 * University of Science and Technology of China(中国科学技术大学) Shanghai AI Laboratory(上海人工智能实验室) Nanjing University(南京大学) Shanghai Innovation Institute(上海创新研究院) City University of Hong Kong(香港城市大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 研究多模态大语言模型视觉知识理解能力,提出VKnowU基准测试。评估28个模型,发现与人类表现有差距。引入新数据集和VideoKnow+基线模型,采用结构化范式和强化学习,提升模型表现。

Comments Accepted by ECCV 2026. https://github.com/OpenGVLab/VKnowU

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.15379 2026-07-07 cs.CV 版本更新 79%

The P$^3$ Dataset: Pixels, Points and Polygons for Multimodal Building Vectorization

P$^3$数据集:用于多模态建筑物矢量化的像素、点和多边形

Raphael Sulzer, Liuyun Duan, Nicolas Girard, Florent Lafarge

机构 * Université Côte d’Azur, INRIA(法国里沃利大学、INRIA) LuxCarta Technology(LuxCarta技术公司)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 介绍用于建筑物矢量化的多模态P$^3$数据集,由多源数据构建,含大量高精度激光雷达点等。证明激光雷达点云可用于预测建筑物多边形,融合激光雷达和图像能提高预测精度与几何质量,数据集公开。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01871 2026-07-03 cs.CV 新提交 79%

Descriptor: LYNRED Mobility Dataset Multimodal Detection Subset (LYNRED-MDS)

描述符:LYNRED 移动数据集多模态检测子集 (LYNRED-MDS)

Loïc Arbez, Jessy Matias, Xavier Brenière, Jocelyn Chanussot, Ronald Phlypo

机构 * INRIA center at University Grenoble Alpes(法国格勒诺布尔阿尔卑斯大学INRIA中心) Lynred(Lynred公司) Univ Grenoble Alpes, CNRS, Grenoble INP, GIPSA-lab(法国格勒诺布尔阿尔卑斯大学、CNRS、格勒诺布尔INP、GIPSA实验室)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 针对现有RGB-红外数据集场景简单、天气单一的问题,提出LYNRED-MDS多模态检测子集,包含4000对不同天气、光照和道路条件下的RGB-红外图像对,覆盖多种驾驶场景,通过YOLOv8n基线跨数据集评估验证了其在行人检测中的泛化潜力。

Journal ref IEEE Data Descriptions, 3, pp.1-10

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17360 2026-07-03 cs.CV 版本更新 79%

Omni-DuplexEval: Evaluating Real-time Duplex Omni-modal Interaction

Omni-DuplexEval: 评估实时双工全模交互

Chaoqun He, Mingyang Xiang, Yingjing Xu, Bokai Xu, Junbo Cui, Jie Zhou, Yuan Yao, Lijie Wen

机构 * Tsinghua University(清华大学) Tongji University(同济大学) ModelBest Inc.(ModelBest公司)

专题命中 多模态评测 :omni-modal(title);multimodal(abstract);分类 cs.CV

AI总结 本文提出Omni-DuplexEval基准,用于系统评估实时双工交互能力,通过两个互补场景评估模型生成连续响应和主动提醒的能力,并揭示现有模型在平衡响应及时性和内容连贯性方面的局限性。

Comments 21 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00606 2026-07-02 cs.CV 新提交 79%

Retrieved Images as Visual Thought: Training-Free Multimodal In-Context Learning for the Open-vs-Closed Gap

检索图像作为视觉思维:面向开放与封闭差距的无训练多模态上下文学习

Bingchen Huang, Zhiling Wang, Yifu Chen, Yuanchao Du

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 提出无训练框架ReVisIT,通过检索图像-标签对作为视觉思维单元,结合结构化类定义、多模态检索和交替注入示例,在多个基准上显著提升性能,弥合开放与封闭任务差距。

Comments 12 pages, 6 figures. Includes appendix. Introduces the MAAC-Bench benchmark

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00530 2026-07-02 cs.RO cs.AI 新提交 79%

From Technical Metrics to User Perception: A User Study of a Multimodal Human-Robot Interaction System for Object Detection and Grasping

从技术指标到用户感知:面向物体检测与抓取的多模态人机交互系统用户研究

Jian Song, Tian Zi, Shen Guanting

机构 * Dalian University of Technology(大连理工大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.AI

AI总结 通过24名用户的受试内实验,验证了端到端任务成功率从75%提升至90%的技术改进能显著提升用户对速度、可靠性和整体能力的感知,且70.83%的用户偏好改进系统。

Comments 8 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19614 2026-07-02 cs.LG cs.CV 版本更新 79%

Multiplicity is an Inevitable and Inherent Challenge in Multimodal Learning

多重性是多模态学习中不可避免且固有的挑战

Sanghyuk Chun, Olga Russakovsky

机构 * Princeton University(普林斯顿大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 本文论证多模态数据固有的多对多映射关系(多重性)是影响数据构建、模型训练和评估的根本瓶颈,并呼吁发展多重性感知的学习框架与评估协议。

Comments ICML 2026 Position Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31895 2026-07-01 cs.CV 新提交 79%

RESOLVE: A Multi-Resolution and Multi-Modal Dataset for Roadside Cooperative Perception

RESOLVE:用于路边协同感知的多分辨率多模态数据集

Shaozu Ding, Linan Song, Marco De Vincenzi, Dajiang Suo

机构 * The Polytechnic School, Arizona State University(亚利桑那州立大学理工学院) Department of Computer Science and Engineering, New York University(纽约大学计算机科学与工程系)

专题命中 多模态评测 :multi-modal(title);multimodal(abstract);分类 cs.CV

AI总结 提出RESOLVE数据集,包含多分辨率LiDAR和相机-LiDAR同步数据,用于评估路边3D检测与跟踪中的单模态与融合架构,揭示多模态融合如何补偿LiDAR点稀疏性。

Comments Accepted to ECCV 2026. Including supplementary material

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31219 2026-07-01 cs.CV 新提交 79%

CooperScene: Multi-Modal Cooperative Autonomy Benchmark with C-V2X Communication Characterization

CooperScene: 具有C-V2X通信特性的多模态协作自主基准

Bo Wu, Ruoshen Mo, Justin Yue, Yanyu Zhang, Janice Nguyen, Guoyuan Wu, Amit Roy-Chowdhury, Matthew J. Barth, Hang Qiu

机构 * University of California, Riverside(加州大学河滨分校)

专题命中 多模态评测 :multi-modal(title,abstract);分类 cs.CV

AI总结 提出CooperScene数据集,通过真实C-V2X通信特性、多模态传感器和3GPP标准,建立多车协作感知基准,包含59K帧、344K标注对象。

Comments Accepted to ECCV 2026. 15 pages, 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31211 2026-07-01 cs.CV cs.HC 新提交 79%

AA: A Multi-view Multimodal Dataset for Screen-based Gaze Estimation

AA: 用于屏幕式视线估计的多视角多模态数据集

Chang Liu, Jiaqi Liu, Zhoutong Ye, Xinjie Shen, Chun Yu, Yuanchun Shi

机构 * Tsinghua University(清华大学) Georgia Institute of Technology(佐治亚理工学院)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 提出AA数据集,包含8个屏幕摄像头和2个侧视角摄像头的同步面部观测及精确视线目标,支持多视角多模态学习,解决单视角数据集的视角变化和遮挡问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31069 2026-07-01 cs.CL cs.DL cs.HC cs.IR 新提交 79%

Building a Multimodal Dataset of Academic Paper for Keyword Extraction

构建用于关键词提取的学术论文多模态数据集

Jingyu Zhang, Xinyi Yan, Yi Xiang, Yingyi Zhang, Chengzhi Zhang

机构 * Department of Information Management, Nanjing University of Science and Technology(南京理工大学经济管理学院信息管理系) Department of Archives and E-government, Soochow University(苏州大学社会学院档案与电子政务系)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CL

AI总结 针对关键词提取任务缺乏多模态数据的问题,构建包含文本、图像、音频和关键词的学术论文多模态数据集,实验表明融合多模态文本能有效提升关键词提取性能。

Journal ref ASIST, 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30492 2026-06-30 cs.CV 79%

RBE-Flow: Recurrent Bayesian Estimation on Feature Manifolds for Cross-Modal Registration

RBE-Flow:基于特征流形的递归贝叶斯估计用于跨模态配准

Mengzhu Ding, Xin Song, Xiaoke Ding, Hongwei Ding, Xuecong Liu

机构 * Northeastern University, China(东北大学)

专题命中 多模态评测 :cross-modal(title,abstract);分类 cs.CV

AI总结 针对跨模态图像配准中非线性辐射差异和几何畸变导致的优化困难,提出RBE-Flow框架,将密集流估计重构为特征流形上的闭环递归贝叶斯估计,通过递归流形优化和不确定性自适应概率更新实现自校正,在多个基准上取得最优性能。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29808 2026-06-30 cs.HC cs.AI 79%

Making Multimodal LLMs Reliable Chart Data Extractors: A Benchmark and Training Framework

使多模态大语言模型成为可靠的图表数据提取器:一个基准和训练框架

Yuchen He, Peizhi Ying, Liqi Cheng, Kuilin Peng, Yuan Tian, Dazhen Deng, Yingcai Wu

机构 * Zhejiang University(浙江大学) Guangdong University of Technology(广东工业大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.AI

AI总结 针对多模态大语言模型在图表数据提取中数值精度不足的问题,提出渐进式学习训练框架,显著提升7B参数模型的准确率,达到最优性能。

Comments Accepted at CHI'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28780 2026-06-30 cs.IR cs.CV 79%

Multimodal Graph RAG for Long-range Visually Rich Document Understanding

多模态图RAG用于长程视觉丰富文档理解

Yi-Cheng Wang, Chu-Song Chen

机构 * Department of Computer Science and Information Engineering, National Taiwan University(国家台湾大学计算机科学与信息工程系) FinTech Center, National Taiwan University(国家台湾大学金融科技中心)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 提出多模态图RAG方法,通过构建多模态知识图谱解决长文档视觉问答中全局理解不足的问题,并引入新基准DLVQA进行评测,实验表明该方法优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏