arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 9205 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态评测 9205 篇

2603.20209 2026-04-02 cs.CL cs.AI 73%

Children's Intelligence Tests Pose Challenges for MLLMs? KidGym: A 2D Grid-Based Reasoning Benchmark for MLLMs

儿童智力测试对大语言模型构成挑战?KidGym:一种基于二维网格的推理基准测试用于大语言模型

Hengwei Ye, Yuanting Guan, Yuxuan Ge, Tianying Zhu, Zhenhan Guan, Yijia Zhong, Yijing Zhang, Han Zhang, Yingna Wu, Zheng Tian

机构 * ShanghaiTech University(上海科技大学)

专题命中 多模态评测 :multimodal(abstract);MLLM(abstract);分类 cs.CL、cs.AI

AI总结 本文提出KidGym,一种基于二维网格的推理基准测试,用于评估大语言模型的执行、感知推理、学习、记忆和规划能力,通过12个独特任务测试模型适应性和发展潜力,揭示当前模型的局限性。

Comments Accepted at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.20964 2026-03-30 cs.CV cs.AI 73%

Evidence-based diagnostic reasoning with multi-agent copilot for human pathology

基于多智能体助手的证据驱动诊断推理

Luca L. Weishaupt, Chengkuan Chen, Drew F. K. Williamson, Richard J. Chen, Guillaume Jaume, Tong Ding, Bowen Chen, Anurag Vaidya, Long Phi Le, Guillaume Jaume, Ming Y. Lu, Faisal Mahmood

机构 * Health Sciences and Technology, Harvard-MIT(哈佛-MIT健康科学与技术) Department of Pathology, Massachusetts General Hospital, Harvard Medical School(麻省总医院病理科,哈佛医学院) Cancer Program, Broad Institute of Harvard and MIT(哈佛-MIT博德研究所癌症项目) Harvard John A. Paulson School of Engineering and Applied Sciences, Harvard University(哈佛大学约翰·A·保尔森工程与应用科学学院) Electrical Engineering and Computer Science, Massachusetts Institute of Technology (MIT)(麻省理工学院电气工程与计算机科学) Harvard Data Science Initiative, Harvard University(哈佛大学数据科学计划)

专题命中 多模态评测 :multimodal(abstract);MLLM(abstract);分类 cs.CV、cs.AI

AI总结 本文提出PathChat+,一种专为人类病理设计的多模态大语言模型,通过大量病理特定指令样本训练,显著优于现有模型,在多图像理解与自主诊断推理方面表现突出。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18418 2026-03-20 cs.CV cs.AI 73%

Mind the Rarities: Can Rare Skin Diseases Be Reliably Diagnosed via Diagnostic Reasoning?

注意罕见病:罕见皮肤疾病能否通过诊断推理可靠诊断?

Yang Liu, Jiyao Yang, Hongjin Zhao, Xiaoyong Li, Yanzhe Ji, Xingjian Li, Runmin Jiang, Tianyang Wang, Saeed Anwar, Dongwoo Kim, Yue Yao, Zhenyue Qin, Min Xu

机构 * Carnegie Mellon University(卡内基梅隆大学) University of Alabama at Birmingham(阿拉巴马大学伯明翰分校) Australian National University(澳大利亚国立大学) University of Western Australia(西澳大学) POSTECH Yale University(耶鲁大学)

专题命中 多模态评测 :multi-modal(abstract);image-text(abstract);分类 cs.CV、cs.AI

AI总结 本文提出DermCase基准,通过多模态数据评估罕见皮肤疾病诊断推理能力,揭示现有模型在诊断准确性和临床推理中的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.15540 2026-03-17 cs.CV cs.CL 73%

Beyond Words: Enhancing Desire, Emotion, and Sentiment Recognition with Non-Verbal Cues

超越词语:利用非语言线索增强欲望、情感和情感识别

Wei Chen, Tongguan Wang, Feiyue Xue, Junkai Li, Hui Liu, Ying Sha

专题命中 多模态评测 :multimodal(abstract);cross-modal(abstract);分类 cs.CV、cs.CL

AI总结 本文提出SyDES框架,通过双向细粒度模态对齐和非语言线索利用,提升多模态欲望、情感和情感识别性能,实验显示在MSED基准上取得新的SOTA成果。

Comments Accepted by WWW 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.02108 2026-03-16 cs.CV cs.GR cs.MM 73%

Unveiling Deep Shadows: A Survey and Benchmark on Image and Video Shadow Detection, Removal, and Generation in the Deep Learning Era

揭示深层阴影:深度学习时代图像和视频阴影检测、去除与生成的综述与基准

Xiaowei Hu, Zhenghao Xing, Tianyu Wang, Chi-Wing Fu, Pheng-Ann Heng

机构 * School of Future Technology, South China University of Technology(华南理工大学未来技术学院) Department of Computer Science and Engineering, The Chinese University of Hong Kong(香港中文大学计算机科学与工程学院) Adobe Research(Adobe研究)

专题命中 多模态评测 :multimodal(abstract);multimodal foundation model(abstract);分类 cs.CV、cs.MM

AI总结 本文综述并建立了深度学习时代图像和视频阴影检测、去除与生成的统一基准,揭示了现有研究中的不一致、模型设计依赖性和跨数据集泛化限制,并提出了未来研究方向。

Comments Accepted by International Journal of Computer Vision (IJCV). Publicly available results, trained models, and evaluation metrics at https://github.com/xw-hu/Unveiling-Deep-Shadows

Journal ref International Journal of Computer Vision (IJCV), vol.134, article 158, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.06727 2026-03-09 cs.AI cs.CV 73%

VisioMath: Benchmarking Figure-based Mathematical Reasoning in LMMs

VisioMath: 评估LMMs中基于图的数学推理能力的基准测试

Can Li, Ying Liu, Ting Zhang, Mei Wang, Hua Huang

机构 * School of Artificial Intelligence, Beijing Normal University(北京师范大学人工智能学院) Beijing Key Laboratory of Artificial Intelligence for Education(北京人工智能教育重点实验室) Engineering Research Center of Intelligent Technology and Educational Application, Ministry of Education(教育部智能技术与教育应用工程研究中心)

专题命中 多模态评测 :multimodal(abstract);image-text(abstract);分类 cs.CV、cs.AI

AI总结 VisioMath是一个针对LMMs中基于图表的数学推理能力的基准测试,通过1,800个高质量K-12数学问题评估模型在视觉相似图像间的推理能力,并提出三种提升对齐效果的策略。

Comments Accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.15040 2026-03-05 cs.CV cs.CL cs.LG 73%

Composition-Grounded Data Synthesis for Visual Reasoning

基于组成性的数据合成用于视觉推理

Xinyi Gu, Jiayuan Mao, Zhang-Wei Hong, Zhuoran Yu, Pengyuan Li, Dhiraj Joshi, Rogerio Feris, Zexue He

机构 * MIT(麻省理工学院) UW-Madison(威斯康星大学麦迪逊分校) MIT-IBM Watson AI Lab(麻省理工-IBM沃森人工智能实验室)

专题命中 多模态评测 :multimodal(abstract);multi-modal(abstract);分类 cs.CV、cs.CL

AI总结 COGS通过分解种子问题并重新组合生成合成数据,提升MLLMs在图表和网页等人工图像领域的推理能力。

Comments ICLR2026 camera-ready version. Project page: https://cogsynthesis.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.17623 2026-03-04 cs.MM cs.CV 73%

Synthetic Perception: Can Generated Images Unlock Latent Visual Prior for Text-Centric Reasoning?

合成感知:生成图像能否解锁潜在的视觉先验以用于以文本为中心的推理?

Yuesheng Huang, Peng Zhang, Xiaoxin Wu, Riliang Liu, Jiaqi Liang

专题命中 多模态评测 :multimodal(abstract);cross-modal(abstract);分类 cs.CV、cs.MM

AI总结 本文探讨生成图像能否解锁潜在视觉先验以提升文本中心推理,通过多模态融合架构和提示工程策略实现性能提升。

Comments Accepted as a poster at the International Conference on Machine Learning (ICML 2025) NewInML Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00938 2026-03-03 cs.CV cs.AI 73%

Seeing Beyond 8bits: Subjective and Objective Quality Assessment of HDR-UGC Videos

超越8位:HDR-UGC视频的主观和客观质量评估

Shreshth Saini, Bowen Chen, Neil Birkbeck, Yilin Wang, Balu Adsumilli, Alan C. Bovik

机构 * Laboratory for Image and Video Engineering (LIVE), UT Austin(图像与视频工程实验室(LIVE),得克萨斯大学奥斯汀分校) Google/YouTube(谷歌/YouTube)

专题命中 多模态评测 :multimodal(abstract);MLLM(abstract);分类 cs.CV、cs.AI

AI总结 本文提出HDR-Q,首个针对HDR-UGC视频的多模态大语言模型,通过HDR感知编码器和HAPO框架实现超越8位的高质量视频评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.21048 2026-03-02 cs.CV cs.AI 73%

Veritas: Generalizable Deepfake Detection via Pattern-Aware Reasoning

Veritas:通过模式感知推理实现通用的深度伪造检测

Hao Tan, Jun Lan, Zichang Tan, Ajian Liu, Chuanbiao Song, Senyuan Shi, Huijia Zhu, Weiqiang Wang, Jun Wan, Zhen Lei

机构 * School of Advanced Interdisciplinary Sciences (SAIS), University of Chinese Academy of Sciences(中国科学院大学先进交叉学科学院) MAIS, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所MAIS) Ant Group(蚂蚁集团) Shenzhen Institute of Advanced Technology (SIAT), Chinese Academy of Sciences(中国科学院深圳先进技术研究所) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院)

专题命中 多模态评测 :multi-modal(abstract);MLLM(abstract);分类 cs.CV、cs.AI

AI总结 Veritas通过模式感知推理,基于多模态大语言模型实现通用深度伪造检测,提升对未知伪造技术和数据领域的检测能力。

Comments ICLR 2026 Oral. Project: https://github.com/EricTan7/Veritas

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12919 2026-02-16 cs.CV cs.AI cs.NE 73%

EPRBench: A High-Quality Benchmark Dataset for Event Stream Based Visual Place Recognition

EPRBench: 一种高质量的基于事件流的视觉位置识别基准数据集

Xiao Wang, Xingxing Xiong, Jinfeng Gao, Xufeng Lou, Bo Jiang, Si-bao Chen, Yaowei Wang, Yonghong Tian

机构 * School of Computer Science and Technology, Anhui University(安徽大学计算机科学与技术学院) Harbin Institute of Technology(哈尔滨工业大学) Peng Cheng Laboratory(鹏城实验室) School of Computer Science, Peking University(北京大学计算机科学学院) Shenzhen Graduate School, Peking University(北京大学深圳研究生院)

专题命中 多模态评测 :multi-modal(abstract);cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 EPRBench提出了一种高质量的基于事件流的视觉位置识别基准数据集,结合LLM生成场景描述与多模态融合方法,提升位置识别的准确性和模型透明度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07055 2026-02-10 cs.AI cs.CL cs.LG 73%

Theory of Space: Can Foundation Models Construct Spatial Beliefs through Active Exploration?

空间理论:基础模型能否通过主动探索构建空间信念?

Pingyue Zhang, Zihan Huang, Yue Wang, Jieyu Zhang, Letian Xue, Zihan Wang, Qineng Wang, Keshigeyan Chandrasegaran, Ruohan Zhang, Yejin Choi, Ranjay Krishna, Jiajun Wu, Li Fei-Fei, Manling Li

机构 * Northwestern University(西北大学) Stanford University(斯坦福大学) University of Washington(华盛顿大学) Cornell University(康奈尔大学)

专题命中 多模态评测 :multimodal(abstract);multimodal foundation model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出空间理论,探讨基础模型通过主动探索构建空间信念的挑战,发现主动-被动差距、探索低效和信念惯性等问题。

Comments published at iclr 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07014 2026-02-10 cs.CV cs.AI 73%

Vectra: A New Metric, Dataset, and Model for Visual Quality Assessment in E-Commerce In-Image Machine Translation

Vectra: 一种新的度量标准、数据集和模型用于电子商务图像中的图像翻译视觉质量评估

Qingyu Wu, Yuxuan Han, Haijun Li, Zhao Xu, Jianshan Zhao, Xu Jin, Longyue Wang, Weihua Luo

机构 * Alibaba International Digital Commerce Group(阿里巴巴国际数字商业集团)

专题命中 多模态评测 :multimodal(abstract);MLLM(abstract);分类 cs.CV、cs.AI

AI总结 Vectra提出了一种无参考、基于大语言模型的视觉质量评估框架,通过多维度量系统、数据集和模型提升电子商务图像翻译的视觉质量评估效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00269 2026-02-03 cs.CV cs.AI 73%

FaithSCAN: Model-Driven Single-Pass Hallucination Detection for Faithful Visual Question Answering

FaithSCAN: 基于模型的单次幻觉检测用于可靠的视觉问答

Chaodong Tong, Qi Zhang, Chen Li, Lei Jiang, Yanbing Liu

机构 * Institute of Information Engineering, Chinese Academy of Sciences (CAS) and the School of Cyber Security, University of CAS(信息工程研究所、中国科学院(CAS)和安全学院、CAS大学)

专题命中 多模态评测 :multimodal(abstract);cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 FaithSCAN通过利用VLMs的内部信号实现高效准确的视觉问答幻觉检测,克服现有方法的效率与鲁棒性限制。

Comments 21 pages, 13 figures, 8 tables. Submitted to IEEE Transactions on Big Data

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.07450 2026-02-03 cs.CV cs.CL 73%

GLEAM: Learning to Match and Explain in Cross-View Geo-Localization

GLEAM: 在跨视图地理定位中学习匹配与解释

Xudong Lu, Zhi Zheng, Yi Wan, Yongxiang Yao, Annan Wang, Renrui Zhang, Panwang Xia, Qiong Wu, Qingyun Li, Weifeng Lin, Xiangyu Zhao, Peifeng Ma, Xue Yang, Hongsheng Li

专题命中 多模态评测 :multimodal(abstract);multi-modal(abstract);分类 cs.CV、cs.CL

AI总结 GLEAM提出了一种结合多模态、多视角对齐与可解释对应分析的CVGL方法,通过双阶段训练策略提升精度并增强可解释性。

Comments 23 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.03205 2026-02-03 cs.CL cs.AI 73%

U-MATH: A University-Level Benchmark for Evaluating Mathematical Skills in LLMs

U-MATH:一个大学级评估LLM数学能力的基准测试

Konstantin Chernyshev, Vitaliy Polshkov, Ekaterina Artemova, Alex Myasnikov, Vlad Stepanov, Alexei Miasnikov, Sergei Tilga

机构 * Toloka AI Gradarius Stevens Institute of Technology(史蒂文斯理工学院)

专题命中 多模态评测 :multimodal(abstract);multi-modal(abstract);分类 cs.CL、cs.AI

AI总结 U-MATH是一个大学级数学能力评估基准,包含1100个开放性问题,用于评估LLM在多模态推理和解决方案判断方面的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22575 2026-02-02 cs.CV cs.CL 73%

PhoStream: Benchmarking Real-World Streaming for Omnimodal Assistants in Mobile Scenarios

PhoStream:面向移动场景的多模态助手实时流基准测试

Xudong Lu, Huankang Guan, Yang Bo, Jinpeng Chen, Xintong Guo, Shuhan Li, Fang Liu, Peiwen Sun, Xueying Li, Wei Zhang, Xue Yang, Rui Liu, Hongsheng Li

机构 * CUHK MMLab(CUHK 多模态实验室) Huawei Research(华为研究) City University of Hong Kong(城市大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 多模态评测 :multimodal(abstract);audio-visual(abstract);分类 cs.CV、cs.CL

AI总结 PhoStream是首个面向移动场景的多模态助手实时流基准测试,通过统一屏幕内外场景评估视频、音频和时间推理能力,揭示了大语言模型在决定何时发言上的局限性。

Comments 18 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20689 2026-01-29 cs.CV cs.AI 73%

Decoupling Perception and Calibration: Label-Efficient Image Quality Assessment Framework

解耦感知与校准:一种标签高效的图像质量评估框架

Xinyue Li, Zhichao Zhang, Zhiming Xu, Shubo Xu, Xiongkuo Min, Yitong Chen, Guangtao Zhai

机构 * Shanghai Jiao Tong University(上海交通大学) Xi’an Jiaotong University(西安交通大学) Baidu(百度)

专题命中 多模态评测 :multimodal(abstract);MLLM(abstract);分类 cs.CV、cs.AI

AI总结 LEAF通过蒸馏多模态大语言模型的感知先验,实现轻量级图像质量评估,减少对人类标注的依赖,同时保持与人类注释的一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19222 2026-01-28 cs.CV cs.AI 73%

UniPCB: A Unified Vision-Language Benchmark for Open-Ended PCB Quality Inspection

UniPCB: 一个统一的视觉-语言基准用于开放式PCB质量检测

Fuxiang Sun, Xi Jiang, Jiansheng Wu, Haigang Zhang, Feng Zheng, Jinfeng Yang

机构 * Shenzhen Polytechnic University(深圳职业技术大学) Southern University of Science and Technology(南方科技大学) University of Science and Technology Liaoning(辽宁科技大学)

专题命中 多模态评测 :multimodal(abstract);MLLM(abstract);分类 cs.CV、cs.AI

AI总结 UniPCB提出一个统一的视觉-语言基准用于开放式PCB质量检测,通过系统化流程和PCB-GPT模型提升缺陷定位性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16303 2026-01-12 cs.CV cs.AI 73%

PixelArena: A benchmark for Pixel-Precision Visual Intelligence

PixelArena: 一个用于像素级视觉智能的基准测试

Feng Liang, Sizhe Cheng, Chenqi Yi, Yong Wang

机构 * Nanyang Technological University(南洋理工大学)

专题命中 多模态评测 :multimodal(abstract);omni-modal(abstract);分类 cs.CV、cs.AI

AI总结 PixelArena提出通过语义分割任务以像素精度评估多模态模型的细粒度生成能力,发现Gemini 3 Pro在零样本设置下展现高保真语义掩码生成能力,揭示了视觉智能的新进展。

Comments 8 pages, 11 figures, project page: https://pixelarena.reify.ing/project

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22899 2025-12-30 cs.AI cs.CV 73%

HiSciBench: A Hierarchical Multi-disciplinary Benchmark for Scientific Intelligence from Reading to Discovery

HiSciBench: 一个分层多学科基准,用于从阅读到发现的科学智能

Yaping Zhang, Qixuan Zhang, Xingquan Zhang, Zhiyuan Chen, Wenwen Zhuang, Yupu Liang, Lu Xiang, Yang Zhao, Jiajun Zhang, Yu Zhou, Chengqing Zong

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) University of the Chinese Academy of Sciences(中国科学院大学)

专题命中 多模态评测 :multimodal(abstract);multimodal foundation model(abstract);分类 cs.CV、cs.AI

AI总结 HiSciBench是一个分层多学科基准,用于评估从阅读到发现的科学智能,涵盖五个层次,揭示了模型在不同科学推理阶段的能力差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16921 2025-12-19 cs.CV cs.AI 73%

Differences That Matter: Auditing Models for Capability Gap Discovery and Rectification

关键差异:用于能力缺口发现与纠正的模型审计

Qihao Liu, Chengzhi Mao, Yaojie Liu, Alan Yuille, Wen-Sheng Chu

机构 * Google(谷歌) Johns Hopkins University(约翰霍普金斯大学)

专题命中 多模态评测 :multimodal(abstract);MLLM(abstract);分类 cs.CV、cs.AI

AI总结 AuditDM通过主动发现和纠正多模态大语言模型的失败模式,提升模型性能和诊断能力。

Comments project page: https://auditdm.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07186 2025-12-09 cs.CV cs.AI 73%

START: Spatial and Textual Learning for Chart Understanding

START: 空间与文本学习用于图表理解

Zhuoming Liu, Xiaofeng Gao, Feiyang Niu, Qiaozi Gao, Liu Liu, Robinson Piramuthu

机构 * University of Wisconsin-Madison(威斯康星大学麦迪逊分校) Amazon AGI(亚马逊人工智能实验室) MIT(麻省理工学院)

专题命中 多模态评测 :multimodal(abstract);MLLM(abstract);分类 cs.CV、cs.AI

AI总结 START通过空间与文本学习提升图表理解能力,引入图表元素定位和图表到代码生成,增强多模态大语言模型对图表结构和数据细节的理解。

Comments WACV2026 Camera Ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05119 2025-12-08 cs.IR cs.AI cs.CL 73%

RAG-IGBench: Innovative Evaluation for RAG-based Interleaved Generation in Open-domain Question Answering

RAG-IGBench: 用于开放领域问答中基于检索增强生成的交错生成的创新评估

Rongyang Zhang, Yuqing Huang, Chengqiang Lu, Qimeng Wang, Yan Gao, Yi Wu, Yao Hu, Yin Xu, Wei Wang, Hao Wang, Enhong Chen

机构 * State Key Laboratory of Cognitive Intelligence, University of Science and Technology of China(认知智能国家重点实验室,中国科学技术大学) Xiaohongshu Inc.(小红书公司) Xi’an Jiaotong University(西安交通大学)

专题命中 多模态评测 :multimodal(abstract);image-text(abstract);分类 cs.CL、cs.AI

AI总结 RAG-IGBench通过创新的评估指标和多模态数据,评估基于检索增强生成的交错生成任务,验证了模型在开放领域问答中的性能提升。

Comments 26 pages, 6 figures, NeurIPS 2025 D&B Track poster

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.09321 2025-12-05 cs.CV cs.AI cs.LG 73%

DAVE: Diagnostic benchmark for Audio Visual Evaluation

DAVE: 音频视觉评估诊断基准

Gorjan Radevski, Teodora Popordanoska, Matthew B. Blaschko, Tinne Tuytelaars

机构 * KU Leuven(卢森堡大学)

专题命中 多模态评测 :multi-modal(abstract);audio-visual(abstract);分类 cs.CV、cs.AI

AI总结 DAVE提出一个诊断基准,通过确保两种模态必要性及分解评估子类,解决多模态模型评估中的视觉偏见问题,提供更精准的模型诊断与改进指导。

Comments First two authors contributed equally

Journal ref NeurIPS 2025 Datasets & Benchmarks

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12140 2025-11-18 cs.CL cs.CV 73%

Seeing is Believing: Rich-Context Hallucination Detection for MLLMs via Backward Visual Grounding

Pinxue Guo, Chongruo Wu, Xinyu Zhou, Lingyi Hong, Zhaoyu Chen, Jinglun Li, Kaixun Jiang, Sen-ching Samson Cheung, Wei Zhang, Wenqiang Zhang

专题命中 多模态评测 :multimodal(abstract);cross-modal(abstract);分类 cs.CV、cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.26125 2025-11-14 cs.CV cs.AI 73%

WOD-E2E: Waymo Open Dataset for End-to-End Driving in Challenging Long-tail Scenarios

Runsheng Xu, Hubert Lin, Wonseok Jeon, Hao Feng, Yuliang Zou, Liting Sun, John Gorman, Ekaterina Tolstaya, Sarah Tang, Brandyn White, Ben Sapp, Mingxing Tan, Jyh-Jing Hwang, Dragomir Anguelov

机构 * Waymo LLC(Waymo公司)

专题命中 多模态评测 :multimodal(abstract);multi-modal(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.08133 2025-11-12 cs.CV cs.AI 73%

OTSNet: A Neurocognitive-Inspired Observation-Thinking-Spelling Pipeline for Scene Text Recognition

Lixu Sun, Nurmemet Yolwas, Wushour Silamu

机构 * School of Computer Science and Technology(计算机科学与技术学院) School of Computer Science(计算机科学学院) Xinjiang University(新疆大学)

专题命中 多模态评测 :multi-modal(abstract);cross-modal(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10534 2025-11-11 cs.CV cs.LG cs.MM 73%

MCE: Towards a General Framework for Handling Missing Modalities under Imbalanced Missing Rates

Binyu Zhao, Wei Zhang, Zhaonian Zou

机构 * The School of Computer Science and Technology, Harbin Institute of Technology(计算机科学与技术学院,哈尔滨工业大学)

专题命中 多模态评测 :multi-modal(abstract);cross-modal(abstract);分类 cs.CV、cs.MM

Comments This is the accepted version of an article that has been published in \textbf{Pattern Recognition}. The final version is available via the DOI, or for 50 days' free access via this Share Link: https://authors.elsevier.com/a/1m40D77nKsBm- (valid until December 28, 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.21881 2025-10-28 cs.AI cs.CL 73%

GeoThought: A Dataset for Enhancing Mathematical Geometry Reasoning in Vision-Language Models

Nannan Shi, Chuanyu Qin, Shipeng Song, Man Luo

机构 * Baidu Inc.(百度公司) Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) Intel Lab, Intel(英特尔实验室)

专题命中 多模态评测 :multimodal(abstract);MLLM(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏