arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2025-12-29 至 2025-12-29 共收录 4 信号源:cs.CV, cs.AI, cs.LG

1. 视觉问答 4 篇

2511.18286 2025-12-29 cs.CV 83%

RoadSceneVQA: Benchmarking Visual Question Answering in Roadside Perception Systems for Intelligent Transportation System

RoadSceneVQA: 用于智能交通系统 roadside 系统的视觉问答基准测试

Runwei Guan, Rongsheng Hu, Shangshu Chen, Ningyuan Xiao, Xue Xia, Jiayang Liu, Beibei Chen, Ziren Tang, Ningwei Ouyang, Shaofeng Liang, Yuxuan Fan, Wanjie Sun, Yutao Yue

专题命中 视觉问答 :visual question answering(title,abstract);MLLM(abstract);分类 cs.CV

AI总结 RoadSceneVQA 通过大规模标注数据和 CogniAnchor 融合模块,提升多模态大语言模型在交通感知与推理任务中的性能。

Comments 10 pages, 6 figures, accepted by AAAI 2026. The model is also called Dream, to the other me in the world forever

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21675 2025-12-29 cs.CV 77%

UniPercept: Towards Unified Perceptual-Level Image Understanding across Aesthetics, Quality, Structure, and Texture

UniPercept:迈向跨美学、质量、结构和纹理的统一感知级图像理解

Shuo Cao, Jiayang Li, Xiaohui Li, Yuandong Pu, Kaiwen Zhu, Yuanting Gao, Siqi Luo, Yi Xin, Qi Qin, Yu Zhou, Xiangyu Chen, Wenlong Zhang, Bin Fu, Yu Qiao, Yihao Liu

机构 * University of Science and Technology of China(中国科学技术大学) Shanghai AI Laboratory(上海人工智能实验室) Peking University(北京大学) Shanghai Jiao Tong University(上海交通大学) Tsinghua University(清华大学) Nanjing University(南京大学) Sun Yat-sen University(中山大学) Tele-AI Website(Tele-AI网站)

专题命中 视觉问答 :visual question answering(abstract);grounding(abstract);multimodal large language model(abstract);分类 cs.CV

AI总结 UniPercept通过领域自适应预训练和任务对齐强化学习,实现跨美学、质量、结构和纹理的统一感知级图像理解,优于现有多模态大语言模型。

Comments 27 pages, 14 figures, 17 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14330 2025-12-29 cs.IR 67%

Ensembling Multiple Hallucination Detectors Trained on VLLM Internal Representations

集成多个基于VLLM内部表示的幻觉检测器

Yuto Nakamizo, Ryuhei Miyazato, Hikaru Tanabe, Ryuta Yamakura, Kiori Hatanaka

专题命中 视觉问答 :VLM(abstract);visual question answering(abstract)

AI总结 本文提出通过集成多个基于VLLM内部表示的幻觉检测模型,以减少幻觉并提高VQA任务的准确性。

Comments 5th place solution at Meta KDD Cup 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.00846 2025-12-29 cs.CV cs.AI 62%

OmniBrainBench: A Comprehensive Multimodal Benchmark for Brain Imaging Analysis Across Multi-stage Clinical Tasks

OmniBrainBench: 一种全面的多模态基准,用于跨多阶段临床任务的脑影像分析

Zhihao Peng, Cheng Wang, Shengyuan Liu, Zhiying Liang, Zanting Ye, Minjie Ju, PeterYM Woo, Yixuan Yuan

机构 * Chinese University of Hong Kong(香港中文大学) Sun Yat-sen Memorial Hospital, Sun Yat-sen University(中山大学孙逸仙纪念医院) Southern Medical University(南方医科大学) Zhongshan Hospital, Fudan University(复旦大学中山医院) Department of Neurosurgery, Prince of Wales Hospital(威尔士王室医院神经外科部)

专题命中 视觉问答 :multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 OmniBrainBench是一个全面的多模态基准,用于评估脑影像分析中MLLMs的多模态理解能力,揭示了其在复杂临床任务中的挑战和与医生的差距。

详情

展开后加载摘要…

URL PDF HTML 收藏