arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 9205 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态评测 9205 篇

2504.00476 2025-04-02 cs.CV 70%

4th PVUW MeViS 3rd Place Report: Sa2VA

Haobo Yuan, Tao Zhang, Xiangtai Li, Lu Qi, Zilong Huang, Shilin Xu, Jiashi Feng, Ming-Hsuan Yang

机构 * UC Merced(加州大学默塞德分校) Bytedance(字节跳动)

专题命中 多模态评测 :multi-modal(abstract);MLLM(abstract);分类 cs.CV

Comments Technical Report, 4 pages, Code: https://github.com/magic-research/Sa2VA

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.15164 2025-04-02 cs.AI 70%

SPA-Bench: A Comprehensive Benchmark for SmartPhone Agent Evaluation

Jingxuan Chen, Derek Yuen, Bin Xie, Yuhao Yang, Gongwei Chen, Zhihao Wu, Li Yixing, Xurui Zhou, Weiwen Liu, Shuai Wang, Kaiwen Zhou, Rui Shao, Liqiang Nie, Yasheng Wang, Jianye Hao, Jun Wang, Kun Shao

机构 * Harbin Institute of Technology(哈尔滨工业大学) Tianjin University(天津大学) AI Centre, University College London(伦敦大学学院人工智能中心)

专题命中 多模态评测 :multimodal(abstract);MLLM(abstract);分类 cs.AI

Comments ICLR 2025 Spotlight

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.19412 2025-04-01 cs.CV 70%

MINIMA: Modality Invariant Image Matching

Jiangwei Ren, Xingyu Jiang, Zizhuo Li, Dingkang Liang, Xin Zhou, Xiang Bai

机构 * Huazhong University of Science and Technology(华中科技大学) Wuhan University(武汉大学)

专题命中 多模态评测 :multimodal(abstract);cross-modal(abstract);分类 cs.CV

Comments Accepted to CVPR 2025. The dataset and code are available at https://github.com/LSXI7/MINIMA

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.21457 2025-03-28 cs.CV 70%

FaceBench: A Multi-View Multi-Level Facial Attribute VQA Dataset for Benchmarking Face Perception MLLMs

Xiaoqin Wang, Xusen Ma, Xianxu Hou, Meidan Ding, Yudong Li, Junliang Chen, Wenting Chen, Xiaoyang Peng, Linlin Shen

机构 * Shenzhen University(深圳大学) Tsinghua University(清华大学) The Hong Kong Polytechnic University(香港理工大学) City University of Hong Kong(香港城市大学) Sun Yat-sen University(中山大学)

专题命中 多模态评测 :multimodal(abstract);MLLM(abstract);分类 cs.CV

Comments Accepted by CVPR2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.20085 2025-03-25 cs.CV 70%

Auto Cherry-Picker: Learning from High-quality Generative Data Driven by Language

Yicheng Chen, Xiangtai Li, Yining Li, Yanhong Zeng, Jianzong Wu, Xiangyu Zhao, Kai Chen

机构 * Shanghai AI Laboratory(上海人工智能实验室) Fudan University(复旦大学) S-Lab, Nanyang Technological University(南洋理工大学S-Lab) Peking University(北京大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 多模态评测 :multi-modal(abstract);MLLM(abstract);分类 cs.CV

Comments Accepted to CVPR2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.16260 2025-03-21 cs.CV 70%

Chain of Functions: A Programmatic Pipeline for Fine-Grained Chart Reasoning Data

Zijian Li, Jingjing Fu, Lei Song, Jiang Bian, Jun Zhang, Rui Wang

机构 * Microsoft Research(微软研究院) Hong Kong University of Science and Technology(香港科技大学)

专题命中 多模态评测 :multimodal(abstract);MLLM(abstract);分类 cs.CV

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.10757 2025-03-18 astro-ph.IM astro-ph.SR cs.CL cs.LG 70%

Deep Learning and LLM-based Methods Applied to Stellar Lightcurve Classification

Yu-Yang Li, Yu Bai, Cunshi Wang, Mengwei Qu, Ziteng Lu, Roberto Soria, Jifeng Liu

机构 * National Astronomical Observatories, Chinese Academy of Sciences(中国科学院国家天文台) University of Chinese Academy of Sciences(中国科学院大学) Beijing Normal University(北京师范大学) Guangzhou Institute of Geochemistry, Chinese Academy of Sciences(中国科学院广州地球化学研究所) INAF—Osservatorio Astrofisico di Torino(意大利国家天体物理研究所都灵天文台) The University of Sydney(悉尼大学)

专题命中 多模态评测 :multimodal(abstract);MLLM(abstract);分类 cs.CL

Comments 35 pages, 20 figures

Journal ref Intell Comput. 2025;4:0110

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.10120 2025-03-14 cs.CV eess.IV 70%

Hybrid Agents for Image Restoration

Bingchen Li, Xin Li, Yiting Lu, Zhibo Chen

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 多模态评测 :multimodal(abstract);MLLM(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.19962 2025-03-13 cs.CV cs.IR 70%

ReCon: Enhancing True Correspondence Discrimination through Relation Consistency for Robust Noisy Correspondence Learning

Quanxing Zha, Xin Liu, Shu-Juan Peng, Yiu-ming Cheung, Xing Xu, Nannan Wang

机构 * Huaqiao University(华侨大学) Hong Kong Baptist University(香港浸会大学) University of Electronic Science and Technology of China(电子科技大学) Xidian University(西安电子科技大学)

专题命中 多模态评测 :multimodal(abstract);cross-modal(abstract);分类 cs.CV

Comments 10 pages, 4 figures, Accepted by CVPR2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.07097 2025-03-11 eess.IV cs.CV 70%

A Comprehensive Survey on Magnetic Resonance Image Reconstruction

Xiaoyan Kui, Zijie Fan, Zexin Ji, Qinsong Li, Chengtao Liu, Weixin Si, Beiji Zou

机构 * School of Computer Science and Engineering, Central South University(中南大学计算机科学与工程学院) Big Data Institute, Central South University(中南大学大数据研究院) Shenzhen Institute of Advanced Technology, Chinese Academy of Science(中国科学院深圳先进技术研究院)

专题命中 多模态评测 :multimodal(abstract);multi-modal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.02270 2025-03-05 cs.CV 70%

SSNet: Saliency Prior and State Space Model-based Network for Salient Object Detection in RGB-D Images

Gargi Panda, Soumitra Kundu, Saumik Bhattacharya, Aurobinda Routray

机构 * IIT Kharagpur(印度理工学院克勒格布尔分校) Rekhi Centre of Excellence for the Science of Happiness, IIT Kharagpur(印度理工学院克勒格布尔分校雷克希幸福科学卓越中心)

专题命中 多模态评测 :multi-modal(abstract);cross-modal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.20271 2025-02-25 cs.CV 70%

Draw-and-Understand: Leveraging Visual Prompts to Enable MLLMs to Comprehend What You Want

Weifeng Lin, Xinyu Wei, Ruichuan An, Peng Gao, Bocheng Zou, Yulin Luo, Siyuan Huang, Shanghang Zhang, Hongsheng Li

机构 * CUHK(香港中文大学) Peking University(北京大学) University of Wisconsin–Madison(威斯康星大学麦迪逊分校) Shanghai AI Laboratory(上海人工智能实验室)

专题命中 多模态评测 :multimodal(abstract);multi-modal(abstract);分类 cs.CV

Comments 30 pages, 8 figures, 15 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.13789 2025-02-20 cs.CV 70%

From Correctness to Comprehension: AI Agents for Personalized Error Diagnosis in Education

Yi-Fan Zhang, Hang Li, Dingjie Song, Lichao Sun, Tianlong Xu, Qingsong Wen

机构 * National Laboratory of Pattern Recognition, University of Chinese Academy of Sciences(中国科学院大学模式识别国家重点实验室) Michigan State University(密歇根州立大学) CUHK-Shenzhen(香港中文大学(深圳)) Lehigh University(利哈伊大学) Squirrel Ai Learning(松鼠AI学习)

专题命中 多模态评测 :multi-modal(abstract);MLLM(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.09325 2025-02-14 cs.CV 70%

A Benchmark for Crime Surveillance Video Analysis with Large Models

Haoran Chen, Dong Yi, Moyan Cao, Chensen Huang, Guibo Zhu, Jinqiao Wang

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) University of Chinese Academy of Sciences(中国科学院大学) Wuhan AI Research(武汉人工智能研究院)

专题命中 多模态评测 :multimodal(abstract);MLLM(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.13950 2025-01-27 cs.CV 70%

DEFEND: A Large-scale 1M Dataset and Foundation Model for Tobacco Addiction Prevention

Naga VS Raviteja Chappa, Matthew Shepard, Connor McCurtain, Charlotte McCormick, Page Daniel Dobbs, Khoa Luu

机构 * University of Arkansas(阿肯色大学) Center for Public Health and Technology, University of Arkansas(阿肯色大学公共卫生与技术中心)

专题命中 多模态评测 :multimodal(abstract);image-text(abstract);分类 cs.CV

Comments 11 pages, 5 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.12565 2024-12-18 cs.CV 70%

PBVS 2024 Solution: Self-Supervised Learning and Sampling Strategies for SAR Classification in Extreme Long-Tail Distribution

Yuhyun Kim, Minwoo Kim, Hyobin Park, Jinwook Jung, Dong-Geol Choi

机构 * Hanbat National University(韩bat国立大学)

专题命中 多模态评测 :multimodal(abstract);multi-modal(abstract);分类 cs.CV

Comments 4 pages, 3 figures, 1 Table

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.11767 2024-12-17 cs.CV 70%

IDEA-Bench: How Far are Generative Models from Professional Designing?

Chen Liang, Lianghua Huang, Jingwu Fang, Huanzhang Dou, Wei Wang, Zhi-Fan Wu, Yupeng Shi, Junge Zhang, Xin Zhao, Yu Liu

机构 * Tongyi Lab(通义实验室) CASIA(中国科学院自动化研究所) USTB(北京科技大学) ZJU(浙江大学)

专题命中 多模态评测 :multimodal(abstract);MLLM(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.06693 2024-12-10 cs.CL cs.AI cs.CV cs.LG cs.MM 70%

OmniEvalKit: A Modular, Lightweight Toolbox for Evaluating Large Language Model and its Omni-Extensions

Yi-Kai Zhang, Xu-Xiang Zhong, Shiyin Lu, Qing-Guo Chen, De-Chuan Zhan, Han-Jia Ye

机构 * School of Artificial Intelligence, Nanjing University(南京大学人工智能学院) Alibaba Group(阿里巴巴集团)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.04888 2024-12-09 cs.RO cs.AI 70%

VTD: Visual and Tactile Database for Driver State and Behavior Perception

Jie Wang, Mobing Cai, Zhongpan Zhu, Hongjun Ding, Jiwei Yi, Aimin Du

机构 * College of Electronics and Information Engineering, Tongji University(同济大学电子与信息工程学院) Frontiers Science Center for Intelligent Autonomous Systems(智能自主系统前沿科学中心) Trinity College, University of Oxford(牛津大学三一学院) CATARC Automotive Technology (Shanghai) Co., LTD.(中汽研汽车技术(上海)有限公司) School of Automotive Studies, Tongji University(同济大学汽车学院)

专题命中 多模态评测 :multi-modal(abstract);cross-modal(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.10708 2024-11-28 cs.CV cs.LG 70%

SelfEval: Leveraging the discriminative nature of generative models for evaluation

Sai Saketh Rambhatla, Ishan Misra

机构 * Meta GenAI(生成式人工智能部门)

专题命中 多模态评测 :multimodal(abstract);image-text(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.11840 2024-11-25 cs.CV 70%

LLaNA: Large Language and NeRF Assistant

Andrea Amaduzzi, Pierluigi Zama Ramirez, Giuseppe Lisanti, Samuele Salti, Luigi Di Stefano

机构 * University of Bologna(博洛尼亚大学)

专题命中 多模态评测 :multimodal(abstract);MLLM(abstract);分类 cs.CV

Comments Under review. Project page: https://andreamaduzzi.github.io/llana/

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.10845 2024-11-19 cs.CV 70%

Automatic Discovery and Assessment of Interpretable Systematic Errors in Semantic Segmentation

Jaisidh Singh, Sonam Singh, Amit Arvind Kale, Harsh K Gandhi

机构 * Bosch(博世)

专题命中 多模态评测 :multimodal(abstract);multimodal foundation model(abstract);分类 cs.CV

Comments 7 pages main paper (without references), total 13 pages & 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.18666 2024-10-30 cs.CV 70%

DreamClear: High-Capacity Real-World Image Restoration with Privacy-Safe Dataset Curation

Yuang Ai, Xiaoqiang Zhou, Huaibo Huang, Xiaotian Han, Zhengyu Chen, Quanzeng You, Hongxia Yang

专题命中 多模态评测 :multi-modal(abstract);image-text(abstract);分类 cs.CV

Comments Accepted by NeurIPS 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.07087 2024-10-11 cs.CV cs.RO 70%

Towards Realistic UAV Vision-Language Navigation: Platform, Benchmark, and Methodology

Xiangyu Wang, Donglin Yang, Ziqin Wang, Hohin Kwan, Jinyu Chen, Wenjun Wu, Hongsheng Li, Yue Liao, Si Liu

专题命中 多模态评测 :multimodal(abstract);MLLM(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.06555 2024-10-10 cs.CL 70%

ING-VP: MLLMs cannot Play Easy Vision-based Games Yet

Haoran Zhang, Hangyu Guo, Shuyue Guo, Meng Cao, Wenhao Huang, Jiaheng Liu, Ge Zhang

专题命中 多模态评测 :multimodal(abstract);image-text(abstract);分类 cs.CL

Comments 49 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.09045 2024-10-10 cs.CV 70%

AMSNet: Netlist Dataset for AMS Circuits

Zhuofu Tao, Yichen Shi, Yiru Huo, Rui Ye, Zonghang Li, Li Huang, Chen Wu, Na Bai, Zhiping Yu, Ting-Jung Lin, Lei He

专题命中 多模态评测 :multimodal(abstract);MLLM(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.20440 2024-09-26 cs.CL 70%

Integrating curation into scientific publishing to train AI models

Jorge Abreu-Vicente, Hannah Sonntag, Thomas Eidens, Cassie S. Mitchell, Thomas Lemberger

专题命中 多模态评测 :multimodal(abstract);multi-modal(abstract);分类 cs.CL

Comments Submitted to Journal for revision

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.12184 2024-09-19 cs.LG cs.AI 70%

Democratizing MLLMs in Healthcare: TinyLLaVA-Med for Efficient Healthcare Diagnostics in Resource-Constrained Settings

Aya El Mir, Lukelo Thadei Luoga, Boyuan Chen, Muhammad Abdullah Hanif, Muhammad Shafique

专题命中 多模态评测 :multi-modal(abstract);MLLM(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.18451 2024-09-10 cs.LG cs.AI 70%

CoRAST: Towards Foundation Model-Powered Correlated Data Analysis in Resource-Constrained CPS and IoT

Yi Hu, Jinhang Zuo, Alanis Zhao, Bob Iannucci, Carlee Joe-Wong

专题命中 多模态评测 :multimodal(abstract);cross-modal(abstract);分类 cs.AI

Comments accepted and to be published in 2024 IEEE International Workshop on Foundation Models for Cyber-Physical Systems & Internet of Things (FMSys)

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.16197 2024-07-24 cs.CV cs.RO 70%

LiCROcc: Teach Radar for Accurate Semantic Occupancy Prediction using LiDAR and Camera

Yukai Ma, Jianbiao Mei, Xuemeng Yang, Licheng Wen, Weihua Xu, Jiangning Zhang, Botian Shi, Yong Liu, Xingxing Zuo

专题命中 多模态评测 :multi-modal(abstract);cross-modal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏