arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 6918 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态训练与对齐 6918 篇

2506.20757 2025-06-27 cs.CV cs.RO 57%

ConViTac: Aligning Visual-Tactile Fusion with Contrastive Representations

Zhiyuan Wu, Yongqiang Zhao, Shan Luo

机构 * Department of Engineering, King’s College London(伦敦国王学院工程系)

专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.19777 2025-06-26 cs.CV cs.LG 57%

LPOSS: Label Propagation Over Patches and Pixels for Open-vocabulary Semantic Segmentation

Vladan Stojnić, Yannis Kalantidis, Jiří Matas, Giorgos Tolias

专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.19585 2025-06-25 cs.CV 57%

SMARTIES: Spectrum-Aware Multi-Sensor Auto-Encoder for Remote Sensing Images

Gencer Sumbul, Chang Xu, Emanuele Dalsasso, Devis Tuia

机构 * Ecole Polytechnique Fédérale de Lausanne(瑞士联邦理工学院洛桑分校)

专题命中 多模态训练与对齐 :multi-modal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.19341 2025-06-25 cs.CV 57%

Trajectory Prediction in Dynamic Object Tracking: A Critical Study

Zhongping Dong, Liming Chen, Mohand Tahar Kechadi

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.20881 2025-06-24 cs.CV 57%

S4Fusion: Saliency-aware Selective State Space Model for Infrared Visible Image Fusion

Haolong Ma, Hui Li, Chunyang Cheng, Gaoang Wang, Xiaoning Song, Xiaojun Wu

机构 * Sino-UK Joint Laboratory on Artificial Intelligence of Ministry of Science and Technology(科技部中英联合人工智能实验室) International Joint Laboratory on Artificial Intelligence of Ministry of Education(教育部国际人工智能联合实验室) School of Artificial Intelligence and Computer Science(人工智能与计算机科学学院) College of Computer Science and Technology(计算机科学与技术学院)

专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.03177 2025-06-24 cs.CV 57%

Transformer-based RGB-T Tracking with Channel and Spatial Feature Fusion

Yunfeng Li, Bo Wang, Ye Li

机构 * National Key Laboratory of Autonomous Marine Vehicle Technology, Harbin Engineering University(自主水下机器人类国家实验室,哈尔滨工程大学)

专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CV

Comments This work has been submitted to the IEEE for possible publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.17267 2025-06-24 cs.LG cs.AI 57%

CF-VLM:CounterFactual Vision-Language Fine-tuning

Jusheng Zhang, Kaitong Cai, Yijia Fan, Jian Wang, Keze Wang

机构 * Sun Yat-sen University(中山大学) Snap Inc.(Snap公司)

专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.16773 2025-06-23 cs.CV 57%

Infrared and Visible Image Fusion Based on Implicit Neural Representations

Shuchen Sun, Ligen Shi, Chang Liu, Lina Wu, Jun Qiu

机构 * College of Computer Science, Beijing Information Science and Technology University(北京信息科技大学计算机学院) School of Mathematical Sciences, Capital Normal University(首都师范大学数学学院)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.16000 2025-06-23 cs.ET cs.AI cs.RO quant-ph 57%

Quantum Artificial Intelligence for Secure Autonomous Vehicle Navigation: An Architectural Proposal

Hemanth Kannamarlapudi, Sowmya Chintalapudi

机构 * University of Rhode Island(罗德岛大学) Carleton University(卡尔顿大学)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.AI

Comments 5 pages, 2 figures, 17 references. Architectural proposal for quantum AI integration in autonomous vehicle navigation systems for secured navigation

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.14384 2025-06-18 cs.CV 57%

GrFormer: A Novel Transformer on Grassmann Manifold for Infrared and Visible Image Fusion

Huan Kang, Hui Li, Xiao-Jun Wu, Tianyang Xu, Rui Wang, Chunyang Cheng, Josef Kittler

机构 * School of Artificial Intelligence(人工智能学院) Computer Science, Jiangnan University(计算机科学,江南大学) The Centre for Vision, Speech(视觉、语音与信号处理中心) Signal Processing, University of Surrey(信号处理,萨里大学)

专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CV

Comments 16 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.14238 2025-06-18 cs.CV 57%

Unified Representation Space for 3D Visual Grounding

Yinuo Zheng, Lipeng Gu, Honghua Chen, Liangliang Nan, Mingqiang Wei

机构 * School of Computer Science and Technology, Nanjing University of Aeronautics and Astronautics(计算机科学与技术学院,南京航空航天大学) Urban Data Science Section, Delft University of Technology(数据科学部,代尔夫特理工大学)

专题命中 多模态训练与对齐 :multi-modal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.13166 2025-06-17 cs.CV 57%

GreedyPrune: Retenting Critical Visual Token Set for Large Vision Language Models

Ruiguang Pei, Weiqing Sun, Zhihui Fu, Jun Wang

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.12536 2025-06-17 cs.RO cs.AI 57%

Deep Fusion of Ultra-Low-Resolution Thermal Camera and Gyroscope Data for Lighting-Robust and Compute-Efficient Rotational Odometry

Farida Mohsen, Ali Safa

机构 * College of Science and Engineering, Hamad Bin Khalifa University(哈马德·本·哈利法大学科学与工程学院)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.08666 2025-06-16 cs.CV 57%

LLaVA-c: Continual Improved Visual Instruction Tuning

Wenzhuo Liu, Fei Zhu, Haiyang Guo, Longhui Wei, Cheng-Lin Liu

机构 * School of Artificial Intelligence, UCAS(人工智能学院,UCAS) State Key Laboratory of Multimodal Artificial Intelligence Systems, CASIA(多模态人工智能系统国家重点实验室,CASIA) Centre for Artificial Intelligence and Robotics, HKISI-CAS(人工智能与机器人中心,HKISI-CAS) Huawei Inc(华为公司)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.10575 2025-06-13 cs.CV 57%

Text to Image for Multi-Label Image Recognition with Joint Prompt-Adapter Learning

Chun-Mei Feng, Kai Yu, Xinxing Xu, Salman Khan, Rick Siow Mong Goh, Wangmeng Zuo, Yong Liu

机构 * Institute of High Performance Computing (IHPC), Agency for Science, Technology and Research (A*STAR)(高性能计算研究所,科技研究局) University of Minnesota(明尼苏达大学) Microsoft Research Asia Singapore(微软亚洲研究院新加坡分部) Mohamed bin Zayed University of Artificial Intelligence (MBZUAI)(Mohamed bin Zayed人工智能大学) Australian National University(澳大利亚国立大学) Harbin Institute of Technology(哈尔滨工业大学)

专题命中 多模态训练与对齐 :image-text(abstract);分类 cs.CV

Journal ref TPAMI-2024-04-1021

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.09491 2025-06-12 cs.RO cs.CV 57%

DCIRNet: Depth Completion with Iterative Refinement for Dexterous Grasping of Transparent and Reflective Objects

Guanghu Xie, Zhiduo Jiang, Yonglong Zhang, Yang Liu, Zongwu Xie, Baoshi Cao, Hong Liu

机构 * State Key Laboratory of Robotics and Systems, Harbin Institute of Technology(机器人系统国家重点实验室,哈尔滨工业大学)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.08777 2025-06-12 cs.CV 57%

Gaussian2Scene: 3D Scene Representation Learning via Self-supervised Learning with 3D Gaussian Splatting

Keyi Liu, Weidong Yang, Ben Fei, Ying He

机构 * Fudan University(复旦大学) The Chinese University of Hong Kong(香港中文大学) Nanyang Technological University(南洋理工大学)

专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.12803 2025-06-12 cs.CV cs.LG 57%

TextSquare: Scaling up Text-Centric Visual Instruction Tuning

Jingqun Tang, Chunhui Lin, Zhen Zhao, Shu Wei, Binghong Wu, Qi Liu, Yangfan He, Kuan Lu, Hao Feng, Yang Li, Siqi Wang, Lei Liao, Wei Shi, Yuliang Liu, Hao Liu, Yuan Xie, Xiang Bai, Can Huang

机构 * ByteDance Inc.(字节跳动公司) East China Normal University(东华大学) Huazhong University of Science and Technology(华中科技大学) University of Minnesota(明尼苏达大学) Cornell University(康奈尔大学)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.08887 2025-06-11 cs.CV 57%

DiscoVLA: Discrepancy Reduction in Vision, Language, and Alignment for Parameter-Efficient Video-Text Retrieval

Leqi Shen, Guoqiang Gong, Tianxiang Hao, Tao He, Yifeng Zhang, Pengzhang Liu, Sicheng Zhao, Jungong Han, Guiguang Ding

机构 * School of Software(软件学院) BNRist Department of Automation, Tsinghua University(自动化系,清华大学) Hangzhou Zhuoxi Institute of Brain and Intelligence(杭州卓溪脑科学与智能研究院) GRG Banking Equipment Co., Ltd.(GRG银行设备有限公司) South China University of Technology(华南理工大学)

专题命中 多模态训练与对齐 :image-text(abstract);分类 cs.CV

Comments CVPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.07814 2025-06-10 cs.CV 57%

M2Restore: Mixture-of-Experts-based Mamba-CNN Fusion Framework for All-in-One Image Restoration

Yongzhen Wang, Yongjun Li, Zhuoran Zheng, Xiao-Ping Zhang, Mingqiang Wei

机构 * School of Computer Science and Technology, Anhui University of Technology(安徽理工大学计算机科学与技术学院) School of Cyberspace Security, Sun Yat-sen University(中山大学网络安全学院) Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) School of Computer Science and Technology, Nanjing University of Aeronautics and Astronautics(南京航空航天大学计算机科学与技术学院) College of Artificial Intelligence, Taiyuan University of Technology(太原科技大学人工智能学院)

专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CV

Comments 13 pages, 8 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.07402 2025-06-10 cs.CR cs.CL 57%

Beyond Jailbreaks: Revealing Stealthier and Broader LLM Security Risks Stemming from Alignment Failures

Yukai Zhou, Sibei Yang, Wenjie Wang

机构 * ShanghaiTech University(上海科技大学)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.07035 2025-06-10 q-bio.BM cs.AI 57%

AnnoDPO: Protein Functional Annotation Learning with Direct Preference Optimization

Zixuan Jiang, Renjing Xu

专题命中 多模态训练与对齐 :multi-modal(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.05873 2025-06-09 cs.IR cs.AI 57%

Research on Personalized Financial Product Recommendation by Integrating Large Language Models and Graph Neural Networks

Yushang Zhao, Yike Peng, Dannier Li, Yuxin Yang, Chengrui Zhou, Jing Dong

专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.05689 2025-06-09 cs.CV 57%

Pts3D-LLM: Studying the Impact of Token Structure for 3D Scene Understanding With Large Language Models

Hugues Thomas, Chen Chen, Jian Zhang

机构 * Apple(苹果公司)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV

Comments Main paper and appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.03643 2025-06-06 cs.CV 57%

Images are Worth Variable Length of Representations

Lingjun Mao, Rodolfo Corona, Xin Liang, Wenhao Yan, Zineng Tang

机构 * University of California, San Diego(加州大学圣迭戈分校) University of California, Berkeley(加州大学伯克利分校) University of Washington(华盛顿大学)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.03440 2025-06-06 cs.CV 57%

Geometric Visual Fusion Graph Neural Networks for Multi-Person Human-Object Interaction Recognition in Videos

Tanqiu Qiao, Ruochen Li, Frederick W. B. Li, Yoshiki Kubotani, Shigeo Morishima, Hubert P. H. Shum

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV

Comments Accepted by Expert Systems with Applications (ESWA)

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.09427 2025-06-05 cs.LG cs.AI 57%

Language-Enhanced Representation Learning for Single-Cell Transcriptomics

Yaorui Shi, Jiaqi Yang, Changhao Nai, Sihang Li, Junfeng Fang, Xiang Wang, Zhiyuan Liu, Yang Zhang

机构 * University of Science and Technology of China(中国科学技术大学) Harbin Institute of Technology(哈尔滨工业大学) National University of Singapore(新加坡国立大学)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.16739 2025-06-05 cs.LG cs.AI 57%

Pushing Large Language Models to the 6G Edge: Vision, Challenges, and Opportunities

Zheng Lin, Guanqiao Qu, Qiyuan Chen, Xianhao Chen, Zhe Chen, Kaibin Huang

机构 * Department of Electrical and Electronic Engineering, University of Hong Kong(香港大学电子与电气工程系) HKU Musketeers Foundation Institute of Data Science, University of Hong Kong(香港大学穆斯奎特基金会数据科学研究所) School of Computer Science, Fudan University(复旦大学计算机学院)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.AI

Comments 7 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.02744 2025-06-04 cs.CE cs.AI 57%

Enriching Location Representation with Detailed Semantic Information

Junyuan Liu, Xinglei Wang, Tao Cheng

机构 * SpaceTimeLab, University College London, UK(SpaceTimeLab,伦敦大学学院,英国)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.02557 2025-06-04 cs.CV 57%

Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models

Shizhan Gong, Yankai Jiang, Qi Dou, Farzan Farnia

专题命中 多模态训练与对齐 :multi-modal(abstract);分类 cs.CV

Comments ICML 2025

详情

展开后加载摘要…

URL PDF HTML 收藏