arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 4672 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 图文多模态 4672 篇

2405.14517 2025-03-26 cs.LG cs.CR 50%

TUNI: A Textual Unimodal Detector for Identity Inference in CLIP Models

Songze Li, Ruoxi Cheng, Xiaojun Jia

专题命中 图文多模态 :multimodal(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.07343 2025-02-12 cs.DB 50%

DEG: Efficient Hybrid Vector Search Using the Dynamic Edge Navigation Graph

Ziqi Yin, Jianyang Gao, Pasquale Balsebre, Gao Cong, Cheng Long

专题命中 图文多模态 :image-text(abstract)

Comments Accepted by sigmod 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.15065 2025-02-12 stat.ML cs.LG math.ST stat.TH 50%

The Benefits of Balance: From Information Projections to Variance Reduction

Lang Liu, Ronak Mehta, Soumik Pal, Zaid Harchaoui

专题命中 图文多模态 :multimodal(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.19457 2025-02-10 cs.RO 50%

A Parameter-Efficient Tuning Framework for Language-guided Object Grounding and Robot Grasping

Houjian Yu, Mingen Li, Alireza Rezazadeh, Yang Yang, Changhyun Choi

专题命中 图文多模态 :multimodal(abstract)

Comments Accepted for ICRA 2025. Project page: https://sites.google.com/umn.edu/etog-etrg/home

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.03721 2025-02-07 cs.CR cs.LG 50%

Detecting Backdoor Attacks via Similarity in Semantic Communication Systems

Ziyang Wei, Yili Jiang, Jiaqi Huang, Fangtian Zhong, Sohan Gyawali

专题命中 图文多模态 :image-text(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.13851 2025-01-24 cs.LG 50%

Large Vision-Language Models for Knowledge-Grounded Data Annotation of Memes

Shiling Deng, Serge Belongie, Peter Ebert Christensen

专题命中 图文多模态 :cross-modal(abstract)

Comments 18 pages, 5 figures, 13 tables, GitHub repository: https://github.com/Seefreem/meme_text_retrieval_p1

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.04897 2025-01-10 cs.LG 50%

Online Continual Learning: A Systematic Literature Review of Approaches, Challenges, and Benchmarks

Seyed Amir Bidaki, Amir Mohammadkhah, Kiyan Rezaee, Faeze Hassani, Sadegh Eskandari, Maziar Salahi, Mohammad M. Ghassemi

专题命中 图文多模态 :multimodal(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2302.12610 2024-11-01 cs.RO 50%

A Joint Modeling of Vision-Language-Action for Target-oriented Grasping in Clutter

Kechun Xu, Shuqi Zhao, Zhongxiang Zhou, Zizhang Li, Huaijin Pi, Yue Wang, Rong Xiong

专题命中 图文多模态 :multi-modal(abstract)

Comments Accepted by ICRA 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.19438 2024-10-15 cs.NE 50%

Neuro-Vision to Language: Enhancing Brain Recording-based Visual Reconstruction and Language Interaction

Guobin Shen, Dongcheng Zhao, Xiang He, Linghao Feng, Yiting Dong, Jihang Wang, Qian Zhang, Yi Zeng

专题命中 图文多模态 :multimodal(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.11838 2024-10-15 cs.RO cs.HC 50%

The Conversation is the Command: Interacting with Real-World Autonomous Robot Through Natural Language

Linus Nwankwo, Elmar Rueckert

专题命中 图文多模态 :multimodal(abstract)

Comments 5 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.01190 2024-10-03 cs.IR cs.DL 50%

Integrating Visual and Textual Inputs for Searching Large-Scale Map Collections with CLIP

Jamie Mahowald, Benjamin Charles Germain Lee

专题命中 图文多模态 :multimodal(abstract)

Comments 18 pages, 7 figures, accepted at the Computational Humanities Research Conference (CHR 2024)

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.13383 2024-07-18 cs.LG 50%

Gradient Projection For Continual Parameter-Efficient Tuning

Jingyang Qiao, Zhizhong Zhang, Xin Tan, Yanyun Qu, Wensheng Zhang, Zhi Han, Yuan Xie

专题命中 图文多模态 :cross-modal(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.05874 2024-06-11 cs.CR 50%

Stealthy Targeted Backdoor Attacks against Image Captioning

Wenshu Fan, Hongwei Li, Wenbo Jiang, Meng Hao, Shui Yu, Xiao Zhang

专题命中 图文多模态 :multimodal(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.06904 2024-04-11 cs.RO 50%

Vision-Language Model-based Physical Reasoning for Robot Liquid Perception

Wenqiang Lai, Yuan Gao, Tin Lun Lam

专题命中 图文多模态 :multimodal(abstract)

Comments 8 pages, 6 figures, submitted to IROS 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.14883 2023-11-28 cs.SI 50%

Predicting Potential School Shooters from Social Media Posts

Alana Cedeno, Rachel Liang, Sheikh Rabiul Islam

专题命中 图文多模态 :multimodal(abstract)

Journal ref IEEE Big Data 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.04628 2023-10-10 cs.CY 50%

(Re)framing Built Heritage through the Machinic Gaze

Vanicka Arora, Liam Magee, Luke Munn

专题命中 图文多模态 :image-text(abstract)

Comments 18 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.17609 2023-05-30 cs.GR cs.HC 50%

EvIcon: Designing High-Usability Icon with Human-in-the-loop Exploration and IconCLIP

I-Chao Shen, Fu-Yin Cherng, Takeo Igarashi, Wen-Chieh Lin, Bing-Yu Chen

专题命中 图文多模态 :image-text(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2304.13172 2023-04-27 cs.GR 50%

Generating Procedural Materials from Text or Image Prompts

Yiwei Hu, Paul Guerrero, Miloš Hašan, Holly Rushmeier, Valentin Deschaintre

专题命中 图文多模态 :multi-modal(abstract)

Journal ref SIGGRAPH 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.05830 2023-03-13 cs.CR 50%

ICStega: Image Captioning-based Semantically Controllable Linguistic Steganography

Xilong Wang, Yaofei Wang, Kejiang Chen, Jinyang Ding, Weiming Zhang, Nenghai Yu

专题命中 图文多模态 :image-text(abstract)

Comments 5 pages, 5 tables, 3 figures. Accepted by ICASSP 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2302.06671 2023-02-24 cs.RO 50%

GenAug: Retargeting behaviors to unseen situations via Generative Augmentation

Zoey Chen, Sho Kiami, Abhishek Gupta, Vikash Kumar

专题命中 图文多模态 :image-text(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2212.05195 2022-12-13 cs.LG 50%

Uniform Masking Prevails in Vision-Language Pretraining

Siddharth Verma, Yuchen Lu, Rui Hou, Hanchao Yu, Nicolas Ballas, Madian Khabsa, Amjad Almahairi

专题命中 图文多模态 :image-text(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
1507.00130 2015-07-02 cs.GT 50%

Randomized Revenue Monotone Mechanisms for Online Advertising

Gagan Goel, MohammadTaghi Hajiaghayi, Mohammad Reza Khani

专题命中 图文多模态 :image-text(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏