arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 1583 信号源:cs.CV, cs.AI, cs.LG

1. 其他VLM 1583 篇

2502.08193 2025-02-13 cs.CR 50%

Typographic Attacks in a Multi-Image Setting

Xiaomeng Wang, Zhengyu Zhao, Martha Larson

专题命中 其他VLM :vision-language model(abstract)

Comments Accepted by NAACL2025. Our code is available at https://github.com/XiaomengWang-AI/Typographic-Attacks-in-a-Multi-Image-Setting

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.09013 2025-01-31 cs.CL 50%

The Impact of Visual Information in Chinese Characters: Evaluating Large Models' Ability to Recognize and Utilize Radicals

Xiaofeng Wu, Karl Stratos, Wei Xu

专题命中 其他VLM :vision-language model(abstract)

Comments Accepted to NAACL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.07051 2025-01-14 cs.RO cs.HC 50%

ROSAnnotator: A Web Application for ROSBag Data Analysis in Human-Robot Interaction

Yan Zhang, Haoqi Li, Ramtin Tabatabaei, Wafa Johal

专题命中 其他VLM :multimodal large language model(abstract)

Comments Accepted to HRI 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.20632 2024-12-31 cs.RO cs.HC 50%

EVOLVE: Emotion and Visual Output Learning via LLM Evaluation

Jordan Sinclair, Christopher Reardon

专题命中 其他VLM :vision-language model(abstract)

Comments This work was presented at the WARN, Weighing the Benefits of Autonomous Robot Personalization, workshop at the 33rd IEEE RO-MAN 2024 conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.14769 2024-12-20 cs.CL 50%

PsyDraw: A Multi-Agent Multimodal System for Mental Health Screening in Left-Behind Children

Yiqun Zhang, Xiaocui Yang, Xiaobai Li, Siyuan Yu, Yi Luan, Shi Feng, Daling Wang, Yifei Zhang

专题命中 其他VLM :multimodal large language model(abstract)

Comments preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.14210 2024-12-20 cs.HC cs.CY cs.SI 50%

Mobilizing Waldo: Evaluating Multimodal AI for Public Mobilization

Manuel Cebrian, Petter Holme, Niccolo Pescetelli

专题命中 其他VLM :multimodal large language model(abstract)

Comments 11 pages, 2 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.07619 2024-12-11 cs.CL 50%

DRUM: Learning Demonstration Retriever for Large MUlti-modal Models

Ellen Yi-Ge, Jiechao Gao, Wei Han, Wei Zhu

专题命中 其他VLM :vision-language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.18908 2024-12-04 cs.HC 50%

DuetML: Human-LLM Collaborative Machine Learning Framework for Non-Expert Users

Wataru Kawabe, Yusuke Sugano

专题命中 其他VLM :MLLM(abstract)

Comments 22 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.06078 2024-11-27 cs.RO cs.SY eess.SY 50%

PEERNet: An End-to-End Profiling Tool for Real-Time Networked Robotic Systems

Aditya Narayanan, Pranav Kasibhatla, Minkyu Choi, Po-han Li, Ruihan Zhao, Sandeep Chinchali

专题命中 其他VLM :vision language model(abstract)

Comments Accepted at IROS 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.10880 2024-11-15 cs.CL 50%

Exploring the Potential of Multimodal LLM with Knowledge-Intensive Multimodal ASR

Minghan Wang, Yuxia Wang, Thuy-Trang Vu, Ehsan Shareghi, Gholamreza Haffari

专题命中 其他VLM :multimodal large language model(abstract)

Comments Accepted to EMNLP 2024 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.17152 2024-10-23 cs.IR cs.CL 50%

Improving Pinterest Search Relevance Using Large Language Models

Han Wang, Mukuntha Narayanan Sundararaman, Onur Gungor, Yu Xu, Krishna Kamath, Rakesh Chalasani, Kurchi Subhra Hazra, Jinfeng Rao

专题命中 其他VLM :visual language model(abstract)

Comments CIKM 2024 Workshop on Industrial Recommendation Systems

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.11838 2024-10-15 cs.RO cs.HC 50%

The Conversation is the Command: Interacting with Real-World Autonomous Robot Through Natural Language

Linus Nwankwo, Elmar Rueckert

专题命中 其他VLM :vision-language model(abstract)

Comments 5 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.11941 2024-09-19 cs.RO 50%

GauTOAO: Gaussian-based Task-Oriented Affordance of Objects

Jiawen Wang, Dingsheng Luo

专题命中 其他VLM :vision-language model(abstract)

Comments 6 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.06413 2024-09-18 cs.RO cs.CL math.OC 50%

Foundation Models to the Rescue: Deadlock Resolution in Connected Multi-Robot Systems

Kunal Garg, Songyuan Zhang, Jacob Arkin, Chuchu Fan

专题命中 其他VLM :vision-language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.15335 2024-07-23 eess.SP 50%

Addressing Out-of-Distribution Challenges in Image Semantic Communication Systems with Multi-modal Large Language Models

Feifan Zhang, Yuyang Du, Kexin Chen, Yulin Shao, Soung Chang Liew

专题命中 其他VLM :MLLM(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.08882 2024-07-15 cs.HC 50%

Emerging Practices for Large Multimodal Model (LMM) Assistance for People with Visual Impairments: Implications for Design

Jingyi Xie, Rui Yu, He Zhang, Sooyeon Lee, Syed Masum Billah, John M. Carroll

专题命中 其他VLM :vision-language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.07588 2024-07-02 cs.MM cs.CL 50%

AIM: Let Any Multi-modal Large Language Models Embrace Efficient In-Context Learning

Jun Gao, Qian Qiao, Ziqiang Cao, Zili Wang, Wenjie Li

专题命中 其他VLM :MLLM(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.07612 2024-04-12 cs.CY 50%

Measuring Geographic Diversity of Foundation Models with a Natural Language--based Geo-guessing Experiment on GPT-4

Zilong Liu, Krzysztof Janowicz, Kitty Currier, Meilin Shi

专题命中 其他VLM :multimodal large language model(abstract)

Comments Short paper accepted by AGILE 2024 conference (https://agile-gi.eu/conference-2024)

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.06659 2024-02-21 cs.CL 50%

WisdoM: Improving Multimodal Sentiment Analysis by Fusing Contextual World Knowledge

Wenbin Wang, Liang Ding, Li Shen, Yong Luo, Han Hu, Dacheng Tao

专题命中 其他VLM :vision-language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.10085 2024-01-19 cs.RO 50%

CLIP feature-based randomized control using images and text for multiple tasks and robots

Kazuki Shibata, Hideki Deguchi, Shun Taguchi

专题命中 其他VLM :vision language model(abstract)

Comments 13 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.04471 2024-01-10 cs.CL 50%

TransportationGames: Benchmarking Transportation Knowledge of (Multimodal) Large Language Models

Xue Zhang, Xiangyu Shi, Xinyue Lou, Rui Qi, Yufeng Chen, Jinan Xu, Wenjuan Han

专题命中 其他VLM :multimodal large language model(abstract)

Comments Work in Progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2307.07589 2023-07-24 cs.HC 50%

GenAssist: Making Image Generation Accessible

Mina Huh, Yi-Hao Peng, Amy Pavel

专题命中 其他VLM :vision-language model(abstract)

Comments For accessibility tagged pdf, please refer to the ancillary file

详情

展开后加载摘要…

URL PDF HTML 收藏
2302.01582 2023-02-06 cs.CL 50%

Controlling for Stereotypes in Multimodal Language Model Evaluation

Manuj Malik, Richard Johansson

专题命中 其他VLM :vision language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏