arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-01-19 至 2026-01-19 共收录 4 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态评测 4 篇

2312.03543 2026-01-19 cs.CV cs.AI 88%

GPT-4 Enhanced Multimodal Grounding for Autonomous Driving: Leveraging Cross-Modal Attention with Large Language Models

GPT-4增强的多模态接地用于自动驾驶:利用跨模态注意力与大语言模型

Haicheng Liao, Huanming Shen, Zhenning Li, Chengyue Wang, Guofa Li, Yiming Bie, Chengzhong Xu

机构 * Univ City(大学城市)

专题命中 多模态评测 :multimodal(title,abstract);cross-modal(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出了一种结合GPT-4的大语言模型的多模态接地框架,用于提升自动驾驶中的视觉理解和指令执行能力。

Journal ref Communications in Transportation Research 4 (2024) 100116

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.08779 2026-01-19 cs.CV 79%

BBQ-V: Benchmarking Visual Stereotype Bias in Large Multimodal Models

BBQ-V:评估大型多模态模型中视觉刻板印象偏见的基准

Vishal Narnaware, Ashmal Vayani, Rohit Gupta, Sirnam Swetha, Mubarak Shah

机构 * Institute of Artificial Intelligence, University of Central Florida(人工智能研究所,中央佛罗里达大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 BBQ-V通过真实多演员图像和多样类别评估LMMs的刻板印象偏见,揭示了主流模型在推理链中的偏见问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.10962 2026-01-19 cs.CV 79%

V2X-Radar: A Multi-modal Dataset with 4D Radar for Cooperative Perception

V2X-Radar: 一种包含4D雷达的多模态数据集用于协作感知

Lei Yang, Xinyu Zhang, Jun Li, Chen Wang, Jiaqi Ma, Zhiying Song, Tong Zhao, Ziying Song, Li Wang, Mo Zhou, Yang Shen, Kai Wu, Chen Lv

机构 * School of Vehicle and Mobility, Tsinghua University(车辆与移动性学院,清华大学) Nanyang Technological University(南洋理工大学) CUMTB(中国交通车辆技术研究所) University of California, Los Angeles(加州大学洛杉矶分校) Beijing Jiaotong University(北京交通大学) ByteDance(字节跳动)

专题命中 多模态评测 :multi-modal(title,abstract);分类 cs.CV

AI总结 V2X-Radar是首个包含4D雷达的多模态数据集,用于提升自动驾驶中的协作感知能力。

Comments NeurIPS 2025 Spotlight

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.06404 2026-01-19 cs.CV 57%

InfoAffect: Affective Annotations of Infographics in Information Spread

InfoAffect: 信息传播中信息图的情感标注

Zihang Fu, Yunchao Wang, Chenyu Huang, Guodao Sun, Ronghua Liang

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 InfoAffect数据集通过多模态大语言模型和递归排名融合算法,实现了信息图情感标注的高准确度研究。

详情

展开后加载摘要…

URL PDF HTML 收藏