arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2025-11-10 至 2025-11-10 共收录 7 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态评测 7 篇

2502.15027 2025-11-10 cs.CL cs.AI cs.CV cs.HC 82%

InterFeedback: Unveiling Interactive Intelligence of Large Multimodal Models via Human Feedback

Henry Hengyuan Zhao, Wenqi Pei, Yifei Tao, Haiyang Mei, Mike Zheng Shou

机构 * Show Lab, National University of Singapore(新加坡国立大学Show实验室)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.CL、cs.AI

Comments Accepted by EMNLP 2025 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.04948 2025-11-10 cs.CV cs.AI 81%

A benchmark multimodal oro-dental dataset for large vision-language models

Haoxin Lv, Ijazul Haq, Jin Du, Jiaxin Ma, Binnian Zhu, Xiaobing Dang, Chaoan Liang, Ruxu Du, Yingjie Zhang, Muhammad Saqib

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.04270 2025-11-10 cs.CV cs.AI 81%

ZERO: Industry-ready Vision Foundation Model with Multi-modal Prompts

Sangbum Choi, Kyeongryeol Go, Taewoong Jang

机构 * Superb AI Seoul, South Korea(超霸AI首尔韩国)

专题命中 多模态评测 :multi-modal(title,abstract);分类 cs.CV、cs.AI

Comments 9 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.04977 2025-11-10 cs.CV cs.MM 62%

GSE: Evaluating Sticker Visual Semantic Similarity via a General Sticker Encoder

Heng Er Metilda Chee, Jiayin Wang, Zhiqiang Guo, Weizhi Ma, Min Zhang

机构 * DCST, Tsinghua University(清华大学信息国家实验室) Quan Cheng Laboratory(钱程实验室) AIR, Tsinghua University(清华大学人工智能研究院)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.MM

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.04727 2025-11-10 cs.CV cs.AI cs.LG 62%

IndicVisionBench: Benchmarking Cultural and Multilingual Understanding in VLMs

Ali Faraz, Akash, Shaharukh Khan, Raja Kolla, Akshat Patidar, Suranjan Goswami, Abhinav Ravi, Chandra Khatri, Shubham Agarwal

机构 * Krutrim AI OLA Electric

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.21069 2025-11-10 cs.CV cs.AI cs.HC 62%

GAITEX: Human motion dataset of impaired gait and rehabilitation exercises using inertial and optical sensors

Andreas Spilz, Heiko Oppel, Jochen Werner, Kathrin Stucke-Straub, Felix Capanni, Michael Munz

机构 * AI for Sensor Data Analytics Research Group(人工智能传感器数据解析研究组) Ulm University of Applied Sciences(乌尔姆应用科学大学) Biomechatronic Research Group(生物机械研究组) Institute of Computer Science(计算机科学研究所)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.05106 2025-11-10 cs.CV cs.LG 57%

Early Alzheimer's Disease Detection from Retinal OCT Images: A UK Biobank Study

Yasemin Turkan, F. Boray Tek, M. Serdar Nazlı, Öykü Eren

机构 * Department of Computer Engineering Isik University Istanbul, Turkey(计算机工程系伊斯肯大学) Department of Artificial Intelligence and Data Engineering(人工智能与数据工程系) Data Engineering Istanbul Technical University Istanbul, Turkey(数据工程系伊斯坦布尔技术大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏