arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2025-11-07 至 2025-11-07 共收录 41 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态评测 16 篇

2505.18246 2025-11-07 cs.CY cs.CL 57%

Will Large Language Models Transform Clinical Prediction?

Yusuf Yildiz, Goran Nenadic, Meghna Jani, David A. Jenkins

专题命中 多模态评测 :multimodal(abstract);分类 cs.CL

Comments Published: BMC Diagnostic and Prognostic Research

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.01833 2025-11-07 cs.CV 57%

TIR-Bench: A Comprehensive Benchmark for Agentic Thinking-with-Images Reasoning

Ming Li, Jike Zhong, Shitian Zhao, Haoquan Zhang, Shaoheng Lin, Yuxiang Lai, Chen Wei, Konstantinos Psounis, Kaipeng Zhang

机构 * Shanghai AI Laboratory(上海人工智能实验室) University of Southern California(南加州大学) Emory University(埃默里大学) Chinese University of Hong Kong(香港中文大学) Rice University(德克萨斯大学奥斯汀分校)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.04664 2025-11-07 cs.RO 50%

SAFe-Copilot: Unified Shared Autonomy Framework

Phat Nguyen, Erfan Aasi, Shiva Sreeram, Guy Rosman, Andrew Silva, Sertac Karaman, Daniela Rus

机构 * MIT CSAIL(麻省理工学院计算机科学与人工智能实验室) TRI(丰田研究机构) MIT LIDS(麻省理工学院领导力与决策科学实验室)

专题命中 多模态评测 :multi-modal(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.16206 2025-11-07 cs.HC 50%

Cluster Haptic Texture Dataset: Haptic Texture Dataset with Varied Velocity-Direction Sliding Contacts

Michikuni Eguchi, Tomohiro Hayase, Yuichi Hiroi, Takefumi Hiraki

专题命中 多模态评测 :multimodal(abstract)

Comments dataset: https://doi.org/10.6084/m9.figshare.29438288 code: https://github.com/cluster-lab/Cluster-Haptic-Texture-Dataset

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 多模态训练与对齐 4 篇

2511.04078 2025-11-07 cs.CV 83%

Unveiling Deep Semantic Uncertainty Perception for Language-Anchored Multi-modal Vision-Brain Alignment

Zehui Feng, Chenqi Zhang, Mingru Wang, Minuo Wei, Shiwei Cheng, Cuntai Guan, Ting Han

专题命中 多模态训练与对齐 :multi-modal(title);multimodal(abstract);cross-modal(abstract);分类 cs.CV

Comments 30 pages, 16 figures, under review as a conference paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.12795 2025-11-07 cs.CV 83%

EarthGPT-X: A Spatial MLLM for Multi-level Multi-Source Remote Sensing Imagery Understanding with Visual Prompting

Wei Zhang, Miaoxin Cai, Yaqian Ning, Tong Zhang, Yin Zhuang, Shijian Lu, He Chen, Jun Li, Xuerui Mao

机构 * School of Interdisciplinary Science, Beijing Institute of Technology(交叉科学学院,北京理工大学) College of Computing and Data Science, Nanyang Technological University(计算与数据科学学院,南洋理工大学) National Key Laboratory of Science and Technology on Space-Born Intelligent Information Processing, Beijing Institute of Technology(空间智能信息处理国家重点实验室,北京理工大学) School of Optics and Photonics, Beijing Institute of Technology(光学与 photonics 学院,北京理工大学) State Key Laboratory of Explosion Science and Safety Protection, Beijing(爆炸科学与安全防护国家重点实验室,北京)

专题命中 多模态训练与对齐 :MLLM(title,abstract);multi-modal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.03939 2025-11-07 cs.LG cs.AI cs.CL 81%

RLHF: A comprehensive Survey for Cultural, Multimodal and Low Latency Alignment Methods

Raghav Sharma, Manan Mehta, Sai Tiger Raina

机构 * Northeastern University(东北大学) University of Southern California(南加州大学)

专题命中 多模态训练与对齐 :multimodal(title);multi-modal(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.04601 2025-11-07 cs.CV cs.MM 73%

PixCLIP: Achieving Fine-grained Visual Language Understanding via Any-granularity Pixel-Text Alignment Learning

Yicheng Xiao, Yu Chen, Haoxuan Ma, Jiale Hong, Caorui Li, Lingxiang Wu, Haiyun Guo, Jinqiao Wang

专题命中 多模态训练与对齐 :multimodal(abstract);image-text(abstract);分类 cs.CV、cs.MM

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 其他多模态 3 篇

2510.11190 2025-11-07 cs.CV 79%

FlexAC: Towards Flexible Control of Associative Reasoning in Multimodal Large Language Models

Shengming Yuan, Xinyu Lyu, Shuailong Wang, Beitao Chen, Jingkuan Song, Lianli Gao

机构 * University of Electronic Science and Technology of China(电子科学与技术大学) Southwestern University of Finance and Economics(西南财经大学) Tongji University(同济大学)

专题命中 其他多模态 :multimodal(title,abstract);分类 cs.CV

Comments 19 pages, 11 figures. Accepted by the 39th Conference on Neural Information Processing Systems (NeurIPS 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.04209 2025-11-07 cond-mat.soft 78%

Multimodal Physical Learning in Brain-Inspired Iontronic Networks

Monica Conte, René van Roij, Marjolein Dijkstra

专题命中 其他多模态 :multimodal(title,abstract)

Comments 8 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.04225 2025-11-07 math.OC 50%

A black-box optimization method with polynomial-based kernels and quadratic-optimization annealing

Yuki Minamoto, Yuya Sakamoto

专题命中 其他多模态 :multi-modal(abstract)

Comments 32 pages, 11 figures, and 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏