arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2025-12-11 至 2025-12-11 共收录 56 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态生成 7 篇

2512.09814 2025-12-11 cs.CV 57%

DynaIP: Dynamic Image Prompt Adapter for Scalable Zero-shot Personalized Text-to-Image Generation

DynaIP: 动态图像提示适配器用于可扩展的零样本个性化文本到图像生成

Zhizhong Wang, Tianyi Chu, Zeyi Huang, Nanyang Wang, Kehan Li

机构 * Central Media Technology Institute, Huawei(华为中央媒体技术研究所)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 DynaIP通过动态解耦策略和层次特征融合模块,提升零样本个性化文本到图像生成的细粒度概念保真度与多主体扩展能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03506 2025-12-11 cs.AI 57%

OneFlow: Concurrent Mixed-Modal and Interleaved Generation with Edit Flows

OneFlow:并发混合模态与交错生成的编辑流

John Nguyen, Marton Havasi, Tariq Berrada, Luke Zettlemoyer, Ricky T. Q. Chen

机构 * FAIR at Meta(Meta 的 FAIR 部门) Univ. Grenoble Alpes, Inria, CNRS, Grenoble INP, LJK, France(格勒诺布尔阿尔卑斯大学、法国国家科学研究中心、法国国家信息与自动化技术研究所、格勒诺布尔理工大学、LJK、法国)

专题命中 多模态生成 :multimodal(abstract);分类 cs.AI

AI总结 OneFlow是一种非自回归多模态模型,通过编辑流和流匹配实现并发混合模态生成,优于自回归和扩散方法,提升生成效率和推理能力。

Comments https://oneflow.framer.ai

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 多模态评测 14 篇

2512.09872 2025-12-11 cs.CR cs.AI 83%

FlipLLM: Efficient Bit-Flip Attacks on Multimodal LLMs using Reinforcement Learning

FlipLLM: 通过强化学习高效攻击多模态大语言模型的位翻转攻击

Khurram Khalil, Khaza Anuarul Hoque

机构 * Department of Electrical Engineering and Computer Science(电气工程与计算机科学系) University of Missouri-Columbia(密苏里大学哥伦比亚分校)

专题命中 多模态评测 :multimodal(title,abstract);multimodal foundation model(abstract);分类 cs.AI

AI总结 FlipLLM通过强化学习高效识别多模态大语言模型的位翻转攻击漏洞,显著提升攻击检测速度和防御指导价值。

Comments Accepted in IEEE HOST 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.02022 2025-12-11 cs.CV 83%

Do You See Me : A Multidimensional Benchmark for Evaluating Visual Perception in Multimodal LLMs

你看见我:一个多维基准用于评估多模态大语言模型的视觉感知

Aditya Kanade, Tanuja Ganu

机构 * Microsoft Research India(微软印度研究院)

专题命中 多模态评测 :multimodal(title,abstract);MLLM(abstract);分类 cs.CV

AI总结 该研究提出‘你看见我’基准,评估多模态大语言模型的视觉感知能力,发现其在复杂任务中表现远低于人类。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.19366 2025-12-11 cs.LG cs.AI 79%

Grounding the Ungrounded: A Spectral-Graph Framework for Quantifying Hallucinations in Multimodal LLMs

未接地的接地:一种基于谱-图框架的多模态大语言模型幻觉量化方法

Supratik Sarkar, Swagatam Das

机构 * Morgan Stanley(摩根士丹利) Indian Statistical Institute (Kolkata)(印度统计研究所(加尔各答))

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.AI

AI总结 本文提出了一种基于谱-图框架的多模态大语言模型幻觉量化方法,通过谱分解和RKHS本征模式,提供可解释的语义失真度量。

Comments 49 pages, 3 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.16954 2025-12-11 q-bio.QM 78%

Deep Multi-modal Breast Cancer Detection Network

深度多模态乳腺癌检测网络

Noor Ul Huda Shah, Tanveer Hussain, Amr Ahmed, Yonghuai Liu, Usman Ali, Ardhendu Behera

专题命中 多模态评测 :multi-modal(title,abstract)

AI总结 本文提出深度多模态乳腺癌检测网络,整合视觉与临床数据提升诊断准确率,实验显示在Mini-DDSM数据集上准确率提升至90.87%。

Comments The paper is withdrawn because we identified an error in the dataset splitting procedure used in the experiments for MMCDNET. The training/validation split was incorrectly implemented, leading to data leakage and invalid performance results

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09251 2025-12-11 cs.CV cs.AI 76%

GLACIA: Instance-Aware Positional Reasoning for Glacial Lake Segmentation via Multimodal Large Language Model

GLACIA:基于多模态大语言模型的冰湖分割实例感知位置推理

Lalit Maurya, Saurabh Kaushik, Beth Tellman

机构 * Portsmouth AI and Data Science Centre (PAIDS), School of Computing, University of Portsmouth(普森大学计算学院) Center for Sustainability and the Global Environment (SAGE), University of Wisconsin–Madison(威斯康星大学麦迪逊分校可持续性与全球环境中心)

专题命中 多模态评测 :multimodal(title);分类 cs.CV、cs.AI

AI总结 GLACIA通过多模态大语言模型实现冰湖分割的实例感知位置推理,提升分割精度与可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.09085 2025-12-11 cs.LG 71%

Preoperative Prognosis Assessment of Lumbar Spinal Surgery for Low Back Pain and Sciatica Patients based on Multimodalities and Multimodal Learning

基于多模态与多模态学习的腰椎手术术前预后评估

Li-Chin Chen, Jung-Nien Lai, Hung-En Lin, Hsien-Te Chen, Kuo-Hsuan Hung, Yu Tsao

专题命中 多模态评测 :multimodal(title)

AI总结 本研究通过结合东方医学和机器学习,开发了一种基于多模态数据的术前预后评估工具,准确率高达0.81,为腰椎手术患者提供术前预后预测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.23981 2025-12-11 cs.CV 70%

TeleEgo: Benchmarking Egocentric AI Assistants in the Wild

TeleEgo:在真实场景中评估第一人称AI助手的基准测试

Jiaqi Yan, Ruilong Ren, Jingren Liu, Shuning Xu, Ling Wang, Yiheng Wang, Xinlin Zhong, Yun Wang, Long Zhang, Xiangyu Chen, Changzhi Sun, Jixiang Luo, Dell Zhang, Hao Sun, Chi Zhang, Xuelong Li

机构 * Institute of Artificial Intelligence (TeleAI), China Telecom(人工智能研究院(TeleAI),中国电信)

专题命中 多模态评测 :multi-modal(abstract);omni-modal(abstract);分类 cs.CV

AI总结 TeleEgo是一个用于评估第一人称AI助手在真实场景中多模态处理能力的基准测试,通过长持续时间流媒体数据和严格评估指标,推动未来具有更强流媒体记忆能力的助手发展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09663 2025-12-11 cs.CV 57%

IF-Bench: Benchmarking and Enhancing MLLMs for Infrared Images with Generative Visual Prompting

IF-Bench:基于生成视觉提示的多模态大语言模型在红外图像上的基准测试与增强

Tao Zhang, Yuyang Hong, Yang Xia, Kun Ding, Zeyu Zhang, Ying Wang, Shiming Xiang, Chunhong Pan

机构 * MAIS, Institute of Automation(自动化研究所信息处理中心) School of Artificial Intelligence, UCAS(中国科学院大学人工智能学院) Research Center of Aerospace Information, Institute of Automation(自动化研究所航空信息研究中心)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 IF-Bench通过生成视觉提示方法提升多模态大语言模型对红外图像的理解能力,提供首个高质量基准测试及实验验证。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09591 2025-12-11 cs.LG cs.AI 57%

Stanford Sleep Bench: Evaluating Polysomnography Pre-training Methods for Sleep Foundation Models

斯坦福睡眠基准:评估多导睡眠图预训练方法用于睡眠基础模型

Magnus Ruud Kjaer, Rahul Thapa, Gauri Ganjoo, Hyatt Moore, Poul Joergen Jennum, Brandon M. Westover, James Zou, Emmanuel Mignot, Bryan He, Andreas Brink-Kjaer

机构 * Stanford University(斯坦福大学) Technical University of Denmark(技术大学) Danish Center for Sleep Medicine(丹麦睡眠医学中心) University of Copenhagen(哥本哈根大学) Harvard Medical School(哈佛医学院)

专题命中 多模态评测 :multimodal(abstract);分类 cs.AI

AI总结 斯坦福睡眠基准通过大规模多导睡眠图数据集评估多种自监督预训练方法,提升睡眠分析的准确性和可重复性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.20209 2025-12-11 cs.LG cs.AI 57%

Assessing the Feasibility of Early Cancer Detection Using Routine Laboratory Data: An Evaluation of Machine Learning Approaches on an Imbalanced Dataset

利用常规实验室数据评估早期癌症检测的可行性:对机器学习方法在不平衡数据集上的评估

Shumin Li

专题命中 多模态评测 :multi-modal(abstract);分类 cs.AI

AI总结 本研究评估了利用常规实验室数据通过机器学习检测癌症的可行性,发现其在临床分类上表现欠佳,需整合多模态数据以提升效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08934 2025-12-11 cs.HC cs.AI 57%

Motion2Meaning: A Clinician-Centered Framework for Contestable LLM in Parkinson's Disease Gait Interpretation

Motion2Meaning: 一种以临床为中心的可挑战LLM框架,用于帕金森病步态解读

Loc Phuc Truong Nguyen, Hung Thanh Do, Hung Truong Thanh Nguyen, Hung Cao

机构 * Friedrich-Alexander-Universität Erlangen-Nürnberg(埃朗根-纽伦堡弗里德里希-亚历山大大学) University of New Brunswick(新 Brunswick大学)

专题命中 多模态评测 :cross-modal(abstract);分类 cs.AI

AI总结 Motion2Meaning通过结合可解释AI和可挑战LLM,为帕金森病步态解读提供透明、可审计的临床系统。

Comments Accepted at the 9th International Symposium on Chatbots and Human-Centered AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09205 2025-12-11 physics.plasm-ph cond-mat.mtrl-sci physics.bio-ph 50%

Activation of Polylactic Acid and Polycarbonate Surfaces with Non-Thermal Plasma

非热等离子体激活聚乳酸和聚碳酸酯表面

Jairo Rondón, Ginger Urrutia, Angel Gonzalez-Lizardo

专题命中 多模态评测 :multimodal(abstract)

AI总结 非热等离子体活化聚乳酸和聚碳酸酯表面,通过多模式分析提升细胞-材料相互作用,为下一代生物材料设计提供指导。

Comments 4 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.04842 2025-12-11 cs.HC 50%

Charts-of-Thought: Enhancing LLM Visualization Literacy Through Structured Data Extraction

图表思维:通过结构化数据提取提升大语言模型的可视化素养

Amit Kumar Das, Mohammad Tarun, Klaus Mueller

专题命中 多模态评测 :multimodal(abstract)

AI总结 通过结构化数据提取方法,图表思维显著提升了大语言模型在可视化任务上的表现,使其超越人类基准,同时为复杂视觉解释任务提供了新的基准。

Comments 11 pages, 8 figures. Accepted at IEEE VIS: Visualization & Visual Analytics 2025 conference, November 2-7, 2025, Vienna, Austria

Journal ref IEEE Transactions on Visualization and Computer Graphics (TVCG), PrePrints 5555, pp. 1-11, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.17353 2025-12-11 cs.CE 50%

RoadBench: A Vision-Language Foundation Model and Benchmark for Road Damage Understanding

RoadBench: 一种用于道路损伤理解的视觉-语言基础模型和基准

Xi Xiao, Yunbei Zhang, Janet Wang, Lin Zhao, Yuxiang Wei, Hengjia Li, Yanshu Li, Xinyuan Song, Xiao Wang, Swalpa Kumar Roy, Hao Xu, Tianyang Wang

专题命中 多模态评测 :multimodal(abstract)

AI总结 RoadBench通过整合视觉与文本信息,提出RoadCLIP模型,显著提升道路损伤识别性能,为基础设施监测提供新基准。

Comments Accepted by WACV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 多模态Agent 1 篇

2512.09396 2025-12-11 cs.MA cs.AI 57%

GAIR: GUI Automation via Information-Joint Reasoning and Group Reflection

GAIR:通过信息联合推理和群体反思实现GUI自动化

Zishu Wei, Qixiang Ma, Xavier Hu, Yuhang Liu, Hui Zang, Yudong Zhao, Tao Wang, Shengyu Zhang, Fei Wu

机构 * Zhejiang University(浙江大学) Huawei Technologies Ltd.(华为技术有限公司)

专题命中 多模态Agent :MLLM(abstract);分类 cs.AI

AI总结 GAIR是一种基于MLLM的GUI自动化代理框架,通过信息联合推理和群体反思整合异质模型能力,提升GUI自动化性能。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 多模态训练与对齐 5 篇

2512.09801 2025-12-11 cs.CV 83%

Modality-Specific Enhancement and Complementary Fusion for Semi-Supervised Multi-Modal Brain Tumor Segmentation

模态特异性增强与互补融合用于半监督多模态脑肿瘤分割

Tien-Dat Chung, Ba-Thinh Lam, Thanh-Huy Nguyen, Thien Nguyen, Nguyen Lan Vi Vu, Hoang-Loc Cao, Phat Kim Huynh, Min Xu

专题命中 多模态训练与对齐 :multi-modal(title,abstract);cross-modal(abstract);分类 cs.CV

AI总结 本文提出了一种半监督多模态脑肿瘤分割框架,通过模态特异性增强模块和互补信息融合模块提升分割性能。

Comments 9 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09311 2025-12-11 cs.CV cs.CR 79%

Transformer-Driven Multimodal Fusion for Explainable Suspiciousness Estimation in Visual Surveillance

基于Transformer的多模态融合用于视觉监控中的可解释性可疑性估计

Kuldeep Singh Yadav, Lalan Kumar

机构 * Big Data Research and Supercomputing Division, CSIR Fourth Paradigm Institute(CSIR第四范式研究所大数据研究与超级计算部门) Department of Electrical Engineering, Bharti School of Telecommunication, Yardi School of Artificial Intelligence, IIT Delhi(电信学院电子工程系、Yardi人工智能学院、德里理工学院)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出基于Transformer的多模态融合框架DeepUSEvision,结合YOLOv12、双深度卷积网络和Transformer判别器,实现高准确率和可解释性的可疑性估计。

Comments 12 pages, 10 figures, IEEE Transaction on Image Processing

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09010 2025-12-11 cs.CV cs.AI 73%

Towards Lossless Ultimate Vision Token Compression for VLMs

面向视觉语言模型的无损终极视觉标记压缩

Dehua Zheng, Mouxiao Huang, Borui Jiang, Hailin Hu, Xinghao Chen

机构 * Huawei Noah’s Ark Lab(华为诺亚实验室)

专题命中 多模态训练与对齐 :multimodal(abstract);cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出LUVC框架,通过正交空间轴的迭代合并和频谱修剪单元,实现视觉语言模型中视觉标记的无损压缩,提升推理速度并保持精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06249 2025-12-11 cs.CL cs.AI 62%

TRepLiNa: Layer-wise CKA+REPINA Alignment Improves Low-Resource Machine Translation in Aya-23 8B

TRepLiNa:分层CKA+REPINA对齐改进Aya-23 8B低资源机器翻译

Toshiki Nakai, Ravi Kiran Chikkala, Lena Sophie Oberkircher, Nicholas Jennings, Natalia Skachkova, Tatiana Anikina, Jesujoba Oluwadara Alabi

机构 * Saarland University(萨尔兰大学) German Research Center for Artificial Intelligence (DFKI)(德国人工智能研究中心)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CL、cs.AI

AI总结 TRepLiNa通过结合CKA和REPINA实现分层对齐,提升低资源语言Aya-23 8B的机器翻译质量,尤其在数据稀缺情况下效果显著。

Comments It is work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09580 2025-12-11 cs.CV 57%

Content-Adaptive Image Retouching Guided by Attribute-Based Text Representation

基于属性文本表示的内容自适应图像润色

Hancheng Zhu, Xinyu Liu, Rui Yao, Kunyang Sun, Leida Li, Abdulmotaleb El Saddik

机构 * School of Computer Science and Technology/School of Artificial Intelligence, China University of Mining and Technology(计算机科学与技术学院/人工智能学院,中国矿业大学) Mine Digitization Engineering Research Center of the Ministry of Education, China University of Mining and Technology(教育部矿山数字化工程研究中心,中国矿业大学) School of Artificial Intelligence, Xidian University(人工智能学院,西安电子科技大学) School of Electrical Engineering and Computer Science, University of Ottawa(电气与计算机工程学院,多伦多大学)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV

AI总结 本文提出基于属性文本表示的内容自适应图像润色方法,通过结合内容感知的颜色调整和用户定义的风格偏好,实现高质量的图像润色效果。

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 其他多模态 4 篇

2512.09840 2025-12-11 cond-mat.soft 78%

Multimodal motion and behavior switching of multistable ciliary walkers

多模态运动与行为切换的多稳态纤毛行者

Sumit Mohanty, Paul Baconnier, Harmannus A. H. Schomaker, Alberto Comoretto, Martin van Hecke, Johannes T. B. Overvelde

专题命中 其他多模态 :multimodal(title,abstract)

AI总结 本研究通过多稳态纤毛设计实现机器人多模态运动与行为切换,展示了自主导航和环境交互的复杂行为。

Comments 10 pages, 6 figures, and supporting information

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09581 2025-12-11 cond-mat.mtrl-sci 78%

Structural Phase Transition and Cooperative Luminescence in K3Yb(PO4)2:Eu3+ for Multimodal Down-shifting and Up-converting Luminescence Thermometry

K3Yb(PO4)2:Eu3+的结构相变与协同发光用于多模降频和升频发光温度计

Anam Javaid, Maja Szymczak, Damian Szymanski, Lukasz Marciniak

专题命中 其他多模态 :multimodal(title,abstract)

AI总结 K3Yb(PO4)2:Eu3+通过结构相变和协同发光实现多模温度传感

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09393 2025-12-11 cs.CV cs.LG 57%

Detection and Localization of Subdural Hematoma Using Deep Learning on Computed Tomography

利用深度学习进行CT扫描中硬脑膜下出血的检测与定位

Vasiliki Stoumpou, Rohan Kumar, Bernard Burman, Diego Ojeda, Tapan Mehta, Dimitris Bertsimas

机构 * Operations Research Center, Massachusetts Institute of Technology(麻省理工学院运营研究中心) Boston University(波士顿大学) Massachusetts Institute of Technology(麻省理工学院) University of Connecticut School of Medicine(康奈尔大学医学学院) Hartford HealthCare(哈特福德医疗集团) Sloan School of Management, Massachusetts Institute of Technology(麻省理工学院斯隆管理学院)

专题命中 其他多模态 :multimodal(abstract);分类 cs.CV

AI总结 本文提出一种多模态深度学习框架,结合临床数据与CT影像,实现硬脑膜下出血的快速准确检测与定位,提升神经外科急诊处理效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13151 2025-12-11 cs.CV cs.GR 57%

Foveation Improves Payload Capacity in Steganography

注视点增强隐写术的载荷能力

Lifeng Qiu Lin, Henry Kam, Qi Sun, Kaan Akşit

机构 * University College London(伦敦大学学院) New York University(纽约大学)

专题命中 其他多模态 :multi-modal(abstract);分类 cs.CV

AI总结 通过高效潜在表示和注视点渲染,提升隐写术的载荷能力至500位,并在高准确率和视觉质量上取得显著成果。

Comments SIGGRAPH Asia 2025 Posters Proceedings

详情

展开后加载摘要…

URL PDF HTML 收藏