arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2025-12-02 至 2025-12-02 共收录 112 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态评测 20 篇

2512.00082 2025-12-02 cs.CV 84%

Exploring Diagnostic Prompting Approach for Multimodal LLM-based Visual Complexity Assessment: A Case Study of Amazon Search Result Pages

探索用于多模态大语言模型视觉复杂性评估的诊断提示方法:亚马逊搜索结果页面案例研究

Divendar Murtadak, Yoon Kim, Trilokya Akula

专题命中 多模态评测 :multimodal(title,abstract);MLLM(abstract);分类 cs.CV

AI总结 本研究通过对比诊断提示与传统提示方法,发现其在提升多模态大语言模型对亚马逊搜索结果页面视觉复杂性评估的可靠性方面有显著改进,但仍有待进一步优化。

Comments 9 pages, 4 figures, 9 tables. Study on diagnostic prompting for multimodal LLM-based visual complexity assessment of Amazon search result pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01274 2025-12-02 cs.CL cs.AI cs.LG 81%

SUPERChem: A Multimodal Reasoning Benchmark in Chemistry

SUPERChem:化学领域的多模态推理基准

Zehua Zhao, Zhixian Huang, Junren Li, Siyu Lin, Junting Zhou, Fengqi Cao, Kun Zhou, Rui Ge, Tingting Long, Yuexiang Zhu, Yan Liu, Jie Zheng, Junnian Wei, Rong Zhu, Peng Zou, Wenyu Li, Zekai Cheng, Tian Ding, Yaxuan Wang, Yizhao Yan, Tingru Wei, Haowei Ming, Weijie Mao, Chen Sun, Yiming Liu, Zichen Wang, Zuo Zhang, Tong Yang, Hao Ma, Zhen Gao, Jian Pei

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CL、cs.AI

AI总结 SUPERChem通过多模态推理基准测试,评估LLMs在化学领域的能力,揭示模型对视觉信息的依赖,并区分高保真推理与启发式推理。

Comments 35 pages, 11 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00060 2025-12-02 cs.CV cs.AI 81%

PEFT-DML: Parameter-Efficient Fine-Tuning Deep Metric Learning for Robust Multi-Modal 3D Object Detection in Autonomous Driving

PEFT-DML:参数高效微调深度度量学习用于自动驾驶中鲁棒的多模态3D物体检测

Abdolazim Rezaei, Mehdi Sookhak

专题命中 多模态评测 :multi-modal(title,abstract);分类 cs.CV、cs.AI

AI总结 PEFT-DML通过参数高效微调深度度量学习,提升自动驾驶中多模态3D物体检测的鲁棒性和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01519 2025-12-02 cs.CV cond-mat.mtrl-sci quant-ph 79%

QuantumCanvas: A Multimodal Benchmark for Visual Learning of Atomic Interactions

QuantumCanvas:一种用于原子相互作用视觉学习的多模态基准

Can Polat, Erchin Serpedin, Mustafa Kurban, Hasan Kurban

机构 * Texas A&M University(德克萨斯大学) Ankara University(安卡拉大学) Texas A&M University at Qatar(德克萨斯大学(卡塔尔)) Hamad Bin Khalifa University(哈马德·本·卡西姆大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 QuantumCanvas通过多模态基准统一轨道物理与视觉表示学习,为学习可转移的量子相互作用提供了系统且可解释的基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01300 2025-12-02 cs.AI 70%

RoboDriveVLM: A Novel Benchmark and Baseline towards Robust Vision-Language Models for Autonomous Driving

RoboDriveVLM:一种面向自动驾驶鲁棒视觉-语言模型的新型基准与基线

Dacheng Liao, Mengshi Qi, Peng Shu, Zhining Zhang, Yuxin Lin, Liang Liu, Huadong Ma

机构 * State Key Laboratory of Networking and Switching Technology(网络与交换技术国家重点实验室) Beijing University of Posts and Telecommunications(北京邮电大学)

专题命中 多模态评测 :multimodal(abstract);cross-modal(abstract);分类 cs.AI

AI总结 RoboDriveVLM提出了一种新型基准和基线,用于评估视觉-语言模型在自动驾驶中的鲁棒性,通过模拟多种腐蚀场景提升系统可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00880 2025-12-02 cs.CV 70%

Quantum-Inspired Spectral Geometry for Neural Operator Equivalence and Structured Pruning

量子启发的谱几何用于神经运算等价与结构剪枝

Haijian Shao, Wei Liu, Xing Deng

机构 * School of Computer Jiangsu University of Science and Technology(江苏科技大学计算机学院) School of Computer and Software Nanjing University of Information Science and Technology(南京信息工程大学计算机与软件学院) Department of Electrical and Computer Engineering University of Nevada Las Vegas(内华达大学拉斯维加斯分校电气与计算机工程系)

专题命中 多模态评测 :multimodal(abstract);cross-modal(abstract);分类 cs.CV

AI总结 本文提出量子启发的谱几何框架,用于神经运算等价与结构化剪枝,通过归一化奇异值谱建立跨模态运算替代的理论基础,并验证其在异构硬件上的有效性。

Comments 6 pages, 1 figure, preliminary version; concepts and simulation experiments only

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.01755 2025-12-02 cs.CV cs.RO 70%

3EED: Ground Everything Everywhere in 3D

3EED: 在三维中万物皆 grounded

Rong Li, Yuhao Dong, Tianshuai Hu, Ao Liang, Youquan Liu, Dongyue Lu, Liang Pan, Lingdong Kong, Junwei Liang, Ziwei Liu

机构 * WorldBench Team(WorldBench团队)

专题命中 多模态评测 :multi-modal(abstract);cross-modal(abstract);分类 cs.CV

AI总结 3EED提出一个大规模多平台多模态三维 grounding 基准测试,通过提供丰富的户外场景数据和跨平台学习技术,推动语言驱动的三维具身感知研究。

Comments NeurIPS 2025 DB Track; 38 pages, 17 figures, 10 tables; Project Page at https://project-3eed.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00259 2025-12-02 cs.NI 67%

Design and Evaluation of a Multi-Agent Perception System for Autonomous Flying Networks

自主飞行网络多智能体感知系统的設計與評估

Diogo Ferreira, Pedro Ribeiro, André Coelho, Rui Campos

专题命中 多模态评测 :multimodal(abstract);multi-modal(abstract)

AI总结 本文提出多智能体感知系统MAPS,利用多模态大语言模型和代理AI,实现自主飞行网络中用户感知与服务需求的自动识别与规范生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.07993 2025-12-02 cs.CV cs.AI eess.IV q-bio.NC 62%

Multigranular Evaluation for Brain Visual Decoding

多粒度评估用于脑视觉解码

Weihao Xia, Cengiz Oztireli

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本研究提出BASIC框架,通过多粒度评估方法提升脑视觉解码的评估精度与解释性。

Comments AAAI 2026 (Oral). Code: https://github.com/weihaox/BASIC

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00287 2025-12-02 cs.RO cs.AI cs.CV 62%

RealAppliance: Let High-fidelity Appliance Assets Controllable and Workable as Aligned Real Manuals

RealAppliance: 让高保真家电资产可控且可操作,如对齐的现实手册

Yuzheng Gao, Yuxing Long, Lei Kang, Yuchong Guo, Ziyan Yu, Shangqing Mao, Jiyao Zhang, Ruihai Wu, Dongjiang Li, Hui Shen, Hao Dong

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 RealAppliance通过高保真家电资产和对齐手册的基准测试,推动家电操控技术的发展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01989 2025-12-02 cs.CV 57%

PAI-Bench: A Comprehensive Benchmark For Physical AI

PAI-Bench: 一个全面的物理AI基准

Fengzhe Zhou, Jiannan Huang, Jialuo Li, Deva Ramanan, Humphrey Shi

机构 * Georgia Tech(佐治亚理工学院) CMU(卡内基梅隆大学)

专题命中 多模态评测 :multi-modal(abstract);分类 cs.CV

AI总结 PAI-Bench通过评估视频生成和理解任务,揭示了当前模型在物理合理性和动态一致性上的不足,为物理AI的发展指明了方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01771 2025-12-02 cs.CV 57%

Robust Rigid and Non-Rigid Medical Image Registration Using Learnable Edge Kernels

鲁棒的刚性与非刚性医学图像配准使用可学习边缘核

Ahsan Raza Siyal, Markus Haltmeier, Ruth Steiger, Malik Galijasevic, Elke Ruth Gizewski, Astrid Ellen Grams

机构 * Department of Mathematics, University of Innsbruck(因斯布鲁克大学数学系) Department of Radiology, Medical University of Innsbruck(因斯布鲁克医学大学放射学系) Neuroimaging Research Core Facility, Medical University of Innsbruck(因斯布鲁克医学大学神经影像研究核心设施)

专题命中 多模态评测 :multi-modal(abstract);分类 cs.CV

AI总结 本文提出了一种结合可学习边缘核的刚性和非刚性医学图像配准方法,通过自适应边缘检测提升多模态图像对齐和解剖结构分析的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01352 2025-12-02 cs.CV 57%

OpenBox: Annotate Any Bounding Boxes in 3D

OpenBox: 任意3D边界框的标注

In-Jae Lee, Mungyeom Kim, Kwonyoung Ryu, Pierre Musacchio, Jaesik Park

机构 * Seoul National University(首尔国立大学) POSTECH

专题命中 多模态评测 :cross-modal(abstract);分类 cs.CV

AI总结 OpenBox通过2D视觉基础模型实现无需自我训练的高质量3D边界框标注,提升自动驾驶中物体检测的准确性和效率。

Comments Accepted by NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01340 2025-12-02 cs.CV 57%

EvalTalker: Learning to Evaluate Real-Portrait-Driven Multi-Subject Talking Humans

EvalTalker: 学习评估基于真实人像的多主体说话人类

Yingjie Zhou, Xilei Zhu, Siyu Ren, Ziyi Zhao, Ziwen Wang, Farong Wen, Yu Zhou, Jiezhang Cao, Xiongkuo Min, Fengjiao Chen, Xiaoyu Li, Xuezhi Cao, Guangtao Zhai, Xiaohong Liu

机构 * Shanghai Jiao Tong University(上海交通大学) Meituan(美团) Shanghai Innovation Institute(上海创新研究院)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 EvalTalker通过构建大规模多Talker生成的说话人类质量评估数据集,提出了一种能够感知整体质量、人类特征和身份一致性的新型质量评估框架,以提升多主体说话人类生成的质量和用户体验。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01077 2025-12-02 cs.CL cs.HC 57%

ELR-1000: A Community-Generated Dataset for Endangered Indic Indigenous Languages

ELR-1000:一个社区生成的濒危印度-原住民语言数据集

Neha Joshi, Pamir Gogoi, Aasim Mirza, Aayush Jansari, Aditya Yadavalli, Ayushi Pandey, Arunima Shukla, Deepthi Sudharsan, Kalika Bali, Vivek Seshadri

机构 * Karya UC San Diego Microsoft Corporation(微软公司)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CL

AI总结 ELR-1000数据集通过众包方式收集10种濒危印度-原住民语言的传统食谱,评估LLMs翻译表现,发现提供文化背景信息可显著提升翻译质量,推动公平的文化敏感语言技术发展。

Comments Accepted at AACL 2025 (Main)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01009 2025-12-02 cs.RO cs.CV 57%

FOM-Nav: Frontier-Object Maps for Object Goal Navigation

FOM-Nav:用于目标导航的前沿-对象地图

Thomas Chabal, Shizhe Chen, Jean Ponce, Cordelia Schmid

机构 * Inria(法国国家信息与自动化技术研究院) Department of Computer Science, École normale supérieure (ENS-PSL, CNRS, Inria)(高等师范学院计算机科学系) Courant Institute of Mathematical Sciences and Center for Data Science, New York University(纽约大学Courant数学科学研究所和数据科学中心)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 FOM-Nav通过前沿-对象地图和视觉-语言模型提升机器人在未知环境中的目标导航效率,实现最先进的导航性能。

Comments Project page: https://www.di.ens.fr/willow/research/fom-nav/

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.23594 2025-12-02 cs.CV 57%

PRISM-Bench: A Benchmark of Puzzle-Based Visual Tasks with CoT Error Detection

PRISM-Bench: 一个包含推理错误检测的基于谜题的视觉任务基准

Yusu Qian, Cheng Wan, Chao Jia, Yinfei Yang, Qingyu Zhao, Zhe Gan

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 PRISM-Bench通过检测推理错误评估多模态模型的视觉推理能力,揭示了流畅生成与忠实推理之间的差距。

Comments This paper's first error detection task's ground truth data contains hallucination introduced by gpt and needs to be withdrawn

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00305 2025-12-02 cs.AI 57%

ChartPoint: Guiding MLLMs with Grounding Reflection for Chart Reasoning

ChartPoint: 通过 grounding 反射引导 MLLMs 进行图表推理

Zhengzhuo Xu, SiNan Du, Yiyan Qi, SiwenLu, Chengjin Xu, Chun Yuan, Jian Guo

机构 * Tsinghua University(清华大学) International Digital Economy Academy(国际数字经济学院) Beihang University(北航) Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

专题命中 多模态评测 :multimodal(abstract);分类 cs.AI

AI总结 ChartPoint通过引入 grounding 反射机制,提升 MLLMs 在图表推理中的表现,开发了两个指令微调模型,在多个图表基准上取得显著提升。

Comments Accepted by ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.17808 2025-12-02 cs.LG 50%

Remote Sensing-Oriented World Model

面向遥感的世界模型

Yuxi Lu, Biao Wu, Zhidong Li, Kunqi Li, Chenya Huang, Huacan Wang, Qizhen Lan, Ronghao Chen, Ling Chen, Bin Liang

机构 * University of Technology Sydney (UTS)(悉尼技术大学) University of Chinese Academy of Sciences (UCAS)(中国科学院大学) University of Alabama at Birmingham(阿拉巴马大学伯明翰分校) Peking University(北京大学)

专题命中 多模态评测 :multimodal(abstract)

AI总结 本文提出首个面向遥感的世界模型框架,通过RemoteBAGEL模型在RSWISE基准上实现空间推理的高效外推。

Comments 10 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 多模态Agent 6 篇

2512.01223 2025-12-02 cs.CV cs.AI 84%

S$^2$-MLLM: Boosting Spatial Reasoning Capability of MLLMs for 3D Visual Grounding with Structural Guidance

S$^2$-MLLM:通过结构指导提升多模态大语言模型在3D视觉定位中的空间推理能力

Beining Xu, Siting Zhu, Zhao Jin, Junxian Li, Hesheng Wang

机构 * Shanghai Jiao Tong University(上海交通大学) Nanyang Technological University(南洋理工大学)

专题命中 多模态Agent :MLLM(title,abstract);multi-modal(abstract);分类 cs.CV、cs.AI

AI总结 S$^2$-MLLM通过隐式空间推理提升多模态大语言模型在3D视觉定位中的空间推理能力,实现高效且准确的3D场景理解。

Comments 18 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01979 2025-12-02 cs.AI cs.CL cs.CV 67%

Chain-of-Ground: Improving GUI Grounding via Iterative Reasoning and Reference Feedback

Chain-of-Ground: 通过迭代推理和参考反馈提升GUI定位

Aiden Yiliu Li, Bizhi Yu, Daoan Lei, Tianhe Ren, Shilong Liu

机构 * University College London(伦敦大学学院) Chico Future AI Lab(芝加哥未来人工智能实验室) The University of Hong Kong(香港大学) Princeton University(普林斯顿大学)

专题命中 多模态Agent :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 Chain-of-Ground通过迭代推理和参考反馈提升GUI定位,实现68.4的准确率,并在现实世界界面中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00736 2025-12-02 cs.LG cs.AI cs.CV 62%

REM: Evaluating LLM Embodied Spatial Reasoning through Multi-Frame Trajectories

REM:通过多帧轨迹评估大语言模型的具身空间推理

Jacob Thompson, Emiliano Garcia-Lopez, Yonatan Bisk

机构 * Department of Computer Science(计算机科学系) Carnegie Mellon University(卡内基梅隆大学)

专题命中 多模态Agent :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 REM通过多帧轨迹评估大语言模型的空间推理能力,揭示其在复杂空间任务中的不足,推动更 robust 的空间表示研究。

Journal ref Proceedings of the Conference on Language Modeling (COLM 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00027 2025-12-02 cs.RO cs.AI cs.CV cs.HC 62%

A Survey on Improving Human Robot Collaboration through Vision-and-Language Navigation

通过视觉-语言导航提升人机协作的综述

Nivedan Yakolli, Avinash Gautam, Abhijit Das, Yuankai Qi, Virendra Singh Shekhawat

机构 * Birla Institute of Technology and Science (BITS)(比拉理工学院和科学学院) Macquarie University(麦考瑞大学)

专题命中 多模态Agent :multi-modal(abstract);分类 cs.CV、cs.AI

AI总结 本文综述了视觉-语言导航在提升人机协作中的最新进展,探讨了多机器人协作中的关键挑战,并提出通过先进NLU技术实现主动澄清和动态角色分配的未来方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01369 2025-12-02 cs.CL 57%

MARSAD: A Multi-Functional Tool for Real-Time Social Media Analysis

MARSAD:一个多功能的实时社交媒体分析工具

Md. Rafiul Biswas, Firoj Alam, Wajdi Zaghouani

机构 * Hamad bin Khalifa University(哈马德·本·卡勒希大学) Qatar Computing Research Institute(卡塔尔计算研究所) Northwestern University in Qatar(卡塔尔西北大学)

专题命中 多模态Agent :multimodal(abstract);分类 cs.CL

AI总结 MARSAD 是一个用于实时分析阿拉伯语社交媒体内容的多功能NLP平台,提供情感分析、宣传检测等核心功能,并支持数据抓取与可视化。

Comments 6 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00076 2025-12-02 cs.RO cs.CV 57%

Arcadia: Toward a Full-Lifecycle Framework for Embodied Lifelong Learning

Arcadia:迈向一个完整的生命周期框架用于具身终身学习

Minghe Gao, Juncheng Li, Yuze Lin, Xuqi Liu, Jiaming Ji, Xiaoran Pan, Zihan Xu, Xian Li, Mingjie Li, Wei Ji, Rong Wei, Rui Tang, Qizhou Wang, Kai Shen, Jun Xiao, Qi Wu, Siliang Tang, Yueting Zhuang

机构 * Zhejiang University(浙江大学) Unitree Tech(单位树科技) Peking University(北京大学) Nanjing University(南京大学) Manycore Tech(Manycore科技) Bytedance Seed(字节跳动种子) University of Adelaide(阿德莱德大学)

专题命中 多模态Agent :multimodal(abstract);分类 cs.CV

AI总结 Arcadia提出了一种闭环框架,通过紧密耦合四个阶段实现具身终身学习,支持持续改进和端到端泛化。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 多模态训练与对齐 16 篇

2512.00496 2025-12-02 cs.CL cs.AI 87%

CACARA: Cross-Modal Alignment Leveraging a Text-Centric Approach for Cost-Effective Multimodal and Multilingual Learning

CACARA:基于文本中心方法的跨模态对齐,用于高效多模态和多语言学习

Diego A. B. Moreira, Alef I. Ferreira, Jhessica Silva, Gabriel O. dos Santos, Gustavo Bonil, João Gondim, Marina dos Santos, Helena Maia, Simone Hashiguti, Nádia da Silva, Carolina Scarton, Helio Pedrini, Sandra Avila

机构 * Instituto de Computação, Universidade Estadual de Campinas (UNICAMP), Brasil(计算机学院,Campinas州立大学(UNICAMP)) Instituto de Estudos da Linguagem, Universidade Estadual de Campinas (UNICAMP), Brasil(语言研究学院,Campinas州立大学(UNICAMP)) Instituto de Informática, Universidade Federal de Goiás (UFG), Goiás, Brasil(信息学院,戈亚斯联邦大学(UFG)) Department of Computer Science, University of Sheffield, Sheffield, United Kingdom(计算机科学系,谢菲尔德大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract);cross-modal(title);分类 cs.CL、cs.AI

AI总结 CACARA通过文本中心方法实现多模态和多语言学习,无需重新训练即可支持100多种语言,提升音频到文本检索性能达14.24个百分点。

Comments 25 pages, 12 tables, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00363 2025-12-02 cs.CV 83%

MM-DETR: An Efficient Multimodal Detection Transformer with Mamba-Driven Dual-Granularity Fusion and Frequency-Aware Modality Adapters

MM-DETR: 一种高效的多模态检测Transformer,采用Mamba驱动的双粒度融合和频率感知模态适配器

Jianhong Han, Yupei Wang, Yuan Zhang, Liang Chen

机构 * School of Information and Electronics, Beijing Institute of Technology(信息与电子学院,北京理工大学) Beijing Institute of Technology Chongqing Innovation Center(北京理工大学重庆创新中心) National Key Laboratory for Space-Born Intelligent Information Processing(空间智能信息处理国家级重点实验室) School of Automation, Beijing Institute of Technology(自动化学院,北京理工大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV

AI总结 MM-DETR通过Mamba驱动的双粒度融合和频率感知模态适配器,实现高效的多模态目标检测,提升检测精度与轻量化性能。

Comments Manuscript submitted to IEEE Transactions on Geoscience and Remote Sensing

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01442 2025-12-02 cs.MM cs.AI 81%

PSA-MF: Personality-Sentiment Aligned Multi-Level Fusion for Multimodal Sentiment Analysis

PSA-MF:基于人格-情感对齐的多级融合用于多模态情感分析

Heng Xie, Kang Zhu, Zhengqi Wen, Jianhua Tao, Xuefei Liu, Ruibo Fu, Changsheng Li

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.AI、cs.MM

AI总结 PSA-MF通过引入人格-情感对齐和多级融合方法,提升多模态情感分析的识别性能。

Comments AAAI 2026 accepted

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01214 2025-12-02 cs.CV cs.AI 81%

M4-BLIP: Advancing Multi-Modal Media Manipulation Detection through Face-Enhanced Local Analysis

M4-BLIP:通过面部增强的局部分析推进多模态媒体篡改检测

Hang Wu, Ke Sun, Jiayi Ji, Xiaoshuai Sun, Rongrong Ji

机构 * Key Laboratory of Multimedia Trusted Perception and Efficient Computing(多媒体可信感知与高效计算重点实验室)

专题命中 多模态训练与对齐 :multi-modal(title,abstract);分类 cs.CV、cs.AI

AI总结 M4-BLIP通过引入面部增强的局部分析,提升多模态媒体篡改检测的准确性和可解释性。

Comments 12 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.08679 2025-12-02 cs.CV cs.AI 81%

MMIF-AMIN: Adaptive Loss-Driven Multi-Scale Invertible Dense Network for Multimodal Medical Image Fusion

MMIF-AMIN: 适应性损失驱动的多尺度可逆密集网络用于多模态医学图像融合

Tao Luo, Weihua Xu

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 MMIF-AMIN通过可逆密集网络和多尺度互补特征提取模块,实现多模态医学图像融合的高效融合与精准诊断。

Comments This manuscript is withdrawn to allow for substantial expansion and restructuring. Based on recent research progress, we plan to add Generalization experiment and reorganize the manuscript structure to improve readability and logical flow. Thank you for your understanding and support

详情

展开后加载摘要…

URL PDF HTML 收藏