arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2025-12-03 至 2025-12-03 共收录 10 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态评测 10 篇

2512.02668 2025-12-03 cs.CV 83%

UAUTrack: Towards Unified Multimodal Anti-UAV Visual Tracking

UAUTrack:迈向统一的多模态反无人机视觉跟踪

Qionglin Ren, Dawei Zhang, Chunxu Tian, Dan Zhang

机构 * College of Intelligent Robotics and Advanced Manufacturing(智能机器人与先进制造学院) Fudan University(复旦大学) School of Computer Science and Technology(计算机科学与技术学院) Zhejiang Normal University(浙江师范大学) Department of Mechanical Engineering(机械工程系) The Hong Kong Polytechnic University(香港理工大学)

专题命中 多模态评测 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV

AI总结 UAUTrack通过统一多模态框架实现反无人机跟踪,结合文本先验提示策略提升跨模态信息整合效率,取得优异性能与效率平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.19551 2025-12-03 cs.CY cs.AI cs.CV 81%

Rainbow Noise: Stress-Testing Multimodal Harmful-Meme Detectors on LGBTQ Content

彩虹噪声:对多模态有害迷因检测器进行压力测试以应对LGBTQ内容

Ran Tong, Songtao Wei, Jiaqi Liu, Lanruo Wang

机构 * Mathematics and Statistics Department University of Texas at Dallas(德克萨斯大学达拉斯分校数学与统计学系) Computer Science Department University of Texas at Dallas(德克萨斯大学达拉斯分校计算机科学系) Naveen Jindal School of Management University of Texas at Dallas(德克萨斯大学达拉斯分校奈文·金达尔管理学院)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出彩虹噪声基准测试,通过压力测试多模态有害迷因检测器,引入轻量级TDA提升鲁棒性,揭示当前模型弱点并展示改进方向。

Comments 14 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02699 2025-12-03 cs.AI 79%

Learning What to Attend First: Modality-Importance-Guided Reasoning for Reliable Multimodal Emotion Understanding

学习优先关注什么:模态重要性引导的推理用于可靠的多模态情感理解

Hyeongseop Rha, Jeong Hun Yeo, Junil Won, Se Jin Park, Yong Man Ro

机构 * Integrated Vision and Language Lab, KAIST, South Korea(韩国成均馆大学集成视觉与语言实验室)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.AI

AI总结 本文提出MIGR框架,通过模态重要性引导推理,提升多模态情感理解的可靠性,实验表明能有效减少情感不一致的解释实例。

Comments 16 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02719 2025-12-03 cs.CL cs.AI cs.CV cs.LG q-bio.NC 67%

Emergent Bayesian Behaviour and Optimal Cue Combination in LLMs

涌现的贝叶斯行为与LLMs中的最优线索整合

Julian Ma, Jun Wang, Zafeirios Fountas

机构 * Huawei Noah’s Ark Lab(华为诺亚实验室) AI Centre, Department of Computer Science, University College London(人工智能中心,计算机科学系,伦敦大学学院)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 研究揭示LLMs在多模态整合中表现出贝叶斯策略,但准确性不等于鲁棒性,提出贝叶斯一致性分数以评估不确定性处理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.11275 2025-12-03 cs.MM cs.AI cs.CY 62%

TCC-Bench: Benchmarking the Traditional Chinese Culture Understanding Capabilities of MLLMs

TCC-Bench:评估多模态大语言模型对传统中国文化理解能力的基准测试

Pengju Xu, Yan Wang, Shuyuan Zhang, Xuan Zhou, Xin Li, Yue Yuan, Fengzhao Li, Shunyuan Zhou, Xingyu Wang, Yi Zhang, Haiying Zhao

专题命中 多模态评测 :multimodal(abstract);分类 cs.AI、cs.MM

AI总结 TCC-Bench通过双语视觉问答基准评估多模态大语言模型对传统中国文化理解能力,揭示其在文化相关视觉内容推理上的挑战。

Comments There are issues with the paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.15690 2025-12-03 cs.AI cs.LG cs.MM 62%

GRAFT: GRaPH and Table Reasoning for Textual Alignment -- A Benchmark for Structured Instruction Following and Visual Reasoning

GRAFT:用于文本对齐的图和表推理——一个结构化指令遵循和视觉推理的基准

Abhigya Verma, Sriram Puttagunta, Seganrasan Subramanian, Sravan Ramachandran

机构 * ServiceNow

专题命中 多模态评测 :multimodal(abstract);分类 cs.AI、cs.MM

AI总结 GRAFT基准通过结构化图表和表格及多步骤问题,评估大语言模型在视觉文本对齐、指令遵循和视觉推理方面的综合能力。

Comments 25 pages, 10 tables, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02867 2025-12-03 cs.CV 57%

MICCAI STSR 2025 Challenge: Semi-Supervised Teeth and Pulp Segmentation and CBCT-IOS Registration

MICCAI STSR 2025挑战:半监督牙齿和牙髓分割及CBCT-IOS配准

Yaqi Wang, Zhi Li, Chengyu Wu, Jun Liu, Yifan Zhang, Jialuo Chen, Jiaxue Ni, Qian Luo, Jin Liu, Can Han, Changkai Ji, Zhi Qin Tan, Ajo Babu George, Liangyu Chen, Qianni Zhang, Dahong Qian, Shuai Wang, Huiyu Zhou

机构 * Innovation Center for Electronic Design Automation Technology(电子设计自动化技术创新中心) School of Cyberspace(网络空间学院) Hangzhou Dianzi University(杭州电子科技大学) Hangzhou Geriatric Stomatology Hospital(杭州老年牙科医院) Shenzhen University(深圳大学) Queen Mary University of London(伦敦女王大学) Shandong University(山东大学) School of Automation and Intelligent Sensing(自动化与智能感知学院) King’s College London(伦敦国王学院) College of Information Engineering(信息工程学院) University of Leicester(莱斯特大学)

专题命中 多模态评测 :cross-modal(abstract);分类 cs.CV

AI总结 STSR 2025挑战通过半监督学习方法解决CBCT和IOS的牙齿分割与配准问题,采用深度学习模型提升分割和配准精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02790 2025-12-03 cs.CV 57%

UnicEdit-10M: A Dataset and Benchmark Breaking the Scale-Quality Barrier via Unified Verification for Reasoning-Enriched Edits

UnicEdit-10M: 一个通过统一验证打破规模-质量壁垒的数据集和基准

Keming Ye, Zhipeng Huang, Canmiao Fu, Qingyang Liu, Jiani Cai, Zheqi Lv, Chen Li, Jing Lyu, Zhou Zhao, Shengyu Zhang

机构 * Zhejiang University(浙江大学) WeChat Vision, Tencent Inc.(腾讯微信视觉团队) Shanghai Jiao Tong University(上海交通大学) Xinjiang University(新疆大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 UnicEdit-10M通过统一验证方法构建大规模高质量数据集和基准,解决图像编辑中规模与质量的矛盾,评估模型在空间和知识推理中的表现。

Comments 31 pages, 15 figures, 12 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02624 2025-12-03 cs.CV 57%

PPTBench: Towards Holistic Evaluation of Large Language Models for PowerPoint Layout and Design Understanding

PPTBench: 向大语言模型在PowerPoint布局和设计理解的全面评估迈进

Zheng Huang, Xukai Liu, Tianyu Hu, Kai Zhang, Ye Liu

机构 * University of Science and Technology of China(中国科学技术大学) State Key Laboratory of Cognitive Intelligence(认知智能国家重点实验室)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 PPTBench通过全面评估大语言模型在PowerPoint布局和设计理解上的能力,揭示了当前模型在视觉布局推理和生成中的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.12498 2025-12-03 cs.AI 57%

Artificial Intelligence Virtual Cells: From Measurements to Decisions across Modality, Scale, Dynamics, and Evaluation

人工智能虚拟细胞:从多模态、多尺度测量到决策的跨模态、跨尺度、动态和评估

Chengpeng Hu, Calvin Yu-Chian Chen

专题命中 多模态评测 :multimodal(abstract);分类 cs.AI

AI总结 本文提出了一种模型无关的细胞状态潜在视角,通过操作符语法组织学习,旨在跨模态、跨尺度、上下文和干预实现决策对齐的评估框架。

详情

展开后加载摘要…

URL PDF HTML 收藏