arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-01-09 至 2026-01-09 共收录 13 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态评测 13 篇

2510.17722 2026-01-09 cs.CV cs.AI 81%

MT-Video-Bench: A Holistic Video Understanding Benchmark for Evaluating Multimodal LLMs in Multi-Turn Dialogues

MT-Video-Bench: 一个多轮对话中评估多模态大语言模型的综合视频理解基准

Yaning Pan, Qianqian Xie, Guohui Zhang, Zekun Wang, Yongqian Wen, Yuanxing Zhang, Haoxuan Hu, Zhiyu Pan, Yibing Huang, Zhidong Gan, Yonghong Lin, An Ping, Shihao Li, Yanghai Wang, Tianhao Peng, Jiaheng Liu

机构 * Fudan University(复旦大学) NJU-LINK Team, Nanjing University(南京大学NJU-LINK团队) University of Science and Technology of China(中国科学技术大学) Kuaishou Technology(快手科技)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 MT-Video-Bench通过评估多轮对话中多模态大语言模型的6项核心能力,揭示其在处理多轮视频对话任务中的性能差异和局限性。

Comments Project Website: https://github.com/NJU-LINK/MT-Video-Bench

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04819 2026-01-09 cs.AI 79%

AECV-Bench: Benchmarking Multimodal Models on Architectural and Engineering Drawings Understanding

AECV-Bench:在建筑和工程图纸理解上的多模态模型评估基准

Aleksei Kondratenko, Mussie Birhane, Houssame E. Hsain, Guido Maciocci

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.AI

AI总结 AECV-Bench评估多模态模型在建筑图纸理解上的能力,发现OCR和文本问答表现最佳,但符号理解尤其是门窗计数仍存在较大误差,需改进领域特定表示和人机协作流程。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04715 2026-01-09 cs.CV 70%

On the Holistic Approach for Detecting Human Image Forgery

对人类图像伪造的总体方法

Xiao Guo, Jie Zhu, Anil Jain, Xiaoming Liu

机构 * Michigan State University(密歇根州立大学)

专题命中 多模态评测 :multi-modal(abstract);MLLM(abstract);分类 cs.CV

AI总结 HuForDet通过双分支架构,结合异构专家和多模态大语言模型,实现了对人类图像伪造的全面检测,提升了对各类伪造的检测性能和鲁棒性。

Comments 6 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.14749 2026-01-09 cs.CL 70%

On the robustness of modeling grounded word learning through a child's egocentric input

基于儿童自体输入的建模 grounded 词学习的鲁棒性研究

Wai Keen Vong, Brenden M. Lake

机构 * Center for Data Science, New York University(纽约大学数据科学中心) Department of Psychology, New York University(纽约大学心理学系)

专题命中 多模态评测 :multimodal(abstract);multi-modal(abstract);分类 cs.CL

AI总结 本文通过分析儿童自体输入数据,验证了多模态神经网络在 grounded 词学习中的鲁棒性,并揭示了不同儿童经验对学习模式的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.18951 2026-01-09 cs.CV 70%

TopoBDA: Towards Bezier Deformable Attention for Road Topology Understanding

TopoBDA: 向贝塞尔可变形注意力迈进:道路拓扑理解

Muhammet Esat Kalfaoglu, Halil Ibrahim Ozturk, Ozsel Kilinc, Alptekin Temizel

机构 * Graduate School of Informatics, Middle East Technical University(信息学院,中东部技术大学) Togg/Trutek AI Team(Togg/Trutek人工智能团队)

专题命中 多模态评测 :multimodal(abstract);multi-modal(abstract);分类 cs.CV

AI总结 TopoBDA通过贝塞尔可变形注意力提升道路拓扑理解,结合多模态数据增强性能。

Comments Project page: https://artest08.github.io/TopoBDA.github.io/

Journal ref Neurocomputing, Vol. 670, 132360 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04897 2026-01-09 cs.CL cs.CV cs.LG cs.MM 67%

V-FAT: Benchmarking Visual Fidelity Against Text-bias

V-FAT:基于文本偏见的视觉真实性基准测试

Ziteng Wang, Yujie He, Guanliang Li, Siqi Yang, Jiaqi Xiong, Songxiang Liu

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Meituan(美团) University of Oxford(牛津大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.CL、cs.MM

AI总结 V-FAT通过三级评估框架量化文本偏见对视觉真实性的干扰,揭示多模态大语言模型在高语言主导性下的视觉崩溃问题。

Comments 12 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04202 2026-01-09 cs.CL cs.AI cs.LG 62%

TeleTables: A Benchmark for Large Language Models in Telecom Table Interpretation

TeleTables: 电信表格解释中的大语言模型基准

Anas Ezzakri, Nicola Piovesan, Mohamed Sana, Antonio De Domenico, Fadhel Ayed, Haozhe Zhang

机构 * Paris Research Center, Huawei Technologies(巴黎研究中心,华为技术)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CL、cs.AI

AI总结 TeleTables 是一个用于评估大语言模型在电信表格解释能力的基准,揭示了在电信标准上进行领域微调的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04199 2026-01-09 cs.LG cs.AI cs.CL 62%

The Forgotten Shield: Safety Grafting in Parameter-Space for Medical MLLMs

被遗忘的盾牌:参数空间中的医疗大语言模型安全性移植

Jiale Zhao, Xing Mou, Jinlin Wu, Hongyuan Yu, Mingrui Sun, Yang Shi, Xuanwu Yin, Zhen Chen, Zhen Lei, Yaohua Wang

机构 * National University of Defense Technology(国防科技大学) Multimodal Artificial Intelligence Systems (MAIS), Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所多模态人工智能系统(MAIS)) Multimedia Department, Xiaomi Inc(小米公司多媒体部门) Centre for Artificial Intelligence and Robotics, Hong Kong Institute of Science and Innovation, Chinese Academy of Sciences, Hong Kong(香港科学院人工智能与机器人中心) School of Artificial Intelligence, University of Chinese Academy of Sciences, UCAS(中国科学院大学人工智能学院)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CL、cs.AI

AI总结 本文提出参数空间干预方法,通过提取原始模型的安全知识并注入目标模型,提升医疗大语言模型的安全性,同时保持医疗性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.17297 2026-01-09 cs.CV 57%

BOP-Distrib: Revisiting 6D Pose Estimation Benchmarks for Better Evaluation under Visual Ambiguities

BOP-Distrib: 重新审视6D位姿估计基准测试以在视觉模糊情况下获得更好的评估

Boris Meden, Asma Brazi, Fabrice Mayran de Chamisso, Steve Bourgeois, Vincent Lepetit

机构 * Université Paris-Saclay, CEA, List(巴黎萨克雷大学、CEA、List) LIGM, Ecole des Ponts, Univ Gustave Eiffel, CNRS(LIGM、巴黎桥梁学院、冈斯-伊夫勒大学、CNRS)

专题命中 多模态评测 :multi-modal(abstract);分类 cs.CV

AI总结 BOP-Distrib重新审视6D位姿估计基准测试,通过自动生成图像级位姿分布来改进评估,在视觉模糊情况下提升方法评估的准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04732 2026-01-09 quant-ph cs.AI cs.LG 57%

The Role of Quantum in Hybrid Quantum-Classical Neural Networks: A Realistic Assessment

量子在混合量子经典神经网络中的作用:一种现实评估

Dominik Freinberger, Philipp Moser

机构 * Research Unit Medical Informatics(医学信息学研究单元) RISC Software GmbH(RISC软件公司)

专题命中 多模态评测 :multi-modal(abstract);分类 cs.AI

AI总结 本文通过系统评估混合量子经典神经网络,探讨量子组件对性能的实际影响,发现量子组件在多数情况下会降低性能,呼吁在近期应用中谨慎使用。

Comments 16 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04219 2026-01-09 cs.CY cs.AI cs.MA 57%

AgentTutor: Empowering Personalized Learning with Multi-Turn Interactive Teaching in Intelligent Education Systems

AgentTutor: 通过多轮互动教学赋能个性化学习在智能教育系统中

Yuxin Liu, Zeqing Song, Jiong Lou, Chentao Wu, Jie Li

专题命中 多模态评测 :multimodal(abstract);分类 cs.AI

AI总结 AgentTutor通过多轮互动教学系统提升个性化学习效果,结合多代理系统和学习者档案实现动态优化的教学策略。

Comments AAAI2026 Workshop AI4EDU

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05073 2026-01-09 cs.LG 50%

Milestones over Outcome: Unlocking Geometric Reasoning with Sub-Goal Verifiable Reward

几何推理的里程碑:通过子目标可验证奖励解锁几何推理

Jianlong Chen, Daocheng Fu, Shengze Xu, Jiawei Chen, Yuan Feng, Yue Yang, Junchi Yan, Hongyuan Zha, Renqiu Xia

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Shanghai Jiao Tong University(上海交通大学) Fudan University(复旦大学) The Chinese University of Hong Kong(香港中文大学) University of Science and Technology Beijing(北京科技大学)

专题命中 多模态评测 :multimodal(abstract)

AI总结 本文提出SGVR框架,通过子目标可验证奖励提升多模态大语言模型在几何推理及泛化能力上的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05014 2026-01-09 cs.RO 50%

The RoboSense Challenge: Sense Anything, Navigate Anywhere, Adapt Across Platforms

RoboSense挑战:感知一切,导航任何地方,跨平台适应

Lingdong Kong, Shaoyuan Xie, Zeying Gong, Ye Li, Meng Chu, Ao Liang, Yuhao Dong, Tianshuai Hu, Ronghe Qiu, Rong Li, Hanjiang Hu, Dongyue Lu, Wei Yin, Wenhao Ding, Linfeng Li, Hang Song, Wenwei Zhang, Yuexin Ma, Junwei Liang, Zhedong Zheng, Lai Xing Ng, Benoit R. Cottereau, Wei Tsang Ooi, Ziwei Liu, Zhanpeng Zhang, Weichao Qiu, Wei Zhang, Ji Ao, Jiangpeng Zheng, Siyu Wang, Guang Yang, Zihao Zhang, Yu Zhong, Enzhu Gao, Xinhan Zheng, Xueting Wang, Shouming Li, Yunkai Gao, Siming Lan, Mingfei Han, Xing Hu, Dusan Malic, Christian Fruhwirth-Reisinger, Alexander Prutsch, Wei Lin, Samuel Schulter, Horst Possegger, Linfeng Li, Jian Zhao, Zepeng Yang, Yuhang Song, Bojun Lin, Tianle Zhang, Yuchen Yuan, Chi Zhang, Xuelong Li, Youngseok Kim, Sihwan Hwang, Hyeonjun Jeong, Aodi Wu, Xubo Luo, Erjia Xiao, Lingfeng Zhang, Yingbo Tang, Hao Cheng, Renjing Xu, Wenbo Ding, Lei Zhou, Long Chen, Hangjun Ye, Xiaoshuai Hao, Shuangzhi Li, Junlong Shen, Xingyu Li, Hao Ruan, Jinliang Lin, Zhiming Luo, Yu Zang, Cheng Wang, Hanshi Wang, Xijie Gong, Yixiang Yang, Qianli Ma, Zhipeng Zhang, Wenxiang Shi, Jingmeng Zhou, Weijun Zeng, Kexin Xu, Yuchen Zhang, Haoxiang Fu, Ruibin Hu, Yanbiao Ma, Xiyan Feng, Wenbo Zhang, Lu Zhang, Yunzhi Zhuge, Huchuan Lu, You He, Seungjun Yu, Junsung Park, Youngsun Lim, Hyunjung Shim, Faduo Liang, Zihang Wang, Yiming Peng, Guanyu Zong, Xu Li, Binghao Wang, Hao Wei, Yongxin Ma, Yunke Shi, Shuaipeng Liu, Dong Kong, Yongchun Lin, Huitong Yang, Liang Lei, Haoang Li, Xinliang Zhang, Zhiyong Wang, Xiaofeng Wang, Yuxia Fu, Yadan Luo, Djamahl Etchegaray, Yang Li, Congfei Li, Yuxiang Sun, Wenkai Zhu, Wang Xu, Linru Li, Longjie Liao, Jun Yan, Benwu Wang, Xueliang Ren, Xiaoyu Yue, Jixian Zheng, Jinfeng Wu, Shurui Qin, Wei Cong, Yao He

机构 * Technical Committee(技术委员会) Challenge & Workshop Organizers(挑战与研讨会组织者)

专题命中 多模态评测 :cross-modal(abstract)

AI总结 RoboSense 2025挑战通过统一五个研究领域,推动机器人感知在多样化场景下的鲁棒性和适应性,提升真实环境中的感知可靠性与行动稳健性。

Comments Official IROS 2025 RoboSense Challenge Report; 51 pages, 37 figures, 5 tables; Competition Website at https://robosense2025.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏