arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2025-12-02 至 2025-12-02 共收录 112 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 图文多模态 17 篇

2405.20015 2025-12-02 cs.AI cs.CL 86%

Efficient LLM-Jailbreaking via Multimodal-LLM Jailbreak

通过多模态大语言模型 jailbreak 实现高效的 LLM-jailbreaking

Haoxuan Ji, Zheng Lin, Zhenxing Niu, Xinbo Gao, Gang Hua

专题命中 图文多模态 :multimodal(title,abstract);MLLM(abstract);image-text(abstract);分类 cs.CL、cs.AI

AI总结 本文提出一种通过多模态大语言模型实现高效 LLM-jailbreaking 的方法,结合图像-文本语义匹配提升攻击成功率,并在效率和泛化能力上优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.06284 2025-12-02 cs.AI 85%

A Comprehensive Survey and Guide to Multimodal Large Language Models in Vision-Language Tasks

多模态大语言模型在视觉-语言任务中的综合综述与指南

Chia Xin Liang, Pu Tian, Caitlyn Heqi Yin, Yao Yua, Wei An-Hou, Li Ming, Xinyuan Song, Tianyang Wang, Ziqian Bi, Ming Liu

机构 * JTB Technology Corp.(JTB技术公司) Stockton University(斯托顿大学) University of Wisconsin-Madison(威斯康星大学麦迪逊分校) AppCubic USA(AppCubic美国公司) Nomad Sustaintech LTD(Nomad可持续科技有限公司) Georgia Institute of Technology(佐治亚理工学院) Emory University(埃默里大学) University of Liverpool(利物浦大学) Indiana University(印第安纳大学) Purdue University(普渡大学)

专题命中 图文多模态 :multimodal(title,abstract);MLLM(abstract);cross-modal(abstract);分类 cs.AI

AI总结 本文综述了多模态大语言模型在视觉-语言任务中的应用,探讨了其架构、训练方法及挑战,并提供了理论与实践的全面指南。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.03657 2025-12-02 cs.CV 79%

Dynamic Multimodal Prototype Learning in Vision-Language Models

视觉-语言模型中的动态多模态原型学习

Xingyu Zhu, Shuo Wang, Beier Zhu, Miaoge Li, Yunfan Li, Junfeng Fang, Zhicai Wang, Dongsheng Wang, Hanwang Zhang

机构 * University of Science and Technology of China(中国科学技术大学) Nanyang Technological University(南洋理工大学) The Hong Kong Polytechnic University(香港理工大学) Sichuan University(四川大学) National University of Singapore(新加坡国立大学) Shenzhen University(深圳大学)

专题命中 图文多模态 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出ProtoMM框架,通过动态更新视觉粒子和多模态原型学习,提升视觉-语言模型在测试时的适应性能。

Comments ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.07710 2025-12-02 cs.CV cs.MM 79%

Cross Modal Fine-Grained Alignment via Granularity-Aware and Region-Uncertain Modeling

跨模态细粒度对齐 via 粒度感知和区域不确定建模

Jiale Liu, Haoming Zhou, Yishu Liu, Bingzhi Chen, Yuncheng Jiang

专题命中 图文多模态 :multimodal(abstract);cross-modal(abstract);image-text(abstract);分类 cs.CV、cs.MM

AI总结 本文提出了一种基于粒度感知和区域不确定建模的跨模态细粒度对齐方法,通过显著性感知和不确定性建模提升对齐的鲁棒性和可解释性。

Comments 10 pages, 6 figures, accepted by AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.15607 2025-12-02 cs.RO 78%

PRIMT: Preference-based Reinforcement Learning with Multimodal Feedback and Trajectory Synthesis from Foundation Models

基于偏好强化学习的多模态反馈与轨迹合成:从基础模型出发

Ruiqi Wang, Dezhong Zhao, Ziqin Yuan, Tianyu Shao, Guohua Chen, Dominic Kao, Sungeun Hong, Byung-Cheol Min

机构 * Purdue University(普渡大学) Beijing University of Chemical Technology(北京化工大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Sungkyunkwan University(成均馆大学) Indiana University Bloomington(印第安纳大学布卢明顿分校)

专题命中 图文多模态 :multimodal(title,abstract)

AI总结 PRIMT通过多模态反馈和轨迹合成,利用基础模型解决偏好强化学习中的查询模糊性和信用分配问题,提升机器人复杂行为的学习效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00597 2025-12-02 cs.CV 74%

Scaling Down to Scale Up: Towards Operationally-Efficient and Deployable Clinical Models via Cross-Modal Low-Rank Adaptation for Medical Vision-Language Models

缩小规模以扩大规模:通过跨模态低秩适应实现操作高效且可部署的临床模型

Thuraya Alzubaidi, Farhad R. Nezami, Muzammil Behzad

机构 * King Fahd University of Petroleum(国王法赫德石油与矿物大学) Institute for Medical Engineering(医学工程研究所) Science, Massachusetts Institute of Technology, US(科学,麻省理工学院,美国) Harvard Medical School, Harvard University, US(哈佛医学院,哈佛大学,美国) SDAIA-KFUPM Joint Research Center for Artificial Intelligence, Saudi Arabia(SDAIA-KFUPM人工智能联合研究中心,沙特阿拉伯)

专题命中 图文多模态 :cross-modal(title);分类 cs.CV

AI总结 通过跨模态低秩适应,MedCT-VLM在零样本分类中实现了对CT影像的高效适应,显著提升了病理分类的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00773 2025-12-02 cs.CV 70%

DEJIMA: A Novel Large-scale Japanese Dataset for Image Captioning and Visual Question Answering

DEJIMA:一种新的大规模日语数据集用于图像描述和视觉问答

Toshiki Katsube, Taiga Fukuhara, Kenichiro Ando, Yusuke Mukuta, Kohei Uehara, Tatsuya Harada

机构 * The University of Tokyo(东京大学) RIKEN(日本资源技术研究所)

专题命中 图文多模态 :multimodal(abstract);image-text(abstract);分类 cs.CV

AI总结 DEJIMA是首个大规模日语图像描述与视觉问答数据集,通过整合网络收集、目标检测和大语言模型优化,提升了日语语言和文化表现力,显著优于现有翻译或人工标注数据集。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01419 2025-12-02 cs.CV cs.AI 62%

Rice-VL: Evaluating Vision-Language Models for Cultural Understanding Across ASEAN Countries

Rice-VL:评估跨东盟国家的视觉语言模型的文化理解能力

Tushar Pranav, Eshan Pandey, Austria Lyka Diane Bala, Aman Chadha, Indriyati Atmosukarto, Donny Soh Cheng Lock

机构 * Singapore Institute of Technology(新加坡理工学院) Amazon GenAI(亚马逊人工智能实验室)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 RICE-VL通过评估视觉语言模型在11个东盟国家的文化理解能力,揭示了模型在文化多样性地区存在的偏见和局限性,强调了开发更具包容性的模型的重要性。

Comments 14 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00706 2025-12-02 cs.CV cs.AI 62%

Optimizing LVLMs with On-Policy Data for Effective Hallucination Mitigation

利用策略数据优化LVLMs以实现有效的幻觉缓解

Chengzhi Yu, Yifan Xu, Yifan Chen, Wenyi Zhang

机构 * University of Science and Technology of China(中国科学技术大学) Hong Kong Baptist University(香港 Baptist 大学)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出利用策略数据优化LVLMs,通过幻觉分类器和动态加权DPO算法,显著降低幻觉率并提升模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.23907 2025-12-02 cs.CV cs.AI cs.LG 62%

DynaStride: Dynamic Stride Windowing with MMCoT for Instructional Multi-Scene Captioning

DynaStride: 基于MMCoT的动态步长窗多场景描述生成

Eddison Pham, Prisha Priyadarshini, Adrian Maliackel, Kanishk Bandi, Cristian Meo, Kevin Zhu

机构 * Algoverse AI Research(Algoverse人工智能研究)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 DynaStride通过多模态链式思考和动态步长窗算法,实现无需手动分割的多场景教学视频连贯描述生成,提升描述的连贯性和信息量。

Comments 16 pages, 15 figures, 5 Tables, Accepted at NeurIPS 7HVU Workshop, Accepted at AAAI AI4ED Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.19943 2025-12-02 cs.CV cs.AI 62%

Interpreting ResNet-based CLIP via Neuron-Attention Decomposition

通过神经-注意力分解解释基于ResNet的CLIP

Edmund Bu, Yossi Gandelsman

机构 * UC San Diego(圣迭戈大学) UC Berkeley(伯克利大学)

专题命中 图文多模态 :image-text(abstract);分类 cs.CV、cs.AI

AI总结 通过神经-注意力分解解释CLIP-ResNet中的神经元,实现无训练语义分割和分布偏移监控

Comments Accepted at NeurIPS 2025 Workshop on Mechanistic Interpretability. Project page: https://edmundbu.github.io/clip-neur-attn/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00226 2025-12-02 cs.CV cs.AI 62%

DenseScan: Advancing 3D Scene Understanding with 2D Dense Annotation

DenseScan: 通过2D密集标注提升3D场景理解

Zirui Wang, Tao Zhang

机构 * University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Wuhan University(武汉大学)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 DenseScan通过2D密集标注提升3D场景理解,结合多视角图像和多模态大语言模型生成丰富语义标注,拓展下游任务应用。

Comments Workshop on Space in Vision, Language, and Embodied AI at NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01427 2025-12-02 cs.CV 57%

Language-Guided Open-World Anomaly Segmentation

语言引导的开放世界异常分割

Klara Reichard, Nikolas Brasch, Nassir Navab, Federico Tombari

机构 * Technical University of Munich(慕尼黑技术大学) BMW Group(宝马集团)

专题命中 图文多模态 :image-text(abstract);分类 cs.CV

AI总结 基于CLIP的开放世界异常分割方法,通过零样本学习实现未知物体的分割与命名,提升自动驾驶中的异常检测能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00194 2025-12-02 cs.CV cs.LG eess.IV q-bio.QM 57%

AutocleanEEG ICVision: Automated ICA Artifact Classification Using Vision-Language AI

AutocleanEEG ICVision:利用视觉-语言AI实现自动化ICA噪声分类

Zag ElSayed, Grace Westerkamp, Gavin Gammoh, Yanchen Liu, Peyton Siekierski, Craig Erickson, Ernest Pedapati

机构 * School of Information Technology University of Cincinnati Ohio, USA(信息科技学院 奥地利辛辛那提大学 美国俄亥俄州)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

AI总结 ICVision通过视觉-语言AI实现自动化EEG ICA噪声分类,达到专家级准确度并提供可解释结果。

Comments 6 pages, 8 figures

Journal ref Conference ICMI2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12003 2025-12-02 cs.AI 57%

Look as You Think: Unifying Reasoning and Visual Evidence Attribution for Verifiable Document RAG via Reinforcement Learning

看而思:通过强化学习统一推理与视觉证据归因以实现可验证文档RAG

Shuochen Liu, Pengfei Luo, Chao Zhang, Yuhao Chen, Haotian Zhang, Qi Liu, Xin Kou, Tong Xu, Enhong Chen

专题命中 图文多模态 :multimodal(abstract);分类 cs.AI

AI总结 通过强化学习统一推理与视觉证据归因,提升多模态问答的可验证性和准确性。

Comments Poster of AAAI'2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.22171 2025-12-02 cs.CV 57%

HARMONY: Hidden Activation Representations and Model Output-Aware Uncertainty Estimation for Vision-Language Models

HARMONY:隐藏的激活表示和模型输出感知的不确定性估计用于视觉-语言模型

Erum Mushtaq, Zalan Fabian, Yavuz Faruk Bakman, Anil Ramakrishna, Mahdi Soltanolkotabi, Salman Avestimehr

机构 * University of Southern California(南加州大学) Amazon AGI(亚马逊人工智能实验室)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

AI总结 HARMONY通过整合生成token、模型输出不确定性分数和隐藏表示,提升视觉-语言模型的不确定性估计性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.01331 2025-12-02 cs.RO cs.LG 50%

RobustVLA: Robustness-Aware Reinforcement Post-Training for Vision-Language-Action Models

RobustVLA: 为视觉-语言-动作模型引入鲁棒性感知的强化学习后训练

Hongyin Zhang, Shuo Zhang, Junxi Jin, Qixin Zeng, Runze Li, Donglin Wang

机构 * Westlake University(西湖大学)

专题命中 图文多模态 :multi-modal(abstract)

AI总结 RobustVLA通过引入鲁棒性感知的强化学习后训练方法,提升视觉-语言-动作模型在环境不确定性下的鲁棒性和可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 音频语音多模态 6 篇

2512.00120 2025-12-02 cs.SD cs.AI cs.CV cs.LG cs.MM 85%

Art2Music: Generating Music for Art Images with Multi-modal Feeling Alignment

Art2Music: 通过多模态情感对齐生成艺术图像的音乐

Jiaying Hong, Ting Zhu, Thanet Markchom, Huizhi Liang

机构 * School of Computing Newcastle University(计算学院新castle大学) Department of Computer Science University of Reading(计算机科学系阅读大学)

专题命中 音频语音多模态 :multi-modal(title);multimodal(abstract);cross-modal(abstract);分类 cs.CV、cs.AI、cs.MM

AI总结 Art2Music通过多模态情感对齐生成艺术图像的音乐,利用轻量级跨模态框架提升音乐生成的感知自然性和频谱保真度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00115 2025-12-02 cs.SD cs.CV cs.MM 84%

MoLT: Mixture of Layer-Wise Tokens for Efficient Audio-Visual Learning

MoLT:基于层级令牌的高效音频视觉学习

Kyeongha Rho, Hyeongkeun Lee, Jae Won Cho, Joon Son Chung

机构 * KAIST(韩国科学技术院) Sejong University(世宗大学)

专题命中 音频语音多模态 :audio-visual(title,abstract);cross-modal(abstract);分类 cs.CV、cs.MM

AI总结 MoLT通过层级令牌融合提升音频视觉学习效率,采用轻量适应策略和正交正则化,优于现有方法。

Comments 10 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.06434 2025-12-02 cs.CL cs.AI cs.MM cs.SD eess.AS 83%

Whispering LLaMA: A Cross-Modal Generative Error Correction Framework for Speech Recognition

Whispering LLaMA: 一种用于语音识别的跨模态生成性错误校正框架

Srijith Radhakrishnan, Chao-Han Huck Yang, Sumeer Ahmad Khan, Rohit Kumar, Narsis A. Kiani, David Gomez-Cabrero, Jesper N. Tegner

专题命中 音频语音多模态 :cross-modal(title,abstract);分类 cs.CL、cs.AI、cs.MM

AI总结 Whispering LLaMA通过跨模态融合技术提升语音识别的生成性错误校正性能,相较n-best假设提升37.66%的词错误率。

Comments Accepted to EMNLP 2023 as main paper. 10 pages. Revised math notations. GitHub: https://github.com/Srijith-rkr/Whispering-LLaMA

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00563 2025-12-02 cs.SD cs.AI cs.LG 79%

Explainable Multi-Modal Deep Learning for Automatic Detection of Lung Diseases from Respiratory Audio Signals

可解释的多模态深度学习用于从呼吸音频信号自动检测肺部疾病

S M Asiful Islam Saky, Md Rashidul Islam, Md Saiful Arefin, Shahaba Alam

机构 * Albukhary International University(阿尔布胡亚国际大学)

专题命中 音频语音多模态 :multi-modal(title);multimodal(abstract);分类 cs.AI

AI总结 本研究提出一种可解释的多模态深度学习框架,通过结合频谱-时间编码器和手工制作的声学特征编码器,利用呼吸音频信号自动检测肺部疾病,实现了高准确率和良好的泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12077 2025-12-02 cs.CV 70%

Learning to Hear by Seeing: It's Time for Vision Language Models to Understand Artistic Emotion from Sight and Sound

通过视觉学习听觉:现在是让视觉语言模型理解艺术情感的时候了

Dengming Zhang, Weitao You, Jingxiong Li, Weishen Lin, Wenda Shi, Xue Zhao, Heda Zuo, Junxian Wu, Lingyun Sun

机构 * Zhejiang University(浙江大学) The Hong Kong Polytechnic University(香港理工大学)

专题命中 音频语音多模态 :cross-modal(abstract);audio-visual(abstract);分类 cs.CV

AI总结 VAEmotionLLM通过两阶段框架,利用有限音频预训练使视觉语言模型理解艺术中的多模态情感

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.19361 2025-12-02 cs.CL cs.AI cs.SC cs.SD eess.AS 67%

SpeechIQ: Speech-Agentic Intelligence Quotient Across Cognitive Levels in Voice Understanding by Large Language Models

SpeechIQ: 大型语言模型在语音理解中的跨认知层级语音智能商

Zhen Wan, Chao-Han Huck Yang, Yahan Yu, Jinchuan Tian, Sheng Li, Ke Hu, Zhehuai Chen, Shinji Watanabe, Fei Cheng, Chenhui Chu, Sadao Kurohashi

机构 * Kyoto University(京都大学) NVIDIA Carnegie Mellon University(卡内基梅隆大学) Institute of Science Tokyo(东京科学研究院)

专题命中 音频语音多模态 :multi-modal(abstract);分类 cs.CL、cs.AI、eess.AS

AI总结 SpeechIQ是一种基于语音的智能评估框架,通过三个认知层级评估大型语言模型在语音理解中的能力,提供统一的比较和识别标注错误与幻觉。

Comments ACL 2025 main. Our Speech-IQ leaderboard is hosted at huggingface.co/spaces/nvidia/Speech-IQ-leaderboard. Speech-IQ Calculator: https://github.com/YukinoWan/SpeechIQ

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 视频多模态 8 篇

2512.00714 2025-12-02 cs.CV cs.AI 81%

Deep Learning-Based Computer Vision Models for Early Cancer Detection Using Multimodal Medical Imaging and Radiogenomic Integration Frameworks

基于深度学习的计算机视觉模型用于多模态医学影像和放射基因组整合框架中的早期癌症检测

Emmanuella Avwerosuoghene Oghenekaro

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出基于深度学习的计算机视觉模型,结合多模态医学影像和放射基因组学,用于早期癌症检测,提升肿瘤基因型预测和治疗抗性分析能力。

Journal ref International Journal of Computer Applications Technology and Research, vol. 14, no. 11, pp. 1-14, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12263 2025-12-02 cs.CV cs.AI 81%

CrossVid: A Comprehensive Benchmark for Evaluating Cross-Video Reasoning in Multimodal Large Language Models

CrossVid: 一个用于评估多模态大语言模型在跨视频推理中的综合基准

Jingyao Li, Jingyun Wang, Molin Tan, Haochen Wang, Cilin Yan, Likun Shi, Jiayin Cai, Xiaolong Jiang, Yao Hu

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 CrossVid是首个用于评估多模态大语言模型跨视频推理能力的综合基准,通过多样化的任务和数据集验证了模型在复杂视频推理任务中的表现。

Comments Accepted to AAAI 2026 (main track). For code and data, see https://github.com/chuntianli666/CrossVid

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.07867 2025-12-02 cs.CV 79%

Continuous Perception Matters: Diagnosing Temporal Integration Failures in Multimodal Models

持续感知至关重要:多模态模型中时间整合失败的诊断

Zeyu Wang, Zhenzhen Weng, Serena Yeung-Levy

机构 * Stanford University(斯坦福大学)

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出CP-Bench,通过简单任务揭示多模态模型在持续感知中的时间整合缺陷,指出现有模型无法有效跨时间积累证据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01882 2025-12-02 cs.LG 78%

New Spiking Architecture for Multi-Modal Decision-Making in Autonomous Vehicles

多模态决策中自动驾驶车辆的新脉冲架构

Aref Ghoreishee, Abhishek Mishra, Lifeng Zhou, John Walsh, Nagarajan Kandasamy

机构 * Electrical and Computer Engineering Department(电子与计算机工程系)

专题命中 视频多模态 :multi-modal(title,abstract)

AI总结 本文提出了一种基于脉冲神经元的高效多模态决策架构,用于提升自动驾驶车辆的实时决策能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00989 2025-12-02 q-bio.QM cs.LG 71%

Sleep Apnea Detection on a Wireless Multimodal Wearable Device Without Oxygen Flow Using a Mamba-based Deep Learning Approach

基于Mamba深度学习方法的无线多模态可穿戴设备无氧流睡眠呼吸暂停检测

Dominik Luszczynski, Richard Fei Yin, Nicholas Afonin, Andrew S. P. Lim

机构 * University of Toronto Department of Medicine(多伦多大学医学系) Sunnybrook Research Institute Department of Medicine Neurology Div.(圣玛丽医院研究学院医学系神经病学部)

专题命中 视频多模态 :multimodal(title)

AI总结 本文提出基于Mamba架构的深度学习模型,利用无线多模态可穿戴设备无氧流信号,实现睡眠呼吸暂停的准确检测与事件级表征。

Comments 29 pages, 14 figures. Authors Dominik Luszczynski, Richard Fei Yin and Nicholas Afonin contributed equally

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01312 2025-12-02 cs.CV 57%

IVCR-200K: A Large-Scale Multi-turn Dialogue Benchmark for Interactive Video Corpus Retrieval

IVCR-200K: 一个大规模多轮对话基准数据集用于交互视频语料检索

Ning Han, Yawen Zeng, Shaohua Long, Chengqing Li, Sijie Yang, Dun Tan, Jianfeng Dong, Jingjing Chen

机构 * Xiangtan University(湘潭大学) Hunan University(湖南大学) Zhejiang Gongshang University(浙江工商大学) Fudan University(复旦大学)

专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV

AI总结 本文提出IVCR-200K数据集及基于多模态大语言模型的框架,用于交互视频语料检索,提升多轮对话式交互效果。

Comments Accepted by SIGIR2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01298 2025-12-02 cs.CV 57%

TBT-Former: Learning Temporal Boundary Distributions for Action Localization

TBT-Former:基于时间边界分布的学习用于动作定位

Thisara Rathnayaka, Uthayasanker Thayasivam

机构 * Dept. of Computer Science \& Engineering University of Moratuwa Sri Lanka

专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV

AI总结 TBT-Former通过改进的Transformer架构和边界分布回归头,提升动作定位性能,实现THUMOS14和EPIC-Kitchens 100数据集上的新高。

Comments 8 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏