arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2025-12-16 至 2025-12-16 共收录 87 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 图文多模态 6 篇

2512.12107 2025-12-16 cs.CV 83%

EchoVLM: Measurement-Grounded Multimodal Learning for Echocardiography

EchoVLM:基于测量的多模态学习用于超声心动图

Yuheng Li, Yue Zhang, Abdoul Aziz Amadou, Yuxiang Lai, Jike Zhong, Tiziano Passerini, Dorin Comaniciu, Puneet Sharma

机构 * Georgia Institute of Technology(佐治亚理工学院) Siemens Healthineers(西门子医疗) Siemens Healthcare Limited(西门子医疗有限公司) Emory University(埃默里大学) University of Southern California(南加州大学)

专题命中 图文多模态 :multimodal(title,abstract);image-text(abstract);分类 cs.CV

AI总结 EchoVLM通过引入基于测量的多模态学习方法,实现了超声心动图的端到端解读,提升了疾病分类和视图识别的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23661 2025-12-16 cs.CV 79%

LLaVA-OneVision-1.5: Fully Open Framework for Democratized Multimodal Training

LLaVA-OneVision-1.5:面向民主化多模态训练的完全开放框架

Xiang An, Yin Xie, Kaicheng Yang, Wenkang Zhang, Xiuwei Zhao, Zheng Cheng, Yirui Wang, Songcen Xu, Changrui Chen, Didi Zhu, Chunsheng Wu, Huajie Tan, Chunyuan Li, Jing Yang, Jie Yu, Xiyao Wang, Bin Qin, Yumeng Wang, Zizhen Yan, Ziyong Feng, Ziwei Liu, Bo Li, Jiankang Deng

机构 * LLaVA-OneVision Community Contributors(LLaVA-OneVision社区贡献者)

专题命中 图文多模态 :multimodal(title,abstract);分类 cs.CV

AI总结 LLaVA-OneVision-1.5通过开放框架和高效训练方法实现了多模态模型的低成本高性能训练。

Comments LLaVA-OneVision-1.5 Technical Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23065 2025-12-16 cs.CL 79%

SNS-Bench-VL: Benchmarking Multimodal Large Language Models in Social Networking Services

SNS-Bench-VL:在社交网络服务中评估多模态大语言模型的基准测试

Hongcheng Guo, Zheyong Xie, Shaosheng Cao, Boyang Wang, Weiting Liu, Anjie Le, Lei Li, Zhoujun Li

专题命中 图文多模态 :multimodal(title,abstract);分类 cs.CL

AI总结 SNS-Bench-VL是一个用于评估多模态大语言模型在社交网络服务中性能的基准测试,涵盖8个多模态任务,包含4001个问题-答案对,评估25种先进模型,揭示多模态社交理解的挑战。

Comments We found problems in the code while rechecking our implementation. These issues led to noticeable numerical discrepancies, making some of the reported results and conclusions potentially unreliable. Therefore, we request to withdraw this submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12701 2025-12-16 cs.CV cs.CL cs.LG 62%

Efficient Vision-Language Reasoning via Adaptive Token Pruning

通过自适应令牌修剪实现高效的视觉语言推理

Xue Li, Xiaonan Song, Henry Hu

机构 * Scholar42(学者42) InfiniPouch LLC(InfiniPouch公司) Labelbox, Inc.(Labelbox公司)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.CL

AI总结 本研究提出自适应令牌修剪方法,通过动态保留关键令牌提升视觉语言模型的推理效率和稳定性,减少计算量并保持精度。

Comments 10 pages, 3 figures. Expanded version of an extended abstract accepted at NeurIPS 2025 Workshop on VLM4RWD. Presents methodology and preliminary experimental results

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12487 2025-12-16 cs.CV 57%

More Than the Final Answer: Improving Visual Extraction and Logical Consistency in Vision-Language Models

不止于最终答案:提升视觉提取和逻辑一致性的视觉语言模型

Hoang Anh Just, Yifei Fan, Handong Zhao, Jiuxiang Gu, Ruiyi Zhang, Simon Jenni, Kushal Kafle, Ruoxi Jia, Jing Shi

机构 * Virginia Tech(弗吉尼亚理工大学) Adobe Research(Adobe研究院) Apple(苹果公司)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

AI总结 PeRL-VL通过解耦框架提升视觉语言模型的视觉提取和推理一致性,实现Pass@1准确率提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.14642 2025-12-16 cs.CV 57%

Relation-R1: Progressively Cognitive Chain-of-Thought Guided Reinforcement Learning for Unified Relation Comprehension

Relation-R1: 逐步认知链式思维引导的强化学习用于统一关系理解

Lin Li, Wei Chen, Jiahui Li, Kwang-Ting Cheng, Long Chen

专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV

AI总结 Relation-R1通过整合认知链式思维引导的强化学习,实现了对二元和N元关系的统一理解,提升了视觉-语义定位能力。

Comments AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 音频语音多模态 5 篇

2511.22447 2025-12-16 cs.MM 83%

Angle-Optimized Partial Disentanglement for Multimodal Emotion Recognition in Conversation

对话中多模态情感识别的视角优化部分解耦

Xinyi Che, Wenbo Wang, Yuanbo Hou, Mingjie Xie, Qijun Zhao, Jian Guan

专题命中 音频语音多模态 :multimodal(title,abstract);cross-modal(abstract);分类 cs.MM

AI总结 本文提出AO-FL框架,通过自适应角度优化实现对话中多模态情感识别的共享与特定特征部分解耦,提升情感识别性能。

Comments 10 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12875 2025-12-16 cs.CV cs.MM cs.SD 81%

Schrodinger Audio-Visual Editor: Object-Level Audiovisual Removal

Schrodinger Audio-Visual Editor: 对象级音频视觉去除

Weihan Xu, Kan Jen Cheng, Koichi Saito, Muhammad Jehanzeb Mirza, Tingle Li, Yisi Liu, Alexander H. Liu, Liming Wang, Masato Ishii, Takashi Shibuya, Yuki Mitsufuji, Gopala Anumanchipalli, Paul Pu Liang

机构 * MIT(麻省理工学院) UC Berkeley(加州大学伯克利分校) Berkeley AI Research(伯克利人工智能研究) Sony AI(索尼人工智能) Sony Group Corporation(索尼集团)

专题命中 音频语音多模态 :audio-visual(title,abstract);分类 cs.CV、cs.MM

AI总结 本文提出Schrodinger Audio-Visual Editor,通过联合编辑音频和视频实现对象级去除,提升时间同步性和语义对应性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13495 2025-12-16 cs.CV 79%

Soul: Breathe Life into Digital Human for High-fidelity Long-term Multimodal Animation

Soul:为高保真长期多模态动画注入生命

Jiangning Zhang, Junwei Zhu, Zhenye Gan, Donghao Luo, Chuming Lin, Feifan Xu, Xu Peng, Jianlong Hu, Yuansen Liu, Yijia Hong, Weijian Cao, Han Feng, Xu Chen, Chencan Fu, Keke He, Xiaobin Hu, Chengjie Wang

机构 * Tencent(腾讯)

专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.CV

AI总结 Soul通过多模态驱动框架实现高保真长期数字人类动画,结合自动化标注和优化推理效率,显著提升视频质量和唇同步精度。

Comments Project page: https://zhangzjn.github.io/projects/Soul/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13131 2025-12-16 cs.AI cs.CV cs.GR cs.MM cs.SD 67%

Towards Unified Co-Speech Gesture Generation via Hierarchical Implicit Periodicity Learning

基于层次隐周期学习的统一语音同步手势生成

Xin Guo, Yifan Zhao, Jia Li

专题命中 音频语音多模态 :multi-modal(abstract);分类 cs.CV、cs.AI、cs.MM

AI总结 本文提出基于层次隐周期学习的统一语音同步手势生成方法,通过周期自动编码器和级联指导技术提升手势生成的自然性和协调性。

Comments IEEE Transactions on Image Processing

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.20336 2025-12-16 cs.CV cs.SD eess.AS 62%

RapVerse: Coherent Vocals and Whole-Body Motions Generations from Text

RapVerse: 从文本歌词生成连贯的唱声与全身动作

Jiaben Chen, Xin Yan, Yihang Chen, Siyuan Cen, Zixin Wang, Qinwei Ma, Haoyu Zhen, Kaizhi Qian, Lie Lu, Chuang Gan

机构 * UMass Amherst(马萨诸塞大学阿默斯特分校) Wuhan University(武汉大学) UC San Diego(加州大学圣地亚哥分校) Tsinghua University(清华大学) MIT-IBM Watson AI Lab(麻省理工-IBM沃森人工智能实验室) Dolby Laboratories(杜比实验室)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CV、eess.AS

AI总结 RapVerse通过统一生成框架,从文本歌词生成连贯唱声与全身动作,实现多模态统一建模,提升生成效果与基准性能。

Comments ICCV 2025, Project website: https://jiabenchen.github.io/RapVerse/

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 视频多模态 14 篇

2512.12246 2025-12-16 cs.CV 83%

Moment and Highlight Detection via MLLM Frame Segmentation

通过MLLM帧分割进行时刻和亮点检测

I Putu Andika Bagas Jiwanta, Ayu Purwarianti

机构 * School of Electrical Engineering and Informatics(电气工程与信息学院) Institut Teknologi Bandung(万隆技术大学)

专题命中 视频多模态 :MLLM(title,abstract);multimodal(abstract);分类 cs.CV

AI总结 本文提出通过MLLM帧分割实现视频时刻和亮点检测,利用分割损失与因果LM损失结合,提升检测精度与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.20268 2025-12-16 cs.CV cs.MM 81%

GMFVAD: Using Grained Multi-modal Feature to Improve Video Anomaly Detection

GMFVAD:利用细粒度多模态特征提升视频异常检测

Guangyu Dai, Dong Chen, Siliang Tang, Yueting Zhuang

机构 * Zhejiang University(浙江大学) Zhengzhou University(郑州大学)

专题命中 视频多模态 :multi-modal(title,abstract);分类 cs.CV、cs.MM

AI总结 GMFVAD通过细粒度多模态特征减少冗余信息,提升视频异常检测性能。

Comments Accepted for publication in the Proceedings of the ICONIP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13604 2025-12-16 cs.CV 79%

LongVie 2: Multimodal Controllable Ultra-Long Video World Model

LongVie 2: 多模态可控超长视频世界模型

Jianxiong Gao, Zhaoxi Chen, Xian Liu, Junhao Zhuang, Chengming Xu, Jianfeng Feng, Yu Qiao, Yanwei Fu, Chenyang Si, Ziwei Liu

机构 * FDU(福建大学) NJU(南京大学) NTU(National University of Taiwan) NVIDIA(英伟达) THU(清华大学) Shanghai AI Laboratory(上海人工智能实验室)

专题命中 视频多模态 :multimodal(title);multi-modal(abstract);分类 cs.CV

AI总结 LongVie 2通过多模态引导、退化感知训练和历史-上下文引导,实现了超长视频的可控生成,支持连续视频生成长达五分钟,推动视频世界建模的统一发展。

Comments Project Page: https://vchitect.github.io/LongVie2-project/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13313 2025-12-16 cs.CV 70%

KlingAvatar 2.0 Technical Report

KlingAvatar 2.0 技术报告

Kling Team, Jialu Chen, Yikang Ding, Zhixue Fang, Kun Gai, Yuan Gao, Kang He, Jingyun Hua, Boyuan Jiang, Mingming Lao, Xiaohan Li, Hui Liu, Jiwen Liu, Xiaoqiang Liu, Yuan Liu, Shun Lu, Yongsen Mao, Yingchao Shao, Huafeng Shi, Xiaoyu Shi, Peiqin Sun, Songlin Tang, Pengfei Wan, Chao Wang, Xuebo Wang, Haoxian Zhang, Yuanxing Zhang, Yan Zhou

机构 * Kuaishou Technology(快手科技)

专题命中 视频多模态 :multimodal(abstract);cross-modal(abstract);分类 cs.CV

AI总结 KlingAvatar 2.0 通过时空级联框架和多模态指令融合技术,实现了高效且高质量的长视频生成,提升了视觉清晰度和多模态对齐能力。

Comments 14 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12560 2025-12-16 cs.CV cs.AI 62%

StreamingAssistant: Efficient Visual Token Pruning for Accelerating Online Video Understanding

StreamingAssistant: 为加速在线视频理解的高效视觉标记修剪

Xinqi Jin, Hanxun Yu, Bohan Yu, Kebin Liu, Jian Liu, Keda Tao, Yixuan Pei, Huan Wang, Fan Dang, Jiangchuan Liu, Weiqiang Wang

机构 * Tsinghua University(清华大学) Zhejiang University(浙江大学) Ant Group(蚂蚁集团) Westlake University(西湖大学) Beijing Jiaotong University(北京交通大学) Simon Fraser University(西蒙弗雷泽大学)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 StreamingAssistant通过高效视觉标记修剪技术,提升在线视频理解的准确性和效率,减少GPU内存使用和计算延迟。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.14505 2025-12-16 cs.CV cs.AI cs.LG 62%

MusicInfuser: Making Video Diffusion Listen and Dance

MusicInfuser: 使视频扩散模型听音乐并跳舞

Susung Hong, Ira Kemelmacher-Shlizerman, Brian Curless, Steven M. Seitz

机构 * University of Washington(华盛顿大学)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 MusicInfuser通过调整预训练视频扩散模型,使视频能与指定音乐同步生成舞蹈,无需运动数据,训练高效且泛化能力强。

Comments Project page: https://susunghong.github.io/MusicInfuser

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13238 2025-12-16 cs.CV 57%

Ego-EXTRA: video-language Egocentric Dataset for EXpert-TRAinee assistance

Ego-EXTRA:视频语言眼动数据集用于专家-学员协助

Francesco Ragusa, Michele Mazzamuto, Rosario Forte, Irene D'Ambra, James Fort, Jakob Engel, Antonino Furnari, Giovanni Maria Farinella

机构 * Department of Mathematics and Computer Science - University of Catania(数学与计算机科学系 - 卡塔尼亚大学) Next Vision s.r.l. - Spinoff of the University of Catania(Next Vision公司 - 卡塔尼亚大学衍生机构) Meta Reality Labs Research(Meta现实实验室)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 Ego-EXTRA数据集通过专家-学员双向对话评估多模态大语言模型,揭示其在专家级帮助中的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13015 2025-12-16 cs.CV 57%

What Happens Next? Next Scene Prediction with a Unified Video Model

接下来会发生什么?一种统一的视频模型用于下一场景预测

Xinjie Li, Zhimin Chen, Rui Zhao, Florian Schiffers, Zhenyu Liao, Vimal Bhat

机构 * Pennsylvania State University(宾夕法尼亚州立大学) Amazon(亚马逊)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 本文提出Next Scene Prediction任务,通过联合框架结合Qwen-VL和LTX,利用预训练、监督微调和强化学习提升视频模型的时间推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12462 2025-12-16 cs.LG cs.AI q-bio.NC 57%

Dynamical modeling of nonlinear latent factors in multiscale neural activity with real-time inference

多尺度神经活动中非线性潜在因子的动力学建模

Eray Erturk, Maryam M. Shanechi

机构 * Department of Electrical and Computer Engineering(电气与计算机工程系) University of Southern California(南加州大学) Department of Computer Science(计算机科学系) Department of Biomedical Engineering(生物医学工程系) Neuroscience Graduate Program(神经科学研究生项目)

专题命中 视频多模态 :multimodal(abstract);分类 cs.AI

AI总结 本研究提出了一种多尺度动态框架,用于实时解码多模态神经活动,通过非线性聚合不同时间尺度和分布的数据以提升解码性能。

Comments Published at the 39th Annual Conference on Neural Information Processing Systems 2025. Code is available at https://github.com/ShanechiLab/mrine

Journal ref NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.06080 2025-12-16 cs.CV 57%

CAST-Phys: Contactless Affective States Through Physiological signals Database

CAST-Phys: 通过生理信号进行无接触情绪状态的数据库

Joaquim Comas, Alexander Joel Vera, Xavier Vives, Eleonora De Filippi, Alexandre Pereda, Federico Sukno

机构 * Department of Information and Communication Technologies, Pompeu Fabra University(信息与通信技术系,庞培法布拉大学) Eurecat Centre Tecnològic(埃鲁卡特技术中心)

专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV

AI总结 CAST-Phys数据库通过多模态远程生理信号实现无接触情绪识别,提供高质量的生理和面部数据以提升情绪识别技术。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00696 2025-12-16 q-bio.MN cs.AI cs.ET 57%

Hierarchical Molecular Language Models (HMLMs)

分层分子语言模型(HMLMs)

Hasi Hays, Yue Yu, William J. Richardson

机构 * Department of Chemical Engineering, University of Arkansas(化学工程系,亚拉巴马大学)

专题命中 视频多模态 :multi-modal(abstract);分类 cs.AI

AI总结 HMLMs通过构建分子语言模型,将细胞信号传递建模为分子语言,利用分层注意力机制和跨尺度操作符整合多模态数据,提升对复杂信号网络的时间动态预测能力,推动精准医学发展。

Comments The current version includes minor revisions to the preprint v2 (arXiv preprint arXiv:2512.00696), Added the Supplementary materials section

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13073 2025-12-16 math.ST stat.TH 50%

Spectral Equivariance and Geometric Transport in Reproducing Kernel Hilbert Spaces: A Unified Framework for Orthogonal Polynomial and Kernel Estimation

谱等变性与几何传输在再生核希尔伯特空间中的统一框架:一种用于正交多项式和核估计的统一方法

Jocelyn Nembé

专题命中 视频多模态 :multimodal(abstract)

AI总结 本文提出了一种基于双核空间的统一几何框架,通过谱等变性定理揭示了正交多项式估计器、核估计器和谱平滑方法之间的联系,为非参数估计提供了新的视角。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13067 2025-12-16 math.PR cs.IT math.GR math.IT stat.CO 50%

Group-averaged Markov chains II: tuning of group action in finite state space

群平均马尔可夫链II:在有限状态空间中调节群作用

Michael C. H. Choi, Ryan J. Y. Lim, Youjia Wang

专题命中 视频多模态 :multimodal(abstract)

AI总结 本文研究了群平均马尔可夫链,分析了轨道核及其混合方法,并提出调节群作用的启发式方法,展示了GPG在信息投影中的应用及在不同模型中的混合性能。

Comments 44 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12318 2025-12-16 hep-ph hep-ex 50%

Interference Effects in Resonant Standard Model di-Higgs Production and Decay into $4b$ Final States: the Role of Machine Learning Analysis

共振标准模型双Higgs生产与衰变成4b最终态中的干涉效应:机器学习分析的作用

A. Hammad, S. Moretti, A. P. Przybyl, H. Waltari

专题命中 视频多模态 :multi-modal(abstract)

AI总结 该研究利用多模式Transformer机器学习分析,探讨共振标准模型双Higgs衰变成4b最终态中的干涉效应,发现其能提升显著性并适应复杂数据集,但忽视干涉可能导致错误结论。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 跨模态检索 8 篇

2512.12824 2025-12-16 cs.CV cs.AI 88%

Adapting Multimodal Foundation Models for Few-Shot Learning: A Comprehensive Study on Contrastive Captioners

为少样本学习适应多模态基础模型:对比captioners的全面研究

N. K. B. M. P. K. B. Narasinghe, Uthayasanker Thayasivam

机构 * Department of Computer Science and Engineering, University of Moratuwa, Sri Lanka(计算机科学与工程系,穆塔瓦大学,斯里兰卡)

专题命中 跨模态检索 :multimodal(title,abstract);multimodal foundation model(title,abstract);分类 cs.CV、cs.AI

AI总结 本文研究了如何通过对比captioners适应少样本学习,探讨了参数高效微调策略及生成-对比基础模型的高效适应方法。

Comments 9 pages, 3 figures. Accepted to VISAPP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12935 2025-12-16 cs.CV cs.AI cs.IR 81%

Unified Interactive Multimodal Moment Retrieval via Cascaded Embedding-Reranking and Temporal-Aware Score Fusion

通过级联嵌入-重排序和时间感知得分融合实现统一的交互式多模态时刻检索

Toan Le Ngo Thanh, Phat Ha Huu, Tan Nguyen Dang Duy, Thong Nguyen Le Minh, Anh Nguyen Nhu Tinh

专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出通过级联嵌入-重排序和时间感知得分融合实现统一的多模态时刻检索系统,解决跨模态噪声、时间序列连贯性和模态选择问题。

Comments Accepted at AAAI Workshop 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.02454 2025-12-16 cs.CL cs.AI 81%

Multimodal DeepResearcher: Generating Text-Chart Interleaved Reports From Scratch with Agentic Framework

多模态深度研究员:从零开始生成文本-图表交织报告的代理框架

Zhaorui Yang, Bo Pan, Han Wang, Yiyao Wang, Xingyu Liu, Luoxuan Weng, Yingchaojie Feng, Haozhe Feng, Minfeng Zhu, Bo Zhang, Wei Chen

专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.CL、cs.AI

AI总结 多模态深度研究员通过代理框架实现从零开始生成文本-图表交织报告,利用FDV结构化文本表示提升可视化生成质量。

Comments AAAI 2026 Oral

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23316 2025-12-16 cs.CV 79%

C3-OWD: A Curriculum Cross-modal Contrastive Learning Framework for Open-World Detection

C3-OWD: 一种用于开放世界检测的课程跨模态对比学习框架

Siheng Wang, Zhengdao Li, Yanshu Li, Canran Xiao, Haibo Zhan, Zhengtao Yao, Xuzhi Zhang, Jiale Kang, Linshan Li, Weiming Liu, Zhikang Dong, Jifeng Shen, Junhao Dong, Qiang Sun, Piotr Koniusz

专题命中 跨模态检索 :cross-modal(title,abstract);分类 cs.CV

AI总结 C3-OWD提出一种课程跨模态对比学习框架,通过预训练和视觉-语言对齐提升目标检测的鲁棒性和泛化能力。

Comments one of the authors doesn't agree any more

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02792 2025-12-16 cs.CV cs.MM 73%

HUD: Hierarchical Uncertainty-Aware Disambiguation Network for Composed Video Retrieval

HUD: 用于组合视频检索的层次不确定性感知网络

Zhiwei Chen, Yupeng Hu, Zixu Li, Zhiheng Fu, Haokun Wen, Weili Guan

机构 * School of Software Shandong University Jinan China(软件学院 山东大学 济南 中国) School of Data Science City University of Hong Kong Hong Kong China(数据科学学院 香港城市大学 香港 中国) Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳)) City University of Hong Kong(香港城市大学)

专题命中 跨模态检索 :multi-modal(abstract);cross-modal(abstract);分类 cs.CV、cs.MM

AI总结 HUD通过层次不确定性感知网络提升组合视频检索的多模态查询理解与特征学习精度。

Comments Accepted by ACM MM 2025

详情

展开后加载摘要…

URL PDF HTML 收藏