arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2025-11-25 至 2025-11-25 共收录 134 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态评测 32 篇

2511.17672 2025-11-25 cs.AI 57%

Cognitive Inception: Agentic Reasoning against Visual Deceptions by Injecting Skepticism

认知 inception:通过注入怀疑进行视觉欺骗的代理推理

Yinjie Zhao, Heng Zhao, Bihan Wen, Joey Tianyi Zhou

机构 * CFAR, Agency for Science, Technology and Research (A*STAR), Singapore(科技研究局(A*STAR)认知智能研究所,新加坡) IHPC, Agency for Science, Technology and Research (A*STAR), Singapore(科技研究局(A*STAR)信息处理中心,新加坡) ROSE Lab, School of Electrical and Electronic Engineering, Nanyang Technological University(南洋理工大学电子与电气工程学院ROSE实验室)

专题命中 多模态评测 :multi-modal(abstract);分类 cs.AI

AI总结 本文提出Inception框架,通过注入怀疑提升LLM对视觉欺骗的抵御能力,实现可推广的真伪验证。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.19659 2025-11-25 cs.CV 57%

Bias in the Picture: Benchmarking VLMs with Social-Cue News Images and LLM-as-Judge Assessment

图像中的偏见:使用社会线索新闻图像和LLM作为裁判的基准测试

Aravind Narayanan, Vahid Reza Khazaie, Shaina Raza

机构 * Vector Institute for AI(向量人工智能研究院)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 本文通过社会线索新闻图像基准测试,揭示了VLMs在视觉上下文中存在系统性偏见,特别是性别和职业属性,指出高忠实度并不必然降低偏见,提出公平的多模态评估方法。

Comments Accepted to NeurIPS 2025 Workshop (Evaluating the Evolving LLM Lifecycle)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.23771 2025-11-25 cs.RO cs.AI 57%

Multi-Timescale Hierarchical Reinforcement Learning for Unified Behavior and Control of Autonomous Driving

多尺度分层强化学习用于自动驾驶的统一行为与控制

Guizhe Jin, Zhuoren Li, Bo Leng, Ran Yu, Lu Xiong, Chen Sun

机构 * School of Automotive Studies, Tongji University(同济大学汽车学院) Department of Data and Systems Engineering, University of Hong Kong(香港大学数据与系统工程系)

专题命中 多模态评测 :multimodal(abstract);分类 cs.AI

AI总结 本文提出多尺度分层强化学习方法,通过分层策略结构统一生成运动引导和控制指令,提升自动驾驶的效率、一致性和安全性。

Comments 8 pages, accepted for publication in IEEE Robotics and Automation Letters (RAL)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19341 2025-11-25 astro-ph.CO 50%

Systematic assessment of the Hubble tension via Bayesian jackknife testing

通过贝叶斯杰克逊检验系统评估哈勃张力

Thomas Hughes, Michael J. Wilensky, Philip Bull

专题命中 多模态评测 :multi-modal(abstract)

AI总结 通过贝叶斯杰克逊检验系统评估哈勃张力,发现无偏模型被否定,哈勃常数后验分布倾向68 km/s/Mpc

Comments 13 pages, 8 figures. For the busy reader: jump to figures 6 and 8

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.05709 2025-11-25 cs.IR cs.LG cs.MA 50%

G-UBS: Towards Robust Understanding of Implicit Feedback via Group-Aware User Behavior Simulation

G-UBS: 通过群体意识用户行为模拟实现隐式反馈的稳健理解

Boyu Chen, Siran Chen, Zhengrong Yue, Kainan Yan, Chenyun Yu, Beibei Kong, Cheng Lei, Chengxiang Zhuo, Zang Li, Yali Wang

专题命中 多模态评测 :multi-modal(abstract)

AI总结 G-UBS通过群体意识用户行为模拟方法,利用群体档案引导强化学习,提升隐式反馈理解的鲁棒性和深度。

Comments Accepted in AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2206.02340 2025-11-25 stat.ME cs.IT math.IT stat.ML 50%

Unifying Summary Statistic Selection for Approximate Bayesian Computation

统一的近似贝叶斯计算中总结统计量选择

Till Hoffmann, Jukka-Pekka Onnela

专题命中 多模态评测 :multi-modal(abstract)

AI总结 本文提出了一种统一的近似贝叶斯计算中总结统计量选择框架,通过最小化预期后验熵来获得信息性总结,适用于多种复杂模型。

Comments 34 pages, 6 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 多模态Agent 5 篇

2511.19417 2025-11-25 cs.CL cs.AI cs.LG 62%

Be My Eyes: Extending Large Language Models to New Modalities Through Multi-Agent Collaboration

Be My Eyes: 通过多智能体协作扩展大型语言模型到新模态

James Y. Huang, Sheng Zhang, Qianchu Liu, Guanghui Qin, Tinghui Zhu, Tristan Naumann, Muhao Chen, Hoifung Poon

机构 * University of Southern California(南加州大学) Microsoft Research(微软研究院) University of California, Davis(加州大学戴维斯分校)

专题命中 多模态Agent :multimodal(abstract);分类 cs.CL、cs.AI

AI总结 BeMyEyes通过多智能体协作扩展LLMs到多模态推理,利用高效VLMs与强大LLMs的互补优势,实现轻量级开源解决方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19046 2025-11-25 cs.CV cs.AI 62%

MedSAM3: Delving into Segment Anything with Medical Concepts

MedSAM3:深入探索医学概念中的分割任务

Anglin Liu, Rundong Xue, Xu R. Cao, Yifan Shen, Yi Lu, Xiang Li, Qianqian Chen, Jintai Chen

专题命中 多模态Agent :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 MedSAM3通过引入可文本提示的医学分割模型,实现了基于开放词汇文本描述的精准解剖结构分割,显著优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19430 2025-11-25 cs.CV 57%

Cook and Clean Together: Teaching Embodied Agents for Parallel Task Execution

烹饪与清洁同时进行:教授并行任务执行的具身智能体

Dingkang Liang, Cheng Zhang, Xiaopeng Xu, Jianzhong Ju, Zhenbo Luo, Xiang Bai

专题命中 多模态Agent :multi-modal(abstract);分类 cs.CV

AI总结 GRANT通过结合语言理解、3D定位和效率优化,实现并行任务调度,提升智能体在复杂环境中的任务执行效率。

Comments Accepted to AAAI 2026 (Oral). The code is available at \url{https://github.com/H-EmbodVis/GRANT}

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19033 2025-11-25 cs.CV 57%

ReEXplore: Improving MLLMs for Embodied Exploration with Contextualized Retrospective Experience Replay

ReEXplore: 通过上下文化回顾经验回放提升具身探索的MLLMs

Gengyuan Zhang, Mingcong Ding, Jingpei Wu, Ruotong Liao, Volker Tresp

机构 * LMU Munich(慕尼黑大学) Munich Center for Machine Learning(慕尼黑机器学习中心) TU Munich(慕尼黑技术大学)

专题命中 多模态Agent :MLLM(abstract);分类 cs.CV

AI总结 ReEXplore通过回顾经验回放和分层前沿选择,提升MLLMs在具身探索中的效率和性能。

Comments 8 main pages plus 13 pages Appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15253 2025-11-25 cs.HC cs.AI 57%

PresentCoach: Dual-Agent Presentation Coaching through Exemplars and Interactive Feedback

PresentCoach: 通过典范和交互反馈的双智能体演示指导

Sirui Chen, Jinsong Zhou, Xinli Xu, Xiaoyu Yang, Litao Guo, Ying-Cong Chen

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州))

专题命中 多模态Agent :multimodal(abstract);分类 cs.AI

AI总结 PresentCoach通过双智能体系统,结合典范和交互反馈,提供高效的演示技能指导,提升学习者在教育和专业领域的表现能力。

Comments 13pages,6figures

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 多模态训练与对齐 26 篇

2511.18875 2025-11-25 cs.CV cs.MM 84%

Parallel Vision Token Scheduling for Fast and Accurate Multimodal LMMs Inference

并行视觉令牌调度用于快速准确的多模态大语言模型推理

Wengyi Zhan, Mingbao Lin, Zhihang Lin, Rongrong Ji

机构 * Xiamen University(厦门大学) Rakuten Asia Pte. Ltd.(拉面亚洲有限公司) Xiamen University, China(厦门大学) Shanghai Innovation Institute, China(上海创新研究院)

专题命中 多模态训练与对齐 :multimodal(title,abstract);MLLM(abstract);分类 cs.CV、cs.MM

AI总结 ParVTS通过并行调度视觉令牌,高效减少多模态大语言模型推理的计算复杂度,实现高剪枝率与性能损失小的平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17927 2025-11-25 cs.CV cs.AI 84%

PA-FAS: Towards Interpretable and Generalizable Multimodal Face Anti-Spoofing via Path-Augmented Reinforcement Learning

PA-FAS: 向可解释和通用的多模态人脸反伪装迈进:通过路径增强强化学习

Yingjie Ma, Xun Lin, Yong Xu, Weicheng Xie, Zitong Yu

专题命中 多模态训练与对齐 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 PA-FAS通过路径增强强化学习提升多模态人脸反伪装的可解释性和泛化能力。

Comments Accepted by AAAI 2026 (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17596 2025-11-25 cs.CV cs.AI 84%

Reconstruction-Driven Multimodal Representation Learning for Automated Media Understanding

基于重建的多模态表示学习用于自动化媒体理解

Yassir Benhammou, Suman Kalyan, Sujay Kumar

专题命中 多模态训练与对齐 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出多模态自编码器MMAE,通过统一学习文本、音频和视觉数据的表示,实现广播内容的端到端自动化元数据提取与语义聚类,提升广播档案的可检索性与管理效率。

Comments 8 pages, 5 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17952 2025-11-25 cs.CV 83%

Multi-speaker Attention Alignment for Multimodal Social Interaction

多说话者注意力对齐用于多模态社交互动

Liangyang Ouyang, Yifei Huang, Mingfang Zhang, Caixin Kang, Ryosuke Furuta, Yoichi Sato

机构 * The University of Tokyo(东京大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV

AI总结 本文提出了一种多模态多说话者注意力对齐方法,通过动态头选择和自适应注意力偏差提升多模态社交互动理解能力,实现SOTA效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15122 2025-11-25 cs.IR cs.AI 83%

Multi-Aspect Cross-modal Quantization for Generative Recommendation

多方面跨模态量化用于生成性推荐

Fuwei Zhang, Xiaoyu Liu, Dongbo Xi, Jishen Yin, Huan Chen, Peng Yan, Fuzhen Zhuang, Zhao Zhang

专题命中 多模态训练与对齐 :cross-modal(title,abstract);multimodal(abstract);分类 cs.AI

AI总结 MACRec通过多方面跨模态量化方法,提升生成性推荐中多模态信息利用和语义ID学习的性能。

Comments Accepted by AAAI 2026 (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18824 2025-11-25 cs.CV cs.CL 81%

Assessing the alignment between infants' visual and linguistic experience using multimodal language models

利用多模态语言模型评估婴儿的视觉和语言经验一致性

Alvin Wei Ming Tan, Jane Yang, Tarun Sepuri, Khai Loong Aw, Robert Z. Sparks, Zi Yin, Virginia A. Marchman, Michael C. Frank, Bria Long

机构 * Department of Psychology, Stanford University(心理学系,斯坦福大学) Department of Psychology, University of California, San Diego(心理学系,加州大学圣地亚哥分校) Department of Psychology, Tsinghua University(心理学系,清华大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV、cs.CL

AI总结 基于多模态语言模型评估婴儿视觉与语言经验一致性,揭示日常学习中视觉与语言对齐的稀有性及跨儿童差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17965 2025-11-25 cs.CV cs.MM 81%

Signal: Selective Interaction and Global-local Alignment for Multi-Modal Object Re-Identification

信号:选择性交互与全局-局部对齐用于多模态对象重识别

Yangyang Liu, Yuhao Wang, Pingping Zhang

专题命中 多模态训练与对齐 :multi-modal(title,abstract);分类 cs.CV、cs.MM

AI总结 Signal通过选择性交互和全局-局部对齐框架提升多模态对象重识别的性能。

Comments Accepted by AAAI2026. More modifications may be performed

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.14169 2025-11-25 cs.CV cs.AI 81%

AdaTok: Adaptive Token Compression with Object-Aware Representations for Efficient Multimodal LLMs

AdaTok: 一种基于对象感知表示的自适应令牌压缩方法,用于高效多模态大语言模型

Xinliang Zhang, Lei Zhu, Hangzhou He, Shuang Zeng, Ourui Fu, Jiakui Hu, Zhengjian Yao, Yanye Lu

机构 * Institute of Medical Technology, Peking University Health Science Center(北京大学医学部医学技术研究所) Department of Biomedical Engineering, Peking University(北京大学生物医学工程系) National Biomedical Imaging Center, Peking University(北京大学国家生物医学成像中心)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 AdaTok通过自适应令牌压缩方法,利用对象感知表示提升多模态大语言模型的效率,实现高压缩比与高性能的平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15986 2025-11-25 cs.CV cs.CY cs.LG 80%

Fairness in Multi-modal Medical Diagnosis with Demonstration Selection

多模态医学诊断中的公平性与演示选择

Dawei Li, Zijian Gu, Peng Wang, Chuhan Song, Zhen Tan, Mohan Zhang, Tianlong Chen, Yu Tian, Song Wang

机构 * Arizona State University(亚利桑那州立大学) University of Rochester(罗切斯特大学) University of Virginia(弗吉尼亚大学) UCL(伦敦大学学院) University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校) University of Central Florida(佛罗里达中央大学)

专题命中 多模态训练与对齐 :multi-modal(title,comments);multimodal(abstract);分类 cs.CV

AI总结 本文提出FADS方法,通过基于聚类的采样提升多模态医学影像诊断的公平性,减少性别、种族和族裔相关差异,同时保持高准确性。

Comments 10 pages (including 2 pages of references), 4 figures. This work explores fairness in multi-modal medical image reasoning using in-context learning

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19023 2025-11-25 cs.LG cs.AI 79%

OrdMoE: Preference Alignment via Hierarchical Expert Group Ranking in Multimodal Mixture-of-Experts LLMs

OrdMoE:通过多模态混合专家模型中的层次专家小组排名实现偏好对齐

Yuting Gao, Weihao Chen, Lan Wang, Ruihan Xu, Qingpei Guo

机构 * AntGroup(蚂蚁集团) Peking University(北京大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.AI

AI总结 OrdMoE通过利用混合专家架构中的内在信号,实现多模态混合专家语言模型的零成本偏好对齐,无需人工标注数据即可提升模型对齐和性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18677 2025-11-25 cs.CV 79%

A Theory-Inspired Framework for Few-Shot Cross-Modal Sketch Person Re-Identification

基于理论的少样本跨模态素描人重识别框架

Yunpeng Gong, Yongjie Hou, Jiangming Shi, Kim Long Diep, Min Jiang

机构 * School of Informatics, Xiamen University(厦门大学信息学院) School of Electronic Science and Engineering, Xiamen University(厦门大学电子科学与技术学院) Institute of Artificial Intelligence, Xiamen University(厦门大学人工智能研究院) Department of Artificial Intelligence, Key Laboratory of Multimedia Trusted Perception and Efficient Computing, Ministry of Education of China, School of Informatics, Key Laboratory of Digital Protection and Intelligent Processing of Intangible CulturalHeritage of Fujian and Taiwan, Ministry of Culture and Tourism, Xiamen University(人工智能系,教育部多媒体可信感知与高效计算重点实验室,厦门大学信息学院,福建省和台湾非物质文化遗产数字化保护与智能处理重点实验室,文化和旅游部,厦门大学)

专题命中 多模态训练与对齐 :cross-modal(title,abstract);分类 cs.CV

AI总结 本文提出KTCAA框架,通过理论指导的对齐增强和知识转移催化剂,解决少样本跨模态素描人重识别中的模态差距和数据稀缺问题。

Comments Accepted by AAAI2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23206 2025-11-25 cs.CV 79%

HyperPointFormer: Multimodal Fusion in 3D Space with Dual-Branch Cross-Attention Transformers

HyperPointFormer: 在三维空间中通过双分支交叉注意力变换器实现多模态融合

Aldino Rizaldy, Richard Gloaguen, Fabian Ewald Fassnacht, Pedram Ghamisi

机构 * Helmholtz-Zentrum Dresden-Rossendorf (HZDR)(德累斯顿-罗斯托克亥姆霍尔茨研究中心) Freie Universität Berlin(柏林自由大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV

AI总结 HyperPointFormer通过双分支交叉注意力Transformer在三维空间中融合多模态数据,提升城市场景土地利用分类的精度与灵活性。

Journal ref IEEE Journal of Selected Topics in Applied Earth Observations and Remote Sensing, vol. 18, pp. 21254-21274, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.00728 2025-11-25 eess.IV cs.CV cs.LG 79%

MultiFusionNet: Multilayer Multimodal Fusion of Deep Neural Networks for Chest X-Ray Image Classification

MultiFusionNet:多层多模态融合的深度神经网络用于胸部X光图像分类

Saurabh Agarwal, K. V. Arya, Yogesh Kumar Meena

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV

AI总结 MultiFusionNet通过多层多模态融合和FDSFM模块提升胸部X光图像分类的准确率,达到97.21%和99.60%

Comments 19 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18424 2025-11-25 cs.CV 79%

CrossJEPA: Cross-Modal Joint-Embedding Predictive Architecture for Efficient 3D Representation Learning from 2D Images

跨模态联合嵌入预测架构CrossJEPA:用于从2D图像高效学习3D表示的架构

Avishka Perera, Kumal Hewagamage, Saeedha Nazar, Kavishka Abeywardana, Hasitha Gallella, Ranga Rodrigo, Mohamed Afham

机构 * University of Moratuwa(摩图瓦大学) Technische Universität Darmstadt(达姆施塔特技术大学)

专题命中 多模态训练与对齐 :cross-modal(title,abstract);分类 cs.CV

AI总结 CrossJEPA通过跨模态联合嵌入预测架构,利用图像基础模型知识,实现高效3D表示学习,达到SOTA性能,且训练高效、内存占用低。

Comments 24 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17904 2025-11-25 cs.CV cs.RO 79%

CUS-GS: A Compact Unified Structured Gaussian Splatting Framework for Multimodal Scene Representation

CUS-GS: 一种紧凑的统一结构高斯点扩散框架用于多模态场景表示

Yuhang Ming, Chenxin Fang, Xingyuan Yu, Fan Zhang, Weichen Dai, Wanzeng Kong, Guofeng Zhang

机构 * School of Computer Science, Hangzhou Dianzi University(杭州电子科技大学计算机科学学院) CAD & CG, Zhejiang University(浙江大学计算机辅助设计与图形学研究所) School of Computer Science, University of Bristol(布里斯托大学计算机科学学院)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV

AI总结 CUS-GS通过统一结构化高斯点扩散框架,实现多模态场景表示的高效建模与语义一致性。

Comments 15 pages, 8 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17587 2025-11-25 cs.LG cs.AI 79%

Emotion and Intention Guided Multi-Modal Learning for Sticker Response Selection

基于情感与意图引导的多模态学习用于贴纸响应选择

Yuxuan Hu, Jian Chen, Yuhao Wang, Zixuan Li, Jing Xiong, Pengyue Jia, Wei Wang, Chengming Li, Xiangyu Zhao

专题命中 多模态训练与对齐 :multi-modal(title,abstract);分类 cs.AI

AI总结 本文提出EIGML框架,通过联合建模情感与意图,提升贴纸响应选择的准确性和理解深度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18325 2025-11-25 q-bio.NC cs.LG 78%

Brain-MGF: Multimodal Graph Fusion Network for EEG-fMRI Brain Connectivity Analysis Under Psilocybin

Brain-MGF:多模态图融合网络用于psilocybin下EEG-fMRI脑连接分析

Sin-Yee Yap, Fuad Noman, Junn Yong Loo, Devon Stoliker, Moein Khajehnejad, Raphaël C. -W. Phan, David L. Dowe, Adeel Razi, Chee-Ming Ting

机构 * School of Information Technology, Monash University Malaysia(信息技术学院,墨尔本大学马来西亚分校) Department of Data Science and AI, Faculty of Information Technology, Monash University(数据科学与人工智能系,信息科技学院,墨尔本大学) Turner Institute for Brain and Mental Health, School of Psychological Sciences, Monash University(脑与心理健康研究所,心理学科学学院,墨尔本大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract)

AI总结 Brain-MGF通过多模态图融合网络实现psilocybin下EEG-fMRI脑连接分析,提升冥想和休息状态下的区分准确率与F1分数。

Comments 5 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12609 2025-11-25 cs.CL cs.AI cs.CV 75%

Uni-MoE-2.0-Omni: Scaling Language-Centric Omnimodal Large Model with Advanced MoE, Training and Data

Uni-MoE-2.0-Omni: 通过先进MoE、训练和数据扩展语言导向的多模态大模型

Yunxin Li, Xinyu Chen, Shenyuan Jiang, Haoyuan Shi, Zhenyu Liu, Xuanyu Zhang, Nanhao Deng, Zhenran Xu, Yicheng Ma, Meishan Zhang, Baotian Hu, Min Zhang

机构 * Research Institute of Computing and Intelligence(计算与智能研究 institute) Harbin Institute of Technology(哈尔滨工业大学)

专题命中 多模态训练与对齐 :multimodal(abstract);cross-modal(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 Uni-MoE-2.0-Omni通过先进MoE、训练和数据技术,实现了语言导向的多模态大模型,展现出在多模态理解、推理和生成任务中的卓越性能。

Comments 47 pages,10 Figures, Project Website: https://idealistxy.github.io/Uni-MoE-v2.github.io/ Codes: https://github.com/HITsz-TMG/Uni-MoE

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.01558 2025-11-25 cs.CV cs.AI 73%

VideoLights: Feature Refinement and Cross-Task Alignment Transformer for Joint Video Highlight Detection and Moment Retrieval

VideoLights: 用于联合视频亮点检测和时刻检索的特征细化与跨任务对齐变换器

Dhiman Paul, Md Rizwan Parvez, Nabeel Mohammed, Shafin Rahman

机构 * North South University(北南大学) Qatar Computing Research Institute (QCRI)(卡塔尔计算研究 institute)

专题命中 多模态训练与对齐 :multimodal(abstract);cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 VideoLights通过引入特征细化、跨模态融合和联合任务反馈机制,提升视频亮点检测与时刻检索的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏