The USTC-NERCSLIP Systems for the CHiME-9 MCoRec Challenge
USTC-NERCSLIP系统参加CHiME-9 MCoRec挑战
专题命中 音频语音多模态 :multimodal(abstract);audio-visual(abstract);分类 eess.AS
AI总结 USTC-NERCSLIP系统通过多模态级联方法和LLM技术,在CHiME-9 MCoRec挑战中实现15.70%的联合ASR-聚类错误率。
AI 大模型
跨文本、图像、视频、音频等模态的大模型与学习方法。
USTC-NERCSLIP系统参加CHiME-9 MCoRec挑战
专题命中 音频语音多模态 :multimodal(abstract);audio-visual(abstract);分类 eess.AS
AI总结 USTC-NERCSLIP系统通过多模态级联方法和LLM技术,在CHiME-9 MCoRec挑战中实现15.70%的联合ASR-聚类错误率。
UniTalking: 一种统一的音频-视频框架用于说话肖像生成
机构 * Central Media Technology Institute, Huawei(华为中央媒体技术研究所) ; School of Computer Science and Engineering, Beihang University(北航计算机科学与工程学院)
专题命中 音频语音多模态 :multi-modal(abstract);分类 cs.CV、cs.MM
AI总结 UniTalking提出了一种统一的端到端扩散框架,用于生成高质量的语音和唇同步视频,通过多模态Transformer块和个性化语音克隆技术,提升了视觉保真度和训练效率。
Comments Accepted at CVPR 2026 (Findings Track)
UniCUE: 中国手语提示语音视频到语音生成统一识别与生成框架
机构 * HKUST-GZ(香港科技大学-珠海校区)
专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CV、eess.AS
AI总结 UniCUE提出首个统一框架,直接从CS视频生成语音,无需中间文本,通过整合姿态感知视觉处理器、语义对齐池和VisioPhonetic适配器,提升语音生成精度。
Comments 13 pages, 12 figures
Journal ref AAAI 2026 Oral
JALMBench: 对音频语言模型中越权攻击的基准测试
机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) ; State Key Laboratory of Internet Architecture, Tsinghua University(清华大学互联网架构国家重点实验室) ; University of North Texas(北卡罗来纳州立大学) ; University of Science and Technology of China(中国科学技术大学) ; Fujian Normal University(福建师范大学) ; Nanjing University of Aeronautics and Astronautics(南京航空航天大学)
专题命中 音频语音多模态 :cross-modal(abstract);分类 cs.AI、eess.AS
AI总结 JALMBench通过评估11,316个文本样本和245,355个音频样本,分析LALMs对越权攻击的安全性,揭示模态和架构对安全性的影响,强调需专门设计的防御方法。
大规模多模态基础模型:一种捕捉交互的专用专家混合框架
机构 * Johns Hopkins University(约翰霍普金斯大学) ; University of Texas at Austin(德克萨斯大学奥斯汀分校) ; Massachusetts Institute of Technology(麻省理工学院)
专题命中 视频多模态 :multimodal(title,abstract);multimodal foundation model(title);cross-modal(abstract)
AI总结 本文提出了一种大规模多模态基础模型框架,通过量化模态间的时间依赖性,改进混合专家路由机制,提升跨模态交互处理能力。
Comments Published at International Conference on Learning Representations (ICLR) 2026 as a conference paper. 28 pages, 16 figures, 10 tables
Vid-LLM:一种基于视频的紧凑型3D多模态大语言模型,具有重建-推理协同效应
机构 * School of Geodesy and Geomatics, Wuhan University(武汉大学测绘学院) ; Hubei Luojia Laboratory(湖北珞珈实验室) ; School of Architecture and Urban Planning, Shenzhen University(深圳大学建筑与城市规划学院)
专题命中 视频多模态 :multimodal(title,abstract);MLLM(abstract);分类 cs.CV、cs.AI
AI总结 Vid-LLM通过基于视频的紧凑型3D多模态大语言模型,实现了重建与推理的协同效应,提升了三维场景理解的性能和泛化能力。
向人类专家对齐多模态大语言模型:聚焦亲子互动
专题命中 视频多模态 :multimodal(title,abstract);MLLM(abstract);分类 cs.MM
AI总结 本文探讨了如何通过两阶段提示方法使多模态大语言模型更有效地对齐语言治疗师在分析亲子互动中的联合注意,揭示了观察层与判断层对齐的差异及挑战。
Comments Accepted at CHI 2026 Full Papers
VideoFusion: 一种用于多模态视频融合的时空协作网络
机构 * School of Robotics, Wuhan University, Wuhan, China(机器人学院,武汉大学,武汉,中国) ; Electronic Information School, Wuhan University, Wuhan, China(电子信息学院,武汉大学,武汉,中国) ; Southeast University, Nanjing, China(东南大学,南京,中国)
专题命中 视频多模态 :multi-modal(title,abstract);cross-modal(abstract);分类 cs.CV
AI总结 VideoFusion通过时空协作网络实现多模态视频融合,利用跨模态互补性和时间动态性提升视频一致性。
Comments Accepted to CVPR 2026. The dataset and code are available at https://github.com/Linfeng-Tang/VideoFusion
MLLM-4D: 向基于视觉的空间-时间智能迈进
机构 * University of Macau(澳门大学) ; Xi'an Jiaotong University(西安交通大学) ; The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) ; GVC Lab, Great Bay University(大湾大学GVC实验室)
专题命中 视频多模态 :MLLM(title,abstract);multimodal(abstract);分类 cs.CV
AI总结 MLLM-4D通过改进的数据筛选和训练策略,实现了从2D输入中强大的空间-时间理解和推理能力。
Trident:异构多模态数据流水线的自适应调度
专题命中 视频多模态 :multimodal(title,abstract);multimodal foundation model(abstract)
AI总结 Trident通过自适应调度框架提升异构多模态数据流水线的吞吐量,优化资源分配与配置转换,降低内存不足风险。
Comments 22 pages, 3 figures
超越单一模态分析:一种整合异构LLM查询系统的框架用于多模态数据
机构 * University of Hawaii at Manoa(夏威夷大学曼纳oa分校) ; University of Florida(佛罗里达大学)
专题命中 视频多模态 :multi-modal(title,abstract);分类 cs.AI
AI总结 本文提出Meta Engine,一种整合异构LLM查询系统的框架,通过统一的语义查询引擎提升多模态数据处理性能。
UME-R1: 探索基于推理的生成多模态嵌入
机构 * School of Informatics, Xiamen University, China(厦门大学信息学院) ; WeChat AI, Tencent Inc, China(腾讯公司微信AI部门) ; Key Laboratory of Digital Protection and Intelligent Processing of Intangible Cultural Heritage of Fujian and Taiwan (Xiamen University), Ministry of Culture and Tourism, China(福建省和台湾非物质文化遗产数字化保护与智能处理重点实验室) ; Shanghai Artificial Intelligence Laboratory, China(上海人工智能实验室)
专题命中 视频多模态 :multimodal(title,abstract);分类 cs.AI
AI总结 UME-R1通过生成嵌入和强化学习提升多模态嵌入性能,实现判别与生成嵌入的互补,展现生成嵌入在推理和下游任务中的优势。
Comments Accepted by ICLR 2026
EchoMimicV3:13亿参数足矣实现统一的多模态和多任务人类动画
机构 * Terminal Technology Department, Alipay, Ant Group(蚂蚁集团支付宝终端技术部)
专题命中 视频多模态 :multi-modal(title,abstract);分类 cs.CV
AI总结 EchoMimicV3通过统一多任务和多模态人类动画,以13亿参数实现高效且稳定的多任务和多模态动画生成。
从预训练视频模型中学习物理:一种多模态连续和序列世界交互模型用于机器人操作
机构 * Sun Yat-sen University(中山大学) ; Guangdong Key Laboratory of Big Data Analysis(广东大数据分析与处理重点实验室) ; X-Era AI Lab(X-Era人工智能实验室) ; Guangdong University of Technology(广东工业大学)
专题命中 视频多模态 :multimodal(title,abstract)
AI总结 PhysGen通过预训练视频模型学习物理知识,实现机器人操作的连续和序列世界交互,优于现有基线方法。
Comments 11 pages, 6 figures
FoSS:通过傅里叶状态空间整合建模长距离依赖性和多模态不确定性在轨迹预测中
机构 * Brunel University of London(伦敦布鲁内尔大学) ; University of Birmingham(伯明翰大学)
专题命中 视频多模态 :multimodal(title);分类 cs.CV
AI总结 FoSS通过结合频域和时域建模,有效提升轨迹预测的准确性和效率,减少计算与参数消耗,实现多模态不确定性建模。
Comments Accepted by CVPR 2026
统一语言-动作理解与生成以实现自动驾驶
机构 * State Key Lab of CAD&CG, Zhejiang University(浙江大学计算机辅助设计与图形学国家重点实验室) ; Li Auto
专题命中 视频多模态 :multi-modal(abstract);cross-modal(abstract);分类 cs.CV
AI总结 LinkVLA通过统一语言和动作令牌及两步生成方法,提升自动驾驶中语言-动作一致性和效率
MVR:多视图视频奖励塑造用于强化学习
机构 * School of Intelligence Science and Technology, Peking University(北京大学智能科学与技术学院) ; State Key Laboratory of General Artificial Intelligence, BIGAI(通用人工智能国家重点实验室)
专题命中 视频多模态 :image-text(abstract);分类 cs.CV、cs.AI
AI总结 MVR通过多视角视频和视觉语言模型提升强化学习中的奖励塑造,有效解决复杂动态任务中的状态相关性和视角偏见问题。
Comments ICLR 2026
TripleSumm: 适应性三模态融合用于视频摘要
机构 * Seoul National University(首尔国立大学)
专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.AI
AI总结 TripleSumm通过适应性三模态融合技术,在视频摘要任务中实现了最先进的性能,首次提出了多模态视频摘要的大型基准MoSu。
Comments Published as a Conference Paper at ICLR 2026
第一人称共驾:面向辅助第一人称AI的网页原生智能眼镜代理
机构 * Shenzhen International Graduate School Tsinghua University Shenzhen China(深圳国际研究生院清华大学深圳中国) ; Independent Researcher London United Kingdom(独立研究者伦敦英国) ; Queen Mary University of London London United Kingdom(女王玛丽大学伦敦英国) ; Imperial College London London United Kingdom(帝国理工学院伦敦英国) ; University Of Surrey Guildford United Kingdom(Surrey大学Guildford英国)
专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.AI
AI总结 Egocentric Co-Pilot通过网页原生智能眼镜代理实现第一人称AI的持续辅助,结合神经符号框架和多模态意图层,展示了在日常生活中提升可及性和情境感知的实用路径。
Comments 14 pages, 6 figures, WWW 2026
MealRec: 基于分层扩散模型的多粒度序列建模用于微视频推荐
机构 * National University of Defense Technology(国防科技大学) ; National University of Singapore(新加坡国立大学)
专题命中 视频多模态 :multimodal(abstract);分类 cs.CV
AI总结 MealRec通过分层扩散模型实现多粒度序列建模,解决微视频推荐中的偏好无关表示和模态冲突问题,提升推荐效果。
LEAR: 为事件到LiDAR定位学习边缘感知表示
机构 * Institute of Visual Computing, Graz University of Technology(视觉计算研究所,技术大学格拉茨) ; School of Artificial Intelligence and Robotics, Hunan University(人工智能与机器人学院,湖南大学)
专题命中 视频多模态 :cross-modal(abstract);分类 cs.CV
AI总结 LEAR通过联合估计边缘结构和密集事件深度流场,解决事件与LiDAR对齐难题,提升GPS受限环境下的定位精度。
无需训练的时空解耦推理视频分割与自适应对象记忆
专题命中 视频多模态 :multimodal(abstract);分类 cs.CV
AI总结 本文提出无需训练的时空解耦推理视频分割方法SDAM,通过自适应对象记忆模块和时空解耦技术实现稳定的时间传播,优于现有微调方法。
Comments Accept by AAAI2026
基于非对称事件-SVE相机系统的高动态范围成像
机构 * College of Aerospace Science and Engineering(航空航天科学与工程学院) ; National University of Defense Technology(国防科技大学) ; Hunan Provincial Key Laboratory of Image Measurement and Vision Navigation(湖南省图像测量与视觉导航重点实验室)
专题命中 视频多模态 :cross-modal(abstract);分类 cs.CV
AI总结 本文提出了一种基于非对称事件-SVE相机系统的高动态范围成像系统,通过跨模态对齐和计算融合技术提升高动态场景下的成像性能。
Comments This paper has been accepted by Optics Express
数字与机器人双胞胎用于近距操作与编队飞行的验证
机构 * Stanford University(斯坦福大学)
专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV
AI总结 本文提出了一种混合双胞胎框架,用于验证航天器GNC系统在近距操作和编队飞行中的性能。
Journal ref 2026 Rocky Mountain AAS GN&C Conference, Breckenridge, Colorado
超越全局相似性:面向细粒度、多条件多模态检索
机构 * Shanghai Jiao Tong University(上海交通大学) ; Institute of Digital Twin, Eastern Institute of Technology(数字孪生研究院,东部技术研究所) ; Ningbo Key Laboratory of Spatial Intelligence and Digital Derivative(宁波空间智能与数字衍生关键实验室)
专题命中 跨模态检索 :multimodal(title,abstract);MLLM(abstract);cross-modal(abstract);分类 cs.CV
AI总结 MCMR提出一个多条件多模态检索基准,通过细粒度多模态检索评估模型在复杂查询中的条件感知推理能力。
Comments Accepted by CVPR 2026
伪对比学习用于多模态模型中的图表理解
机构 * The Japan Research Institute, Limited(日本研究机构有限公司)
专题命中 跨模态检索 :multimodal(title,abstract);image-text(abstract);分类 cs.CV、cs.AI
AI总结 本文提出伪对比学习方法,通过生成合成图表增强多模态模型对图表的理解能力,实验表明在图像-文本匹配和视觉问答任务中优于传统CLIP方法。
Comments 9 pages, 3 figures
视觉标记究竟编码了什么?揭示多模态大语言模型中的稀疏性与冗余性
机构 * Institute of Digital Twin, Eastern Institute of Technology(数字孪生研究所,东部技术研究所) ; Ningbo Key Laboratory of Spatial Intelligence and Digital Derivative(宁波空间智能与数字衍生关键实验室) ; Shanghai Jiao Tong University(上海交通大学) ; The Hong Kong Polytechnic University(香港理工大学)
专题命中 跨模态检索 :multimodal(title,abstract);MLLM(abstract);分类 cs.CV、cs.AI
AI总结 本研究揭示多模态大语言模型中视觉标记的稀疏性与冗余性,通过EmbedLens工具发现活跃标记在进入模型前已编码细粒度信息,并提出中层注入方法提升效率。
Comments Accepted by CVPR2026
元数据中的隐藏攻击:多模态检索增强生成中的隐秘污染攻击
机构 * The City University of New York, CSI, Staten Island, NY 10314, USA(纽约城市大学,CSI,史泰登岛分校) ; The City University of New York, Graduate Center, New York, NY 10016, USA(纽约城市大学研究生中心)
专题命中 跨模态检索 :multimodal(title,abstract);image-text(abstract);分类 cs.AI
AI总结 本研究提出MM-MEPA,一种通过操纵多模态检索条目元数据来影响模型响应的隐秘污染攻击,展示了其在多模态RAG系统中的高攻击成功率和防御不足问题。
鲁棒适应大规模多模态模型用于检索增强的仇恨表情包检测
机构 * Department of Engineering University of Cambridge(工程系剑桥大学)
专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.CV、cs.CL、cs.AI
AI总结 本文提出了一种鲁棒适应框架,用于提升大规模多模态模型在检索增强的仇恨表情包检测中的性能与泛化能力,同时提高模型的可解释性。
Comments EMNLP 2025 Main (Oral)
通过3D高斯点云增强的多模态检索增强生成实现零样本机器人操作
专题命中 跨模态检索 :multimodal(title,abstract);MLLM(abstract)
AI总结 本文提出RobMRAG框架,通过3D高斯点云增强多模态检索增强生成,提升零样本机器人操作的泛化能力和可解释性。
Comments 9 pages, 5 figures