arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2025-12-23 至 2025-12-23 共收录 89 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 图文多模态 11 篇

2512.18747 2025-12-23 cs.CV cs.AI 84%

IPCV: Information-Preserving Compression for MLLM Visual Encoders

IPCV:信息保留的多模态大语言模型视觉编码器压缩

Yuan Chen, Zichen Wen, Yuzhou Wu, Xuyang Liu, Shuang Chen, Junpeng Ma, Weijia Li, Conghui He, Linfeng Zhang

机构 * EPIC Lab, SJTU(上海交通大学EPIC实验室) CityU(城市大学) Shanghai AI Laboratory(上海人工智能实验室) University of Sheffield(谢菲尔德大学) SCU(上海科技大学) FDU(福建大学) SYSU(南方科技大学)

专题命中 图文多模态 :MLLM(title,abstract);multimodal(abstract);分类 cs.CV、cs.AI

AI总结 IPCV通过邻居引导重建和注意力稳定化技术,实现无需训练的多模态大语言模型视觉编码器高效压缩,有效降低计算成本并提升性能。

Comments 13 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18660 2025-12-23 cs.CV cs.LG cs.MM 84%

PMPGuard: Catching Pseudo-Matched Pairs in Remote Sensing Image-Text Retrieval

PMPGuard: 捕获遥感图像-文本检索中的伪匹配对

Pengxiang Ouyang, Qing Ma, Zheng Wang, Cong Bai

专题命中 图文多模态 :image-text(title,abstract);cross-modal(abstract);分类 cs.CV、cs.MM

AI总结 PMPGuard通过跨模态门控注意力和正负意识注意力机制,有效捕捉遥感图像-文本检索中的伪匹配对,提升跨模态对齐的鲁棒性和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.04939 2025-12-23 cs.CV 79%

Verb Mirage: Unveiling and Assessing Verb Concept Hallucinations in Multimodal Large Language Models

动词幻觉:揭示和评估多模态大语言模型中的动词概念幻觉

Zehao Wang, Xinpeng Liu, Yudonglin Zhang, Xiaoqian Wu, Zhou Fang, Yifan Fang, Junfu Pu, Cewu Lu, Yong-Lu Li

专题命中 图文多模态 :multimodal(title,abstract);分类 cs.CV

AI总结 本文首次揭示多模态大语言模型中的动词概念幻觉问题,并提出基于丰富动词知识的调优方法以有效缓解该问题。

Comments Accepted by AAAI-26

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.05491 2025-12-23 cs.CV cs.CR 77%

One Perturbation is Enough: On Generating Universal Adversarial Perturbations against Vision-Language Pre-training Models

一次扰动就足够:针对视觉-语言预训练模型生成通用对抗扰动

Hao Fang, Jiawei Kong, Wenbo Yu, Bin Chen, Jiawei Li, Hao Wu, Shutao Xia, Ke Xu

机构 * Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院,清华大学) Harbin Institute of Technology(哈尔滨工业大学)

专题命中 图文多模态 :multimodal(abstract);cross-modal(abstract);image-text(abstract);分类 cs.CV

AI总结 本文提出C-PGC方法,通过对比学习生成通用对抗扰动,攻击视觉-语言预训练模型的多模态对齐能力。

Comments Accepted by ICCV-2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.11496 2025-12-23 cs.CV cs.AI 76%

AndesVL Technical Report: An Efficient Mobile-side Multimodal Large Language Model

AndesVL 技术报告:一种高效的移动端多模态大语言模型

Zhiwei Jin, Xiaohui Song, Nan Wang, Yafei Liu, Chao Li, Xin Li, Ruichen Wang, Zhihao Li, Qi Qi, Long Cheng, Dongze Hao, Quanlong Zheng, Yanhao Zhang, Haobo Ji, Jian Ma, Zhitong Zheng, Zhenyi Lin, Haolin Deng, Xin Zou, Xiaojie Yin, Ruilin Wang, Liankai Cai, Haijing Liu, Yuqing Qiu, Ke Chen, Zixian Li, Chi Xie, Huafei Li, Chenxing Li, Chuangchuang Wang, Kai Tang, Zhiguang Zhu, Kai Tang, Wenmei Gao, Rui Wang, Jun Wu, Chao Liu, Qin Xie, Chen Chen, Haonan Lu

机构 * AndesVL Team(AndesVL团队) OPPO AI Center(OPPO人工智能中心)

专题命中 图文多模态 :multimodal(title);分类 cs.CV、cs.AI

AI总结 AndesVL 是一种高效的移动端多模态大语言模型,通过 1+N LoRA 架构和 QALFT 框架实现高效任务适应和模型压缩,部署在 MediaTek Dimensity 9500 芯片上,达到 6.7 倍解码加速和 30.9% 内存减少。

Comments Tech report of OPPO AndesVL Team

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19360 2025-12-23 cs.IR 71%

Generative vector search to improve pathology foundation models across multimodal vision-language tasks

生成向量搜索以提升多模态视觉-语言任务中的病理基础模型

Markus Ekvall, Ludvig Bergenstråhle, Patrick Truong, Ben Murrell, Joakim Lundeberg

专题命中 图文多模态 :multimodal(title)

AI总结 STHLM通过生成向量搜索方法提升多模态视觉-语言任务中病理基础模型的检索性能,实现10-30%的性能提升和10倍的维度压缩

Comments 13 pages main (54 total), 2 main figures (9 total)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.12715 2025-12-23 cs.CV cs.RO 70%

AsyMoE: Leveraging Modal Asymmetry for Enhanced Expert Specialization in Large Vision-Language Models

AsyMoE:利用模态不对称性提升大视觉-语言模型专家专业化

Heng Zhang, Haichuan Hu, Yaomin Shen, Weihao Yu, Yilei Yuan, Haochen You, Guo Cheng, Zijian Zhang, Lubin Gan, Huihui Wei, Hao Zhang, Jin Huang

专题命中 图文多模态 :multimodal(abstract);cross-modal(abstract);分类 cs.CV

AI总结 AsyMoE通过三个专门专家组解决视觉-语言模态不对称问题,提升大模型专家专业化性能。

Comments This submission has been withdrawn by the authors due to a fundamental error in the methodology that affects the validity of the main results

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20732 2025-12-23 cs.MM cs.CV 62%

Prompt-Aware Adaptive Elastic Weight Consolidation for Continual Learning in Medical Vision-Language Models

面向提示的自适应弹性权重固化用于医学视觉-语言模型的持续学习

Ziyuan Gao, Philippe Morel

机构 * University College London(伦敦大学学院)

专题命中 图文多模态 :cross-modal(abstract);分类 cs.CV、cs.MM

AI总结 PA-EWC通过提示引导的参数专门化,有效缓解医疗视觉-语言模型在持续学习中的灾难性遗忘问题,提升多模态医学任务的性能。

Comments Accepted by 32nd International Conference on MultiMedia Modeling (MMM 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19024 2025-12-23 cs.RO cs.AI 57%

IndoorUAV: Benchmarking Vision-Language UAV Navigation in Continuous Indoor Environments

IndoorUAV:在连续室内环境中进行视觉-语言无人机导航的基准测试

Xu Liu, Yu Liu, Hanshuo Qiu, Yang Qirong, Zhouhui Lian

专题命中 图文多模态 :multimodal(abstract);分类 cs.AI

AI总结 IndoorUAV通过构建室内无人机视觉-语言导航基准,结合多模态推理和任务分解,为长视距和短视距导航提供高质量数据与模型支持。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18028 2025-12-23 cs.RO cs.CV 57%

Embodied4C: Measuring What Matters for Embodied Vision-Language Navigation

Embodied4C: 评估具身视觉-语言导航中至关重要的因素

Tin Stribor Sohn, Maximilian Dillitzer, Jason J. Corso, Eric Sax

机构 * Karlsruhe Institute of Technology(卡尔斯鲁厄理工学院) UAS Esslingen(埃森嫩大学) TU Wien(维也纳技术大学) Dr. Ing. h.c. F. Porsche AG(保时捷股份有限公司) University of Michigan(密歇根大学) Voxel51 Inc.(Voxel51公司)

专题命中 图文多模态 :cross-modal(abstract);分类 cs.CV

AI总结 Embodied4C通过三种异构具身评估VLMs的具身能力,发现跨模态对齐和指令微调比规模更重要,而空间和时间推理是可靠具身能力的主要瓶颈。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01701 2025-12-23 cs.CV 57%

SSR: Semantic and Spatial Rectification for CLIP-based Weakly Supervised Segmentation

SSR:基于CLIP的弱监督分割的语义与空间校正

Xiuli Bi, Die Xiao, Junchao Fan, Bin Xiao

专题命中 图文多模态 :cross-modal(abstract);分类 cs.CV

AI总结 本文提出SSR方法,通过语义与空间校正提升CLIP在弱监督分割中的性能,实现更高的mIoU分数。

Comments Accepted in AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 音频语音多模态 4 篇

2512.18575 2025-12-23 cs.LG cs.AI cs.NE 83%

Modality-Dependent Memory Mechanisms in Cross-Modal Neuromorphic Computing

跨模态类脑计算中的模态依赖性记忆机制

Effiong Blessing, Chiung-Yi Tseng, Somshubhra Roy, Junaid Rehman, Isaac Nkrumah

机构 * 1 Department of Computer Science, Saint Louis University, St. Louis, MO, USA 2 Luxmuse AI, USA 3 Department of Electrical Computer Engineering, North Carolina State University, Raleigh, NC, USA 4 Independent Researcher 5 Department of Computer Science, Saint Louis University, St. Louis, MO, USA Email

专题命中 音频语音多模态 :cross-modal(title,abstract);multi-modal(abstract);分类 cs.AI

AI总结 本文首次探讨了跨模态类脑计算中记忆机制的模态依赖性,通过实验揭示了不同架构在视觉与听觉任务中的性能差异,并验证了并行架构在能效提升方面的优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19687 2025-12-23 cs.SD cs.CV cs.LG 79%

Pushing the Frontier of Audiovisual Perception with Large-Scale Multimodal Correspondence Learning

推动音频视觉感知前沿:大规模多模态对应学习

Apoorv Vyas, Heng-Jui Chang, Cheng-Fu Yang, Po-Yao Huang, Luya Gao, Julius Richter, Sanyuan Chen, Matt Le, Piotr Dollár, Christoph Feichtenhofer, Ann Lee, Wei-Ning Hsu

机构 * Meta Superintelligence Labs(Meta超级智能实验室)

专题命中 音频语音多模态 :multimodal(title);cross-modal(abstract);分类 cs.CV

AI总结 PE-AV通过大规模多模态对应学习提升音频视频理解,支持跨模态嵌入并实现语音检索等新任务,同时开发PE-A-Frame实现细粒度音频-文本对齐。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.12489 2025-12-23 eess.AS cs.AI cs.MM 67%

A Comprehensive Survey on Generative AI for Video-to-Music Generation

生成式AI在视频到音乐生成中的全面综述

Shulei Ji, Songruoyao Wu, Zihao Wang, Shuyu Li, Kejun Zhang

机构 * Zhejiang University(浙江大学) Innovation Center of Yangtze River Delta, Zhejiang University(长江三角洲创新中心) Carnegie Mellon University(卡内基梅隆大学)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.AI、cs.MM、eess.AS

AI总结 本文综述了生成式AI在视频到音乐生成中的关键技术和方法,分析了输入构造、条件机制和音乐生成框架,并总结了现有数据集和评估指标及面临的挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18772 2025-12-23 cs.CV 57%

In-Context Audio Control of Video Diffusion Transformers

上下文音频控制视频扩散变换器

Wenze Liu, Weicai Ye, Minghong Cai, Quande Liu, Xintao Wang, Xiangyu Yue

机构 * MMLab, The Chinese University of Hong Kong(香港中文大学MMLab) Kling Team, Kuaishou Technology(快手科技Kling团队)

专题命中 音频语音多模态 :audio-visual(abstract);分类 cs.CV

AI总结 本文提出ICAC框架,通过三维注意力机制实现音频驱动的视频生成,解决时间同步信号在视频扩散模型中的整合问题。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 视频多模态 11 篇

2512.18878 2025-12-23 cs.CV cs.AI 84%

CrashChat: A Multimodal Large Language Model for Multitask Traffic Crash Video Analysis

CrashChat: 一种多模态大语言模型用于多任务交通事故视频分析

Kaidi Liang, Ke Li, Xianbiao Hu, Ruwen Qin

机构 * Stony Brook University(石溪大学) The Pennsylvania State University(宾夕法尼亚州立大学)

专题命中 视频多模态 :multimodal(title,abstract);MLLM(abstract);分类 cs.CV、cs.AI

AI总结 CrashChat是一种多模态大语言模型,用于多任务交通事故视频分析,通过任务解耦和分组策略提升事故识别、定位等任务的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19528 2025-12-23 cs.CV 83%

Multi-Modal Soccer Scene Analysis with Masked Pre-Training

多模态足球场景分析与掩码预训练

Marc Peral, Guillem Capellera, Luis Ferraz, Antonio Rubio, Antonio Agudo

机构 * Institut de Robòtica i Informàtica Industrial, CSIC-UPC(机器人与信息技术研究所,CSIC-UPC)

专题命中 视频多模态 :multi-modal(title,abstract);cross-modal(abstract);分类 cs.CV

AI总结 本文提出了一种多模态架构,通过结合结构和视觉线索,有效推断足球场景中的球轨迹、状态和控制者,采用CropDrop策略提升模型鲁棒性。

Comments 10 pages, 2 figures. WACV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.07576 2025-12-23 cs.CV 83%

Super Encoding Network: Recursive Association of Multi-Modal Encoders for Video Understanding

超级编码网络:多模态编码器的递归关联用于视频理解

Boyu Chen, Siran Chen, Kunchang Li, Qinglin Xu, Yu Qiao, Yali Wang

机构 * Shenzhen Institute of Advanced Technology, Chinese Academy of Sciences(中国科学院深圳先进技术研究院) the School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) Shanghai AI Laboratory(上海人工智能实验室)

专题命中 视频多模态 :multi-modal(title);multimodal(abstract);multimodal foundation model(abstract);分类 cs.CV

AI总结 本文提出超级编码网络,通过递归关联多模态编码器提升视频理解性能,显著提升跟踪、识别、聊天和编辑等任务效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.13385 2025-12-23 cs.CV 79%

SNN-Driven Multimodal Human Action Recognition via Sparse Spatial-Temporal Data Fusion

基于稀疏时空数据融合的SNN驱动多模态人体动作识别

Naichuan Zheng, Hailun Xia, Zeyu Liang, Yuchen Du

机构 * School of Information and Communication Engineering, Beijing University of Posts and Telecommunications(信息与通信工程学院,北京邮电大学)

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出了一种基于SNN的多模态人体动作识别框架,通过稀疏时空数据融合提升识别准确率和能效。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.10200 2025-12-23 cs.CV 79%

LVAgent: Long Video Understanding by Multi-Round Dynamical Collaboration of MLLM Agents

LVAgent: 通过多轮动态协作的MLLM代理实现长视频理解

Boyu Chen, Zhengrong Yue, Siran Chen, Zikang Wang, Yang Liu, Peng Li, Yali Wang

机构 * Shenzhen Key Lab of Computer Vision and Pattern Recognition, Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences(深圳计算机视觉与模式识别重点实验室,深圳先进技术研究院,中国科学院) Institute for AI Industry Research (AIR), Tsinghua University, Beijing, China(人工智能产业研究院(AIR),清华大学,北京,中国) Dept. of Comp. Sci. & Tech., Institute for AI, Tsinghua University, Beijing, China(计算机科学与技术系,人工智能研究院,清华大学,北京,中国) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Shanghai Jiao Tong University(上海交通大学)

专题命中 视频多模态 :MLLM(title,abstract);分类 cs.CV

AI总结 LVAgent通过多轮动态协作的MLLM代理提升长视频理解性能,实现80%的准确率并在LongVideoBench上提升13.3%

Comments accepted in ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18318 2025-12-23 cs.MM cs.AI cs.CV cs.DC cs.NI 67%

Asynchronous Pipeline Parallelism for Real-Time Multilingual Lip Synchronization in Video Communication Systems

异步流水线并行用于实时多语言唇同步视频通信系统

Eren Caglar, Amirkia Rafiei Oskooei, Mehmet Kutanoglu, Mustafa Keles, Mehmet S. Aktas

机构 * Department of Data Science Big Data Yildiz Technical University Istanbul, Turkey Department of Computer Engineering Yildiz Technical University Istanbul, Turkey R\&D Center Aktif Investment Bank Inc. Istanbul, Turkey 3.5cm R\&D Center 3.5cm Aktif Investment Bank Inc. 3.5cm Istanbul, Turkey 3.5cm 0.25cm Department of Computer Engineering 0.25cm Yildiz Technical University 0.25cm Istanbul, Turkey 0.25cm

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.AI、cs.MM

AI总结 本文提出一种异步流水线并行的Transformer框架,用于实时多语言唇同步,通过模块化设计和优化技术提升处理速度与资源利用率。

Comments Accepted to IEEE Big Data 2025, AIDE4IoT Workshop. Copyright \c{opyright} 2025 IEEE

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19537 2025-12-23 cs.CL 57%

Event Extraction in Large Language Model

大规模语言模型中的事件提取

Bobo Li, Xudong Han, Jiang Liu, Yuzhe Ding, Liqiang Jing, Zhaoqi Zhang, Jinheng Li, Xinya Du, Fei Li, Meishan Zhang, Min Zhang, Aixin Sun, Philip S. Yu, Hao Fei

机构 * National University of Singapore(新加坡国立大学) University of Sussex(苏塞克斯大学) Wuhan University(武汉大学) University of Texas at Dallas(德克萨斯大学达拉斯分校) Nanyang Technological University(南洋理工大学) Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳)) University of Illinois at Chicago(伊利诺伊大学香槟分校)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CL

AI总结 本文探讨了大规模语言模型中事件提取的系统组件,提出通过事件方案、结构和存储提升事件处理的可靠性与智能体准备性。

Comments 38 pages, 9 Figures, 5 Tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19048 2025-12-23 cs.CV 57%

WaTeRFlow: Watermark Temporal Robustness via Flow Consistency

WaTeRFlow:通过流一致性实现水印时间鲁棒性

Utae Jeong, Sumin In, Hyunju Ryu, Jaewan Choi, Feng Yang, Jongheon Jeong, Seungryong Kim, Sangpil Kim

机构 * Korea University(韩国大学) Google DeepMind(谷歌DeepMind) KAIST AI(韩国科学技术院人工智能)

专题命中 视频多模态 :cross-modal(abstract);分类 cs.CV

AI总结 WaTeRFlow通过流一致性提升I2V场景下的水印鲁棒性,结合FUSE引擎、时间一致性损失和语义保持损失,实现跨模态水印恢复。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.24511 2025-12-23 cs.LG cs.AI 57%

Can Slow-thinking LLMs Reason Over Time? Empirical Studies in Time Series Forecasting

慢思考LLM能否在时间上进行推理?时间序列预测的实证研究

Mingyue Cheng, Jiahao Wang, Daoyu Wang, Xiaoyu Tao, Qi Liu, Enhong Chen

机构 * State Key Laboratory of Cognitive Intelligence, University of Science and Technology of China(认知智能国家重点实验室,中国科学技术大学)

专题命中 视频多模态 :multimodal(abstract);分类 cs.AI

AI总结 本文探讨慢思考LLM能否在时间序列预测中进行推理,通过实验证明其零样本预测能力,揭示LLM在时间动态上的潜力与局限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17020 2025-12-23 cs.CV 57%

CrossLMM: Decoupling Long Video Sequences from LMMs via Dual Cross-Attention Mechanisms

CrossLMM: 通过双交叉注意力机制解耦长视频序列与LMMs

Shilin Yan, Jiaming Han, Joey Tsai, Hongwei Xue, Rongyao Fang, Lingyi Hong, Ziyu Guo, Ray Zhang

机构 * Accio Team, Alibaba Group(阿里集团阿奇奥团队) CUHK MMLab(CUHK多模态实验室) Tsinghua University(清华大学)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 CrossLMM通过双交叉注意力机制解耦长视频序列,有效减少视觉token数量并保持性能,适用于多种视频多模态模型基准测试。

Comments Project page: https://github.com/shilinyan99/CrossLMM

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17958 2025-12-23 cs.RO cs.AI 57%

Real-Time Human-Robot Interaction Intent Detection Using RGB-based Pose and Emotion Cues with Cross-Camera Model Generalization

基于RGB姿态和情绪线索的实时人机交互意图检测及跨摄像头模型泛化

Farida Mohsen, Ali Safa

机构 * College of Science and Engineering, Hamad Bin Khalifa University(科学与工程学院,哈马德·本·卡西姆大学)

专题命中 视频多模态 :multimodal(abstract);分类 cs.AI

AI总结 本文提出了一种基于RGB姿态和情绪线索的实时人机交互意图检测方法,通过MINT-RVAE生成意图序列,实现跨摄像头和环境的强泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 跨模态检索 6 篇

2512.19663 2025-12-23 cs.CV cs.AI 90%

Beyond CLIP: Knowledge-Enhanced Multimodal Transformers for Cross-Modal Alignment in Diabetic Retinopathy Diagnosis

超越CLIP:基于知识的多模态Transformer用于糖尿病视网膜病变诊断中的跨模态对齐

Argha Kamal Samanta, Harshika Goyal, Vasudha Joshi, Tushar Mungle, Pabitra Mitra

机构 * Department of Medicine Stanford University Stanford, USA(医学系 斯坦福大学)

专题命中 跨模态检索 :multimodal(title,abstract);cross-modal(title,abstract);image-text(abstract);分类 cs.CV、cs.AI

AI总结 本文提出一种基于知识的多模态Transformer框架,通过整合视网膜图像、临床文本和结构化数据,提升糖尿病视网膜病变诊断中的跨模态对齐与检索性能。

Comments 14 pages, 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18987 2025-12-23 cs.RO cs.CL cs.CV 81%

Affordance RAG: Hierarchical Multimodal Retrieval with Affordance-Aware Embodied Memory for Mobile Manipulation

语义可感知的多模态检索:基于具身记忆的层次化移动操作

Ryosuke Korekata, Quanting Xie, Yonatan Bisk, Komei Sugiura

机构 * Keio University(keio大学) Keio AI Research Center(keio人工智能研究中心) Carnegie Mellon University(卡内基梅隆大学)

专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.CV、cs.CL

AI总结 本研究提出Affordance RAG框架,通过构建具有可操作性的具身记忆,提升机器人在开放词汇移动操作中的检索性能和任务成功率。

Comments Accepted to IEEE RA-L, with presentation at ICRA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.11712 2025-12-23 cs.AI 79%

Mitigating Hallucination Through Theory-Consistent Symmetric Multimodal Preference Optimization

通过理论一致的对称多模态偏好优化缓解幻觉

Wenqi Liu, Xuemeng Song, Jiaxi Li, Yinwei Wei, Na Zheng, Jianhua Yin, Liqiang Nie

机构 * Shandong University(山东大学) Southern University of Science and Technology(南方科技大学) University of Georgia(佐治亚大学) National University of Singapore(新加坡国立大学) Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳))

专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.AI

AI总结 SymMPO通过理论一致的对称多模态偏好优化方法,有效缓解多模态大语言模型中的幻觉问题。

Comments NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18853 2025-12-23 cs.CV cs.HC 57%

VizDefender: Unmasking Visualization Tampering through Proactive Localization and Intent Inference

VizDefender:通过主动定位和意图推断揭示可视化篡改

Sicheng Song, Yanjie Zhang, Zixin Chen, Huamin Qu, Changbo Wang, Chenhui Li

机构 * East China Normal University(华东师范大学) Hong Kong University of Science and Technology(香港科学与技术大学) School of Computer Science and Technology(计算机科学与技术学院)

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CV

AI总结 VizDefender通过半脆弱水印和意图分析模块,主动定位和推断可视化篡改,有效检测和分析数据篡改与视觉编码篡改。

Comments IEEE Transactions on Visualization and Computer Graphics (IEEE PacificVis'26 TVCG Track)

详情

展开后加载摘要…

URL PDF HTML 收藏