arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-02-27 至 2026-02-27 共收录 59 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 图文多模态 9 篇

2602.22678 2026-02-27 cs.CV cs.AI 84%

ViCLIP-OT: The First Foundation Vision-Language Model for Vietnamese Image-Text Retrieval with Optimal Transport

ViCLIP-OT:首个面向越南语图像-文本检索的视觉-语言基础模型,结合最优传输

Quoc-Khang Tran, Minh-Thien Nguyen, Nguyen-Khang Pham

机构 * Can Tho University(金兰大学)

专题命中 图文多模态 :image-text(title,abstract);cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 ViCLIP-OT通过整合CLIP对比学习与SIGROT损失,提升越南语图像-文本检索性能,实现域内和零样本设置下的显著改进。

Comments Preprint submitted to Expert Systems with Applications

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23229 2026-02-27 cs.CV 79%

Large Multimodal Models as General In-Context Classifiers

大多模态模型作为通用上下文分类器

Marco Garosi, Matteo Farina, Alessandro Conti, Massimiliano Mancini, Elisa Ricci

专题命中 图文多模态 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出CIRCLE方法,通过伪标签迭代优化,使LMM在开放世界分类中超越VLM,展示LMM作为统一分类器的潜力。

Comments CVPR Findings 2026. Project website at https://circle-lmm.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22734 2026-02-27 cs.CV 79%

Asymmetric Idiosyncrasies in Multimodal Models

多模态模型中的非对称个性化特征

Muzi Tao, Chufan Shi, Huijuan Wang, Shengbang Tong, Xuezhe Ma

机构 * University of Southern California(南加州大学) New York University(纽约大学)

专题命中 图文多模态 :multimodal(title);cross-modal(abstract);分类 cs.CV

AI总结 本文研究了多模态模型中描述模型的个性化特征及其对文本到图像模型的影响,发现生成图像丢失了描述中的关键变化,提出了一种新的量化方法。

Comments Project page: https://muzi-tao.github.io/asymmetric-idiosyncrasies/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22644 2026-02-27 cs.CV 79%

Plug, Play, and Fortify: A Low-Cost Module for Robust Multimodal Image Understanding Models

插件、即插即用并加固:一种低成本模块用于鲁棒多模态图像理解模型

Siqi Lu, Wanying Xu, Yongbin Zheng, Wenting Luan, Peng Sun, Jianhang Yao

机构 * National University of Defense Technology(国防科技大学)

专题命中 图文多模态 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出了一种低成本模块,通过频域分析解决多模态模型中缺失模态导致的性能问题,提升模型鲁棒性和整体学习效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11221 2026-02-27 cs.CL 79%

The Automatic Verification of Image-Text Claims (AVerImaTeC) Shared Task

图像-文本主张的自动验证(AVerImaTeC)共享任务

Rui Cao, Zhenyun Deng, Yulong Chen, Michael Schlichtkrull, Andreas Vlachos

专题命中 图文多模态 :image-text(title,abstract);分类 cs.CL

AI总结 本文提出图像-文本主张自动验证共享任务,通过检索证据和验证真实主张,评估系统性能并展示最佳结果。

Comments Shared Task Overview and Summary for the Ninth FEVER Workshop, Co-located at EACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.20570 2026-02-27 cs.CV cs.AI 62%

Dyslexify: A Mechanistic Defense Against Typographic Attacks in CLIP

Dyslexify: 一种针对CLIP中印刷攻击的机制性防御

Lorenz Hufe, Constantin Venhoff, Erblina Purelku, Maximilian Dreyer, Sebastian Lapuschkin, Wojciech Samek

机构 * Fraunhofer Heinrich Hertz Institute(弗劳恩霍夫海因里希·赫兹研究所) University of Oxford(牛津大学) Technological University Dublin(都柏林技术大学) Technische Universität Berlin(柏林技术大学)

专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV、cs.AI

AI总结 Dyslexify通过消融CLIP中的印刷电路,有效防御印刷攻击,提升性能并保持应用安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.05435 2026-02-27 eess.AS cs.AI cs.LG 62%

Unbiased Sliced Wasserstein Kernels for High-Quality Audio Captioning

无偏切片Wasserstein核用于高质量音频描述生成

Manh Luong, Khai Nguyen, Dinh Phung, Gholamreza Haffari, Lizhen Qu

机构 * Monash University(墨尔本大学) University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 图文多模态 :cross-modal(abstract);分类 cs.AI、eess.AS

AI总结 本文提出无偏切片Wasserstein核,通过保留模态间时间信息,提升音频描述质量及推理能力。

Journal ref Manh Luong. (2025). Unbiased Sliced Wasserstein Kernels for High-Quality Audio Captioning. In Advances in Neural Information Processing Systems 38 (NeurIPS 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18897 2026-02-27 cs.CV 57%

Thinking Beyond Labels: Vocabulary-Free Fine-Grained Recognition using Reasoning-Augmented LMMs

超越标签:基于推理增强的LMMs的无词汇细粒度识别

Dmitry Demidov, Zaigham Zaheer, Zongyan Han, Omkar Thawakar, Rao Anwer

机构 * Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)

专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV

AI总结 FiNDR通过推理增强的LMMs实现无词汇细粒度识别,提出三步流程生成候选标签、过滤排名并构建轻量级分类器,取得显著性能提升。

Journal ref CVPR 2026 (main conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05535 2026-02-27 cs.LG 50%

Detecting Misbehaviors of Large Vision-Language Models by Evidential Uncertainty Quantification

通过证据不确定性量化检测大视觉-语言模型的误行

Tao Huang, Rui Wang, Xiaofei Liu, Yi Qin, Li Duan, Liping Jing

机构 * State Key Laboratory of Advanced Rail Autonomous Operation(先进轨道交通自主运行国家重点实验室) Beijing Key Laboratory of Traffic Data Mining and Embodied Intelligence(北京交通数据挖掘与具身智能重点实验室) School of Computer Science and Technology, Beijing Jiaotong University(北京交通大学计算机科学与技术学院) School of Automation and Intelligence, Beijing Jiaotong University(北京交通大学自动化与智能学院) Beijing Key Laboratory of Security and Privacy in Intelligent Transportation(北京智能交通安全与隐私重点实验室)

专题命中 图文多模态 :multimodal(abstract)

AI总结 通过证据不确定性量化检测大视觉-语言模型的误行,识别内部冲突和无知以提高模型可靠性。

Comments Accepted to ICLR 2026. Code is available at https://github.com/HT86159/EUQ

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 音频语音多模态 4 篇

2602.22659 2026-02-27 cs.CV cs.MM 84%

Scaling Audio-Visual Quality Assessment Dataset via Crowdsourcing

通过众包扩大音频-视觉质量评估数据集

Renyu Yang, Jian Jin, Lili Meng, Meiqin Liu, Yilin Wang, Balu Adsumilli, Weisi Lin

机构 * College of Computing and Data Science, Nanyang Technological University(计算与数据科学学院,南洋理工大学) School of Information Science and Engineering, Shandong Normal University(信息科学与工程学院,山东师范大学) Institute of Information Science, Beijing Jiao Tong University(信息科学研究院,北京交通大学) YouTube Media Algorithms team, Google Inc.(YouTube媒体算法团队,谷歌公司)

专题命中 音频语音多模态 :audio-visual(title,abstract);multimodal(abstract);分类 cs.CV、cs.MM

AI总结 本文提出了一种通过众包扩大音频-视觉质量评估数据集的方法,通过设计实验框架、系统化数据准备和扩展标注,构建了最大的多样化AVQA数据集,用于多模态感知研究。

Comments Accepted to ICASSP 2026. 5 pages (main paper) + 8 pages (supplementary material)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15340 2026-02-27 cs.CV 70%

Towards Seamless Interaction: Causal Turn-Level Modeling of Interactive 3D Conversational Head Dynamics

迈向无缝交互:交互式3D对话头部动力学的因果回合级建模

Junjie Chen, Fei Wang, Zhihao Huang, Qing Zhou, Kun Li, Dan Guo, Linfeng Zhang, Xun Yang

机构 * HFUT(合肥工业大学) IAI, Hefei Comprehensive National Science Center(人工智能研究院,合肥综合性国家科学中心) USTC(中国科学技术大学) SJTU(上海交通大学) TeleAI, China Telecom(TeleAI,中国电信) NWPU(西北工业大学) UAEU(阿联酋大学) AHPU(安徽大学)

专题命中 音频语音多模态 :multimodal(abstract);audio-visual(abstract);分类 cs.CV

AI总结 TIMAR通过因果回合级建模,实现了交互式3D对话头部动态的高效生成,提升了对话的表达性和时序一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.05115 2026-02-27 cs.GR cs.CV cs.SD eess.AS 62%

RAP: Real-time Audio-driven Portrait Animation with Video Diffusion Transformer

RAP: 基于音频的实时人物动画与视频扩散变换器

Fangyu Du, Taiqing Li, Qian Qiao, Tan Yu, Ziwei Zhang, Dingcheng Zhen, Xu Jia, Yang Yang, Shunshun Yin, Siyuan Liu

专题命中 音频语音多模态 :audio-visual(abstract);分类 cs.CV、eess.AS

AI总结 RAP通过混合注意力机制和静态-动态训练-推理范式,在实时约束下实现高质量音频驱动人物动画,提升音频-视觉同步与视觉保真度。

Comments 11 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23266 2026-02-27 cs.CL 57%

Discourse-Aware Dual-Track Streaming Response for Low-Latency Spoken Dialogue Systems

面向 discourse 的双轨流式响应用于低延迟语音对话系统

Siyuan Liu, Jiahui Xu, Feng Jiang, Kuang Wang, Zefeng Zhao, Chu-Ren Huang, Jinghang Gu, Changqing Yin, Haizhou Li

机构 * School of Computer Science and Technology, Tongji University(同济大学计算机科学与技术学院) Department of Language Science and Technology, Hong Kong Polytechnic University(香港理工大学语言科学与技术系) Artificial Intelligence Research Institute, Shenzhen University of Advanced Technology(深圳先进技术大学人工智能研究院) School of Data Science, Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)数据科学学院) School of Artificial Intelligence, Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)人工智能学院)

专题命中 音频语音多模态 :cross-modal(abstract);分类 cs.CL

AI总结 DDTSR 提出了一种低延迟语音对话系统框架,通过双轨流式响应机制实现听中思考和说中思考,显著降低响应延迟并保持 discourse 质量。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 视频多模态 11 篇

2602.22932 2026-02-27 cs.CV 83%

MSJoE: Jointly Evolving MLLM and Sampler for Efficient Long-Form Video Understanding

MSJoE:联合进化多模态大语言模型与采样器以实现高效的长视频理解

Wenhui Tan, Xiaoyi Yu, Jiaze Li, Yijing Chen, Jianzhong Ju, Zhenbo Luo, Ruihua Song, Jian Luan

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学北京校区人工智能学院) Tongji University(同济大学) MiLM Plus, Xiaomi Inc.(小米公司MiLM Plus)

专题命中 视频多模态 :MLLM(title,abstract);multimodal(abstract);分类 cs.CV

AI总结 MSJoE通过联合进化多模态大语言模型与轻量级采样器,提升长视频理解效率,实验表明其在多个基准测试中表现优异。

Comments Accepted by CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22299 2026-02-27 cs.MM cs.AI cs.CL cs.LG 82%

Decoding the Hook: A Multimodal LLM Framework for Analyzing the Hooking Period of Video Ads

解码钩子:一种多模态大语言模型框架用于分析视频广告的钩子阶段

Kunpeng Zhang, Poppy Zhang, Shawndra Hill, Amel Awadelkarim

机构 * University of Marland, College Park(马里兰大学 College Park分校) Meta Platforms, Inc.(Meta平台公司)

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CL、cs.AI、cs.MM

AI总结 本研究提出一种多模态大语言模型框架,用于分析视频广告的钩子阶段,通过多策略采样和主题提炼提升广告初期效果分析的准确性与实用性。

Comments 11 pages, 5 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22920 2026-02-27 cs.CV 79%

OSDaR-AR: Enhancing Railway Perception Datasets via Multi-modal Augmented Reality

OSDaR-AR: 通过多模态增强现实提升铁路感知数据集

Federico Nesti, Gianluca D'Amico, Mauro Marinoni, Giorgio Buttazzo

机构 * Department of Excellence in Robotics & AI, Scuola Superiore Sant’Anna(机器人与人工智能卓越部门,圣安娜高等学院) Simulatrix MV srl(Simulatrix MV公司)

专题命中 视频多模态 :multi-modal(title,abstract);分类 cs.CV

AI总结 本文提出OSDaR-AR数据集,通过多模态增强现实技术整合逼真虚拟对象,提升铁路感知任务的数据质量与真实性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22923 2026-02-27 cs.CV cs.RO 74%

WaterVideoQA: ASV-Centric Perception and Rule-Compliant Reasoning via Multi-Modal Agents

WaterVideoQA: 以ASV为中心的感知与符合规则的推理 via 多模态智能体

Runwei Guan, Shaofeng Liang, Ningwei Ouyang, Weichen Fei, Shanliang Yao, Wei Dai, Chenhao Ge, Penglei Sun, Xiaohui Zhu, Tao Huang, Ryan Wen Liu, Hui Xiong

机构 * Thrust of Artificial Intelligence, The Hong Kong University of Science and Technology (Guangzhou)(香港理工大学(广州)人工智能研究所) Hubei Key Laboratory of Inland Shipping Technology (Wuhan University of Technology)(湖北内河航运技术重点实验室(武汉理工大学)) School of Navigation, Wuhan University of Technology(武汉理工大学航海学院) School of Advanced Technology, Xi’an Jiaotong-Liverpool University(西安交通大学利物浦大学先进科技学院) School of Artificial Intelligence, Nanjing University(南京大学人工智能学院) School of Information Engineering, Yancheng Institute of Technology(盐城职业技术学院信息工程学院) School of Engineering, Stanford University(斯坦福大学工程学院) Centre for AI and Data Science Innovation and the School of Science and Engineering, James Cook University(詹姆斯库克大学人工智能与数据科学创新中心及科学与工程学院)

专题命中 视频多模态 :multi-modal(title);分类 cs.CV

AI总结 WaterVideoQA通过多模态智能体系统,实现ASV在复杂水域环境中的感知与规则合规推理,提升自主航行的安全性和精确性。

Comments 11 pages,8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08683 2026-02-27 cs.CV 74%

OneVision-Encoder: Codec-Aligned Sparsity as a Foundational Principle for Multimodal Intelligence

OneVision-Encoder: 编码对齐的稀疏性作为多模态智能的基础原则

Feilong Tang, Xiang An, Yunyao Yan, Yin Xie, Bin Qin, Kaicheng Yang, Yifei Shen, Yuanhan Zhang, Chunyuan Li, Shikun Feng, Changrui Chen, Huajie Tan, Ming Hu, Manyuan Zhang, Bo Li, Ziyong Feng, Ziwei Liu, Zongyuan Ge, Jiankang Deng

机构 * Glint Lab(Glint实验室) AIM for Health Lab(健康人工智能实验室) MVP Lab(MVP实验室)

专题命中 视频多模态 :multimodal(title);分类 cs.CV

AI总结 OneVision-Encoder通过编码对齐的稀疏性原则,实现高效的多模态视觉理解。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23152 2026-02-27 cs.AI 57%

The Trinity of Consistency as a Defining Principle for General World Models

一致性三元组作为一般世界模型的定义原则

Jingxuan Wei, Siyuan Li, Yuhang Xu, Zheng Sun, Junjie Jiang, Hexuan Jin, Caijun Jia, Honghao He, Xinglong Xu, Xi bai, Chang Yu, Yumou Liu, Junnan Zhu, Xuanhe Zhou, Jintao Chen, Xiaobin Hu, Shancheng Pang, Bihui Yu, Ran He, Zhen Lei, Stan Z. Li, Conghui He, Shuicheng Yan, Cheng Tan

专题命中 视频多模态 :multimodal(abstract);分类 cs.AI

AI总结 本文提出一致性三元组作为定义通用世界模型的原则,通过系统回顾多模态学习的演变,引入CoW-Bench基准测试,明确未来发展方向。

Comments 119 pages, 50 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23141 2026-02-27 cs.CV 57%

No Labels, No Look-Ahead: Unsupervised Online Video Stabilization with Classical Priors

无标签、无前瞻:基于经典先验的无监督在线视频稳定化

Tao Liu, Gang Wan, Kan Ren, Shibo Wen

机构 * School of Electronic and Optical Engineering, Nanjing University of Science and Technology(南京理工大学电子与光学工程学院) College of Geoexploration Science and Technology, Jilin University(吉林大学地球探测科学与技术学院)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 本文提出一种基于经典先验的无监督在线视频稳定化方法,通过多线程缓冲机制解决数据有限、可控性差和硬件效率低的问题,并在无人机夜间遥感等场景中取得优于现有方法的性能。

Comments CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22963 2026-02-27 cs.AI 57%

FactGuard: Agentic Video Misinformation Detection via Reinforcement Learning

FactGuard:通过强化学习进行代理视频虚假信息检测

Zehao Li, Hongwei Yu, Hao Jiang, Qiang Sheng, Yilong Xu, Baolong Bi, Yang Li, Zhenlong Yuan, Yujun Cai, Zhaoqi Wang

机构 * Institute of Computing Technology, Chinese Academy of Sciences, Beijing, China(中国科学院计算技术研究所) University of Chinese Academy of Sciences, Beijing, China(中国科学院大学) University of Science and Technology Beijing(北京科技大学) The University of Queensland, Brisbane, Australia(昆士兰大学)

专题命中 视频多模态 :multimodal(abstract);分类 cs.AI

AI总结 FactGuard通过强化学习和代理框架,提升视频虚假信息检测的鲁棒性和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10195 2026-02-27 cs.LG cs.AI hep-th 57%

Versor: A Geometric Sequence Architecture

Versor:一种几何序列架构

Truong Minh Huy, Edward Hirst

机构 * Trương Minh Huy Independent Researcher(Trương Minh Huy 独立研究者) Instituto de Matemática, Estatística e Computação Científica University of Campinas (UNICAMP), Brazil(巴西坎皮纳斯大学数学、统计与科学计算研究所)

专题命中 视频多模态 :multimodal(abstract);分类 cs.AI

AI总结 Versor通过共形几何代数实现结构泛化和高效任务处理,优于Transformer等基线模型。

Comments 19+28 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22514 2026-02-27 cs.RO cs.AI cs.SY eess.SY 57%

SignVLA: A Gloss-Free Vision-Language-Action Framework for Real-Time Sign Language-Guided Robotic Manipulation

SignVLA:一种无 gloss 的视觉-语言-动作框架,用于实时 sign language 引导的机器人操作

Xinyu Tan, Ningwei Bai, Harry Gardener, Zhengyang Zhong, Luoyu Zhang, Liuhaichen Yang, Zhekai Duan, Monkgogi Galeitsiwe, Zezhi Tang

机构 * Department of Computer Science, University College London (UCL)(计算机科学系,伦敦大学学院(UCL))

专题命中 视频多模态 :multimodal(abstract);分类 cs.AI

AI总结 SignVLA 提出了一种无 gloss 的视觉-语言-动作框架,用于实时手语引导的机器人操作,通过几何归一化、时间平滑和词汇精炼提升多模态交互的稳定性和可扩展性。

Comments 7 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22285 2026-02-27 cs.LG cs.AI 57%

Early Risk Stratification of Dosing Errors in Clinical Trials Using Machine Learning

利用机器学习进行临床试验中给药错误风险的早期风险分层

Félicien Hêche, Sohrab Ferdowsi, Anthony Yazdani, Sara Sansaloni-Pastor, Douglas Teodoro

机构 * Department of Radiology and Medical Informatics University of Geneva(放射学与医学信息学系,日内瓦大学) Actelion Pharmaceuticals Ltd(阿克泰隆制药有限公司)

专题命中 视频多模态 :multimodal(abstract);分类 cs.AI

AI总结 本文提出利用机器学习对临床试验中给药错误风险进行早期分层,通过融合结构化和非结构化数据,结合概率校准技术,实现可解释的风险评估。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 跨模态检索 5 篇

2602.22278 2026-02-27 cs.IR cs.LG 82%

RETLLM: Training and Data-Free MLLMs for Multimodal Information Retrieval

RETLLM: 无需训练和数据的多模态信息检索中的大规模语言模型训练

Dawei Su, Dongsheng Wang

机构 * College of Computer Science Software Engineering \ University, Shenzhen, China

专题命中 跨模态检索 :multimodal(title,abstract);MLLM(abstract)

AI总结 RetLLM通过无需训练和数据的框架,利用MLLMs的多模态推理能力提升多模态信息检索性能。

Comments 5 pages, 2 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22217 2026-02-27 cs.IR cs.AI 79%

RAGdb: A Zero-Dependency, Embeddable Architecture for Multimodal Retrieval-Augmented Generation on the Edge

RAGdb: 一种无依赖、可嵌入的多模态检索增强生成边缘计算架构

Ahmed Bin Khalid

机构 * SKAS IT

专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.AI

AI总结 RAGdb通过单文件SQLite容器实现多模态检索增强生成,无需GPU推理,提升边缘计算效率与数据主权

Comments 6 pages, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.04724 2026-02-27 q-bio.QM cs.LG 78%

Understanding protein function with a multimodal retrieval-augmented foundation model

通过多模态检索增强基础模型理解蛋白质功能

Timothy Fei Truong, Tristan Bepler

专题命中 跨模态检索 :multimodal(title,abstract)

AI总结 PoET-2通过多模态检索增强方法提升蛋白质功能理解与预测能力

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22716 2026-02-27 cs.CV cs.AI 62%

SoPE: Spherical Coordinate-Based Positional Embedding for Enhancing Spatial Perception of 3D LVLMs

SoPE: 基于球坐标的位置嵌入:增强3D大视觉-语言模型的空间感知

Guanting Ye, Qiyan Zhao, Wenhao Yu, Liangyu Yuan, Mingkai Li, Xiaofeng Zhang, Jianmin Ji, Yanyong Zhang, Qing Jiang, Ka-Veng Yuen

机构 * University of Macau(澳门大学) University of Science and Technology of China(中国科学技术大学) Shanghai Jiaotong University(上海交通大学) Hefei University of Technology(合肥工业大学) National University of Singapore(新加坡国立大学)

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 SoPE通过基于球坐标的位置嵌入提升3D LVLMs的空间感知能力,结合多尺度频率混合策略,增强几何表示的一致性和表达性。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14162 2026-02-27 cs.CL cs.CV cs.IR 62%

Index Light, Reason Deep: Deferred Visual Ingestion for Visual-Dense Document Question Answering

索引轻,推理深:延迟视觉摄入用于视觉密集文档问答

Tao Xu

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CV、cs.CL

AI总结 本文提出延迟视觉摄入框架,通过分层图号聚类构建索引,利用BM25检索和VLM分析提升视觉密集文档问答性能。

Comments 24 pages, 4 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 多模态生成 6 篇

2602.22246 2026-02-27 cs.CR cs.LG 78%

Self-Purification Mitigates Backdoors in Multimodal Diffusion Language Models

自净化缓解多模态扩散语言模型中的后门

Guangnian Wan, Qi Li, Gongfan Fang, Xinyin Ma, Xinchao Wang

机构 * National University of Singapore(新加坡国立大学)

专题命中 多模态生成 :multimodal(title,abstract)

AI总结 DiSP通过在推理过程中选择性屏蔽视觉标记,有效去除多模态扩散语言模型中的后门,无需额外模型或干净数据。

详情

展开后加载摘要…

URL PDF HTML 收藏