arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 6903 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态训练与对齐 6903 篇

2603.29414 2026-04-01 cs.CV cs.RO 57%

Native-Domain Cross-Attention for Camera-LiDAR Extrinsic Calibration Under Large Initial Perturbations

本域交叉注意机制用于大初始扰动下的相机-激光雷达外校准

Ni Ou, Zhuo Chen, Xinru Zhang, Junzheng Wang

机构 * School of Automation, Beijing Institute of Technology(北京理工大学自动化学院) School of Integrated Circuits and Electronics, Beijing Institute of Technology(北京理工大学集成电路与电子学院)

专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CV

AI总结 本文提出一种本域交叉注意机制,通过直接对齐图像块和激光雷达点云实现可靠的跨模态交互,提升在大初始扰动下的外校准精度和鲁棒性。

Comments 8 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28414 2026-03-31 cs.CV 57%

Unified Restoration-Perception Learning: Maritime Infrared-Visible Image Fusion and Segmentation

统一的恢复-感知学习:近岸红外-可见图像融合与分割

Weichao Cai, Weiliang Huang, Biao Xue, Chao Huang, Fei Yuan, Bob Zhang

机构 * Laboratory of Underwater Acoustic Communication and Marine Information Technology, Ministry of Education, Xiamen University(厦门大学水声通信与海洋信息技术教育部重点实验室) PAMI Research Group, Department of Computer and Information Science, University of Macau(澳门大学计算机与信息科学系PAMI研究组) School of Cyber Science and Technology, Shenzhen Campus of Sun Yat-sen University(中山大学深圳校区网络空间安全学院)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV

AI总结 本文提出IVMSD数据集和MCLF框架,通过FSEC、SVCA和跨模态注意力机制实现海洋场景的图像恢复、多模态融合和语义分割,提升复杂海洋环境下的鲁棒性和感知质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27481 2026-03-31 cs.LG cs.AI 57%

On Token's Dilemma: Dynamic MoE with Drift-Aware Token Assignment for Continual Learning of Large Vision Language Models

关于令牌的困境:具有漂移感知令牌分配的动态MoE用于大视觉语言模型的持续学习

Chongyang Zhao, Mingsong Li, Haodong Lu, Dong Gong

机构 * University of New South Wales (UNSW Sydney)(新南威尔士大学(悉尼新南威尔士大学))

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.AI

AI总结 本文提出LLaVA-DyMoE框架,通过动态MoE和漂移感知令牌分配缓解持续学习中的路由漂移问题,提升模型在持续学习中的性能。

Comments Accepted at CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27448 2026-03-31 cs.LG cs.AI cs.CE 57%

GIFT: Bootstrapping Image-to-CAD Program Synthesis via Geometric Feedback

GIFT: 通过几何反馈提升图像到CAD程序合成

Giorgio Giannone, Anna Clare Doris, Amin Heyrani Nobari, Kai Xu, Akash Srivastava, Faez Ahmed

机构 * DeCoDE Lab, MIT(麻省理工学院DeCoDE实验室) Core AI, IBM(IBM核心人工智能) MIT-IBM Watson AI Lab(MIT-IBM沃森人工智能实验室)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.AI

AI总结 本文提出GIFT框架,通过几何反馈生成高质量训练样本,提升CAD程序生成的鲁棒性,无需额外标注。

Comments preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17470 2026-03-31 cs.CV 57%

PhaSR: Generalized Image Shadow Removal with Physically Aligned Priors

PhaSR:基于物理对齐先验的通用图像阴影去除

Chia-Ming Lee, Yu-Fan Lin, Yu-Jou Hsiao, Jin-Hui Jiang, Yu-Lun Liu, Chih-Chung Hsu

机构 * National Yang Ming Chiao Tung University(国立阳明交通大学) National Cheng Kung University(国立成功大学)

专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CV

AI总结 PhaSR通过双层先验对齐解决不同光照条件下阴影去除问题,结合物理对齐归一化和几何-语义校正注意力,提升单光源到多源环境的鲁棒性,实验显示其在复杂光照下表现优异。

Comments CVPR 2026 Camera Ready; Project Page: https://ming053l.github.io/PhaSR_github

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26751 2026-03-31 cs.CV 57%

Survey on Remote Sensing Scene Classification: From Traditional Methods to Large Generative AI Models

遥感场景分类综述:从传统方法到大生成AI模型

Qionghao Huang, Can Hu

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV

AI总结 综述探讨了遥感场景分类从传统方法到大生成AI模型的演变,涵盖深度学习和生成AI的核心方法及最新进展,强调了自监督基础模型和多模态数据融合的挑战与未来方向。

Comments Accepted in Journal of King Saud University Computer and Information Sciences

Journal ref Journal of King Saud University Computer and Information Sciences, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26356 2026-03-30 cs.CV 57%

From Pen to Pixel: Translating Hand-Drawn Plots into Graphical APIs via a Novel Benchmark and Efficient Adapter

从笔到像素:通过新的基准和高效的适配器将手绘图表转化为图形API

Zhenghao Xu, Mengning Yang

机构 * School of Big Data & Software Engineering, Chongqing University(重庆大学大数据与软件学院)

专题命中 多模态训练与对齐 :multi-modal(abstract);分类 cs.CV

AI总结 本文提出HDpy-13数据集和Plot-Adapter方法,解决手绘图表转化为图形API的难题,提升非专家用户生成图表的能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24296 2026-03-26 cs.CV 57%

AMIF: Authorizable Medical Image Fusion Model with Built-in Authentication

AMIF:具有内置认证的可授权医学图像融合模型

Jie Song, Jun Jia, Wei Sun, Wangqiu Zhou, Tao Tan, Guangtao Zhai

机构 * Macao Polytechnic University(澳门理工学院) Shanghai Jiao Tong University(上海交通大学) East China Normal University(华东师范大学) Hefei University of Technology(合肥工业大学)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV

AI总结 本文提出AMIF,首个具有内置认证的医学图像融合模型,通过授权访问控制保护知识产权,防止推理泄露。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06690 2026-03-25 cs.CV 57%

Spectral Gaps and Spatial Priors: Studying Hyperspectral Downstream Adaptation Using TerraMind

光谱间隙与空间先验:利用TerraMind研究高光谱下游适应

Julia Anna Leonardi, Johannes Jakubik, Paolo Fraccaro, Maria Antonia Brovelli

机构 * IBM Research Europe(IBM欧洲研究院)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV

AI总结 本文研究了TerraMind在无高光谱预训练情况下处理高光谱下游任务的适应性,比较了通道适应策略并证明了深度学习模型在处理高光谱数据方面的优势。

Comments Accepted to ICLR 2026 Machine Learning for Remote Sensing (ML4RS) Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.22039 2026-03-25 cs.LG cs.AI 57%

UniCA: Unified Covariate Adaptation for Time Series Foundation Model

UniCA: 时空基础模型的统一协变量适应

Lu Han, Yu Liu, Lan Li, Qiwen Deng, Jian Jiang, Yinbo Sun, Zhe Yu, Binfeng Wang, Xingyu Lu, Lintao Ma, Han-Jia Ye, De-Chuan Zhan

机构 * School of Artificial Intelligence, Nanjing University, China(南京大学人工智能学院,中国) National Key Laboratory for Novel Software Technology, Nanjing University, China(南京大学新型软件技术国家重点实验室,中国) Ant Group, Hangzhou, China(蚂蚁集团,杭州,中国)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.AI

AI总结 UniCA通过协变量同质化和统一注意力融合机制,提升时空基础模型对异质协变量的适应能力,实验证明其在多模态预测任务中的优越性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21999 2026-03-24 cs.CV 57%

STENet: Superpixel Token Enhancing Network for RGB-D Salient Object Detection

STENet:基于超像素令牌增强的RGB-D显著目标检测网络

Jianlin Chen, Gongyang Li, Zhijiang Zhang, Liang Chang, Dan Zeng

机构 * School of Communication and Information Engineering, Shanghai University(上海大学通信与信息工程学院) Yunnan Key Laboratory of Service Computing, Yunnan University of Finance and Economics(云南财经大学服务计算重点实验室) Innovation Academy for Microsatellites of Chinese Academy of Science(中国科学院微卫星创新院) Institute for Urban Governance, Shanghai University(上海大学城市治理研究院)

专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CV

AI总结 STENet通过引入超像素进行跨模态交互,解决RGB-D显著目标检测中注意力机制复杂度高和局部细节提取有限的问题,提出全局增强模块和局部精修模块以提升特征表示。

Comments 12 pages, 8 figures, accepted by IEEE TMM

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21820 2026-03-24 cs.CV 57%

Beyond Strict Pairing: Arbitrarily Paired Training for High-Performance Infrared and Visible Image Fusion

超越严格配对:用于高性能红外和可见图像融合的任意配对训练

Yanglin Deng, Tianyang Xu, Chunyang Cheng, Hui Li, Xiao-jun Wu, Josef Kittler

机构 * School of Artificial Intelligence and Computer Science, Jiangnan University(江南大学人工智能与计算机科学学院) Centre for Vision, Speech and Signal Processing (CVSSP), University of Surrey(Surrey 大学视觉、语音和信号处理中心)

专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CV

AI总结 本文挑战严格配对训练范式,提出任意配对训练范式,通过丰富跨模态关系提升红外和可见图像融合性能,实验证明其在数据有限情况下可达到与大规模数据集相当的性能。

Comments Accepted by CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21660 2026-03-24 cs.CV 57%

OmniFM: Toward Modality-Robust and Task-Agnostic Federated Learning for Heterogeneous Medical Imaging

OmniFM:迈向模态鲁棒且任务无关的联邦学习 for 异质医学影像

Meilin Liu, Jiaying Wang, Jing Shan

机构 * School of Software, Shenyang University of Technology(沈阳理工大学软件学院)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV

AI总结 OmniFM提出一种统一训练分类、分割、超分辨率、视觉问答和多模态融合的联邦学习框架,通过频域洞察提升跨模态一致性,实现任务无关和模态鲁棒的联邦学习。

Comments Accepted by CVPR 2026 (Main)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21528 2026-03-24 cs.CV 57%

PEARL: Geometry Aligns Semantics for Training-Free Open-Vocabulary Semantic Segmentation

PEARL:几何对齐语义以实现无训练的开放词汇语义分割

Gensheng Pei, Xiruo Jiang, Xinhao Cai, Tao Chen, Yazhou Yao, Byeungwoo Jeon

机构 * Department of Electrical and Computer Engineering, Sungkyunkwan University(苏州市立大学电气与计算机工程系) School of Computing and Artificial Intelligence, Southwest Jiaotong University(西南交通大学计算机与人工智能学院) School of Computer Science and Engineering, Nanjing University of Science and Technology(南京理工大学计算机科学与工程学院)

专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CV

AI总结 PEARL提出一种无训练的开放词汇语义分割方法,通过几何对齐和文本感知拉普拉斯传播,在不增加复杂度的情况下实现高效分割。

Comments accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20811 2026-03-24 cs.CV 57%

Lean Learning Beyond Clouds: Efficient Discrepancy-Conditioned Optical-SAR Fusion for Semantic Segmentation

在云之外的高效学习:基于光- SAR融合的语义分割框架

Chenxing Meng, Wuzhou Quan, Yingjie Cai, Liqun Cao, Liyan Zhang, Mingqiang Wei

机构 * School of Computer Science and Technology, Nanjing University of Aeronautics and Astronautics(南京航空航天大学计算机科学与技术学院)

专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CV

AI总结 本文提出EDC框架,通过三流编码器和Discrepancy-Conditioned Hybrid Fusion机制提升光- SAR融合的效率和鲁棒性,实验显示在M3M-CR和WHU-OPT-SAR数据集上mIoU提升0.56%和0.88%,参数量减少46.7%。

Comments 14 page, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10568 2026-03-24 cs.CV 57%

UniStitch: Unifying Semantic and Geometric Features for Image Stitching

UniStitch:统一语义与几何特征用于图像拼接

Yuan Mei, Lang Nie, Kang Liao, Yunqiu Xu, Chunyu Lin, Bin Xiao

机构 * CQUPT(中国科学技术大学紫金学院) PolyU NTU(国立台湾大学) NUS(新加坡国立大学) BJTU(北京交通大学)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV

AI总结 本文提出UniStitch框架,通过融合语义和几何特征提升图像拼接性能,采用Neural Point Transformer和Adaptive Mixture of Experts模块实现特征融合,实验表明其显著优于现有方法。

Comments Project Page: http://mmelodyy.github.io/projects/unistitch

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12984 2026-03-24 cs.CG cs.CV cs.GR cs.LG math.OC 57%

VoroLight: Learning Voronoi Surface Meshes via Sphere Intersection

VoroLight: 通过球体相交学习Voronoi表面网格

Jiayin Lu, Ying Jiang, Yumeng He, Yin Yang, Chenfanfu Jiang

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV

AI总结 VoroLight通过球体相交损失促进可控的Voronoi退化,实现平滑的表面重建,保留Voronoi的拓扑一致性与凸性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02142 2026-03-23 cs.RO cs.CV 57%

FD-VLA: Force-Distilled Vision-Language-Action Model for Contact-Rich Manipulation

FD-VLA:力感知的视觉-语言-动作模型用于接触密集的 manipulation

Ruiteng Zhao, Wenshuo Wang, Yicheng Ma, Xiaocong Li, Francis E. H. Tay, Marcelo H. Ang, Haiyue Zhu

机构 * Advanced Robotics Centre, National University of Singapore(新加坡国立大学先进机器人中心) School of Electrical & Electronic Engineering, Nanyang Technological University(南洋理工大学电子与电气工程学院) College of Information Science and Technology, Eastern Institute of Technology(东部技术学院信息科学与技术学院) John A. Paulson School of Engineering and Applied Sciences, Harvard University(哈佛大学约翰·A·保罗森工程与应用科学学院) Advanced Robotics Centre at National University of Singapore(新加坡国立大学先进机器人中心) Singapore Institute of Manufacturing Technology, Agency for Science, Technology and Research (A*STAR)(新加坡制造技术研究所,科技研究局(A*STAR))

专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CV

AI总结 本文提出FD-VLA模型,通过力蒸馏模块在不依赖物理力传感器的情况下实现接触密集任务的力感知,提升机器人视觉-语言-动作的鲁棒性与实用性。

Comments ICRA 2026 Accepted

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15160 2026-03-23 cs.CV 57%

EagleVision: A Dual-Stage Framework with BEV-grounding-based Chain-of-Thought for Spatial Intelligence

EagleVision:基于BEV的双阶段框架用于空间智能

Jiaxu Wan, Xu Wang, Mengwei Xie, Hang Zhang, Mu Xu, Yang Han, Hong Zhang, Ding Yuan, Yifan Yang

机构 * Atlas Lab(Atlas实验室) School of Aerospace, BUAA(北京航空航天大学航空学院) School of Software, BUAA(北京航空航天大学软件学院) State Key Laboratory of HERATT(HERATT国家重点实验室) Key Laboratory of SDODS (MOE) Project(SDODS重点实验室(教育部))

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV

AI总结 EagleVision通过结合几何感知帧选择与主动BEV推理,提升视频空间推理能力,实现空间感知与验证的闭环循环。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07558 2026-03-23 cs.LG cs.CV 57%

ReLaX: Reasoning with Latent Exploration for Large Reasoning Models

ReLaX:基于潜在探索的大型推理模型推理

Shimin Zhang, Xianwei Chen, Yufan Shen, Ziyuan Ye, Jibin Wu

机构 * Hong Kong Polytechnic University(香港理工大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV

AI总结 ReLaX通过引入潜在动态分析,提升大型推理模型的探索与利用平衡,通过动态谱分散度度量潜在动态异质性,优于现有token级方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18656 2026-03-20 cs.AI 57%

Balanced Thinking: Improving Chain of Thought Training in Vision Language Models

平衡思考:改进视觉语言模型中的推理链训练

Shaked Perek, Ben Wiesel, Avihu Dekel, Nimrod Shabtay, Eli Schwartz

机构 * IBM Research(IBM研究院)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.AI

AI总结 本文提出SCALe方法,通过动态权重平衡推理和答案段,提升视觉语言模型的推理效率和准确性,且训练时间仅为传统方法的七分之一。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17944 2026-03-20 cs.CV 57%

TransText: Alpha-as-RGB Representation for Transparent Text Animation

TransText: Alpha-as-RGB表示法用于透明文本动画

Fei Zhang, Zijian Zhou, Bohao Tang, Sen He, Hang Li, Zhe Wang, Soubhik Sanyal, Pengfei Liu, Viktar Atliha, Tao Xiang, Frost Xu, Semih Gunel

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai Innovation Institute (SII)(上海创新研究院) Meta AI

专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CV

AI总结 TransText通过Alpha-as-RGB方法联合建模外观与透明度,避免修改预训练生成流形,生成高质量透明动画。

Comments 19 pages, publication review

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18541 2026-03-20 cs.CV 57%

Remedying Target-Domain Astigmatism for Cross-Domain Few-Shot Object Detection

矫正目标域色散以提升跨域少样本目标检测

Yongwei Jiang, Yixiong Zou, Yuhua Li, Ruixuan Li

机构 * School of Computer Science and Technology, Huazhong University of Science and Technology(华中科技大学计算机科学与技术学院)

专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CV

AI总结 本文针对跨域少样本目标检测中目标域色散问题,提出生物启发的注意力细化框架,通过正负模式细化和文本语义对齐模块提升检测精度,实验证明在六个基准上取得新突破。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06679 2026-03-20 cs.CL 57%

CMV-Fuse: Cross Modal-View Fusion of AMR, Syntax, and Knowledge Representations for Aspect Based Sentiment Analysis

CMV-Fuse:跨模态视图融合AMR、语法和知识表示以进行基于方面的情感分析

Smitha Muthya Sudheendra, Mani Deep Cherukuri, Jaideep Srivastava

机构 * University of Minnesota, Twin Cities(明尼苏达大学双城分校)

专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CL

AI总结 CMV-Fuse通过融合语法、语义和知识表示,提升基于方面的情感分析的鲁棒性,采用层次门控注意力机制和多视图对比学习,实现结构和语义的双重建模。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08316 2026-03-20 cs.CV 57%

Unlocking 3D Affordance Segmentation with 2D Semantic Knowledge

通过2D语义知识解锁3D affordance分割

Yu Huang, Zelin Peng, Changsong Wen, Xiaokang Yang, Wei Shen

机构 * MoE Key Lab of Artificial Intelligence, School of Computer Science, Shanghai Jiaotong University(人工智能大模型实验室,计算机科学学院,上海交通大学)

专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CV

AI总结 本文提出CMAT预训练策略,利用2D视觉基础模型的语义知识引导3D表征学习,提升3D affordance分割的准确性和效率。

Comments Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17647 2026-03-19 cs.CV 57%

Part-Aware Open-Vocabulary 3D Affordance Grounding via Prototypical Semantic and Geometric Alignment

面向部分的开放词汇3D功能接地 via 语义和几何对齐

Dongqiang Gou, Xuming He

机构 * ShanghaiTech University(上海科技大学)

专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CV

AI总结 本文提出一种双阶段跨模态框架,通过增强语义和几何表示,解决开放词汇3D功能接地中的语义一致性、几何对齐和开放词汇泛化问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17311 2026-03-19 cs.CL 57%

Ruyi2.5 Technical Report

Ruyi2.5 技术报告

Huan Song, Shuyu Tian, Qingfei Zhao, Wenhao Hong, Jiang Liu, Ting Long, Jiawei Shao, Xuelong Li

机构 * Institute of Artificial Intelligence (TeleAI), China Telecom(人工智能研究院(TeleAI),中国电信)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CL

AI总结 Ruyi2.5基于AI Flow框架构建多模态家族模型,通过共享主干架构实现多尺度模型协同训练,提升部署层级语义一致性,同时提出隐私保护摄像头系统及BPPO算法加速强化学习微调。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16671 2026-03-18 cs.CV 57%

$x^2$-Fusion: Cross-Modality and Cross-Dimension Flow Estimation in Event Edge Space

$x^2$-Fusion:事件边缘空间中的跨模态和跨维度流估计

Ruishan Guo, Ciyu Ruan, Haoyang Wang, Zihang Gong, Jingao Xu, Xinlei Chen

机构 * Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) Harbin Institute of Technology(哈尔滨工业大学) The University of Hong Kong(香港大学)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV

AI总结 本文提出$x^2$-Fusion方法,通过事件边缘空间实现跨模态和跨维度流的统一表示,提升动态场景理解的准确性和鲁棒性。

Comments This version is the camera-ready version accepted at CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21637 2026-03-18 cs.CV 57%

CARE: A Molecular-Guided Foundation Model with Adaptive Region Modeling for Whole Slide Image Analysis

CARE:一种具有自适应区域建模的分子引导基础模型用于全切片图像分析

Di Zhang, Zhangpeng Gong, Xiaobo Pang, Jiashuai Liu, Junbo Lu, Hao Cui, Jiusong Ge, Zhi Zeng, Kai Yi, Yinghua Li, Si Liu, Tingsong Yu, Haoran Wang, Mireia Crispin-Ortuzar, Weimiao Yu, Chen Li, Zeyu Gao

机构 * Xi’an Jiaotong University(西安交通大学) University of Cambridge(剑桥大学) KingMed(康方生物) BGI Research(贝登基因研究院) A ⋆ STAR

专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CV

AI总结 CARE通过自适应区域建模和分子引导,提升全切片图像分析的性能,实现对病理区域的精准识别与分类,优于现有基础模型。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18444 2026-03-18 cs.CV 57%

SineProject: Machine Unlearning for Stable Vision Language Alignment

SineProject:用于稳定视觉语言对齐的机器反遗忘

Arpit Garg, Hemanth Saratchandran, Simon Lucey

机构 * Australian Institute for Machine Learning(澳大利亚机器学习研究所)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV

AI总结 SineProject通过在冻结的投影器中加入正弦调制的可训练参数,提升Jacobian的谱条件数,稳定反遗忘过程中的视觉语言对齐,减少无害查询拒绝并实现目标信息遗忘。

Comments Accepted at CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏