arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 6897 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态训练与对齐 6897 篇

2511.15613 2026-03-30 cs.CV cs.CL 62%

When to Think and When to Look: Uncertainty-Guided Lookback

何时思考,何时回顾:不确定性引导的回顾

Jing Bi, Filippos Bellos, Junjia Guo, Yayuan Li, Chao Huang, Yolo Y. Tang, Luchuan Song, Susan Liang, Zhongfei Mark Zhang, Jason J. Corso, Chenliang Xu

机构 * University of Rochester(罗切斯特大学) University of Michigan(密歇根大学) Binghamton University(宾汉姆顿大学)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV、cs.CL

AI总结 本文探讨了在大视觉语言模型中思考与回顾的平衡,提出不确定性引导的回顾策略,通过大规模对比实验提升MMMU性能,并在多个基准上取得新突破。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26008 2026-03-30 cs.CV cs.AI 62%

FairLLaVA: Fairness-Aware Parameter-Efficient Fine-Tuning for Large Vision-Language Assistants

FairLLaVA: 大规模视觉-语言助手中的公平性感知参数高效微调

Mahesh Bhosale, Abdul Wasi, Shantam Srivastava, Shifa Latif, Tianyu Luan, Mingchen Gao, David Doermann, Xuan Gong

机构 * University at Buffalo(布法罗大学) University of Kashmir(克什米尔大学) Accenture(埃森哲) Harvard Medical School(哈佛医学院)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 FairLLaVA通过减少目标属性间的互信息,实现视觉指令微调中的公平性改进,提升医疗影像生成的公平性和自然语言生成质量。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13622 2026-03-30 cs.CV cs.AI 62%

CARPE: Context-Aware Image Representation Prioritization via Ensemble for Large Vision-Language Models

CARPE:通过集成实现上下文感知的图像表示优先级

Donghee Lee, Rui Cai, Zhe Zhao

机构 * University of California, Davis(加州大学戴维斯分校)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 CARPE通过集成机制增强大视觉-语言模型对视觉和文本模态的自适应加权能力,提升图像分类和多模态任务表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18840 2026-03-27 cs.CV cs.CL 62%

See the Text: From Tokenization to Visual Reading

查看文本:从分词到视觉阅读

Ling Xing, Rui Yan, Alex Jinpeng Wang, Zechao Li, Jinhui Tang

机构 * School of Computer Science and Engineering, Nanjing University of Science and Technology(南京理工大学计算机科学与工程学院) School of Computer Science and Engineering, Central South University(中南大学计算机科学与工程学院) College of Information Science and Technology and Artificial Intelligence, Nanjing Forestry University(南京林业大学信息科学技术与人工智能学院)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV、cs.CL

AI总结 本文提出SeeTok方法,通过将文本渲染为图像并利用预训练多模态大模型实现视觉阅读,相比传统子词分词在资源消耗和跨语言泛化方面表现更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02487 2026-03-25 cs.CV cs.AI 62%

Masking Matters: Unlocking the Spatial Reasoning Capabilities of LLMs for 3D Scene-Language Understanding

掩码至关重要:解锁LLMs的三维场景-语言理解的空间推理能力

Yerim Jeon, Miso Lee, WonJun Moon, Jae-Pil Heo

机构 * Sungkyunkwan University(庆尚国立大学)

专题命中 多模态训练与对齐 :multi-modal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出3D-SLIM掩码策略,通过适应性注意力掩码提升LLMs在三维场景-语言理解中的空间推理能力,解决传统因果掩码导致的顺序偏差和注意力受限问题。

Comments Accepted to CVPR 2026. GitHub Page: https://github.com/Jyerim/3D-SLIM

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21754 2026-03-24 cs.CV cs.AI 62%

Let's Think with Images Efficiently! An Interleaved-Modal Chain-of-Thought Reasoning Framework with Dynamic and Precise Visual Thoughts

让我们高效地用图像思考!一种具有动态和精确视觉思维的交错模态推理框架

Xu Liu, Yongheng Zhang, Qiguang Chen, Yao Li, Sheng Wang, Libo Qin

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出DaP-ICoT框架,通过动态视觉思维整合和精确视觉思维引导,解决传统ICoT方法中视觉思维位置固定和表示不连贯的问题,提升推理效率和效果。

Comments Accepted by AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21232 2026-03-24 cs.CV cs.AI 62%

QMoP: Query Guided Mixture-of-Projector for Efficient Visual Token Compression

QMoP:基于查询的混合投影器用于高效的视觉令牌压缩

Zhongyang Li, Yaqian Li, Faming Fang, Rinyoichi Takezoe, Zi-Hao Bo, Cheng Qian, Mo Guang, Guixu Zhang, Kaiwen Long

机构 * East China Normal University(华东师范大学) Li Auto Inc(Li汽车公司)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出QMoP框架,通过三种协作分支实现视觉令牌的自适应压缩,结合查询引导路由和专家融合机制,提升效率并减少资源消耗。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17685 2026-03-24 q-bio.QM cs.AI cs.CV cs.LG 62%

Dual-Path Knowledge-Augmented Contrastive Alignment Network for Spatially Resolved Transcriptomics

双路径知识增强对比对齐网络用于空间解析转录组学

Wei Zhang, Jiajun Chu, Xinci Liu, Chen Tong, Xinyue Li

专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出DKAN网络,通过整合组织病理图像和基因表达谱,利用生物信息学方法预测空间解析基因表达,解决现有方法在生物上下文利用不足、依赖示例检索和模态对齐不充分的问题。

Comments AAAI 2026 Oral, extended version

Journal ref Proceedings of the AAAI Conference on Artificial Intelligence, 40(15), 12807-12815. 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.05264 2026-03-24 cs.CV cs.AI 62%

SGDFuse: SAM-Guided Diffusion Model for High-Fidelity Infrared and Visible Image Fusion

SGDFuse: 基于SAM的扩散模型用于高保真红外与可见图像融合

Xiaoyang Zhang, jinjiang Li, Guodong Fan, Yakun Ju, Linwei Fan, Jun Liu, Alex C. Kot

机构 * School of Computer Science(计算机科学学院) Business University, Yantai, China(烟台商学院) College of Computer and Data Science(计算机与数据科学学院) Fuzhou University, Fuzhou, China(福州大学) School of Computing and Mathematical Sciences(计算与数学科学学院) University of Leicester, Leicester, United Kingdom(莱斯特大学) School of Computing and Artificial Intelligence(计算与人工智能学院) Director of the Rapid-Rich Object Search Laboratory(快速丰富对象搜索实验室主任) NTU-PKU Joint Research Institute, Nanyang Technological University, Singapore(NTU-PKU联合研究机构,新加坡国立大学)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出SGDFuse,通过结合SAM的高阶语义先验与扩散模型的高保真生成能力,解决红外与可见图像融合中的语义盲问题,提升图像质量和下游任务性能。

Comments Published in Information Fusion

Journal ref Information Fusion, 2026: 104290

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.11173 2026-03-20 cs.CV cs.MM 62%

CoPRS: Learning Positional Prior from Chain-of-Thought for Reasoning Segmentation

CoPRS:从链式思维中学习位置先验以进行推理分割

Zhenyu Lu, Liupeng Li, Jinpeng Wang, Yan Feng, Bin Chen, Ke Chen, Yaowei Wang

机构 * Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences(中国科学院深圳先进技术研究院) Peng Cheng Laboratory(鹏城实验室) Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) Meituan, Beijing(北京美团) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 多模态训练与对齐 :multi-modal(abstract);分类 cs.CV、cs.MM

AI总结 本文提出CoPRS模型,通过多模态链式思维生成可解释的位置先验热图,提升推理分割的可解释性和精度,实验表明其在多个数据集上表现优异。

Comments Accepted to ICLR 2026. 20 pages, 8 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18101 2026-03-20 cs.CV cs.AI cs.LG 62%

Training-Only Heterogeneous Image-Patch-Text Graph Supervision for Advancing Few-Shot Learning Adapters

仅训练异构图像-补丁-文本图监督以推进少样本学习适配器

Mohammed Rahman Sherif Khan Mohammad, Ardhendu Behera, Sandip Pradhan, Swagat Kumar, Amr Ahmed

机构 * Edge Hill University(埃德希尔大学)

专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出一种仅训练的异构图监督方法,通过多尺度视觉补丁和文本提示构建统一图,利用模态感知图变压器进行跨模态推理,并通过节点过滤提取高保真类特征,从而提升少样本学习性能。

Comments Accepted at The IEEE/CVF Conference on Computer Vision and Pattern Recognition 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17809 2026-03-19 cs.CV cs.AI 62%

Fine-Grained Post-Training Quantization for Large Vision Language Models with Quantization-Aware Integrated Gradients

细粒度后训练量化用于大型视觉语言模型的量化感知集成梯度

Ziwei Xiang, Fanhu Zeng, Hongjian Fang, Rui-Qi Wang, Renxing Chen, Yanan Zhu, Yi Chen, Peipei Yang, Xu-Yao Zhang

机构 * State Key Laboratory of Multimodal Artificial Intelligence Systems, CASIA(多模态人工智能系统国家重点实验室,中国科学院自动化所) School of Artificial Intelligence, UCAS(人工智能学院,中国科学院大学) Beijing National Research Center for Information Science and Technology(北京信息科学研究中心) Institute of Artificial Intelligence, USTB(信息科学技术大学人工智能学院) School of Artificial Intelligence, Beihang University(北京航空航天大学人工智能学院) Zhongguancun Academy(中关村学院)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出细粒度后训练量化方法,通过量化感知集成梯度评估token敏感性,提升大型视觉语言模型的精度与效率。

Comments Accepted by CVPR 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16482 2026-03-18 cs.CV cs.AI 62%

DST-Net: A Dual-Stream Transformer with Illumination-Independent Feature Guidance and Multi-Scale Spatial Convolution for Low-Light Image Enhancement

DST-Net:一种双流Transformer,具有光照无关特征引导和多尺度空间卷积的低光照图像增强

Yicui Shi, Yuhan Chen, Xiangfei Huang, Zhenguo Wang, Wenxuan Yu, Ying Fang

机构 * College of Mechanical and Vehicle Engineering, Chongqing University(重庆大学机械与车辆工程学院) Shanghai Zhenhua Heavy Industries Co.,Ltd.(上海震华重工有限公司)

专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出DST-Net,通过光照无关特征引导和多尺度空间卷积提升低光照图像增强效果,解决传统方法在信号先验丢失的问题,实验表明其在主观和客观指标上均表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16245 2026-03-18 cs.CV cs.CL 62%

How to Utilize Complementary Vision-Text Information for 2D Structure Understanding

如何利用互补的视觉-文本信息进行2D结构理解

Jiancheng Dong, Pengyue Jia, Derong Xu, Jiawei Cheng, Jingyu Peng, Chao Zhang, Bowen Liu, Xin Sun, Lixin Su, Shuaiqiang Wang, Dawei Yin, Xiangyu Zhao

机构 * City University of Hong Kong(香港城市大学) Baidu Inc(百度公司)

专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CV、cs.CL

AI总结 本文提出DiVA-Former架构,通过动态查询视觉标记将长文本序列压缩为摘要向量,有效整合视觉与文本信息,在13个表格基准测试中提升23.9%。

Comments 16 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15965 2026-03-18 cs.CL cs.AI 62%

MoLoRA: Composable Specialization via Per-Token Adapter Routing

MoLoRA:通过每token适配器路由实现可组合的专精

Shrey Shah, Justin Wagle

机构 * Microsoft(微软)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CL、cs.AI

AI总结 MoLoRA通过每token适配器路由实现可组合专精,优于规模扩展:MoLoRA使Qwen3-1.7B在四个推理基准上超越Qwen3-8B,且小4.7倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14214 2026-03-17 cs.CV cs.AI 62%

UniFusion: A Unified Image Fusion Framework with Robust Representation and Source-Aware Preservation

UniFusion:一种具有鲁棒表示和源感知保留的统一图像融合框架

Xingyuan Li, Songcheng Du, Yang Zou, HaoYuan Xu, Zhiying Jiang, Jinyuan Liu

专题命中 多模态训练与对齐 :multi-modal(abstract);分类 cs.CV、cs.AI

AI总结 UniFusion通过统一框架实现跨任务泛化,利用DINOv3提取模态一致特征,引入重建对齐损失保持源信息一致性,并采用双层优化策略平衡重建与融合目标,提升融合质量与泛化能力。

Comments 11 pages, 8 figures, published to CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13366 2026-03-17 cs.CV cs.AI 62%

Thinking in Uncertainty: Mitigating Hallucinations in MLRMs with Latent Entropy-Aware Decoding

在不确定性中思考:通过潜在熵感知解码减轻MLRMs中的幻觉

Zhongxing Xu, Zhonghua Wang, Zhe Qian, Dachuan Shi, Feilong Tang, Ming Hu, Shiyan Su, Xiaocheng Zou, Wei Feng, Dwarikanath Mahapatra, Yifan Peng, Mingquan Lin, Zongyuan Ge

机构 * Monash University(墨尔本大学) Georgia Tech(佐治亚理工学院) Cornell University(康奈尔大学) Northeastern University(东北大学) Khalifa University(卡利法大学) University of Minnesota(明尼苏达大学)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出通过潜在熵感知解码策略减轻多模态大推理模型中的幻觉问题,利用语义上下文增强推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13335 2026-03-17 cs.CV cs.AI 62%

Information-Theoretic Constraints for Continual Vision-Language-Action Alignment

信息论视角下的持续视觉-语言-动作对齐约束

Libang Zhao, Qixin Zeng, Hongyin Zhang, Donglin Wang

机构 * Westlake University, China(西湖大学) University of Southampton, UK(南安普顿大学)

专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出Info-VLA框架,通过两个互补约束保持跨模态信息结构,解决持续学习中视觉语言动作对齐退化问题,实验表明其在任务保持与适应性上优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18811 2026-03-11 cs.CV cs.AI 62%

Mitigating Long-Tail Bias in HOI Detection via Adaptive Diversity Cache

通过自适应多样性缓存缓解HOI检测中的长尾偏差

Yuqiu Jiang, Xiaozhen Qiao, Yifan Chen, Ye Zheng, Zhe Sun, Xuelong Li

机构 * College of Future Information Technology, Fudan University(复旦大学未来信息技术学院) School of Information Science and Technology, University of Science and Technology of China(中国科学技术大学信息科学与技术学院) Institute of Artificial Intelligence (TeleAI), China Telecom(中国电信人工智能研究院(TeleAI))

专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出自适应多样性缓存模块,通过无训练机制缓解HOI检测中的长尾偏差,提升稀有类别检测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07023 2026-03-10 cs.CL cs.AI 62%

Hit-RAG: Learning to Reason with Long Contexts via Preference Alignment

通过偏好对齐学习长上下文的推理

Junming Liu, Yuqi Li, Shiping Wen, Zhigang Zeng, Tingwen Huang

机构 * Tongji University(同济大学) The City University of New York(纽约城市大学) University of Technology Sydney(悉尼大学) Huazhong University of Science and Technology(华中科技大学) Shenzhen University of Advanced Technology(深圳先进技术大学)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CL、cs.AI

AI总结 Hit-RAG通过多阶段偏好对齐框架解决长上下文推理中的注意力稀释和幻觉问题,提升模型在长上下文场景下的推理能力。

Comments 21 pages, 2 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06750 2026-03-10 cs.CV cs.AI 62%

XMACNet: An Explainable Lightweight Attention based CNN with Multi Modal Fusion for Chili Disease Classification

XMACNet:一种具有多模态融合的轻量级可解释注意力CNN用于辣椒疾病分类

Tapon Kumer Ray, Rajkumar Y, Shalini R, Srigayathri K, Jayashree S, Lokeswari P

专题命中 多模态训练与对齐 :multi-modal(abstract);分类 cs.CV、cs.AI

AI总结 XMACNet通过结合自注意力和多模态融合,实现轻量级且可解释的辣椒疾病分类,优于现有基线模型。

Comments 14 pages, 8 figures, Conference Paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06670 2026-03-10 cs.CV cs.AI 62%

calibfusion: Transformer-Based Differentiable Calibration for Radar-Camera Fusion Detection in Water-Surface Environments

calibfusion: 基于Transformer的可微校准方法用于水表面环境的雷达-摄像头融合检测

Yuting Wan, Liguo Sun, Jiuwu Hao, Pin LV

机构 * School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)

专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 CalibFusion通过端到端学习隐式外校准,提升水表面环境下雷达-摄像头融合检测的鲁棒性和精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.18775 2026-03-10 eess.IV cs.AI cs.CV cs.LG 62%

Subclass Classification of Gliomas Using MRI Fusion Technique

使用MRI融合技术对胶质瘤进行亚类分类

Kiranmayee Janardhan, Christy Bobby Thomas

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本研究提出一种基于MRI融合技术的胶质瘤亚类分类方法,通过融合多模态MRI图像提升分类精度,达到99.25%的准确率。

Comments 15 pages, 7 figures, 1 algorithm, 4 tables, journal paper

Journal ref SN Computer Science, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.23508 2026-03-06 cs.CL cs.AI 62%

Why Reinforcement Fine-Tuning Enables MLLMs Preserve Prior Knowledge Better: A Data Perspective

为何强化微调能更好地使大语言模型保留先验知识:从数据角度出发

Zhihao Zhang, Qiaole Dong, Qi Zhang, Jun Zhao, Enyu Zhou, Zhiheng Xi, Senjie Jin, Xiaoran Fan, Yuhao Zhou, Mingqi Wu, Yanwei Fu, Tao Ji, Tao Gui, Xuanjing Huang, Kai Chen

机构 * Fudan University(复旦大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Shanghai Collaborative Innovation Center of Intelligent Visual Computing(上海智能视觉计算协同创新中心)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CL、cs.AI

AI总结 本文通过数据视角揭示强化微调(RFT)相较于监督微调(SFT)在保留大语言模型先验知识方面的优势,发现RFT通过强化正确样本与基模型对齐,有效减少对先验知识的干扰。

Comments Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03739 2026-03-05 cs.CV cs.AI 62%

PROSPECT: Unified Streaming Vision-Language Navigation via Semantic--Spatial Fusion and Latent Predictive Representation

PROSPECT:通过语义-空间融合和潜在预测表示实现统一的流式视觉-语言导航

Zehua Fan, Wenqi Lyu, Wenxuan Song, Linge Zhao, Yifei Yang, Xi Wang, Junjie He, Lida Huang, Haiyan Liu, Bingchuan Sun, Guangjun Bao, Xuanyao Mao, Liang Xu, Yan Wang, Feng Gao

机构 * Shanghai Jiao Tong University(上海交通大学) Tsinghua University(清华大学) University of Adelaide(阿德莱德大学) Wuhan University(武汉大学) Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Beijing Jiaotong University(北京交通大学) AIR Wuxi Innovation Center, Tsinghua University(清华大学无锡创新中心) Lenovo(联想集团)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 PROSPECT通过语义-空间融合和潜在预测表示,实现统一的流式视觉-语言导航,提升环境动态和空间结构的预测能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10619 2026-03-05 cs.CV cs.AI 62%

Improving Medical Visual Reinforcement Fine-Tuning via Perception and Reasoning Augmentation

通过感知与推理增强改进医疗视觉强化微调

Guangjing Yang, ZhangYuan Yu, Ziyuan Qin, Xinyuan Song, Huahui Yi, Qingbo Kang, Jun Gao, Yiyue Li, Chenlin Du, Qicheng Lao

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Emory University(埃默里大学) Sichuan University(四川大学) Peking University(北京大学)

专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 本研究提出VRFT-Aug框架,通过增强感知与推理能力,改进医疗影像领域的强化微调效果,提升模型在医学应用中的可靠性与推理能力。

Comments CPAL 2026

Journal ref 2026 Conference on Parsimony and Learning (CPAL)

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.20704 2026-03-05 cs.CL cs.AI cs.CR 62%

Text2VLM: Adapting Text-Only Datasets to Evaluate Alignment Training in Visual Language Models

Text2VLM: 将文本-only数据集适应于评估视觉语言模型对齐训练

Gabriel Downer, Sean Craven, Damian Ruck, Jake Thomas

机构 * Advai

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CL、cs.AI

AI总结 Text2VLM通过将文本-only数据集转换为多模态格式,评估VLMs对提示注入攻击的鲁棒性,并揭示模型对齐中的关键弱点。

Comments 9 pages, 9 figures. Jake Thomas served as Editor for this manuscript

Journal ref Proceedings of the 2025 Conference on Applied Machine Learning for Information Security, Proceedings of Machine Learning Research PMLR Vol 299 pp 28 41

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23652 2026-03-04 cs.CV cs.AI 62%

3D Modality-Aware Pre-training for Vision-Language Model in MRI Multi-organ Abnormality Detection

面向MRI多器官异常检测的3D模态感知预训练

Haowen Zhu, Ning Yin, Xiaogen Zhou

机构 * School of Electronic, Electrical Engineering and Physics, Fujian University of Technology(福建工程学院电子电气工程学院) School of Computer Science and Engineering, Southeast University, China(东南大学计算机科学与工程学院) Department of Medical Imaging, Suzhou Traditional Chinese Medicine Hospital, China(苏州中医医院影像科)

专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出MedMAP框架,通过3D MRI的模态感知预训练提升多器官异常检测性能,实验表明其优于现有视觉-语言模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23734 2026-03-02 cs.CV cs.CL 62%

UTPTrack: Towards Simple and Unified Token Pruning for Visual Tracking

UTPTrack: 向简单和统一的令牌剪枝迈进:视觉跟踪中的统一令牌剪枝

Hao Wu, Xudong Wang, Jialiang Zhang, Junlong Tong, Xinghao Chen, Junyan Lin, Yunpu Ma, Xiaoyu Shen

机构 * Institute of Digital Twin, Eastern Institute of Technology(数字孪生研究所,东部技术研究所) Ningbo Key Laboratory of Spatial Intelligence and Digital Derivative(宁波空间智能与数字衍生关键实验室) Shanghai Jiao Tong University(上海交通大学) The Hong Kong Polytechnic University(香港理工大学) Munich Center for Machine Learning, LMU Munich(慕尼黑机器学习中心,慕尼黑大学)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV、cs.CL

AI总结 UTPTrack通过统一令牌剪枝框架,在视觉跟踪中实现高精度与高效能的平衡,同时支持多模态和语言引导任务。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21522 2026-02-26 q-bio.NC cs.AI cs.CL 62%

One Brain, Omni Modalities: Towards Unified Non-Invasive Brain Decoding with Large Language Models

一个大脑,多模态:迈向统一非侵入式脑解码的大型语言模型

Changli Tang, Shurui Li, Junliang Wang, Qinfan Xiao, Zhonghao Zhai, Lei Bai, Yu Qiao, Bowen Zhou, Wen Wu, Yuanning Li, Chao Zhang

机构 * Tsinghua University(清华大学) Shanghai AI Laboratory(上海人工智能实验室) ShanghaiTech University(上海科技大学)

专题命中 多模态训练与对齐 :omni-modal(abstract);分类 cs.CL、cs.AI

AI总结 NOBEL通过统一EEG/MEG与fMRI信号,利用大型语言模型实现多模态非侵入式脑解码,提升解码准确性和对视觉语义的解读能力。

详情

展开后加载摘要…

URL PDF HTML 收藏