arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 5067 信号源:cs.CV, cs.AI, cs.LG

1. VLM训练与架构 5067 篇

2605.15961 2026-05-18 cs.CV 57%

Sparse Autoencoders enable Robust and Interpretable Fine-tuning of CLIP models

稀疏自编码器使CLIP模型的鲁棒且可解释的微调成为可能

Fabian Morelli, Arnas Uselis, Ankit Sonthalia, Seong Joon Oh

机构 * University of Tübingen(图宾根大学) KAIST(韩国科学技术院)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

AI总结 本文提出SAE-FT方法,通过稀疏自编码器约束视觉表示的变化,实现CLIP模型的鲁棒且可解释的微调,提高下游任务性能同时保持模型鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15836 2026-05-18 cs.RO cs.AI 57%

GAP: Geometric Anchor Pre-training for Data-Efficient Visuomotor Learning of Manipulation Tasks

GAP:用于操作任务数据高效视觉运动学习的几何锚预训练

Davide Buoso, Andrea Protopapa, Stefano Di Carlo, Francesca Pistilli, Giuseppe Averta

机构 * Department of Control and Computer Engineering, Polytechnic University of Turin(控制与计算机工程系,都灵理工大学)

专题命中 VLM训练与架构 :grounding(abstract);分类 cs.AI

AI总结 本文提出GAP,通过预训练空间适配器生成稳定的几何锚点,提升在稀疏数据下的视觉运动策略学习性能,实验显示其在多个任务中优于其他方法。

Comments Project webpage at https://lambdavi.github.io/gap

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15621 2026-05-18 cs.CV 57%

LRCP: Low-Rank Compressibility Guided Visual Token Pruning for Efficient LVLMs

LRCP: 低秩压缩性引导的视觉标记修剪用于高效的LVLMs

Hongyu Lu, Feng Zhang, Wenwei Jin, Huanling Hu, Tianjun Shi, Shikai Jiang, Yao Hu, Jiawei Li

机构 * Xiaohongshu(小红书) Harbin Institute of Technology(哈尔滨工业大学) Fudan University(复旦大学)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

AI总结 本文提出LRCP,通过低秩压缩性引导视觉标记修剪,有效减少视觉语言模型的推理成本,实现94.7%的图像理解性能保留和88.9%的标记减少。

Comments The paper includes 11 figures, multiple tables, comprehensive experimental results on 11 image understanding benchmarks and 3 video benchmarks, with extensive ablation studies and qualitative visualizations

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15307 2026-05-18 cs.GR cs.CV cs.MM cs.SD 57%

Sound Sparks Motion: Audio and Text Tuning for Video Editing

声音激发动作:用于视频编辑的音频和文本微调

AmirHossein Naghi Razlighi, Aryan Mikaeili, Ali Mahdavi-Amiri, Daniel Cohen-Or, Yiorgos Chrysanthou

机构 * University of Cyprus(塞浦路斯大学) Simon Fraser University(西蒙弗雷泽大学) Tel Aviv University(特拉维夫大学) CYENS Center Of Excellence(CYENS卓越中心)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

AI总结 本文提出Sound Sparks Motion框架,通过测试时调整音频视觉生成模型的多模态条件信号,实现视频动作编辑,无需训练,通过音频潜在和文本条件残差扰动促进动作修改,同时利用视觉语言模型反馈提升编辑效果。

Comments Project Page: https://amirhossein-razlighi.github.io/Sound_Sparks_Motion

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14833 2026-05-15 cs.AI cs.HC 57%

Emotion-Attended Stateful Memory (EASM):The Architecture for Hyper-Personalization at Scale

情感关注状态记忆(EASM):大规模超个性化的人机交互架构

Vineet Kotecha, Vansh Gupta

机构 * divAIne Research(divAIne研究)

专题命中 VLM训练与架构 :grounding(abstract);分类 cs.AI

AI总结 本文提出EASM架构,通过长期历史、情绪信号和推断意图动态构建用户特定对话上下文,实验表明其在记忆基础、计划清晰度和情感验证方面显著优于无状态基线。

Comments 18 pages, 3 figures, 3 tables. Industry research whitepaper. Includes controlled A/B evaluation across 30 scenarios and 6 emotional categories

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14750 2026-05-15 cs.CR cs.AI 57%

EVA: Editing for Versatile Alignment against Jailbreaks

EVA:针对对抗性攻击的多功能对齐编辑

Yi Wang, Hongye Qiu, Yue Xu, Sibei Yang, Zhan Qin, Minlie Huang, Wenjie Wang

机构 * ShanghaiTech University(上海科技大学) Sun Yat-sen University(中山大学) State Key Laboratory of Blockchain and Data Security(区块链与数据安全国家重点实验室) Tsinghua University(清华大学)

专题命中 VLM训练与架构 :vision language model(abstract);分类 cs.AI

AI总结 本文提出EVA框架,通过直接模型编辑提升安全对齐,有效中和有害行为,实验显示其在LLMs和VLMs中对抗攻击效果优于现有方法。

Comments IEEE TPAMI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14594 2026-05-15 cs.CV cs.GR 57%

TOPOS: High-Fidelity and Efficient Industry-Grade 3D Head Generation

TOPOS: 高保真且高效的工业级3D人脸生成

Bojun Xiong, Zoubin Bi, Xinghui Peng, Yunmu Wang, Junchen Deng, Jun Liang, Jing Li, Bowen Cai, Huan Fu

机构 * HUJING Digital Media & Entertainment Group(华景数字媒体与娱乐集团)

专题命中 VLM训练与架构 :MLLM(abstract_cn);分类 cs.CV

AI总结 TOPOS框架通过统一拓扑结构实现单图像条件下的3D人脸生成,生成具有固定拓扑的高保真人脸网格,提升顶点级对应一致性,优于传统方法。

Comments Technical Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14310 2026-05-15 cs.CV 57%

CoRDS: Coreset-based Representative and Diverse Selection for Streaming Video Understanding

CoRDS:基于核心集的代表性与多样性选择用于流视频理解

Ailar Mahdizadeh, Puria Azadi, Muchen Li, Xiangteng He, Leonid Sigal

机构 * University of British Columbia(不列颠哥伦比亚大学) Vector Institute(向量研究所)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

AI总结 本文提出CoRDS方法,通过核心集选择优化流视频理解中的缓存压缩,提升代表性与多样性,优于传统启发式方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.07459 2026-05-15 cs.CV 57%

DAPL: Integration of Positive and Negative Descriptions in Text-Based Person Search

DAPL: 文本基于人物搜索中正负描述的整合

Yuchuan Deng, Zhanpeng Hu, Zijie Xin, Chuang Deng, Qijun Zhao

机构 * Sichuan University(四川大学) Renmin University of China(中国人民大学)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

AI总结 DAPL通过整合正负描述提升文本基于人物搜索中视觉-语言模型的解释准确性,结合DIAC和SIAM学习,引入DTS损失以平衡视觉与文本嵌入的粗细粒度对齐,提升匹配精度和鲁棒性。

Journal ref 2025 IEEE International Conference on Multimedia and Expo (ICME)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13835 2026-05-14 cs.CV 57%

Unlocking Patch-Level Features for CLIP-Based Class-Incremental Learning

解锁基于CLIP的类增量学习中的补丁级特征

Hao Sun, Zi-Jun Ding, Da-Wei Zhou

机构 * School of Artificial Intelligence, Nanjing University(南京大学人工智能学院) State Key Laboratory for Novel Software Technology, Nanjing University(南京大学软件新技术国家重点实验室)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

AI总结 本文提出SPA方法,通过利用CLIP的补丁级语义信息提升类增量学习性能,通过生成类级语义描述引导补丁特征选择,并利用最优传输对齐语义特征,有效缓解灾难性遗忘。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13501 2026-05-14 cs.AR cs.LG 57%

Reward-Weighted On-Policy Distillation with an Open Property-Equivalence Verifier for NL-to-SVA Generation

基于开放属性等价验证器的奖励加权在线策略蒸馏用于自然语言到SVA生成

Qingyun Zou, Yingze Li, Tianen Liu, Bingsheng He, Weng-Fai Wong

机构 * National University of Singapore(新加坡国立大学)

专题命中 VLM训练与架构 :grounding(abstract);分类 cs.LG

AI总结 本文提出RWOPD方法,通过开放属性等价检查器提升SVA生成性能,使模型在多个评估指标上超越现有最佳模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10755 2026-05-14 cs.CV 57%

MMRareBench: A Rare-Disease Multimodal and Multi-Image Medical Benchmark

MMRareBench: 一种罕见疾病多模态和多图像医学基准

Junzhi Ning, Jiashi Lin, Yingying Fang, Wei Li, Jiyao Liu, Cheng Tang, Chenglong Ma, Wenhao Tang, Tianbin Li, Ziyan Huang, Guang Yang, Junjun He

机构 * Shanghai AI Laboratory(上海人工智能实验室) Imperial College London(帝国理工学院) Shanghai Jiao Tong University(上海交通大学) Fudan University(复旦大学)

专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.CV

AI总结 本文提出MMRareBench,首个评估多模态和多图像临床能力的罕见疾病基准,包含1756个问题-答案对和7958张医学图像,揭示23个MLLMs在多图像任务中表现低下,存在能力稀释效应。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12516 2026-05-14 cs.CL cs.AI 57%

Domain Adaptation of Large Language Models for Polymer-Composite Additive Manufacturing Using Retrieval-Augmented Generation and Fine-Tuning

为聚合物-复合材料增材制造领域进行大型语言模型的领域适应:使用检索增强生成与微调

Saiful Islam Sagor, Tania Haghighi, Minhaj Nur Alam, Erina Baynojir Joyee

机构 * Department of Mechanical Engineering and Engineering Science, University of North Carolina at Charlotte(北卡罗来纳大学夏洛特分校机械工程与工程科学系) Department of Electrical and Computer Engineering, University of North Carolina at Charlotte(北卡罗来纳大学夏洛特分校电气与计算机工程系)

专题命中 VLM训练与架构 :grounding(abstract);分类 cs.AI

AI总结 本文研究了通过检索增强生成和微调来适应大型语言模型至增材制造领域的方法,发现检索增强生成在准确性和相关性上优于单纯微调。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12500 2026-05-13 cs.CV 57%

SenseNova-U1: Unifying Multimodal Understanding and Generation with NEO-unify Architecture

SenseNova-U1:基于NEO-unify架构的多模态理解和生成统一范式

Haiwen Diao, Penghao Wu, Hanming Deng, Jiahao Wang, Shihao Bai, Silei Wu, Weichen Fan, Wenjie Ye, Wenwen Tong, Xiangyu Fan, Yan Li, Yubo Wang, Zhijie Cao, Zhiqian Lin, Zhitao Yang, Zhongang Cai, Yuwei Niu, Yue Zhu, Bo Liu, Chengguang Lv, Haojia Yu, Haozhe Xie, Hongli Wang, Jianan Fan, Jiaqi Li, Jiefan Lu, Jingcheng Ni, Junxiang Xu, Kaihuan Liang, Lianqiang Shi, Linjun Dai, Linyan Wang, Oscar Qian, Peng Gao, Pengfei Liu, Qingping Sun, Rui Shen, Ruisi Wang, Shengnan Ma, Shuang Yang, Siyi Xie, Siying Li, Tianbo Zhong, Xiangli Kong, Xuanke Shi, Yang Gao, Yongqiang Yao, Yves Wang, Zhengqi Bai, Zhengyu Lin, Zixin Yin, Wenxiu Sun, Ruihao Gong, Quan Wang, Lewei Lu, Lei Yang, Ziwei Liu, Dahua Lin

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

AI总结 SenseNova-U1通过NEO-unify架构实现多模态理解与生成的统一,展示了在文本理解、视觉语言感知、知识推理、代理决策和空间智能等任务中的表现,同时在X2I合成、图文生成和视觉语言生成中表现出色。

Comments Project page: https://github.com/OpenSenseNova/SenseNova-U1

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.20899 2026-05-13 cs.CV 57%

Concepts in Motion: Temporal Concept Bottleneck Model for Interpretable Video Classification

动态概念:可解释视频分类的时序概念瓶颈模型

Patrick Knab, Sascha Marton, Philipp J. Schubert, Drago Guggiana, Christian Bartelt

机构 * Technical University of Clausthal(Clausthal 技术大学) Ramblr.ai Research(Ramblr.ai 研究)

专题命中 VLM训练与架构 :VLM(abstract);分类 cs.CV

AI总结 本文提出MoTIF模型,通过时间接地的概念激活序列进行视频分类,利用时序自注意力机制建模概念的出现时间和贡献,提升可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11753 2026-05-13 cs.AI 57%

Towards Visually Grounded Multimodal Summarization via Cross-Modal Transformer and Gated Attention

迈向基于视觉的多模态摘要:通过跨模态Transformer和门控注意力

Abid Ali, Diego Molla-Aliod, Usman Naseem

机构 * School of Computing, Macquarie University(麦考瑞大学计算机学院)

专题命中 VLM训练与架构 :grounding(abstract);分类 cs.AI

AI总结 本文提出SPeCTrA-Sum框架,通过深度视觉处理器和轻量视觉相关性预测器实现文本摘要与图像选择,提升多模态摘要的视觉连贯性与准确性。

Comments Accepted to Findings of ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11334 2026-05-13 cs.LG cs.CL cs.IR 57%

VERDI: Single-Call Confidence Estimation for Verification-Based LLM Judges via Decomposed Inference

VERDI:基于验证的LLM裁判的单次调用置信度估计方法

Jasmine Qi, Danylo Dantsev, Muyang Sun

机构 * Indeed Inc(Indeed公司)

专题命中 VLM训练与架构 :grounding(abstract);分类 cs.LG

AI总结 VERDI通过分解推理过程提取置信度信号,无需额外调用,提升验证型LLM裁判的可信度评估。

Comments 16 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.06950 2026-05-13 cs.CV cs.CL 57%

READ: Recurrent Adapter with Partial Video-Language Alignment for Parameter-Efficient Transfer Learning in Low-Resource Video-Language Modeling

READ:基于部分视频-语言对齐的递归适配器用于低资源视频-语言建模的参数高效迁移学习

Thong Nguyen, Xiaobao Wu, Xinshuai Dong, Khoi Le, Zhiyuan Hu, Cong-Duy Nguyen, See-Kiong Ng, Luu Anh Tuan

专题命中 VLM训练与架构 :grounding(abstract);分类 cs.CV

AI总结 本文提出READ框架,通过递归计算和部分最优传输对齐,提升低资源视频-语言建模任务的性能,优于现有迁移学习方法。

Comments Accepted at AAAI 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.19774 2026-05-12 cs.LG 57%

If Concept Bottlenecks are the Question, are Foundation Models the Answer?

如果概念瓶颈是问题,那么基础模型是答案吗?

Nicola Debole, Pietro Barbiero, Francesco Giannini, Andrea Passerini, Stefano Teso, Emanuele Marconato

机构 * DISI, University of Trento(特伦托大学DISI实验室) IBM Research Zurich(IBM瑞士苏黎世研究实验室) Faculty of Sciences, Scuola Normale Superiore(科学学院,正则大学) CIMeC, University of Trento(特伦托大学CIMeC实验室)

专题命中 VLM训练与架构 :VLM(abstract);分类 cs.LG

AI总结 本文研究了基础模型在概念瓶颈模型中的影响,发现其在不同任务中与专家标注存在差异,且概念准确性与质量不强相关。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09982 2026-05-12 cs.CV 57%

ERASE: Eliminating Redundant Visual Tokens via Adaptive Two-Stage Token Pruning

ERASE: 通过自适应两阶段令牌剪枝消除冗余视觉令牌

Yuna Lee, Kyoungho Min, Yulhwa Kim

机构 * Department of Electrical and Computer Engineering, Sungkyunkwan University, Republic of Korea(电气与计算机工程系,成均馆大学,大韩民国) Department of Semiconductor Systems Engineering, Sungkyunkwan University, Republic of Korea(半导体系统工程系,成均馆大学,大韩民国)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

AI总结 本文提出ERASE框架,通过自适应两阶段令牌剪枝方法减少冗余视觉令牌,实验证明在85%的令牌剪枝率下,模型准确率保持在89.46%。

Comments 20 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09661 2026-05-12 cs.CL cs.AI 57%

MedMeta: A Benchmark for LLMs in Synthesizing Meta-Analysis Conclusion from Medical Studies

MedMeta:用于从医学研究中合成元分析结论的LLM基准测试

Huy Hoang Ha, Benoit Favre, Francois Portet

专题命中 VLM训练与架构 :grounding(abstract);分类 cs.AI

AI总结 本文提出MedMeta基准测试,评估LLM从医学元分析摘要中生成结论的能力,发现检索增强生成方法显著优于纯参数方法,揭示当前RAG系统在识别否定证据方面的缺陷。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09606 2026-05-12 cs.CR cs.CV 57%

On the Generation and Mitigation of Harmful Geometry in Image-to-3D Models

关于图像到3D模型中有害几何的生成与缓解

Yule Liu, Yilong Yang, Jiale Teng, Hanze Jia, Zeren Luo, Jingyi Zheng, Zifan Peng, Ke Li, Yifan Liao, Zhen Sun, Jiaheng Wei, Yang Liu, Zhuo Ma, Xinlei He

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港理工大学(广州)) Xidian University(西安电子科技大学) Zhejiang University(浙江大学) Wuhan University(武汉大学)

专题命中 VLM训练与架构 :VLM(abstract);分类 cs.CV

AI总结 研究探讨了图像到3D模型生成有害几何的风险及缓解方法,通过系统评估发现当前模型能有效重建有害几何,但现有防护措施存在不足,提出堆叠防御策略以降低有害几何留存率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09242 2026-05-12 eess.IV cs.CV 57%

Cross-Modal Semantic-Enhanced Diffusion Framework for Diabetic Retinopathy Grading

跨模态语义增强的扩散框架用于糖尿病视网膜病变分级

Yiqun Wang

机构 * School of Software Engineering Beijing Jiaotong University(软件工程学院 北京交通大学)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

AI总结 本文提出CLIP引导语义扩散框架,通过整合视觉-语言预训练与扩散概率建模,解决糖尿病视网膜病变分级中的细粒度病变模式区分、分布差异和临床语义知识利用问题。

Comments 6 pages, 3 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00327 2026-05-12 cs.AI cs.HC 57%

SayNext-Bench: Why Do LLMs Struggle with Next-Utterance Anticipation?

SayNext-Bench:为什么LLMs在下一句预测中挣扎?

Yueyi Yang, Haotian Liu, Fang Kang, Mengqi Zhang, Zheng Lian, Hao Tang, Haoyu Chen

机构 * University of Oulu(奥卢大学) College of William and Mary(威廉与玛丽学院) Tongji University(同济大学) Peking University(北京大学)

专题命中 VLM训练与架构 :MLLM(abstract);分类 cs.AI

AI总结 研究探讨LLM在人类对话中的下一句预测能力,指出人类可通过多模态线索预测,而LLM表现不足。提出SayNext-Bench基准,结合多模态数据集和评估框架,开发SayNext-Chat模型,证明其在多层面优于现有模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21677 2026-05-12 cs.LG cs.SE 57%

Prophecy: Inferring Formal Properties from Neuron Activations

预言:从神经元激活推断形式属性

Divya Gopinath, Corina S. Pasareanu, Muhammad Usman

机构 * NASA Ames(NASA阿姆斯研究中心) KBR(KBR公司) CMU(卡内基梅隆大学)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.LG

AI总结 Prophecy通过分析神经网络内部层的神经元激活状态,自动推断前馈网络的形式属性,适用于不同模型和输出属性的验证与监控。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07562 2026-05-11 cs.CV 57%

Beyond GSD-as-Token: Continuous Scale Conditioning for Remote Sensing VLMs

超越GSD-as-Token:远程 sensing VLMs 的连续尺度调节

Song Zhang, Yanlong Chen, Yilin Li, Yining Chen, Zili Yi, Xiaowei Zhang, Yawei Li

机构 * Nanjing University(南京大学) ETH Zurich(苏黎世联邦理工学院) RWTH Aachen University(亚琛工业大学)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

AI总结 本文提出ScaleEarth框架,通过连续尺度条件变量动态调节模型计算路径,结合SSE-U和GeoScale-VQA实现遥感VLMs在不同GSD下的高效适应。

Comments Under review. 30 pages, 16 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07517 2026-05-11 cs.IR cs.AI 57%

LARAG: Link-Aware Retrieval Strategy for RAG Systems in Hyperlinked Technical Documentation

LARAG:超链接技术文档中基于链接的RAG系统检索策略

Giorgia Bolognesi, Claudio Estatico, Ulderico Fugacci, Isabella Mastroianni, Claudio Muselli, Luca Oneto

机构 * Rulex s.r.l.(Rulex公司) Department of Mathematics (DIMA), University of Genoa(热那亚大学数学系) Department of Computer Science, Bioengineering, Robotics, and Systems Engineering (DIBRIS), University of Genoa(热那亚大学计算机科学、生物工程、机器人学和系统工程系)

专题命中 VLM训练与架构 :grounding(abstract);分类 cs.AI

AI总结 LARAG通过利用HTML文档中已有的超链接结构,改进RAG系统检索效果,提升答案质量并降低资源消耗。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06943 2026-05-11 cs.LG 57%

ProtoSSL: Interpretable Prototype Learning from Unlabeled Time-Series Data

ProtoSSL: 从未标记时间序列数据中学习可解释的原型

Steven Song, Sahil Sethi, Brett Beaulieu-Jones, Robert L. Grossman

机构 * Department of Computer Science(计算机科学系) Center for Translational Data Science(转化数据科学中心) Medical Scientist Training Program(医学科学家培训计划) Pritzker School of Medicine(皮尔兹克医学院) Center for Computational Medicine & Clinical AI(计算医学与临床人工智能中心) Section of Biomedical Data Science, Department of Medicine(医学部生物医学数据科学部门)

专题命中 VLM训练与架构 :grounding(abstract);分类 cs.LG

AI总结 ProtoSSL通过自监督学习从未标记时间序列数据中学习可解释的原型,提升低数据场景下的性能,并在人类评估中表现更优,扩展至音频分类。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06477 2026-05-08 cs.CV 57%

GeoStack: A Framework for Quasi-Abelian Knowledge Composition in VLMs

GeoStack: 一种用于视觉语言模型中近阿贝尔知识组合的框架

Pranav Mantini, Shishir K. Shah

机构 * The University of Oklahoma School of Computer Science(俄克拉荷马大学计算机科学学院)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

AI总结 GeoStack通过几何约束和结构约束确保基础模型知识保留,实现常数时间推理,有效缓解灾难性遗忘。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06049 2026-05-08 cs.CV 57%

Fusion in Your Way: Aligning Image Fusion with Heterogeneous Demands via Direct Preference Optimization

融合你的方式:通过直接偏好优化对齐图像融合与异质需求

Weijian Su, Songqian Zhang, Yuqi Han, Jian Zhuang, Yongdong Huang, Qiang Zhang

机构 * School of Computer Science and Technology, Dalian University of Technology(大连理工大学计算机科学与技术学院) Key Laboratory of Social Computing and Cognitive Intelligence (Dalian University of Technology), Ministry of Education(社会计算与认知智能重点实验室(大连理工大学),教育部) Institute of Image Processing and Understanding, North Minzu University(北华大学图像处理与理解研究所)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

AI总结 本文提出DPOFusion框架,通过整合PALDM和PCLDM实现任务引导和偏好适应的图像融合,解决人类和机器视觉的异质需求问题,提升融合质量和任务导向的迁移能力。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏