arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 7608 信号源:cs.CL, cs.AI, cs.LG

1. 知识编辑与模型理解 7608 篇

2602.22253 2026-02-27 cs.SD 50%

AR&D: A Framework for Retrieving and Describing Concepts for Interpreting AudioLLMs

AR&D: 一种用于音频大语言模型解释的检索与描述框架

Townim Faisal Chowdhury, Ta Duc Huy, Siqi Pan, Jeremy Stoddard, Zhibin Liao

机构 * Australian Institute for Machine Learning, University of Adelaide(澳大利亚机器学习研究所,阿德莱德大学) Dolby Laboratories(杜比实验室) School of Computer and Mathematical Sciences, University of Adelaide, Australia(计算机与数学科学学院,阿德莱德大学,澳大利亚)

专题命中 知识编辑与模型理解 :language model(abstract)

AI总结 AR&D框架通过稀疏自编码器解构音频大语言模型的多义激活,实现对模型内部特征的可解释性增强,为高风险领域应用提供可靠部署基础。

Comments Accepted at International Conference on Acoustics, Speech, and Signal Processing (ICASSP), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22120 2026-02-26 cs.CV 50%

GeoDiv: Framework For Measuring Geographical Diversity In Text-To-Image Models

GeoDiv:文本到图像模型中地理多样性测量的框架

Abhipsa Basu, Mohana Singh, Shashank Agnihotri, Margret Keuper, R. Venkatesh Babu

机构 * Vision and AI Lab, Indian Institute of Science, Bangalore, India(印度科学院视觉与人工智能实验室) Chair for Machine Learning, University of Mannheim(曼海姆大学机器学习主任) Max Planck Institute for Informatics, Saarland Informatics Campus, Saarbrücken, Germany(马克斯·普朗克信息研究所,萨尔兰州信息学院,萨尔布吕肯,德国)

专题命中 知识编辑与模型理解 :language model(abstract)

AI总结 GeoDiv通过评估文本到图像模型中的地理多样性,揭示模型在描绘地区时的偏见问题,提出可解释的度量框架以促进公平生成系统。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21735 2026-02-26 cs.CV 50%

SigVLP: Sigmoid Volume-Language Pre-Training for Self-Supervised CT-Volume Adaptive Representation Learning

SigVLP:基于sigmoid体积-语言预训练的自监督CT体积自适应表示学习

Jiayi Wang, Hadrien Reynaud, Ibrahim Ethem Hamamci, Sezgin Er, Suprosanna Shit, Bjoern Menze, Bernhard Kainz

机构 * Friedrich-Alexander University Erlangen-Nürnberg(弗里德里希-亚历山大大学埃尔兰根-纽伦堡) Department of Quantitative Biomedicine, University of Zurich(苏黎世大学定量生物医学系) ETH AI Center, ETH Zurich(苏黎世联邦理工学院AI中心) International School of Medicine, Istanbul Medipol University(伊斯坦布尔梅迪波尔大学国际医学院) Department of Computing, Imperial College London(伦敦帝国学院计算机系)

专题命中 知识编辑与模型理解 :language model(abstract)

AI总结 SigVLP通过引入旋转位置嵌入和块级对齐方法,改进CT体积与文本的自监督表示学习,提升文本到体积对齐的精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21405 2026-02-26 cs.CV 50%

Rectifying Geometry-Induced Similarity Distortions for Real-World Aerial-Ground Person Re-Identification

校正几何诱导的相似性失真以应对现实中的空天地人重识别

Kailash A. Hambarde, Hugo Proença

机构 * Instituto de Telecomunicações(电信研究所) Department of Computer Science, Universidade da Beira Interior(计算机科学系,贝拉内尔内大学)

专题命中 知识编辑与模型理解 :prompting(abstract)

AI总结 本文提出GIQT模块,通过校正几何诱导的相似性失真,提升空天地人重识别在极端几何条件下的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18505 2026-02-24 cs.CV 50%

Suppression or Deletion: A Restoration-Based Representation-Level Analysis of Machine Unlearning

抑制或删除:基于恢复的表示层面机器去学习分析

Yurim Jang, Jaeung Lee, Dohyun Kim, Jaemin Jo, Simon S. Woo

机构 * Department of Artificial Intelligence Sungkyunkwan University Suwon Republic of Korea(人工智能系首尔大学水原韩国) Sungkyunkwan University(首尔大学)

专题命中 知识编辑与模型理解 :pretraining(abstract)

AI总结 本文提出了一种基于恢复的分析框架,揭示了现有去学习方法在表示层面保留信息的风险,强调了对新评估标准的需求。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.06084 2026-02-24 cs.CV 50%

Exploring Interpretability for Visual Prompt Tuning with Cross-layer Concepts

探索通过跨层概念实现的视觉提示调优可解释性

Yubin Wang, Xinyang Jiang, De Cheng, Xiangqian Zhao, Zilong Wang, Dongsheng Li, Cairong Zhao

机构 * School of Computer Science and Technology, Tongji University(同济大学计算机科学与技术学院) Microsoft Research Asia(微软亚洲研究院) School of Telecommunication and Engineering, Xidian University(西安电子科技大学电信与工程学院)

专题命中 知识编辑与模型理解 :foundation model(abstract)

AI总结 本文提出可解释视觉提示调优框架,通过跨层概念原型提升视觉提示的可解释性与性能。

Comments ICLR 2026, 21 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15650 2026-02-18 cs.CV 50%

Concept-Enhanced Multimodal RAG: Towards Interpretable and Accurate Radiology Report Generation

概念增强的多模态RAG:迈向可解释且准确的放射科报告生成

Marco Salmè, Federico Siciliano, Fabrizio Silvestri, Paolo Soda, Rosa Sicilia, Valerio Guarrasi

机构 * Department of Engineering(工程系) Research Unit of Artificial Intelligence and Computer Systems(人工智能与计算机系统研究单位) Università Campus Bio-Medico of Roma(罗马大学生物医学校园) Department of Computer, Control and Management Engineering(计算机、控制与管理工程系) Sapienza University of Rome(罗马萨皮恩扎大学) Department of Diagnostics and Intervention, Radiation Physics, Biomedical Engineering(诊断与介入、辐射物理、生物医学工程系) Umeå University(乌梅拉大学) UniCamillus-Saint Camillus International University of Health Sciences(UniCamillus-圣卡米卢斯国际健康科学大学)

专题命中 知识编辑与模型理解 :language model(abstract)

AI总结 概念增强的多模态RAG通过分解视觉表示为可解释的临床概念,提升放射科报告生成的可解释性和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14467 2026-02-17 cs.HC 50%

Conversational Decision Support for Information Search Under Uncertainty: Effects of Gist and Verbatim Feedback

信息搜索中的对话决策支持:概要反馈与原文反馈的影响

Kexin Quan, Jessie Chin

专题命中 知识编辑与模型理解 :LLM(abstract)

AI总结 SERA通过提供概要或原文反馈,在不同不确定性环境下提升决策准确性与自信度,优化信息搜索效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13745 2026-02-17 cs.HC 50%

Human Oversight-by-Design for Accessible Generative IUIs

为可及性生成性IUIs设计的人类监督

Blessing Jerry, Lourdes Moreno, Paloma Martínez

专题命中 知识编辑与模型理解 :LLM(abstract)

AI总结 为可及性生成性IUIs设计的人类监督方法,通过嵌入人类判断和升级策略,确保高风险工作流程中的可靠性和可访问性。

Comments Preprint. Accepted for publication in CEUR Workshop Proceedings (IUI Workshops 2026). 15 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.04553 2026-02-16 cs.HC 50%

Understanding Codebase like a Professional! Human-AI Collaboration for Code Comprehension

像专业人员一样理解代码库!面向代码理解的人机协作

Jie Gao, Yue Xue, Xiaofei Xie, SoeMin Thant, Erika Lee, Bowen Xu

专题命中 知识编辑与模型理解 :LLM(abstract)

AI总结 CodeMap通过动态信息提取和交互式可视化,提升代码理解的直观性和易用性,减少对LLM响应的依赖。

Comments Accepted at the 34th IEEE/ACM International Conference on Program Comprehension (ICPC 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.20034 2026-02-16 cs.CV 50%

MaskInversion: Localized Embeddings via Optimization of Explainability Maps

MaskInversion: 通过可解释性图的优化生成局部嵌入

Walid Bousselham, Sofian Chaybouti, Christian Rupprecht, Vittorio Ferrari, Hilde Kuehne

机构 * Tuebingen AI Center University of Tuebingen(图宾根人工智能中心 图宾根大学) University of Oxford(牛津大学) Meta MIT-IBM Watson AI Lab(麻省理工-IBM Watson人工智能实验室)

专题命中 知识编辑与模型理解 :foundation model(abstract)

AI总结 MaskInversion通过优化可解释性图生成特定图像区域的嵌入,适用于多种视觉-语言任务。

Comments Project page: https://walidbousselham.com/MaskInversion

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10425 2026-02-12 cs.CV 50%

HII-DPO: Eliminate Hallucination via Accurate Hallucination-Inducing Counterfactual Images

HII-DPO: 通过准确的 hallucination-Inducing Counterfactual Images 消除幻觉

Yilin Yang, Zhenghui Guo, Yuke Wang, Omprakash Gnawali, Sheng Di, Chengming Zhang

机构 * University of Houston(休斯顿大学) Rice University(里士满大学) Argonne National Laboratory(阿贡国家实验室)

专题命中 知识编辑与模型理解 :language model(abstract)

AI总结 HII-DPO通过生成准确的幻觉诱导图像,有效缓解了VLMs在语言偏见下的幻觉问题,提升了模型的对齐能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09973 2026-02-11 cs.RO 50%

RoboInter: A Holistic Intermediate Representation Suite Towards Robotic Manipulation

RoboInter: 一种面向机器人操控的综合中间表示套件

Hao Li, Ziqin Wang, Zi-han Ding, Shuai Yang, Yilun Chen, Yang Tian, Xiaolin Hu, Tai Wang, Dahua Lin, Feng Zhao, Si Liu, Jiangmiao Pang

机构 * University of Science and Technology of China(中国科学技术大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Beihang University(北航) Nanyang Technological University(南洋理工大学) Zhejiang University(浙江大学) Tsinghua University(清华大学) The Chinese University of Hong Kong(香港中文大学)

专题命中 知识编辑与模型理解 :language model(abstract)

AI总结 RoboInter通过统一的中间表示套件,提升机器人操控中视觉-语言-动作系统的泛化能力和推理能力。

Comments Published to ICLR 2026, 69 pages, 40 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08620 2026-02-10 cs.CV 50%

Improving Reconstruction of Representation Autoencoder

提升表示自编码器的重建性能

Siyu Liu, Chujie Qin, Hubery Yin, Qixin Yan, Zheng-Peng Duan, Chen Li, Jing Lyu, Chun-Le Guo, Chongyi Li

机构 * VCIP, CS, Nankai University(南开大学计算机科学与技术学院) WeChat Vision, Tencent Inc.(腾讯公司)

专题命中 知识编辑与模型理解 :foundation model(abstract)

AI总结 LV-RAE通过增强语义特征与低级信息,提升潜在扩散模型的重建保真度和生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2106.15332 2026-02-10 cs.CV 50%

Winner Team Mia at TextVQA Challenge 2021: Vision-and-Language Representation Learning with Pre-trained Sequence-to-Sequence Model

TextVQA挑战2021获胜团队Mia:基于预训练序列到序列模型的视觉-语言表示学习

Yixuan Qiao, Hao Chen, Jun Wang, Shanshan Zhao, Yihao Chen, Xianbin Ye, Ziliang Li, Xianbiao Qi, Peng Gao, Guotong Xie

机构 * SFE Deeplearning Platform Ping An Health Technology Beijing China(平安健康科技北京分公司) Peking University Beijing China(北京大学) Visual Computing Group Ping An Property & Casualty Insurance Company Shenzhen China(平安财产保险股份有限公司视觉计算组) Jinan University Guangzhou China(暨南大学) Central University of Finance and Economics Beijing China(中央财经大学) Ping An Health Cloud Company Limited Shenzhen China(平安健康云有限公司) Ping An International Smart City Technology Co Ltd Shenzhen China(平安国际智慧城市科技有限公司)

专题命中 知识编辑与模型理解 :language model(abstract)

AI总结 TextVQA挑战2021中,Mia团队利用预训练序列到序列模型T5,通过融合多模态信息和优化预训练任务,提升视觉-语言推理能力。

Comments Winner of TextVQA 2021

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07608 2026-02-10 cs.CV 50%

HistoMet: A Pan-Cancer Deep Learning Framework for Prognostic Prediction of Metastatic Progression and Site Tropism from Primary Tumor Histopathology

HistoMet:一种跨癌症深度学习框架,用于从原发肿瘤组织病理学预测转移进展和转移部位

Yixin Chen, Ziyu Su, Lingbin Meng, Elshad Hasanov, Wei Chen, Anil Parwani, M. Khalid Khan Niazi

专题命中 知识编辑与模型理解 :language model(abstract)

AI总结 HistoMet通过双模块预测流程,利用预训练的病理学视觉-语言模型,实现了从原发肿瘤组织病理学中预测转移进展和转移部位的稳健预测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04328 2026-02-05 cs.CV 50%

Multiview Self-Representation Learning across Heterogeneous Views

跨异质视图的多视图自表示学习

Jie Chen, Zhu Wang, Chuanbin Liu, Xi Peng

机构 * College of Computer Science, Sichuan University(四川大学计算机学院) School of Economics and Management, China University of Petroleum (Beijing)(中国石油大学(北京)经济管理学院) Law School, Sichuan University(四川大学法学院)

专题命中 知识编辑与模型理解 :pretraining(abstract)

AI总结 本文提出了一种多视图自表示学习方法,通过异质视图中的特征自表示性质,利用信息传递机制和分配概率一致性方案,实现跨不同模型的表示不变性,实验表明其优于现有方法。

Comments 12 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03910 2026-02-05 eess.IV 50%

CONRep: Uncertainty-Aware Vision-Language Report Drafting Using Conformal Prediction

CONRep:基于置信预测的不确定性感知视觉-语言报告起草

Danial Elyassirad, Benyamin Gheiji, Mahsa Vatanparast, Amir Mahmoud Ahmadzadeh, Seyed Amir Asef Agah, Mana Moassefi, Meysam Tavakoli, Shahriar Faghani

专题命中 知识编辑与模型理解 :language model(abstract)

AI总结 CONRep通过置信预测为视觉语言模型生成的放射学报告提供不确定性量化,提升自动化报告系统的透明性和临床实用性。

Comments 17 pages, 3 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02093 2026-02-03 cs.CE 50%

Cell-JEPA: Latent Representation Learning for Single-Cell Transcriptomics

Cell-JEPA: 单细胞转录组学中的潜在表示学习

Ali ElSheikh, Rui-Xi Wang, Weimin Wu, Yibo Wen, Payam Dibaeinia, Jennifer Yuntong Zhang, Jerry Yao-Chieh Hu, Mei Knudson, Sudarshan Babu, Shao-Hua Sun, Aly A. Khan, Han Liu

专题命中 知识编辑与模型理解 :foundation model(abstract)

AI总结 Cell-JEPA通过学习抗丢弃的潜在特征,在单细胞转录组学中实现了更优的细胞类型聚类和扰动预测性能。

Comments 26 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01681 2026-02-03 eess.IV cs.CV cs.MM 50%

Hyperspectral Image Fusion with Spectral-Band and Fusion-Scale Agnosticism

多光谱图像融合与光谱波段及融合尺度无关性

Yu-Jie Liang, Zihan Cao, Liang-Jian Deng, Yang Yang, Malu Zhang

机构 * University of Electronic Science and Technology of China, School of Mathematical Sciences, Chengdu, China(电子科技大学数学学院) University of Electronic Science and Technology of China, Multi-Hazard Early Warning Key Laboratory of Sichuan Province, Chengdu, China(电子科技大学四川省多灾种早期预警重点实验室) University of Electronic Science and Technology of China, School of Computer Science and Engineering (School of Cyber Security), Chengdu, China(电子科技大学计算机科学与工程学院(网络安全学院))

专题命中 知识编辑与模型理解 :foundation model(abstract)

AI总结 本文提出SSA框架,通过Matryoshka核和隐式神经表示实现光谱波段和融合尺度无关性,使单个模型能适应不同传感器和空间尺度,实现超光谱图像融合的高效泛化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.12485 2026-02-03 eess.AS 50%

I-DCCRN-VAE: An Improved Deep Representation Learning Framework for Complex VAE-based Single-channel Speech Enhancement

I-DCCRN-VAE:一种改进的深度表示学习框架用于基于复杂VAE的单通道语音增强

Jiatong Li, Simon Doclo

专题命中 知识编辑与模型理解 :pretraining(abstract)

AI总结 I-DCCRN-VAE通过改进深度表示学习框架,提升单通道语音增强在匹配与不匹配数据集上的性能与泛化能力。

Comments Accepted by ICASSP2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.23041 2026-02-02 cs.CV 50%

One-shot Optimized Steering Vector for Hallucination Mitigation for VLMs

单次优化的转向向量用于VLMs的幻觉缓解

Youxu Shi, Suorong Yang, Dong Liu

机构 * University of Science(科学大学) Nanjing University(南京大学)

专题命中 知识编辑与模型理解 :language model(abstract)

AI总结 本文提出OSGA框架,通过单次优化生成通用转向向量,有效缓解VLMs的幻觉问题并提升安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.02767 2026-02-02 cs.CV 50%

Dynamic Reflections: Probing Video Representations with Text Alignment

动态反射:通过文本对齐探测视频表示

Tyler Zhu, Tengda Han, Leonidas Guibas, Viorica Pătrăucean, Maks Ovsjanikov

机构 * Princeton University(普林斯顿大学) Google DeepMind(谷歌DeepMind)

专题命中 知识编辑与模型理解 :language model(abstract)

AI总结 本研究通过视频-文本表示对齐探索现代视频和语言编码器的能力,揭示了跨模态对齐与数据丰富性、语义对齐与性能相关性以及时间推理与对齐的关系。

Comments To appear at ICLR 2026. 27 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20279 2026-01-29 cs.CV 50%

Hallucination Begins Where Saliency Drops

幻觉始于显著性下降

Xiaofeng Zhang, Yuanchao Zhu, Chaochen Gu, Xiaosong Yuan, Qiyan Zhao, Jiawei Cao, Feilong Tang, Sinan Fan, Yaomin Shen, Chen Shen, Hao Tang

专题命中 知识编辑与模型理解 :language model(abstract)

AI总结 本文提出LVLMs-Saliency框架,通过融合注意力权重与输入梯度,利用显著性引导拒绝采样和局部连贯性强化机制,有效减少幻觉并提升模型可靠性。

Comments Accepted in ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21789 2026-01-29 cs.MA cs.CV 50%

Visual Multi-Agent System: Mitigating Hallucination Snowballing via Visual Flow

视觉多智能体系统:通过视觉流缓解幻觉雪球效应

Xinlei Yu, Chengming Xu, Guibin Zhang, Yongbo He, Zhangquan Chen, Zhucun Xue, Jiangning Zhang, Yue Liao, Xiaobin Hu, Yu-Gang Jiang, Shuicheng Yan

机构 * National University of Singapore(国立新加坡大学) Tencent Youtu Lab(腾讯优图实验室) Zhejiang University(浙江大学) Tsinghua University(清华大学) Fudan University(复旦大学)

专题命中 知识编辑与模型理解 :language model(abstract)

AI总结 本文提出ViF方法,通过视觉流和注意力重新分配缓解多智能体系统中的视觉幻觉雪球效应,提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.04634 2026-01-26 cs.CV 50%

Is What You Ask For What You Get? Investigating Concept Associations in Text-to-Image Models

你所要求的是你所得到的吗?探究文本到图像模型中的概念关联

Salma Abdel Magid, Weiwei Pan, Simon Warchol, Grace Guo, Junsik Kim, Mahia Rahman, Hanspeter Pfister

机构 * Department of Computer Science(计算机科学系) Harvard University(哈佛大学)

专题命中 知识编辑与模型理解 :language model(abstract)

AI总结 本文提出 Concept2Concept 框架,用于审计文本到图像模型中提示与生成内容之间的概念关联,通过可解释的概念和度量标准进行可视化分析。

Journal ref Trans. Mach. Learn. Res, 2835-8856, 2025, https://openreview.net/forum?id=mk1YIkVvTQ

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16208 2026-01-23 cs.CV 50%

Scaling Text-to-Image Diffusion Transformers with Representation Autoencoders

通过表征自编码器扩展文本到图像扩散变换器

Shengbang Tong, Boyang Zheng, Ziteng Wang, Bingda Tang, Nanye Ma, Ellis Brown, Jihan Yang, Rob Fergus, Yann LeCun, Saining Xie

机构 * New York University(纽约大学)

专题命中 知识编辑与模型理解 :pretraining(abstract)

AI总结 通过扩展表征自编码器实现更高效的大规模文本到图像生成,RAE在预训练和微调中均优于VAE,且具有更快的收敛速度和更好的生成质量。

Comments website: https://rae-dit.github.io/scale-rae/

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15453 2026-01-23 cs.CV 50%

DevPrompt: Deviation-Based Prompt Learning for One-Normal ShotImage Anomaly Detection

DevPrompt: 基于偏差的提示学习用于单正常样本图像异常检测

Morteza Poudineh, Marc Lalonde

机构 * Department of Electrical and Computer Engineering, Concordia University(电气与计算机工程系,康科迪亚大学) Computer Research Institute of Montreal (CRIM)(蒙特利尔计算机研究 institute)

专题命中 知识编辑与模型理解 :language model(abstract)

AI总结 DevPrompt通过结合视觉语言模型的语义能力和基于偏差的评分机制,提升单正常样本图像异常检测的性能和可解释性。

Comments 8 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14804 2026-01-22 cs.CV 50%

Symmetry Informative and Agnostic Feature Disentanglement for 3D Shapes

对3D形状的对称信息性和对称无关性特征解耦

Tobias Weißberg, Weikang Wang, Paul Roetzer, Nafie El Amrani, Florian Bernard

机构 * University of Bonn(波恩大学) Lamarr Institute(拉玛尔研究所)

专题命中 知识编辑与模型理解 :foundation model(abstract)

AI总结 本文提出了一种同时具有对称信息性和对称无关性的特征解耦方法,以提高3D形状分析的鲁棒性和准确性。

Comments Accepted at 3DV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13133 2026-01-21 cs.CV 50%

CLIP-Guided Adaptable Self-Supervised Learning for Human-Centric Visual Tasks

面向人类的视觉任务的CLIP引导自监督学习

Mingshuang Luo, Ruibing Hou, Bo Chao, Hong Chang, Zimo Liu, Yaowei Wang, Shiguang Shan

机构 * Key Laboratory of Intelligent Information Processing, Institute of Computing Technology (ICT), Chinese Academy of Sciences (CAS), and University of Chinese Academy of Sciences(智能信息处理重点实验室,计算技术研究所(ICT),中国科学院(CAS)及中国科学院大学)

专题命中 知识编辑与模型理解 :language model(abstract)

AI总结 CLASP通过CLIP生成多级语义伪标签,并结合Prompt-Controlled MoE模块提升迁移性,实现人类中心视觉任务的高效预训练。

Comments Accepted by TMM (IEEE Transactions on Multimedia), 16 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏