arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 11714 信号源:cs.CL, cs.AI, cs.LG

1. 指令微调 11714 篇

2605.19020 2026-05-20 cs.CV 78%

A Systematic Failure Analysis of Vision Foundation Models for Open Set Iris Presentation Attack Detection

对用于开放集虹膜呈现攻击检测的视觉基础模型系统性失败分析

Rahul Anand, Siddharth Singh, Dileep A D, Mahadeva Prasanna, Raghavendra Ramachandra

机构 * Indian Institute of Technology, Dharwad, India(印度德瓦德理工学院) Indian Institute of Information Technology Dharwad, India(印度德瓦德信息学院) SAFE Center, Norwegian University of Science and Technology (NTNU)(挪威科学技术大学(NTNU)的安全中心)

专题命中 指令微调 :foundation model(title,abstract)

AI总结 本文系统分析了视觉基础模型在开放集虹膜呈现攻击检测中的表现,发现其在面对未见过的攻击设备和跨光谱转移时表现不佳,强调了需要更鲁棒的虹膜检测表示方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06809 2026-05-19 cs.CV 78%

VA-Adapter: Adapting Ultrasound Foundation Model to Echocardiography Probe Guidance

VA-Adapter:将超声基础模型适应于超声心动图探头引导

Teng Wang, Haojun Jiang, Yuxuan Wang, Zhenguo Sun, Yujiao Deng, Shiji Song, Gao Huang

机构 * Department of Automation, BNRist, Tsinghua University, Beijing, China(自动化系、BNRist、清华大学、北京、中国) School of Computer Science and Technology, Xidian University(计算机科学与技术学院、西安电子科技大学) Beijing Academy of Artificial Intelligence(北京人工智能研究院) Chinese PLA General Hospital(中国人民解放军总医院)

专题命中 指令微调 :foundation model(title,abstract)

AI总结 本文提出VA-Adapter,通过将超声基础模型与理解个体三维结构的能力相结合,提高超声心动图探头引导的精度和效率,实验表明其在参数量较少的情况下表现优于现有模型。

Comments MICCAI2026 Early Accept Paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17577 2026-05-19 cs.CV 78%

TAME: Test-Time Adversarial Prompt Tuning via Mixture-of-Experts for Vision-Language Models

TAME: 通过混合专家架构实现视觉语言模型的测试时对抗提示调优

Xin Wang, Yixu Wang, Jiaming Zhang, Ruofan Wang, Jiaqi Yu, Kai Chen, Jingjing Chen, Xingjun Ma, Yu-Gang Jiang

机构 * Fellow, IEEE(IEEE会士)

专题命中 指令微调 :language model(title,abstract)

AI总结 本文提出TAME,一种基于混合专家架构的测试时防御方法,旨在提升视觉语言模型在对抗扰动下的鲁棒性,同时保持对清洁样本的泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13054 2026-05-14 cs.CV 78%

Topo-R1: Detecting Topological Anomalies via Vision-Language Models

Topo-R1: 通过视觉-语言模型检测拓扑异常

Meilong Xu, Qingqiao Hu, Xiaoling Hu, Shahira Abousamra, Xin Yu, Weimin Lyu, Kehan Qi, Dimitris Samaras, Chao Chen

机构 * Stony Brook University(石溪大学) Massachusetts General Hospital and Harvard Medical School(麻省总医院和哈佛医学院) Stanford University(斯坦福大学) Penn State University(宾夕法尼亚州立大学)

专题命中 指令微调 :language model(title,abstract)

AI总结 本文通过构建拓扑感知基准Topo-R1,评估视觉-语言模型在检测管状网络拓扑异常中的能力,发现现有模型缺乏拓扑感知,提出基于拓扑感知奖励的联合评分方法,显著提升模型在ID和OOD测试中的性能。

Comments 26 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11939 2026-05-13 cs.CV 78%

Cluster-Aware Neural Collapse Prompt Tuning for Long-Tailed Generalization of Vision-Language Models

面向长尾泛化的眼视觉-语言模型集群感知神经崩溃提示微调

Boyang Guo, Liang Li, Lin Peng, Yuhan Gao, Xichun Sheng, Chenggang Yan

机构 * Hangzhou Dianzi University(杭州电子科技大学) Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) The Hong Kong Polytechnic University(香港理工大学) Macao Polytechnic University(澳门理工学院) Zhejiang Provincial Key Laboratory of Low Altitude Ubiquitous Networking Technology, HDU(浙江省低空 ubiquitous 网络技术重点实验室,HDU)

专题命中 指令微调 :language model(title,abstract)

AI总结 本文提出集群感知神经崩溃提示微调方法,通过优化提示微调视觉-语言模型的长尾类判别能力,提升模型在类别不平衡数据集上的泛化性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10345 2026-05-12 cs.CV 78%

BGG: Bridging the Geometric Gap between Cross-View images by Vision Foundation Model Adaptation for Geo-Localization

BGG: 通过基于视觉基础模型的适应方法弥合跨视角图像间的几何差距以实现地理定位

Wei Wang, Dou Quan, Ning Huyan, Shuang Wang, Yi Li, Pei He, Licheng Jiao

机构 * Key Laboratory of Intelligent Perception and Image Understanding of Ministry of Education of China, Xidian University(中国教育部智能感知与图像理解重点实验室,西安电子科技大学) School of Telecommunications, Xidian University(西安电子科技大学电信学院) Department of Automation, Tsinghua University(清华大学自动化系)

专题命中 指令微调 :foundation model(title,abstract)

AI总结 本文提出BGG框架,通过多粒度特征增强适配器和频率感知结构聚合模块,有效提升跨视角地理定位性能,实验表明其在低训练成本下达到最先进的定位效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07850 2026-05-11 cs.CL cs.AI cs.LG 78%

MatryoshkaLoRA: Learning Accurate Hierarchical Low-Rank Representations for LLM Fine-Tuning

MatryoshkaLoRA: 学习准确的分层低秩表示以用于大语言模型微调

Ionut-Vlad Modoranu, Mher Safaryan, Dan Alistarh

机构 * ISTA Lancaster University, UK(兰卡斯特大学,英国) ISTA Institute of Science and Technology Austria (ISTA)(奥地利ISTA科学与技术研究所(ISTA))

专题命中 指令微调 :LLM(title);分类 cs.CL、cs.AI、cs.LG

AI总结 MatryoshkaLoRA通过引入固定对角矩阵P,学习准确的分层低秩表示,实现动态秩选择并提升精度-性能平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07145 2026-05-11 cond-mat.mtrl-sci cs.CV 78%

Fine-tuning a vision-language model for fracture-surface morphology recognition

对骨折表面形貌识别进行视觉-语言模型的微调

Quanliang Liu, Jungtaek Kim, Kangwook Lee, Hyunseok Oh

机构 * Department of Materials Science & Engineering, University of Wisconsin–Madison(威斯康星大学麦迪逊分校材料科学与工程系) Department of Electrical & Computer Engineering, University of Wisconsin–Madison(威斯康星大学麦迪逊分校电气与计算机工程系) KRAFTON Ludo Robotics

专题命中 指令微调 :language model(title,abstract)

AI总结 本文通过微调开源视觉-语言模型,利用定制化的13168张骨折表面图像数据集,提升了对骨折表面形貌的识别能力,展示了在材料表征中的应用潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05867 2026-05-08 cs.SE 78%

On Fixing Insecure AI-Generated Code through Model Fine-Tuning and Prompting Strategies

通过模型微调和提示策略修复不安全的AI生成代码

Ali Soltanian Fard Jahromi, Amjed Tahir, Peng Liang, Foutse Khomh

专题命中 指令微调 :prompting(title,abstract)

AI总结 本文系统研究了通过模型微调和提示策略增强AI生成代码安全性的方法,分析了不同策略和模型对安全性的提升效果,发现安全改进高度依赖策略和模型,且修复某些漏洞可能引入新漏洞。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.08156 2026-05-04 cs.CV 78%

LandSegmenter: Towards a Flexible Foundation Model for Land Use and Land Cover Mapping

LandSegmenter:面向土地利用与覆盖制图的灵活基础模型

Chenying Liu, Wei Huang, Xiao Xiang Zhu

机构 * Chair of Data Science in Earth Observation, Technical University of Munich(地球观测数据科学教授职位,慕尼黑技术大学) Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心(MCML))

专题命中 指令微调 :foundation model(title,abstract)

AI总结 本文提出LandSegmenter框架,解决土地利用与覆盖制图中数据需求高、模型泛化性差的问题,通过多模态数据集、跨模态特征提取和置信度引导融合策略提升模型性能。

Comments Accepted by ISPRS for publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23166 2026-04-28 cs.CY cs.CV 78%

A satellite foundation model for improved wealth monitoring

一种用于改进财富监测的卫星基础模型

Zhuo Zheng, Iván Higuera-Mendieta, Richard Lee, David Newhouse, Talip Kilic, Stefano Ermon, Marshall Burke, David B. Lobell

机构 * Department of Computer Science, Stanford University(斯坦福大学计算机科学系) Department of Earth System Science, Stanford University(斯坦福大学地球系统科学系) Center on Food Security and the Environment, Stanford University(斯坦福大学食品安全与环境中心) Development Economics Data Group, World Bank Group(世界银行发展经济学数据组) Department of Environmental Social Science, Stanford University(斯坦福大学环境社会科学系)

专题命中 指令微调 :foundation model(title,abstract)

AI总结 本文提出Tempov模型,通过自监督学习预训练并高效微调,实现大规模高精度财富映射与动态监测,减少对昂贵标签的依赖,并在非洲大陆层面取得良好性能。

Comments 22 pages, 10 figures, technical report

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12845 2026-04-24 cs.CV 78%

Multimodal Protein Language Models for Enzyme Kinetic Parameters: From Substrate Recognition to Conformational Adaptation

多模态蛋白质语言模型用于酶动力学参数:从底物识别到构象适应

Fei Wang, Xinye Zheng, Kun Li, Yanyan Wei, Yuxin Liu, Ganpeng Hu, Tong Bao, Jingwen Yang

机构 * School of Computer Science and Information Engineering(计算机科学与信息工程学院) Institute of Artificial Intelligence(人工智能研究院) CVLab, College of Information Technology(CV实验室,信息学院) Intelligent Interconnected Systems Laboratory of Anhui Province(安徽省智能互联系统实验室) School of Food Biological Engineering(食品生物工程学院)

专题命中 指令微调 :language model(title,abstract)

AI总结 本文提出多阶段多模态条件建模方法,通过ERBA模块在蛋白质语言模型中注入跨模态信息,提升酶动力学参数预测的准确性与生物合理性。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20361 2026-04-23 cs.CV 78%

Object Referring-Guided Scanpath Prediction with Perception-Enhanced Vision-Language Models

基于感知增强的视觉-语言模型的物体指称引导的注视路径预测

Rong Quan, Yantao Lai, Dong Liang, Jie Qin

机构 * Nanjing University of Aeronautics and Astronautics(南京航空航天大学)

专题命中 指令微调 :language model(title,abstract)

AI总结 本文提出ScanVLA模型,通过融合视觉和语言特征提升物体指称引导的注视路径预测性能,引入历史增强解码器和冻结分割LoRA辅助定位,提升预测精度且不增加计算成本。

Comments ICMR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18250 2026-04-21 cs.CV 78%

Medical Image Understanding Improves Survival Prediction via Visual Instruction Tuning

医学图像理解通过视觉指令调优提升生存预测

Xixi Liu, Jorge Lazo, Andreas Hallqvist, Mikael Johansson, Åse Johnsson, Jonas S Andersson, Ella Äng Eklund, Patrik Sund, Nasser Hosseini, Jennifer Alvén, Ida Häggström

机构 * Chalmers University of Technology(查尔姆斯理工大学)

专题命中 指令微调 :instruction tuning(title,abstract)

AI总结 本文提出基于3D CT图像的视觉-语言框架,利用大规模公开CT图像与放射科报告进行视觉指令调优,提升生存预测能力,并在临床数据不足时表现更优。

Comments Submitted to MICCAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18075 2026-04-21 cs.CV 78%

Enhancing Continual Learning of Vision-Language Models via Dynamic Prefix Weighting

通过动态前缀加权增强视觉-语言模型的持续学习

Hyeonseo Jang, Hyuk Kwon, Kibok Lee

机构 * Yonsei University(延世大学)

专题命中 指令微调 :language model(title,abstract)

AI总结 本文提出动态前缀加权框架,通过动态调整前缀权重和适配器机制,提升视觉-语言模型在领域-类别增量学习中的性能。

Comments CVPR 2026; revised text and figures for improved readability

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.10635 2026-04-20 cs.CV 78%

ChatENV: An Interactive Vision-Language Model for Sensor-Guided Environmental Monitoring and Scenario Simulation

ChatENV: 一种用于传感器引导的环境监测和场景模拟的交互式视觉-语言模型

Hosam Elgendy, Ahmed Sharshar, Ahmed Aboeitta, Mohsen Guizani

机构 * Mohamed bin Zayed University of Artificial Intelligence(莫扎德·本·扎耶德人工智能大学)

专题命中 指令微调 :language model(title,abstract)

AI总结 ChatENV通过整合卫星图像与真实传感器数据,实现环境变化的时序推理与假设验证,提升了环境监测的交互性和准确性。

Comments 11 pages, 5 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15703 2026-04-20 cs.CV 78%

P3T: Prototypical Point-level Prompt Tuning with Enhanced Generalization for 3D Vision-Language Models

P3T: 用于3D视觉-语言模型的增强泛化原型点级提示微调

Geunyoung Jung, Soohong Kim, Kyungwoo Song, Jiyoung Jung

机构 * Department of Artificial Intelligence, University of Seoul(首尔大学人工智能系) Department of Applied Statistics, Yonsei University(延世大学应用统计系)

专题命中 指令微调 :language model(title,abstract)

AI总结 本文提出P3T,一种针对3D视觉-语言模型的高效提示微调方法,通过点级提示器和文本提示器提升模型泛化能力,并引入原型损失减少类别内方差,实验表明其在分类和少样本学习中表现优异。

Comments Accepted by ICRA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14973 2026-04-17 cs.CR cs.CV 78%

Robustness of Vision Foundation Models to Common Perturbations

视觉基础模型对常见扰动的鲁棒性

Hongbin Liu, Zhengyuan Jiang, Cheng Hong, Neil Zhenqiang Gong

机构 * Duke University(杜克大学) Ant Group(蚂蚁集团)

专题命中 指令微调 :foundation model(title,abstract)

AI总结 研究探讨了视觉基础模型对常见扰动的鲁棒性,提出三种鲁棒性指标和五种数学性质,评估了六个行业级模型,发现其普遍不鲁棒,并提出改进方法。

Comments Accepted by CVPR 2026 Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12371 2026-04-16 cs.CV 78%

Reading Between the Pixels: Linking Text-Image Embedding Alignment to Typographic Attack Success on Vision-Language Models

在像素之间阅读:将文本-图像嵌入对齐与字体攻击成功性联系起来

Ravikumar Balakrishnan, Sanket Mendapara, Ankit Garg

机构 * Cisco Systems(思科系统)

专题命中 指令微调 :language model(title,abstract)

AI总结 研究了视觉-语言模型中字体提示注入攻击的影响,发现字体大小、文本攻击有效性及嵌入距离对攻击成功率有显著影响,为防御策略提供实证指导。

Comments Accepted at ICLR 2026 Workshop on Agents in the Wild

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15564 2026-04-14 cs.CV 78%

On the Effectiveness of Textual Prompting with Lightweight Fine-Tuning for SAM3 Remote Sensing Segmentation

在轻量级微调下文本提示对SAM3遥感分割有效性研究

Roni Blushtein-Livnon, Osher Rafaeli, David Ioffe, Amir Boger, Karen Sandberg Esquenazi, Tal Svoray

机构 * Ben-Gurion University of the Negev(内盖夫本-古里安大学)

专题命中 指令微调 :prompting(title,abstract)

AI总结 本文探讨了在有限监督下,通过文本提示和轻量级微调提升SAM3在遥感图像分割中的性能,发现结合语义和几何信息能获得最佳效果,而纯文本提示在不规则目标上表现较差。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21334 2026-04-13 cs.CV 78%

Streaming Video Instruction Tuning

流式视频指令微调

Jiaer Xia, Peixian Chen, Mengdan Zhang, Xing Sun, Kaiyang Zhou

机构 * Hong Kong Baptist University(香港浸会大学) Tencent Youtu Lab(腾讯优图实验室)

专题命中 指令微调 :instruction tuning(title);LLM(abstract)

AI总结 本文提出Streamo,一个实时流式视频大语言模型,能执行多种视频任务,如实时叙述、动作理解等。通过大规模指令遵循数据集训练,Streamo在时间推理和多任务处理上表现优异,填补了离线视频模型与实时多模态助手之间的差距。

Comments Accepted by CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27139 2026-04-07 cs.CV 78%

The Geometry of Robustness: Optimizing Loss Landscape Curvature and Feature Manifold Alignment for Robust Finetuning of Vision-Language Models

鲁棒性几何:优化损失景观曲率和特征流形对齐以增强视觉-语言模型的鲁棒微调

Shivang Chopra, Shaunak Halbe, Chengyue Huang, Brisa Maneechotesuwan, Zsolt Kira

机构 * Georgia Institute of Technology(佐治亚理工学院)

专题命中 指令微调 :language model(title,abstract)

AI总结 本文提出GRACE框架,通过联合调节参数空间曲率和特征空间不变性,提升视觉-语言模型在分布内准确率、分布外泛化和对抗鲁棒性之间的平衡,实验显示在ImageNet微调中ID准确率提升10.8%,对抗准确率提升13.5%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02009 2026-04-03 cs.CV 78%

Test-Time Adaptation for Height Completion via Self-Supervised ViT Features and Monocular Foundation Models

通过自监督ViT特征和单目基础模型实现高度补全的测试时适应

Osher Rafaeli, Tal Svoray, Ariel Nahlieli

机构 * Ben-Gurion University of the Negev(内盖夫本-古里安大学)

专题命中 指令微调 :foundation model(title,abstract)

AI总结 本文提出Prior2DSM方法,利用自监督ViT特征和单目深度基础模型,在测试时完成高度补全,通过语义特征空间对应传播度量信息,提升重建精度并减少误差。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00661 2026-04-02 astro-ph.GA astro-ph.IM 78%

OJALÁ: Optimizing J-PAS Astronomy for Large-scale Analysis. A foundation model for the SED of galaxies, QSOs and stars

OJALÁ:优化J-PAS天文学以进行大规模分析。一个用于星系、类星体和恒星SED的基础模型

G. Martínez-Solaeche, R. M. González Delgado, R. García-Benito, A. Hernán-Caballero, I. Pérez-Ràfols, L. A. Díaz-García, L. Raul Abramo, J. E. Rodríguez-Martín, A. M. Conrado, I. Breda, H. Domínguez Sánchez, I. Márquez, M. Pieri, D. López-Cano, V. M. Placco, L. Nakazono, A. del Pino, V. Marra, J. Alcaniz, N. Benitez, S. Bonoli, S. Carneiro, A. J. Cenarro, D. Cristóbal-Hornillos, S. Daflon, R. A. Dupke, A. Ederoclite, C. Hernández-Monteagudo, J. Liu, C. López-Sanjuan, A. Marín-Franch, C. Mendes de Oliveira, M. Moles, F. Roig, L. Sodré, K. Taylor, J. Varela, H. Vázquez Ramió, J. M. Vílchez, J. Zaragoza-Cardiel

专题命中 指令微调 :foundation model(title,abstract)

AI总结 本文提出OJALA模型,利用J-PAS的54条窄带与DESI和WISE的宽带数据,通过Transformer架构实现天体分类和物理参数推断,展示其在光谱分类、红移精度、星系物理性质估计等方面的表现。

Comments 23 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00592 2026-04-02 cs.CV cs.HC 78%

HarassGuard: Detecting Harassment Behaviors in Social Virtual Reality with Vision-Language Models

HarassGuard: 在社交虚拟现实中利用视觉-语言模型检测骚扰行为

Junhee Lee, Minseok Kim, Hwanjo Heo, Seungwon Woo, Jinwoo Kim

机构 * Kwangwoon University(光云大学) ETRI(韩国电子通信研究院) Chungbuk National University(忠北大学)

专题命中 指令微调 :language model(title,abstract)

AI总结 本文提出HarassGuard系统,通过视觉输入检测社交VR中的身体骚扰行为,利用提示工程和微调VLMs,在不使用敏感生物数据的情况下实现高准确率的骚扰检测。

Comments To appear in the 2026 TVCG Special Issue on the 2026 IEEE Conference on Virtual Reality and 3D User Interfaces (VR)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13352 2026-03-30 cs.CV 78%

Local Precise Refinement: A Dual-Gated Mixture-of-Experts for Enhancing Foundation Model Generalization against Spectral Shifts

局部精确细化:一种双门控专家混合模型用于增强对抗光谱偏移的基础模型泛化能力

Xi Chen, Maojun Zhang, Yu Liu, Shen Yan

机构 * National University of Defense Technology(国防科技大学)

专题命中 指令微调 :foundation model(title,abstract)

AI总结 本文提出SpectralMoE,通过双门控专家混合模型实现基础模型的局部精确细化,以提升光谱偏移下的语义分割性能,实验表明其在多个基准上达到新状态。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25411 2026-03-27 cs.CV 78%

HiSpatial: Taming Hierarchical 3D Spatial Understanding in Vision-Language Models

HiSpatial:在视觉-语言模型中驯服层次化3D空间理解

Huizhi Liang, Yichao Shen, Yu Deng, Sicheng Xu, Zhiyuan Feng, Tong Zhang, Yaobo Liang, Jiaolong Yang

机构 * Tsinghua University(清华大学) Microsoft Research Asia(微软亚洲研究院) Xi’an Jiaotong University(西安交通大学) University of the Chinese Academy of Sciences(中国科学院大学)

专题命中 指令微调 :language model(title,abstract)

AI总结 本文提出一种层次化框架,通过分解VLM中3D空间理解的学习过程,从几何感知到抽象空间推理,生成多样化任务和场景的3D空间VQA对,提升视觉-语言模型的空间理解能力。

Comments Accepted by CVPR 2026. Project page: https://microsoft.github.io/HiSpatial

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23730 2026-03-26 cs.CV 78%

An Adapter-free Fine-tuning Approach for Tuning 3D Foundation Models

一种无需适配器的微调方法用于调整3D基础模型

Sneha Paul, Zachary Patterson, Nizar Bouguila

机构 * Concordia University(康科德大学)

专题命中 指令微调 :foundation model(title,abstract)

AI总结 本文提出MCFT方法,通过选择性微调和动量一致性约束,在保持参数效率的同时提升3D基础模型的适应能力,实验表明其在少样本和半监督场景下表现优异。

Comments Accepted at The Fifth International Conference on Pattern Recognition and Artificial Intelligence (ICPRAI 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01248 2026-03-25 cs.CV 78%

TRivia: Self-supervised Fine-tuning of Vision-Language Models for Table Recognition

TRivia: 基于视觉-语言模型的自监督微调用于表格识别

Junyuan Zhang, Bin Wang, Qintong Zhang, Fan Wu, Zichen Wen, Jialin Lu, Junjie Shan, Ziqi Zhao, Shuya Yang, Ziling Wang, Ziyang Miao, Huaping Zhong, Yuhang Zang, Xiaoyi Dong, Ka-Ho Chow, Conghui He

机构 * The University of Hong Kong(香港大学) Shanghai AI Laboratory(上海人工智能实验室) Peking University(北京大学) Shanghai Jiaotong University(上海交通大学) Sensetime

专题命中 指令微调 :language model(title,abstract)

AI总结 TRivia通过自监督微调方法,使预训练视觉-语言模型直接从未标注的表格图像中学习表格识别,无需人工标注,提升了表格识别性能。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17079 2026-03-19 cs.CV 78%

ACE-LoRA: Graph-Attentive Context Enhancement for Parameter-Efficient Adaptation of Medical Vision-Language Models

ACE-LoRA:图注意上下文增强用于医疗视觉-语言模型的参数高效适应

M. Arda Aydın, Melih B. Yilmaz, Aykut Koç, Tolga Çukur

机构 * Bilkent University(比尔肯特大学) National Magnetic Resonance Research Center (UMRAM)(国家磁共振研究所以及UMRAM)

专题命中 指令微调 :language model(title,abstract)

AI总结 本文提出ACE-LoRA框架,通过整合LoRA模块和ACE-HGNN模块,提升医疗VLM的零样本泛化能力,解决领域特异性与泛化能力的平衡问题。

详情

展开后加载摘要…

URL PDF HTML 收藏