arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 11714 信号源:cs.CL, cs.AI, cs.LG

1. 指令微调 11714 篇

2602.13293 2026-03-19 cs.CV eess.IV 78%

NutVLM: A Self-Adaptive Defense Framework against Full-Dimension Attacks for Vision Language Models in Autonomous Driving

NutVLM: 一种针对自动驾驶中视觉语言模型全维度攻击的自适应防御框架

Xiaoxu Peng, Dong Zhou, Jianwen Zhang, Guanghui Sun, Anh Tu Ngo, Anupam Chattopadhyay

机构 * Department of Control Science and Engineering, Harbin Institute of Technology(控制科学与工程系,哈尔滨工业大学) College of Computing and Data Science, Nanyang Technological University(计算与数据科学学院,南洋理工大学)

专题命中 指令微调 :language model(title,abstract)

AI总结 本文提出NutVLM框架,通过NutNet++ sentinel检测并净化良性样本、局部修补和全局扰动,结合高效灰度遮蔽和专家引导的对抗提示调优,提升自动驾驶中视觉语言模型的鲁棒性与性能。

Comments 12 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16653 2026-03-18 cs.CV 78%

HeBA: Heterogeneous Bottleneck Adapters for Robust Vision-Language Models

HeBA:异构瓶颈适配器用于鲁棒的视觉-语言模型

Md Jahidul Islam

机构 * Department of Electrical and Electronic Engineering(电气电子工程系) Bangladesh University of Engineering and Technology(孟加拉工程与技术大学)

专题命中 指令微调 :language model(title,abstract)

AI总结 HeBA通过引入模态特定的结构归纳偏置,改进了视觉-语言模型在下游任务中的适应性,提升了稳定性和准确性,达到11个少样本基准的新状态。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10967 2026-03-18 cs.CV 78%

Med-DualLoRA: Local Adaptation of Foundation Models for 3D Cardiac MRI

Med-DualLoRA: 3D心脏MRI基础模型的局部适应

Joan Perramon-Llussà, Amelia Jiménez-Sánchez, Grzegorz Skorupko, Fotis Avgoustidis, Carlos Martín-Isla, Karim Lekadir, Polyxeni Gkontra

机构 * Artificial Intelligence in Medicine Lab (BCN-AIM), Departament de Matemàtiques i Informàtica, Universitat de Barcelona, Spain(巴塞罗那大学人工智能医学实验室(BCN-AIM)、数学与计算机科学系,西班牙) Institució Catalana de Recerca i Estudis Avançats (ICREA), Barcelona, Spain(加泰罗尼亚高级研究机构(ICREA),巴塞罗那,西班牙)

专题命中 指令微调 :foundation model(title,abstract)

AI总结 本文提出Med-DualLoRA框架,通过解耦全局共享和局部低秩适应,实现3D心脏MRI疾病检测的联邦学习,提升个性化与通信效率。

Comments 11 pages, 2 figures. Submitted to MICCAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15003 2026-03-17 cs.CV 78%

Edit2Interp: Adapting Image Foundation Models from Spatial Editing to Video Frame Interpolation with Few-Shot Learning

Edit2Interp:从空间编辑到视频帧插值的图像基础模型适应

Nasrin Rahimi, Mısra Yavuz, Burak Can Biner, Yunus Bilge Kurt, Ahmet Rasim Emirdağı, Süleyman Aslan, Görkay Aydemir, M. Akın Yılmaz, A. Murat Tekalp

机构 * Codeway AI Research Dept. of Electrical \& Electronics Engineering, Ko c University, \. I stanbul, T\" u rkiye

专题命中 指令微调 :foundation model(title,abstract)

AI总结 本文通过少量样本学习,将图像编辑模型适应于视频帧插值,揭示了静态场景中物体变换的理解可激活潜在的时间推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06999 2026-03-17 cs.CV 78%

TrajPred: Trajectory-Conditioned Joint Embedding Prediction for Surgical Instrument-Tissue Interaction Recognition in Vision-Language Models

TrajPred: 基于轨迹的联合嵌入预测用于视觉-语言模型中手术器械-组织交互识别

Jiajun Cheng, Xiaofan Yu, Subarna Tripathi, Sainan Liu, Shan Lin

专题命中 指令微调 :language model(title,abstract)

AI总结 本文提出TrajPred框架,通过编码器械轨迹融入时间运动线索,并基于轨迹引入预测模块生成更精确的视觉语义嵌入,提升手术器械-组织交互识别的准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.03565 2026-03-17 cs.CV 78%

INST-IT: Boosting Instance Understanding via Explicit Visual Prompt Instruction Tuning

INST-IT:通过显式视觉提示指令微调提升实例理解

Wujian Peng, Lingchen Meng, Yitong Chen, Yiweng Xie, Yang Liu, Tao Gui, Hang Xu, Xipeng Qiu, Zuxuan Wu, Yu-Gang Jiang

专题命中 指令微调 :instruction tuning(title,abstract)

AI总结 本文提出INST-IT方法,通过显式视觉提示指令微调提升大模型的实例理解能力,构建了评估基准和数据集,并在多个基准上验证了方法的有效性。

Comments Accepted by NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12989 2026-03-16 cs.CV cs.CR 78%

Test-Time Attention Purification for Backdoored Large Vision Language Models

针对受污染的大视觉语言模型的测试时间注意力净化

Zhifang Zhang, Bojun Yang, Shuo He, Weitong Chen, Wei Emma Zhang, Olaf Maennel, Lei Feng, Miao Xu

机构 * University of Queensland(昆士兰大学) Southeast University(东南大学) Nanyang Technological University(南洋理工大学) Adelaide University(阿德莱德大学)

专题命中 指令微调 :language model(title,abstract)

AI总结 本文提出CleanSight,一种无需训练的测试时间防御方法,通过检测和净化异常的视觉-文本注意力分布来对抗后门攻击,显著优于现有基于像素的净化方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02421 2026-03-13 cs.CV 78%

Generalizing Vision-Language Models with Dedicated Prompt Guidance

通过专用提示引导泛化视觉语言模型

Xinyao Li, Yinjie Min, Hongbo Chen, Zhekai Du, Fengling Li, Jingjing Li

专题命中 指令微调 :language model(title,abstract)

AI总结 本文提出GuiDG框架,通过提示微调和跨模态注意力模块提升视觉语言模型的领域泛化能力,并在ImageNet-DG上验证了其有效性。

Comments Accepted to AAAI26

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08708 2026-03-10 cs.CV 78%

FVG-PT: Adaptive Foreground View-Guided Prompt Tuning for Vision-Language Models

FVG-PT:适应性前景视图引导的提示微调用于视觉-语言模型

Haoyang Li, Liang Wang, Siyu Zhou, Jiacheng Sun, Jing Jiang, Chao Wang, Guodong Long, Yan Peng

机构 * University of Technology Sydney(悉尼技术大学) Shanghai University(上海大学)

专题命中 指令微调 :language model(title,abstract)

AI总结 FVG-PT通过引入前景可靠性门、蒸馏补偿模块和先验校准模块,解决提示微调中前景注意力偏移问题,提升视觉-语言模型的适应性和泛化能力。

Comments 27 Pages, 9 Figures, 15 Tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08497 2026-03-10 cs.CV 78%

Reading $\neq$ Seeing: Diagnosing and Closing the Typography Gap in Vision-Language Models

阅读≠视觉:诊断和缩小视觉语言模型中的字形差距

Heng Zhou, Ao Yu, Li Kang, Yuchen Fan, Yutao Fan, Xiufeng Song, Hejia Geng, Yiran Qin

专题命中 指令微调 :language model(title,abstract)

AI总结 本文研究了视觉语言模型在字形识别上的不足,发现字体风格检测能力差,通过微调提升模型性能,揭示训练数据缺失问题,并提出需架构创新以改进关系性视觉推理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07468 2026-03-10 cs.CV 78%

FedEU: Evidential Uncertainty-Driven Federated Fine-Tuning of Vision Foundation Models for Remote Sensing Image Segmentation

FedEU: 基于证据不确定性的联邦微调视觉基础模型用于遥感图像分割

Xiaokang Zhang, Xuran Xiong, Jianzhong Huang, Lefei Zhang

机构 * School of Artificial Intelligence, Wuhan University(武汉大学人工智能学院) School of Information Science and Engineering, Wuhan University of Science and Technology(武汉科技大学信息科学与工程学院) School of Computer Science, Wuhan University(武汉大学计算机学院)

专题命中 指令微调 :foundation model(title,abstract)

AI总结 FedEU通过证据不确定性驱动联邦微调,提升遥感图像分割在异构数据下的鲁棒性和泛化能力。

Comments 14 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.14273 2026-03-09 eess.AS cs.SD 78%

Efficient Emotion and Speaker Adaptation in LLM-Based TTS via Characteristic-Specific Partial Fine-Tuning

基于特征特定部分微调的LLM语音合成中高效情感与说话人适应

Tianrui Wang, Meng Ge, Cheng Gong, Chunyu Qiang, Haoyu Wang, Zikang Huang, Yu Jiang, Ye Ni, Yuheng Lu, Xiaobao Wang, Engsiong Chng, Xie Chen, Longbiao Wang, Jianwu Dang

机构 * Tianjin Key Laboratory of Cognitive Computing and Application(天津认知计算与应用重点实验室) College of Intelligence and Computing(智能与计算学院) Tianjin University(天津大学) TeleAI, China Telecom(TeleAI,中国电信) Southeast University(东南大学) Shanghai Jiao Tong University(上海交通大学) Huiyan Technology Co., Ltd(慧言科技有限公司) Nanyang Technological University(南洋理工大学) Shenzhen Institute of Advanced Technology, Chinese Academy of Sciences(深圳先进技术研究所,中国科学院)

专题命中 指令微调 :LLM(title,abstract)

AI总结 本文提出CSP-FT方法,通过特征特定部分微调提升LLM语音合成在情感和说话人适应中的性能,实现参数更新效率与模型表现的平衡。

Comments 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.18864 2026-03-06 cs.CV 78%

Flatness Guided Test-Time Adaptation for Vision-Language Models

基于平坦度引导的视觉-语言模型测试时适应

Aodi Li, Liansheng Zhuang, Xiao Long, Houqiang Li, Shafei Wang

机构 * School of Cyber Science and Technology, University of Science and Technology of China(中国科学技术大学网络科学与技术学院) National Engineering Laboratory for Brain-Inspired Intelligence Technology and Applications, University of Science and Technology of China(中国科学技术大学脑启发式智能技术与应用国家工程实验室) Peng Cheng Laboratory, Shenzhen, China(深圳鹏城实验室)

专题命中 指令微调 :language model(title,abstract)

AI总结 本文提出基于平坦度引导的视觉-语言模型测试时适应框架,通过训练时的平坦最小值与测试时损失景观的对齐,提升模型在分布偏移下的适应性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19024 2026-02-24 cs.CV 78%

Towards Calibrating Prompt Tuning of Vision-Language Models

面向视觉-语言模型提示微调的校准

Ashshak Sharifdeen, Fahad Shamshad, Muhammad Akhtar Munir, Abhishek Basu, Mohamed Insaf Ismithdeen, Jeyapriyan Jeyamohan, Chathurika Sewwandi Silva, Karthik Nandakumar, Muhammad Haris Khan

机构 * Mohamed bin Zayed University of AI(Mohamed bin Zayed人工智能大学) University of Colombo(科伦坡大学) Michigan State University(密歇根州立大学)

专题命中 指令微调 :language model(title,abstract)

AI总结 本文提出一种校准框架,通过引入均值-方差边际惩罚和文本矩匹配损失,提升视觉-语言模型提示微调的预测可靠性与置信度校准。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18766 2026-02-24 cs.CV 78%

Initialization matters in few-shot adaptation of vision-language models for histopathological image classification

初始化在视觉-语言模型少量样本适应中的重要性

Pablo Meseguer, Rocío del Amor, Valery Naranjo

机构 * Instituto Universitario de Investigación en Tecnología Centrada en el Ser Humano (HUMAN-Tech)(人类中心技术研究所) Universitat Politécnica de Valencia(巴塞罗那理工大学) Valencian Graduate School and Research Network for Artificial Intelligence (valgrAI)(瓦伦西亚人工智能研究生院和研究网络)

专题命中 指令微调 :language model(title,abstract)

AI总结 本文提出ZS-MIL方法,通过利用视觉-语言模型的类级嵌入优化分类器初始化,提升少量样本场景下的病理图像分类性能。

Comments Accepted as oral presentation at CASEIB 2024 held in Sevilla, Spain

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.01239 2026-02-16 eess.IV cs.CV 78%

Can Foundation Models Really Segment Tumors? A Benchmarking Odyssey in Lung CT Imaging

基础模型真的能分割肿瘤吗?在肺部CT成像中的基准测试之旅

Elena Mulero Ayllón, Massimiliano Mantegna, Linlin Shen, Paolo Soda, Valerio Guarrasi, Matteo Tortora

机构 * College of Computer Science and Software Engineering, Shenzhen University(计算机科学与软件工程学院,深圳大学) Department of Naval, Electrical, Electronics and Telecommunications Engineering, University of Genoa(海军、电气、电子与电信工程部门,热那亚大学)

专题命中 指令微调 :foundation model(title,abstract)

AI总结 本研究评估了基础模型在肺部CT肿瘤分割中的性能,发现MedSAM~2在精度和效率上优于传统模型,展示了其在临床应用中的潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09445 2026-02-11 cs.IR 78%

Personalized Parameter-Efficient Fine-Tuning of Foundation Models for Multimodal Recommendation

面向多模态推荐的个性化参数高效微调

Sunwoo Kim, Hyunjin Hwang, Kijung Shin

专题命中 指令微调 :foundation model(title,abstract)

AI总结 本文提出PerPEFT,一种面向多模态推荐的个性化参数高效微调策略,通过按兴趣分组并为每个组分配独立模块,提升推荐效果。

Comments To be published at The Web Conference 2026 (WWW 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08505 2026-02-10 cs.CV 78%

Are Vision Foundation Models Foundational for Electron Microscopy Image Segmentation?

视觉基础模型是否对电子显微镜图像分割具有基础性作用?

Caterina Fuster-Barceló, Virginie Uhlmann

机构 * Department of Molecular Life Sciences, Universität Zürich(分子生命科学系,苏黎世大学)

专题命中 指令微调 :foundation model(title,abstract)

AI总结 本文研究了视觉基础模型在电子显微镜图像分割中的有效性,发现LoRA能提升单域性能,但多域训练导致性能下降,需额外领域对齐机制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06636 2026-02-09 cs.NI 78%

Talk Like a Packet: Rethinking Network Traffic Analysis with Transformer Foundation Models

像数据包一样说话:用Transformer基础模型重新思考网络流量分析

Samara Mayhoub, Chuan Heng Foh, Mahdi Boloursaz Mashhadi, Mohammad Shojafar, Rahim Tafazolli

专题命中 指令微调 :foundation model(title,abstract)

AI总结 本文提出基于Transformer的基础模型用于网络流量分析,通过统一预训练和微调流程,展示了模型在多种任务中的泛化能力及性能优势。

Comments Accepted for publication in IEEE Communications Magazine

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06507 2026-02-09 cs.CV 78%

FloorplanVLM: A Vision-Language Model for Floorplan Vectorization

FloorplanVLM:一种用于平面图向量化的视觉-语言模型

Yuanqing Liu, Ziming Yang, Yulong Li, Yue Yang

机构 * Beike(贝克)

专题命中 指令微调 :language model(title);SFT(abstract)

AI总结 FloorplanVLM通过像素到序列的范式,实现复杂平面图向量化的高精度与高鲁棒性,其统一框架和渐进训练策略在工程级向量化任务中表现出色。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.15592 2026-02-09 cs.CV 78%

VP Lab: a PEFT-Enabled Visual Prompting Laboratory for Semantic Segmentation

VP Lab: 一种支持PEFT的视觉提示实验室用于语义分割

Niccolo Avogaro, Thomas Frick, Yagmur G. Cinar, Daniel Caraballo, Cezary Skura, Filip M. Janicki, Piotr Kluska, Brown Ebouky, Nicola Farronato, Florian Scheidegger, Cristiano Malossi, Konrad Schindler, Andrea Bartezzaghi, Roy Assaf, Mattia Rigotti

机构 * IBM Research(IBM研究院) ETH Zürich(苏黎世联邦理工学院)

专题命中 指令微调 :prompting(title,abstract)

AI总结 VP Lab通过E-PEFT技术提升视觉提示的语义分割性能,实现高效且交互式的模型部署。

Journal ref IEEE/CVF Conference on Computer Vision and Pattern Recognition, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04565 2026-02-05 cs.CV 78%

Understanding Degradation with Vision Language Model

理解视觉退化

Guanzhou Lan, Chenyi Liao, Yuqi Yang, Qianli Ma, Zhigang Wang, Dong Wang, Bin Zhao, Xuelong Li

机构 * School of Artificial Intelligence, OPtics and ElectroNics (iOPEN), Northwestern Polytechnical University(人工智能学院、光学与电子学(iOPEN)、西北工业大学) Honors College, Northwestern Polytechnical University(荣誉学院、西北工业大学) Shanghai AI Laboratory(上海人工智能实验室) School of Artificial Intelligence, Shanghai Jiaotong University(人工智能学院、上海交通大学)

专题命中 指令微调 :language model(title,abstract)

AI总结 本文提出DU-VLM模型,通过结构化奖励强化学习解决视觉退化理解问题,引入大规模数据集并实现高保真图像恢复。

Comments 17 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.18998 2026-02-05 eess.AS 78%

MOSA: Mixtures of Simple Adapters Outperform Monolithic Approaches in LLM-based Multilingual ASR

MOSA:混合简单适配器在基于LLM的多语言语音识别中优于单体方法

Junjie Li, Jing Peng, Yangui Fang, Shuai Wang, Kai Yu

专题命中 指令微调 :LLM(title,abstract)

AI总结 MOSA通过混合简单适配器在基于LLM的多语言语音识别中实现更高性能和更高效的参数使用。

Comments 5 pages, 3 figures, accepted to ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.26441 2026-01-27 cs.CV 78%

A-TPT: Angular Diversity Calibration Properties for Test-Time Prompt Tuning of Vision-Language Models

A-TPT:面向视觉语言模型测试时提示微调的角多样性校准特性

Shihab Aaqil Ahamed, Udaya S. K. P. Miriya Thanthrige, Ranga Rodrigo, Muhammad Haris Khan

机构 * Dept. of Electronic and Telecommunication Engineering, University of Moratuwa(摩图瓦大学电子与电信工程系) Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)

专题命中 指令微调 :language model(title,abstract)

AI总结 A-TPT通过引入角度多样性提升视觉语言模型测试时提示微调的校准性能,有效减少校准误差并提升适应能力。

Comments Accepted at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05758 2026-01-27 cs.SD 78%

EMORL-TTS: Reinforcement Learning for Fine-Grained Emotion Control in LLM-based TTS

EMORL-TTS:基于强化学习的LLM-TTS细粒度情感控制

Haoxun Li, Yu Liu, Yuqing Sun, Hanlei Shi, Leyuan Qu, Taihao Li

机构 * Hangzhou Institute for Advanced Study, University of Chinese Academy of Sciences(杭州高等研究 institute,中国科学院大学)

专题命中 指令微调 :LLM(title,abstract)

AI总结 EMORL-TTS通过强化学习实现基于LLM的TTS系统中细粒度情感控制,提升情感准确性与强度区分度。

Comments Accepted by ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12366 2026-01-21 cs.CV 78%

DepthCropSeg++: Scaling a Crop Segmentation Foundation Model With Depth-Labeled Data

DepthCropSeg++: 通过深度标注数据扩展作物分割基础模型

Jiafei Zhang, Songliang Cao, Binghui Xu, Yanan Li, Weiwei Jia, Tingting Wu, Hao Lu, Weijuan Hu, Zhiguo Han

机构 * MetaPheno Laboratory(MetaPheno实验室) PhenoTrait Technology Co., Ltd.(PhenoTrait技术有限公司) Wuhan Digital Engineering Institute(武汉数字工程研究院) National Key Laboratory of Multispectral Information Intelligent Processing Technology(国家多光谱信息智能处理技术重点实验室) School of Artificial Intelligence and Automation, Huazhong University of Science and Technology(华中科技大学人工智能与自动化学院) Hubei Key Laboratory of Intelligent Robot(湖北省智能机器人重点实验室) School of Computer Science and Engineering, School of Artificial Intelligence, Wuhan Institute of Technology(武汉理工大学计算机科学与工程学院、人工智能学院)

专题命中 指令微调 :foundation model(title,abstract)

AI总结 DepthCropSeg++通过深度标注数据扩展作物分割模型,采用两阶段自训练流程提升性能,实现93.11%的mIoU,超越监督基线和SAM模型。

Comments 13 pages, 15 figures and 7 tables

Journal ref IEEE Journal of Selected Topics in Signal Processing, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10551 2026-01-16 cs.CV 78%

Unleashing the Capabilities of Large Vision-Language Models for Intelligent Perception of Roadside Infrastructure

释放大型视觉-语言模型的能力以实现道路基础设施的智能感知

Luxuan Fu, Chong Liu, Bisheng Yang, Zhen Dong

机构 * State Key Laboratory of Information Engineering in Surveying, Mapping and Remote Sensing (LIESMARS)(信息工程测绘遥感国家重点实验室) Wuhan University(武汉大学) Hubei Luojia Laboratory(湖北珞珈实验室)

专题命中 指令微调 :language model(title,abstract)

AI总结 本文提出一种领域适应框架,通过数据高效微调和知识引导推理,提升大型视觉语言模型在城市道路基础设施感知中的性能和专业合规性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.01741 2026-01-15 cs.CV 78%

Simulated Ensemble Attack: Transferring Jailbreaks Across Fine-tuned Vision-Language Models

模拟集成攻击:在微调视觉-语言模型之间转移劫持

Ruofan Wang, Xin Wang, Yang Yao, Juncheng Li, Xuan Tong, Xingjun Ma

机构 * Fudan University, Shanghai, China(复旦大学) The University of Hong Kong, Hong Kong, China(香港大学)

专题命中 指令微调 :language model(title,abstract)

AI总结 本文提出SEA框架,通过模拟微调过程中的参数变化,实现跨不同微调变体的高效劫持攻击,揭示了微调导致的局部参数位移对攻击有效性的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.16935 2026-01-13 cs.CV 78%

Parameter-efficient fine-tuning (PEFT) of Vision Foundation Models for Atypical Mitotic Figure Classification

为异常有丝分裂象分类高效微调视觉基础模型

Lavish Ramchandani, Gunjan Deotale, Dev Kumar Das

机构 * Aira Matrix Private Limited(Aira Matrix 私人有限公司)

专题命中 指令微调 :foundation model(title,abstract)

AI总结 本研究利用Virchow与LoRA技术对视觉基础模型进行高效微调,实现异常有丝分裂分类的高精度与鲁棒性。

Comments MIDOG'25

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.18693 2026-01-09 cs.CV 78%

MVT: Mask-Grounded Vision-Language Models for Taxonomy-Aligned Land-Cover Tagging

MVT:基于分类对齐的土地覆盖标签的掩码导向视觉-语言模型

Siyi Chen, Kai Wang, Weicong Pang, Ruiming Yang, Ziru Chen, Renjun Gao, Alexis Kai Hon Lau, Dasa Gu, Chenchen Zhang, Cheng Li

机构 * HKUST(香港科技大学) JHU(约翰·霍普金斯大学) CUHKSZ(香港中文大学) NUS(新加坡国立大学) MUST(穆斯林大学)

专题命中 指令微调 :language model(title);LLM(abstract)

AI总结 MVT通过三阶段框架结合类无关掩码证据与基于分类的场景解释,提升遥感土地覆盖标签的准确性和信息性。

Comments The project is available at https://charlescsyyy.github.io/MVT

详情

展开后加载摘要…

URL PDF HTML 收藏