arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 11714 信号源:cs.CL, cs.AI, cs.LG

1. 指令微调 11714 篇

2601.00372 2026-01-05 cs.CR 78%

LLM-Powered Analysis of IoT User Reviews: Tracking and Ranking Security and Privacy Concerns

基于大语言模型的物联网用户评论分析:跟踪和排序安全与隐私问题

Taufiq Islam Protick, Sai Teja Peddinti, Nina Taft, Anupam Das

专题命中 指令微调 :LLM(title);prompting(abstract)

AI总结 本研究利用大语言模型分析物联网用户评论,识别和排序安全与隐私问题,发现安全摄像头的高关注度及持续存在的隐私问题,为开发者改进用户信任提供洞察。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18801 2025-12-23 quant-ph 78%

Foundation Model for Unified Characterization of Optical Quantum States

光量子态统一表征的基础模型

Xiaoting Gao, Yan Zhu, Feng-Xiao Sun, Ya-Dong Wu, Qiongyi He

专题命中 指令微调 :foundation model(title,abstract)

AI总结 本文提出了一种基础模型,用于统一表征光量子态的复杂性,通过预训练和微调,有效预测多种实验相关态的性质。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17292 2025-12-22 cs.CV 78%

Vision-Language Model Guided Image Restoration

基于视觉语言模型的图像修复

Cuixin Yang, Rongkang Dong, Kin-Man Lam

机构 * Department of Electrical and Electronic Engineering(电子与电气工程系)

专题命中 指令微调 :language model(title,abstract)

AI总结 本文提出VLMIR框架,利用视觉语言模型的先验知识提升图像修复性能,通过两阶段方法结合特征提取与扩散模型实现更高质量的图像恢复。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17509 2025-12-19 cs.CV 78%

MoAPT: Mixture of Adversarial Prompt Tuning for Vision-Language Models

MoAPT: 基于对抗提示微调的视觉-语言模型混合

Shiji Zhao, Qihui Zhu, Shukun Xiong, Shouwei Ruan, Maoxun Yuan, Jialing Tao, Jiexi Liu, Ranjie Duan, Jie Zhang, Jie Zhang, Xingxing Wei

机构 * Institute of Artificial Intelligence, Beihang University, Beijing, China(北京航空航天大学人工智能研究院) Center for Frontier AI Research, A*STAR, Singapore(A*STAR前沿人工智能研究中心) Institute of Computing Technology, Chinese Academy of Sciences, China(中国科学院计算技术研究所)

专题命中 指令微调 :language model(title,abstract)

AI总结 MoAPT通过混合对抗提示微调提升视觉-语言模型对多种对抗攻击的鲁棒性,通过学习多个提示的混合权重以增强泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.23012 2025-12-18 cs.CV 78%

Multi-label classification for multi-temporal, multi-spatial coral reef condition monitoring using vision foundation model with adapter learning

利用视觉基础模型与适配器学习进行多时序、多空间珊瑚礁状态监测的多标签分类

Xinlei Shao, Hongruixuan Chen, Fan Zhao, Kirsty Magson, Jundong Chen, Peiran Li, Jiaqi Wang, Jun Sasaki

机构 * Department of Socio-Cultural Environmental Studies, Graduate School of Frontier Sciences, The University of Tokyo(社会文化环境研究部门,前沿科学研究生院,东京大学) Department of Environment Systems, Graduate School of Frontier Sciences, The University of Tokyo(环境系统部门,前沿科学研究生院,东京大学) New Heaven Reef Conservation Program, Koh Tao, Surat Thani, 84360, Thailand(新天堂珊瑚礁保护计划, Koh Tao, Surat Thani, 84360, Thailand) Data Science and AI Innovation Research Promotion Center, Shiga University(数据科学与人工智能创新研究促进中心,Shiga大学) Interfaculty Initiative in Information Studies, The University of Tokyo(跨学际信息研究倡议,东京大学)

专题命中 指令微调 :foundation model(title,abstract)

AI总结 本研究提出利用DINOv2视觉基础模型与LoRA适配器学习方法,实现多时序、多空间珊瑚礁状态的高效多标签分类,提升了分类精度并减少了计算资源消耗。

Journal ref Marine Pollution Bulletin, Vol. 223, Article 119054, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12268 2025-12-16 cs.CV 78%

MetaTPT: Meta Test-time Prompt Tuning for Vision-Language Models

MetaTPT: 用于视觉-语言模型的元测试时间提示微调

Yuqing Lei, Yingjun Du, Yawen Huang, Xiantong Zhen, Ling Shao

机构 * UCAS-Terminus AI Lab, University of Chinese Academic of Sciences(中国科学院大学Terminus AI实验室,中国科学院大学) AIM Lab, University of Amsterdam(阿姆斯特丹大学AIM实验室) Jarvis Research Center, Tencent Youtu Lab(腾讯优图实验室 Jarvis 研究中心) Central Research Institue, United Imaging Healthcare Co., Ltd(联合影像医疗科技有限公司中央研究所)

专题命中 指令微调 :language model(title,abstract)

AI总结 MetaTPT通过元学习框架结合自监督任务和提示微调,提升视觉-语言模型在领域偏移下的测试时间适应性,实现领域泛化和跨数据集的高性能表现。

Comments NeurIPS 2025 Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22787 2025-12-11 cs.CV 78%

World in a Frame: Understanding Culture Mixing as a New Challenge for Vision-Language Models

世界在框架中:将文化混合视为视觉语言模型的新挑战

Eunsu Kim, Junyeong Park, Na Min An, Junseong Kim, Hitesh Laxmichand Patel, Jiho Jin, Julia Kruk, Amit Agarwal, Srikant Panda, Fenal Ashokbhai Ilasariya, Hyunjung Shim, Alice Oh

专题命中 指令微调 :language model(title,abstract)

AI总结 本文提出CultureMix基准,研究文化混合对视觉语言模型的影响,发现模型在混合场景中表现不佳,通过监督微调提升模型鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05489 2025-12-08 physics.comp-ph 78%

Beyond Adam: Disentangling Optimizer Effects in the Fine-Tuning of Atomistic Foundation Models

超越Adam:在原子基础模型微调中解耦优化器影响

Xiaoqing Liu, Yangshuai Wang, Teng Zhao

专题命中 指令微调 :foundation model(title,abstract)

AI总结 本研究评估了七种优化器在原子基础模型微调中的性能,发现AdamW和ScheduleFree在曲率条件和力准确性方面表现最佳,同时证明二次优化可提升物理性质的保真度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01267 2025-12-02 cs.MM cs.SD 78%

ZO-ASR: Zeroth-Order Fine-Tuning of Speech Foundation Models without Back-Propagation

ZO-ASR: 无需反向传播的语音基础模型零阶微调

Yuezhang Peng, Yuxin Liu, Yao Li, Sheng Wang, Fei Wen, Xie Chen

机构 * X-LANCE Lab, School of Computer Science, MoE Key Lab of Artificial Intelligence, Shanghai Jiao Tong University(X-LANCE实验室、计算机科学学院、人工智能重点实验室、上海交通大学)

专题命中 指令微调 :foundation model(title,abstract)

AI总结 ZO-ASR通过零阶方法无需反向传播实现高效语音模型微调,有效降低内存消耗并在领域适应和测试时间适应任务中取得优于现有方法的性能。

Comments 2025 IEEE Automatic Speech Recognition and Understanding Workshop (ASRU)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22250 2025-12-01 eess.IV cs.CV 78%

ColonAdapter: Geometry Estimation Through Foundation Model Adaptation for Colonoscopy

ColonAdapter:通过基础模型适应进行结肠镜的几何估计

Zhiyi Jiang, Yifu Wang, Xuelian Cheng, Zongyuan Ge

机构 * School of Computer Science and Engineering, Southeast University(东南大学计算机科学与工程学院) Vetex Lab(Vetex实验室) Southeast University - Monash University Joint Graduate School(东南大学-墨尔本大学联合研究生院) Monash Suzhou Research Institute(墨尔本大学苏州研究院) Faculty of Information Technology, Monash University(墨尔本大学信息科技学院)

专题命中 指令微调 :foundation model(title,abstract)

AI总结 ColonAdapter通过自监督微调适应基础模型,提升结肠镜图像的3D几何估计性能,无需地面真实内在参数。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19261 2025-11-25 cs.CV 78%

LAST: LeArning to Think in Space and Time for Generalist Vision-Language Models

LAST: 为通用视觉-语言模型学习在空间和时间中的思考

Shuai Wang, Daoan Zhang, Tianyi Bai, Shitong Shao, Jiebo Luo, Jiaheng Wei

机构 * HKUST(GZ)(香港科技大学(广州)) University of Rochester(罗切斯特大学)

专题命中 指令微调 :language model(title,abstract)

AI总结 LAST通过学习在空间和时间上思考,提升通用视觉-语言模型对3D空间和长视频的理解能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18709 2025-11-25 cs.RO 78%

Autonomous Surface Selection For Manipulator-Based UV Disinfection In Hospitals Using Foundation Models

基于基础模型的医院机器人紫外线消毒表面自主选择

Xueyan Oh, Jonathan Her, Zhixiang Ong, Brandon Koh, Yun Hann Tan, U-Xuan Tan

机构 * Engineering Product Development Pillar, Singapore University of Technology and Design, Singapore(新加坡科技设计大学工程产品开发部门) Centre for Healthcare Assistive & Robotics Technology, Singapore(新加坡医疗辅助与机器人技术中心) National Centre for Infectious Diseases, Singapore(新加坡传染病国家中心)

专题命中 指令微调 :foundation model(title,abstract)

AI总结 本研究提出基于基础模型的机器人紫外线消毒表面自主选择方法,通过视觉语言模型辅助分割细化,提高消毒效率并减少误判,实验证明其在实际应用中的有效性。

Comments 7 pages, 7 figures; This paper has been accepted by IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17255 2025-11-24 cs.CV cs.IR 78%

A Little More Like This: Text-to-Image Retrieval with Vision-Language Models Using Relevance Feedback

略多一些像这个:利用视觉语言模型进行文本到图像检索的相关反馈

Bulat Khaertdinov, Mirela Popa, Nava Tintarev

机构 * Maastricht University(马斯特里赫特大学)

专题命中 指令微调 :language model(title,abstract)

AI总结 本文提出基于相关反馈机制提升视觉语言模型文本到图像检索性能的方法,通过四种反馈策略在Flickr30k和COCO数据集上验证,提升了检索效果并增强了多轮检索的鲁棒性。

Comments Accepted to WACV'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.09439 2025-11-24 eess.AS cs.SD 78%

Omni-R1: Do You Really Need Audio to Fine-Tune Your Audio LLM?

Omni-R1:你真的需要音频来微调你的音频大语言模型吗?

Andrew Rouditchenko, Saurabhchand Bhati, Edson Araujo, Samuel Thomas, Hilde Kuehne, Rogerio Feris, James Glass

机构 * MIT CSAIL(麻省理工学院计算机科学与人工智能实验室) Goethe University of Frankfurt(法兰克福歌德大学) IBM Research AI(IBM人工智能研究部) MIT-IBM Watson AI Lab(麻省理工-IBM沃森人工智能实验室) Tuebingen AI Center/University of Tuebingen(图宾根人工智能中心/图宾根大学)

专题命中 指令微调 :LLM(title,abstract)

AI总结 Omni-R1通过强化学习方法GRPO微调多模态大语言模型,实现了在音频问答任务上的新SOTA性能,同时发现文本推理能力提升对音频性能有显著贡献。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.00236 2025-11-21 cs.RO 78%

Sim2Real Diffusion: Leveraging Foundation Vision Language Models for Adaptive Automated Driving

Sim2Real Diffusion:利用基础视觉语言模型实现自适应自动驾驶

Chinmay Vilas Samak, Tanmay Vilas Samak, Bing Li, Venkat Krovi

机构 * Department of Automotive Engineering, Clemson University International Center for Automotive Research (CU-ICAR)(汽车工程系,克莱姆森大学国际汽车研究中心(CU-ICAR))

专题命中 指令微调 :language model(title);foundation model(abstract)

AI总结 本文提出Sim2Real Diffusion框架,利用基础视觉语言模型实现自动驾驶的跨领域适应,通过条件潜在扩散提升sim2real转换性能。

Comments Accepted in IEEE Robotics and Automation Letters (RA-L)

Journal ref IEEE Robotics and Automation Letters, vol. 11, no. 1, pp. 177-184, Jan. 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16110 2025-11-21 cs.CR 78%

Multi-Faceted Attack: Exposing Cross-Model Vulnerabilities in Defense-Equipped Vision-Language Models

多面攻击:揭示配备防御机制的视觉语言模型中的跨模型漏洞

Yijun Yang, Lichao Wang, Jianping Zhang, Chi Harold Liu, Lanqing Hong, Qiang Xu

专题命中 指令微调 :language model(title,abstract)

AI总结 多面攻击揭示了配备防御机制的视觉语言模型中的跨模型安全漏洞,通过注意力转移攻击和轻量级转移增强算法,实现了58.5%的成功率。

Comments AAAI 2026 Oral

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15404 2025-11-20 cs.IT math.IT 78%

Communication-Pipelined Split Federated Learning for Foundation Model Fine-Tuning in UAV Networks

Zizhen Zhou, Ying-Chang Liang, Yanyu Cheng, Wei Yang Bryan Lim

专题命中 指令微调 :foundation model(title,abstract)

Comments This work has been submitted to the IEEE for possible publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12588 2025-11-18 cs.CV 78%

Rank-Aware Agglomeration of Foundation Models for Immunohistochemistry Image Cell Counting

Zuqi Huang, Mengxin Tian, Huan Liu, Wentao Li, Baobao Liang, Jie Wu, Fang Yan, Zhaoqing Tang, Zhongyu Li

机构 * School of Software Engineering, Xi’an Jiaotong University(西安交通大学软件工程学院) School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学学院) Department of Gastrointestinal Surgery and the Gastric Cancer Center, Zhongshan Hospital, Fudan University(复旦大学中山医院胃肠外科及胃癌中心) School of Computer Science and Technology, Xi’an Jiaotong University(西安交通大学计算机科学与技术学院) The Comprehensive Breast Care Center, The Second Affiliated Hospital of Xi'an Jiaotong University(西安交通大学第二附属医院综合乳腺护理中心) Department of Pathology, The Second Affiliated Hospital of Xi’an Jiaotong University(西安交通大学第二附属医院病理科) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Department of General Surgery, Zhongshan Hospital (Xiamen), Fudan University(复旦大学中山医院(厦门)外科科)

专题命中 指令微调 :foundation model(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12331 2025-11-18 cs.CV 78%

SpaceVLM: Sub-Space Modeling of Negation in Vision-Language Models

Sepehr Kazemi Ranjbar, Kumail Alhamoud, Marzyeh Ghassemi

机构 * MIT(麻省理工学院)

专题命中 指令微调 :language model(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.17714 2025-11-11 cs.CV 78%

F2RVLM: Boosting Fine-grained Fragment Retrieval for Multi-Modal Long-form Dialogue with Vision Language Model

Hanbo Bi, Zhiqiang Yuan, Zexi Jia, Jiapei Zhang, Chongyang Li, Peixiang Luo, Ying Deng, Xiaoyue Duan, Jinchao Zhang

专题命中 指令微调 :language model(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.17088 2025-11-11 cs.CV 78%

FedVLM: Scalable Personalized Vision-Language Models through Federated Learning

Arkajyoti Mitra, Afia Anjum, Paul Agbaje, Mert Pesé, Habeeb Olufowobi

机构 * University of Texas at Arlington(德克萨斯理工大学) Clemson University(克莱姆森大学)

专题命中 指令微调 :language model(title,abstract)

Comments Accepted to ECAI 2025 Main Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.04317 2025-11-07 cs.CV 78%

RISE-T2V: Rephrasing and Injecting Semantics with LLM for Expansive Text-to-Video Generation

Xiangjun Zhang, Litong Gong, Yinglin Zheng, Yansong Liu, Wentao Jiang, Mingyi Xu, Biao Wang, Tiezheng Ge, Ming Zeng

专题命中 指令微调 :LLM(title,abstract)

Comments 17 pages, 16 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.27047 2025-11-03 cs.CV 78%

AD-SAM: Fine-Tuning the Segment Anything Vision Foundation Model for Autonomous Driving Perception

Mario Camarena, Het Patel, Fatemeh Nazari, Evangelos Papalexakis, Mohamadhossein Noruzoliaee, Jia Chen

专题命中 指令微调 :foundation model(title,abstract)

Comments Submitted to IEEE Transactions on Intelligent Transportation Systems (IEEE T-ITS)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.22785 2025-10-28 cs.CV 78%

Self-Calibrated Consistency can Fight Back for Adversarial Robustness in Vision-Language Models

Jiaxiang Liu, Jiawei Du, Xiao Liu, Prayag Tiwari, Mingkun Xu

机构 * Guangdong Institute of Intelligence Science and Technology(广东智能科学与技术研究院) Agency for Science, Technology and Research(科技研究局) School of Information Technology(信息技术学院)

专题命中 指令微调 :language model(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.21069 2025-10-27 cs.CV cs.RO 78%

ZING-3D: Zero-shot Incremental 3D Scene Graphs via Vision-Language Models

Pranav Saxena, Jimmy Chiun

机构 * Birla Institute of Technology and Science Pilani, K.K Birla Goa Campus(比拉理工学院和科学学院,比拉戈阿校园) Department of Mechanical Engineering, College of Design and Engineering, National University of Singapore(设计与工程学院机械工程系,新加坡国立大学)

专题命中 指令微调 :language model(title);foundation model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.20856 2025-10-27 cs.CR 78%

FPT-Noise: Dynamic Scene-Aware Counterattack for Test-Time Adversarial Defense in Vision-Language Models

Jia Deng, Jin Li, Zhenhua Zhao, Shaowei Wang

专题命中 指令微调 :language model(title,abstract)

Comments 11pages,4figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18773 2025-10-22 cs.CV 78%

Detection and Simulation of Urban Heat Islands Using a Fine-Tuned Geospatial Foundation Model for Microclimate Impact Prediction

Jannis Fleckenstein, David Kreismann, Tamara Rosemary Govindasamy, Thomas Brunschwiler, Etienne Vos, Mattia Rigotti

机构 * IBM Research – Europe(IBM欧洲研究院) IBM Research – Africa(IBM非洲研究院)

专题命中 指令微调 :foundation model(title,abstract)

Comments 10 pages, 9 figures. Accepted at the NeurIPS 2025 Workshop on Tackling Climate Change with Machine Learning

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.10784 2025-10-22 eess.IV cs.CV 78%

Adapting Medical Vision Foundation Models for Volumetric Medical Image Segmentation via Active Learning and Selective Semi-supervised Fine-tuning

Jin Yang, Daniel S. Marcus, Aristeidis Sotiras

机构 * Mallinckrodt Institute of Radiology(马林克罗德放射医学研究所) Institute for Informatics, Data Science and Biostatistics(信息学、数据科学与生物统计学研究所) Department of Radiology, Perelman School of Medicine(放射科,佩尔曼医学院) Center for AI and Data Science for Integrated Diagnostics (AI2D)(集成诊断人工智能与数据科学中心(AI2D))

专题命中 指令微调 :foundation model(title,abstract)

Comments 17 pages, 5 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.17165 2025-10-21 cs.CE q-fin.TR 78%

Trading with the Devil: Risk and Return in Foundation Model Strategies

Jinrui Zhang

专题命中 指令微调 :foundation model(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.14967 2025-10-20 math.DS cs.FL 78%

On Countable SFT Covers of Sparse Multidimensional Shift Spaces

Ilkka Törmä

专题命中 指令微调 :SFT(title,abstract)

Comments 38 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏