arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2025-12-19 至 2025-12-19 共收录 17 信号源:cs.CL, cs.AI, cs.LG

1. 指令微调 17 篇

2512.15885 2025-12-19 cs.CV cs.AI cs.CL cs.MM 91%

Seeing Beyond Words: Self-Supervised Visual Learning for Multimodal Large Language Models

超越文字:面向多模态大语言模型的自监督视觉学习

Davide Caffagni, Sara Sarto, Marcella Cornia, Lorenzo Baraldi, Pier Luigi Dovesi, Shaghayegh Roohi, Mark Granroth-Wilding, Rita Cucchiara

机构 * University of Modena and Reggio Emilia(摩德纳和雷吉奥艾米利亚大学) AMD Silo AI

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);LLM(abstract);foundation model(abstract)

AI总结 JARVIS通过自监督视觉学习提升多模态大语言模型的视觉推理能力,无需依赖语言监督。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00946 2025-12-19 cs.CL cs.AI 90%

Fine-tuning of lightweight large language models for sentiment classification on heterogeneous financial textual data

轻量级大语言模型在异构金融文本数据上的情感分类微调

Alvaro Paredes Amorin, Andre Python, Christoph Weisser

机构 * International Business School, Zhejiang University(浙江大学国际商务学院) Center for Data Science, Zhejiang University(浙江大学数据科学中心) Centre for Statistics, Georg-August-Universität Göttingen(哥廷根大学统计中心)

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

AI总结 本研究探讨了轻量级开源大语言模型在异构金融文本数据上的情感分类微调效果,发现Qwen3 8B和Llama3 8B在有限数据下表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15782 2025-12-19 cs.CR cs.CL cs.LG 90%

Auto-Tuning Safety Guardrails for Black-Box Large Language Models

为黑盒大语言模型自动调整安全防护栏

Perry Abdulkadir

机构 * University of St. Thomas(圣托马斯大学)

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.LG

AI总结 本文提出通过超参数优化来自动调整黑盒大语言模型的安全防护栏,以提高其安全性和效率。

Comments 8 pages, 7 figures, 1 table. Work completed as part of the M.S. in Artificial Intelligence at the University of St. Thomas using publicly available models and datasets; all views and any errors are the author's own

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.09121 2025-12-19 cs.CV 88%

MMRel: Benchmarking Relation Understanding in Multi-Modal Large Language Models

MMRel:多模态大语言模型中关系理解的基准测试

Jiahao Nie, Gongjie Zhang, Wenbin An, Yun Xing, Yap-Peng Tan, Alex C. Kot, Shijian Lu

机构 * Interdisciplinary Graduate Programme, Nanyang Technological University, Singapore(南洋理工大学跨学科研究生项目) Alibaba DAMO Academy, Singapore(阿里巴巴达摩院) Xi’an Jiaotong University, China(西安交通大学) Nanyang Technological University, Singapore(南洋理工大学) VinUniversity, Vietnam(文莱大学)

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract)

AI总结 MMRel是一个用于评估和提升多模态大语言模型关系理解能力的基准测试,包含大规模高质量的关系数据和对抗性案例,通过实验验证其在提升模型关系理解方面的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15957 2025-12-19 cs.CV cs.AI 85%

Seeing is Believing (and Predicting): Context-Aware Multi-Human Behavior Prediction with Vision Language Models

看见即信仰(并预测):基于视觉语言模型的上下文感知多人类行为预测

Utsav Panchal, Yuchen Liu, Luigi Palmieri, Ilche Georgievski, Marco Aiello

机构 * Institute of Architecture of Application Systems, University of Stuttgart, Germany(应用系统建筑研究所,斯图加特大学,德国) Bosch Research, Germany(博世研究,德国)

专题命中 指令微调 :language model(title,abstract);SFT(abstract);preference optimization(abstract);分类 cs.AI

AI总结 CAMP-VLM通过结合视觉语言模型与上下文特征,提升了多人类行为预测的准确性,其在预测精度上比基线模型高66.9%。

Comments Accepted at IEEE/CVF Winter Conference on Applications of Computer Vision (WACV) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.12913 2025-12-19 cs.CL 85%

MAIN: Mutual Alignment Is Necessary for instruction tuning

MAIN:互斥对齐是指令微调的必要条件

Fanyi Yang, Jianfeng Liu, Xin Zhang, Haoyu Liu, Xixin Cao, Yuefeng Zhan, Hao Sun, Weiwei Deng, Feng Sun, Qi Zhang

机构 * Peking University(北京大学) Microsoft Corporation(微软公司)

专题命中 指令微调 :instruction tuning(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出MAIN框架,通过互斥约束增强指令与响应的一致性,提升LLM在多种基准上的性能。

Comments Accepted by EMNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.18267 2025-12-19 cs.LG cs.AI 81%

ARD-LoRA: Dynamic Rank Allocation for Parameter-Efficient Fine-Tuning of Foundation Models with Heterogeneous Adaptation Needs

ARD-LoRA:动态秩分配用于具有异质适应需求的基础模型参数高效微调

Haseeb Ullah Khan Shinwari, Muhammad Usama

机构 * Newton AI Lab(牛顿人工智能实验室) School of Electrical Engineering, Korea Advanced Institute of Science and Technology (KAIST)(电气工程学院,韩国科学技术院)

专题命中 指令微调 :foundation model(title,abstract);分类 cs.AI、cs.LG

AI总结 ARD-LoRA通过动态秩分配提升基础模型微调效率,实现参数高效且适应性更强的模型调整。

Journal ref IEEE Transactions on Artificial Intelligence, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15764 2025-12-19 cs.LG cs.AI cs.PF 79%

AdaGradSelect: An adaptive gradient-guided layer selection method for efficient fine-tuning of SLMs

AdaGradSelect: 一种基于自适应梯度引导的层选择方法,用于高效微调小型语言模型

Anshul Kumar, Gagan Raj Gupta, Manisha Chawla

机构 * IIT Bhilai(比哈尔理工学院)

专题命中 指令微调 :large language model(abstract);language model(abstract);small language model(abstract);分类 cs.AI、cs.LG

AI总结 AdaGradSelect通过自适应梯度引导选择Transformer块,实现高效微调SLMs,训练速度快35%且性能接近全微调。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17509 2025-12-19 cs.CV 78%

MoAPT: Mixture of Adversarial Prompt Tuning for Vision-Language Models

MoAPT: 基于对抗提示微调的视觉-语言模型混合

Shiji Zhao, Qihui Zhu, Shukun Xiong, Shouwei Ruan, Maoxun Yuan, Jialing Tao, Jiexi Liu, Ranjie Duan, Jie Zhang, Jie Zhang, Xingxing Wei

机构 * Institute of Artificial Intelligence, Beihang University, Beijing, China(北京航空航天大学人工智能研究院) Center for Frontier AI Research, A*STAR, Singapore(A*STAR前沿人工智能研究中心) Institute of Computing Technology, Chinese Academy of Sciences, China(中国科学院计算技术研究所)

专题命中 指令微调 :language model(title,abstract)

AI总结 MoAPT通过混合对抗提示微调提升视觉-语言模型对多种对抗攻击的鲁棒性,通过学习多个提示的混合权重以增强泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.01384 2025-12-19 stat.ML cs.AI cs.CL cs.LG 75%

Fine-Tuning Discrete Diffusion Models with Policy Gradient Methods

使用策略梯度方法微调离散扩散模型

Oussama Zekri, Nicolas Boullé

专题命中 指令微调 :language model(abstract);RLHF(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出SEPO算法,用于高效微调离散扩散模型,通过理论支持和实验验证展示了其在非可微奖励下的有效性。

Comments 33 pages, 8 figures, 8 tables

Journal ref NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.16745 2025-12-19 cs.LG cs.AI cs.GT stat.ML 73%

Bandits with Preference Feedback: A Stackelberg Game Perspective

带有偏好反馈的多臂问题:从Stackelberg博弈视角出发

Barna Pásztor, Parnian Kassraie, Andreas Krause

机构 * ETH Zurich(苏黎世联邦理工学院) ETH AI Center(苏黎世联邦理工学院人工智能中心)

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出MAXMINLCB算法,通过Stackelberg博弈框架解决无限域和非线性奖励下的多臂问题,实现最优后悔保证和优越性能。

Comments In Proceedings of the 38th Conference on Neural Information Processing Systems (NeurIPS), 30 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01228 2025-12-19 cs.CL cs.LG 73%

Who is In Charge? Dissecting Role Conflicts in Instruction Following

谁在掌控?解析指令遵循中的角色冲突

Siqi Zeng

机构 * University of Illinois, Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 研究揭示大型语言模型在指令遵循中存在角色冲突,通过机制分析发现系统-用户冲突与社会冲突的不同处理方式,并强调了对齐方法的重要性。

Comments 12 pages, 5 figures, Mech Interp Workshop (NeurIPS 2025) Poster

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16013 2025-12-19 cs.LG cs.AI 62%

Towards Fine-Tuning-Based Site Calibration for Knowledge-Guided Machine Learning: A Summary of Results

基于微调的站点校准用于知识引导的机器学习:结果总结

Ruolei Zeng, Arun Sharma, Shuai An, Mingzhou Yang, Shengya Zhang, Licheng Liu, David Mulla, Shashi Shekhar

专题命中 指令微调 :pretraining(abstract);分类 cs.AI、cs.LG

AI总结 本文提出FTBSC-KGML框架,通过预训练和微调结合空间异质性意识和知识引导,提升在有限数据下对土地排放的准确预测能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16755 2025-12-19 cs.AI 57%

CitySeeker: How Do VLMS Explore Embodied Urban Navigation With Implicit Human Needs?

CitySeeker: VLMS如何通过隐含人类需求探索具身城市导航

Siqi Wang, Chao Liang, Yunfan Gao, Erxin Yu, Sen Li, Yushi Li, Jing Li, Haofen Wang

机构 * Department of Computing, The Hong Kong Polytechnic University(香港理工大学计算机系) Tongji University(同济大学) Nanjing Institute of Geography and Limnology, Chinese Academy of Sciences(中国科学院南京地理与湖泊研究所) Research Centre for Data Science & Artificial Intelligence(数据科学与人工智能研究中心)

专题命中 指令微调 :language model(abstract);分类 cs.AI

AI总结 CitySeeker通过评估VLMs在动态城市环境中探索具身导航的能力,揭示了隐含需求理解中的关键瓶颈,并提出改进策略以提升空间推理和决策能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16295 2025-12-19 cs.AI 57%

OS-Oracle: A Comprehensive Framework for Cross-Platform GUI Critic Models

OS-Oracle: 一个跨平台GUI批评模型的综合框架

Zhenyu Wu, Jingjing Xie, Zehao Li, Bowen Yang, Qiushi Sun, Zhaoyang Liu, Zhoumianze Liu, Yu Qiao, Xiangyu Yue, Zun Wang, Zichen Ding

机构 * Shanghai Jiaotong University(上海交通大学) Shanghai AI Laboratory(上海人工智能实验室) CUHK MMLab(香港大学MMLab) The University of Hong Kong(香港大学) The Hong Kong University of Science and Technology(香港科学与技术大学)

专题命中 指令微调 :SFT(abstract);分类 cs.AI

AI总结 OS-Oracle提出了一种跨平台GUI批评模型框架,通过合成数据和两阶段训练方法,实现了在移动、网页和桌面平台上的高效批评评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16164 2025-12-19 cs.CV cs.AI 57%

C-DGPA: Class-Centric Dual-Alignment Generative Prompt Adaptation

面向类别的双对齐生成提示适应:C-DGPA

Chao Li, Dasha Hu, Chengyang Li, Yuming Jiang, Yuncheng Shen

专题命中 指令微调 :language model(abstract);分类 cs.AI

AI总结 C-DGPA通过双分支架构协同优化边缘分布和条件分布对齐,提升无监督领域适应中提示学习的领域不变性和语义判别性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15931 2025-12-19 cs.LG 57%

BarcodeMamba+: Advancing State-Space Models for Fungal Biodiversity Research

BarcodeMamba+: 推动真菌生物多样性研究的state-space模型

Tiancheng Gao, Scott C. Lowe, Brendan Furneaux, Angel X Chang, Graham W. Taylor

机构 * University of Guelph(圭尔夫大学) Vector Institute(向量研究所) University of Jyväskylä(耶夫斯克耶拉大学) Simon Fraser University(西蒙弗雷泽大学) Amii(阿米国际)

专题命中 指令微调 :foundation model(abstract);分类 cs.LG

AI总结 BarcodeMamba+通过高效state-space模型提升真菌分类性能,克服数据稀疏与长尾分布挑战,实现多层级分类优势。

Comments 11 pages, accepted at the 3rd Workshop on Imageomics: Discovering Biological Knowledge from Images Using AI (NeurIPS 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏