arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 11693 信号源:cs.CL, cs.AI, cs.LG

1. 指令微调 11693 篇

2605.21160 2026-05-21 cs.LG 86%

Learning First Integrals via Backward-Generated Data and Guided Reinforcement Learning

通过反向生成数据和引导强化学习学习第一积分

Jingfeng Zhong, Zhengxiang Liu, Zhijie Wang, Shuai Li

机构 * Shanghai Jiao Tong University(上海交通大学)

专题命中 指令微调 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出FISolver,一种基于LLM的求解器,通过反向生成数据和引导强化学习方法,解决第一积分发现中的数据稀缺问题,并在挑战性基准上显著优于其他方法。

Comments 17 pages, 2 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18504 2026-05-19 cs.CL 86%

Ancient Greek to Modern Greek Machine Translation: A Novel Benchmark and Fine-Tuning Experiments on LLMs and NMT Models

古希腊语到现代希腊语机器翻译:一种新的基准和对LLM和NMT模型的微调实验

Spyridon Mavromatis, Sokratis Sofianopoulos, Prokopis Prokopidis, Maria Giagkou

机构 * National and Kapodistrian University of Athens, Department of Informatics and Telecommunications(雅典国家和卡普迪斯特里亚大学信息与电信系) Institute for Language and Speech Processing, Athena RC(语言与语音处理研究所,雅典RC)

专题命中 指令微调 :LLM(title_cn,summary_cn);分类 cs.CL

AI总结 本文提出了一种新的基准测试,并对LLM和NMT模型进行了微调实验,以解决古希腊语到现代希腊语的低资源机器翻译问题,展示了微调在提升翻译性能上的显著效果。

Comments 14 pages. Accepted for presentation at the 15th Language Resources and Evaluation Conference (LREC 2026), Palma, Mallorca, Spain

Journal ref Proceedings of the Fifteenth Language Resources and Evaluation Conference (LREC 2026), pp. 8685-8698. European Language Resources Association (ELRA)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17792 2026-05-19 cs.LG physics.geo-ph 86%

HydroAgent: Closing the Gap Between Frontier LLMs and Human Experts in Hydrologic Model Calibration via Simulator-Grounded RL

HydroAgent: 通过模拟器引导的强化学习缩小前沿大语言模型与人类专家在水文模型校准之间的差距

Zhi Li, Songkun Yan, Jie Cao, Mofan Zhang, Anjiang Wei, Jinwoong Yoo, Yang Hong

机构 * Civil, Environmental, and Architectural Engineering, University of Colorado Boulder(科罗拉多大学波尔德分校土木、环境与建筑工程系) Civil Engineering and Environmental Sciences, University of Oklahoma(俄克拉荷马大学土木工程与环境科学系) Department of Computer Science, University of Oklahoma(俄克拉荷马大学计算机科学系) Civil and Environmental Engineering, Stanford University(斯坦福大学土木与环境工程系) Department of Computer Science, Stanford University(斯坦福大学计算机科学系) NASA Goddard Space Flight Center(美国国家航空航天局戈达德空间飞行中心)

专题命中 指令微调 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文研究如何利用前沿大语言模型(LLM)代理替代人类水文模型师进行水文模型校准,提出HydroAgent方法,通过模拟器引导的强化学习(RLSF)进行微调,以提高模型在不同流域中的适应性和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.02597 2026-05-18 cs.CV cs.AI 86%

Seeing is Understanding: Unlocking Causal Attention into Modality-Mutual Attention for Multimodal LLMs

视觉即理解:解锁因果注意力以实现模态互注意力用于多模态大语言模型

Wei-Yao Wang, Zhao Wang, Helen Suzuki, Yoshiyuki Kobayashi

机构 * Sony Group Corporation, Tokyo, Japan(索尼集团,日本东京)

专题命中 指令微调 :foundation model(abstract,abstract_cn);instruction tuning(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 本文提出模态互注意力机制,通过解锁因果注意力,提升多模态理解性能,无需额外参数,在12个基准测试中平均提升6.2%。

Comments ICML 2026. Code is available at https://github.com/sony/aki

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.11282 2026-05-15 cs.LG 86%

Vision-LLMs for Spatiotemporal Traffic Forecasting

面向时空交通预测的视觉语言模型

Ning Yang, Hengyu Zhong, Haijun Zhang, Randall Berry

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Southwest University(西南大学) Department of Computing and Communication Engineering, Beijing University of Science and Technology(北京科技大学计算机与通信工程学院) Department of Electrical and Computer Engineering, Northwestern University(西北大学电气与计算机工程系)

专题命中 指令微调 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出ST-Vision-LLM框架,将时空预测转化为视觉-语言融合问题,通过视觉编码器处理历史交通矩阵并结合高效数值编码方案,提升交通预测精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24125 2026-05-14 cs.CL 86%

Alignment Reduces Expressed but Not Encoded Gender Bias: A Unified Framework and Study

对齐减少了表达但未减少编码的性别偏见:一个统一的框架和研究

Nour Bouchouchi, Thibault Laugel, Xavier Renard, Christophe Marsala, Marie-Jeanne Lesot, Marcin Detyniecki

机构 * Sorbonne Université, CNRS, LIP6(索邦大学、国家科学研究中心、LIP6实验室) AXA(安盛) Polish Academy of Science, IBS PAN(波兰科学院、IBS PAN)

专题命中 指令微调 :LLM(summary_cn,abstract_cn);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本文提出统一框架分析LLM中的内在和外在性别偏见,发现对齐减少表达偏见但内部表示仍存在关联,且在对抗性提示下可被激活。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00513 2026-05-11 cs.LG 86%

Minerva: Reinforcement Learning with Verifiable Rewards for Cyber Threat Intelligence LLMs

Minerva: 为网络威胁情报LLM采用可验证奖励的强化学习

Md Tanvirul Alam, Aritran Piplai, Ionut Cardei, Nidhi Rastogi, Peter J Worth

机构 * Rochester Institute of Technology(罗切斯特理工学院) University of Texas at El Paso(德克萨斯大学埃尔帕索分校) Florida Atlantic University(佛罗里达Atlantic大学)

专题命中 指令微调 :LLM(title_cn);SFT(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 本文提出Minerva,一种统一的数据集和训练流程,用于多类网络威胁情报子任务,通过任务特定验证器评分结构化输出。MinervaRL通过轻量自训练机制生成额外验证轨迹并反向蒸馏至模型,提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05909 2026-05-08 cs.AI 86%

Null Space Constrained Contrastive Visual Forgetting for MLLM Unlearning

空域约束对比遗忘用于MLLM反学习

Yuhang Wang, Zhenxing Niu, Haoxuan Ji, Guangyu He, Linlin Zhang, Haichang Gao

机构 * School of Computer Science and Technology, Xidian University(西安电子科技大学计算机科学与技术学院) Xi’an Jiaotong University(西安交通大学)

专题命中 指令微调 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出一种MLLM反学习方法,通过冻结LLM主干并微调视觉模块,在保留非目标视觉知识和全部文本知识的同时,有效遗忘目标视觉知识。

Comments 20 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16812 2026-04-29 cs.AI 86%

Introspection Adapters: Training LLMs to Report Their Learned Behaviors

自我反思适配器:训练LLM报告其学习行为

Keshav Shenoy, Li Yang, Abhay Sheshadri, Sören Mindermann, Jack Lindsey, Sam Marks, Rowan Wang

机构 * Ashwood Centre on AI Science and Policy(人工智能科学与政策中心)

专题命中 指令微调 :LLM(title_cn,summary_cn);分类 cs.AI

AI总结 本文提出自我反思适配器,通过训练LLM描述其学习行为,用于快速识别多种LLM的学习行为,实现对微调模型的有效审计。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21045 2026-04-24 cs.CL 86%

Hierarchical Policy Optimization for Simultaneous Translation of Unbounded Speech

分层策略优化用于无界语音的同时翻译

Siqi Ouyang, Shuoyang Ding, Oleksii Hrinchuk, Vitaly Lavrukhin, Brian Yan, Boris Ginsburg, Lei Li

机构 * Carnegie Mellon University(卡内基梅隆大学) NVIDIA(英伟达)

专题命中 指令微调 :LLM(abstract,abstract_cn);SFT(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 本文提出分层策略优化方法,通过后训练处理不完美的监督微调数据,提升同时语音翻译质量与效率,实验显示在1.5秒延迟下,COMET和MetricX得分分别提升超7和1.25。

Comments ACL 2026 Oral

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.05760 2026-04-21 cs.CL 86%

Writing-RL: Advancing Long-form Writing via Adaptive Curriculum Reinforcement Learning

Writing-RL: 通过自适应课程强化学习推进长文本写作

Xuanyu Lei, Chenliang Li, Yuning Wu, Kaiming Liu, Weizhou Shen, Peng Li, Ming Yan, Fei Huang, Ya-Qin Zhang, Yang Liu

机构 * Institute for AI Industry Research (AIR)(人工智能产业研究院) Tsinghua University(清华大学) Dept. of Comp. Sci. & Tech.(计算机科学与技术系) Institute for AI(人工智能研究院) Institute of Intelligent Computing(智能计算研究院) Alibaba Group(阿里巴巴集团)

专题命中 指令微调 :SFT(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出Writing-RL框架,通过自适应课程强化学习提升长文本写作能力,克服SFT的局限,实验表明其在长文本生成任务中优于基线模型。

Comments Code is released at https://github.com/Tongyi-Zhiwen/Writing-RL

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13529 2026-04-17 cs.CR cs.CL 86%

SecureGate: Learning When to Reveal PII Safely via Token-Gated Dual-Adapters for Federated LLMs

SecureGate: 通过令牌门控双适配器安全学习何时揭示PII

Mohamed Shaaban, Mohamed Elmahallawy

机构 * Washington State University(华盛顿州立大学)

专题命中 指令微调 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 SecureGate通过令牌门控双适配器框架,在联邦LLM微调中实现细粒度隐私控制,减少PII泄露并提升任务效用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06946 2026-04-09 cs.SE cs.AI 86%

An empirical study of LoRA-based fine-tuning of large language models for automated test case generation

基于LoRA的大型语言模型微调在自动测试用例生成中的实证研究

Milad Moradi, Ke Yan, David Colwell, Rhona Asgari

机构 * AI Research Lab, Tricentis(Tricentis AI研究实验室) Tricentis GmbH

专题命中 指令微调 :large language model(title);language model(title);LLM(abstract);分类 cs.AI

AI总结 本文通过实证研究探讨LoRA微调在基于需求的测试用例生成中的效果,评估了多种LLM家族,并发现LoRA微调显著提升了开源模型性能,且开源模型在微调后可与专有模型性能相当。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.07597 2026-03-16 cs.CL 86%

Instructing Large Language Models for Low-Resource Languages: A Systematic Study for Basque

为低资源语言指导大型语言模型:巴斯克语的系统研究

Oscar Sainz, Naiara Perez, Julen Etxaniz, Joseba Fernandez de Landa, Itziar Aldabe, Iker García-Ferrero, Aimar Zabala, Ekhi Azurmendi, German Rigau, Eneko Agirre, Mikel Artetxe, Aitor Soroa

专题命中 指令微调 :language model(title,abstract);large language model(title);分类 cs.CL

AI总结 本文系统研究了巴斯克语在低资源场景下的指导模型方法,发现目标语言语料库至关重要,合成指令能产生稳健模型,且使用指导模型作为骨干优于非指导基础模型。

Comments Accepted at EMNLP 2025 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01780 2026-03-02 cs.SE cs.AI 86%

LIA: Supervised Fine-Tuning of Large Language Models for Automatic Issue Assignment

LIA:大型语言模型的监督微调用于自动问题分配

Arsham Khosravani, Alireza Hoseinpour, Arshia Akhavan, Mehdi Keshani, Abbas Heydarnoori

机构 * California State University Northridge(加州州立大学北岭分校) Bowling Green State University(鲍灵格林州立大学)

专题命中 指令微调 :large language model(title);language model(title);LLM(abstract);分类 cs.AI

AI总结 LIA通过监督微调大型语言模型,实现高效准确的问题分配,显著优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20648 2026-02-25 cs.CL 86%

CARE: An Explainable Computational Framework for Assessing Client-Perceived Therapeutic Alliance Using Large Language Models

CARE:基于大语言模型的可解释计算框架,用于评估客户端感知的治疗联盟

Anqi Li, Chenxiao Wang, Yu Lu, Renjun Xu, Lizhi Ma, Zhenzhong Lan

机构 * Zhejiang University(浙江大学) Westlake University(西湖大学) Department of Psychology, Jing Hengyi School of Education, Hangzhou Normal University(心理系,金恒毅教育学院,杭州师范大学)

专题命中 指令微调 :large language model(title);language model(title);LLM(abstract);分类 cs.CL

AI总结 CARE基于大语言模型,通过生成可解释的推理原因,提升对咨询中治疗联盟感知的评估准确性与实用性。

Comments 14 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.04791 2026-01-13 cs.AI 86%

What-If Analysis of Large Language Models: Explore the Game World Using Proactive Thinking

大型语言模型的What-If分析:通过前瞻性思维探索游戏世界

Yuan Sui, Yanming Zhang, Yi Liao, Yu Gu, Guohua Tang, Zhongqian Sun, Wei Yang, Bryan Hooi

专题命中 指令微调 :large language model(title);language model(title);LLM(abstract);分类 cs.AI

AI总结 WiA-LLM通过前瞻性思维提升大型语言模型在复杂游戏环境中的决策能力,实现74.2%的预测准确率和更接近专家玩家的策略行为。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04394 2026-01-09 cs.CL 86%

ARREST: Adversarial Resilient Regulation Enhancing Safety and Truth in Large Language Models

ARREST: 对抗鲁棒调节提升大语言模型的安全性与真实性

Sharanya Dasgupta, Arkaprabha Basu, Sujoy Nath, Swagatam Das

机构 * Electronics and Communication Sciences Unit (ECSU), Indian Statistical Institute Kolkata, University of Surrey, and Indian Institute Of Technology Delhi(电子与通信科学单元(ECSU)、印度统计研究所科钦分校、萨里大学和印度理工学院德里)

专题命中 指令微调 :large language model(title);language model(title);RLHF(abstract);分类 cs.CL

AI总结 ARREST通过对抗鲁棒调节提升大语言模型的安全性与真实性,通过外部网络纠正表征不匹配并生成软拒绝。

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.04862 2026-01-05 cs.CL 86%

EXAONE 3.5: Series of Large Language Models for Real-world Use Cases

EXAONE 3.5:面向实际应用场景的大型语言模型系列

Soyoung An, Kyunghoon Bae, Eunbi Choi, Kibong Choi, Stanley Jungkyu Choi, Seokhee Hong, Junwon Hwang, Hyojin Jeon, Gerrard Jeongwon Jo, Hyunjik Jo, Jiyeon Jung, Yountae Jung, Hyosang Kim, Joonkee Kim, Seonghwan Kim, Soyeon Kim, Sunkyoung Kim, Yireun Kim, Yongil Kim, Youchul Kim, Edward Hwayoung Lee, Haeju Lee, Honglak Lee, Jinsik Lee, Kyungmin Lee, Woohyung Lim, Sangha Park, Sooyoun Park, Yongmin Park, Sihoon Yang, Heuiyeen Yeen, Hyeongu Yun

机构 * LG AI Research(LG人工智能研究)

专题命中 指令微调 :language model(title,abstract);large language model(title);分类 cs.CL

AI总结 EXAONE 3.5系列模型通过指令微调在现实场景中实现卓越的指令遵循能力,同时在长上下文理解和通用基准测试中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.22120 2025-11-25 cs.CL 86%

LoKI: Low-damage Knowledge Implanting of Large Language Models

LoKI: 大型语言模型的低损伤知识植入

Runyu Wang, Peng Ping, Zhengyu Guo, Xiaoye Zhang, Quan Shi, Liting Zhou, Tianbo Ji

专题命中 指令微调 :large language model(title);language model(title);pretraining(abstract);分类 cs.CL

AI总结 LoKI通过利用transformer架构的知识存储机制,实现了在保持通用能力的同时提升任务特定性能的参数高效微调方法。

Comments AAAI-26 Oral

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.07760 2025-10-01 cs.CR cs.LG 86%

Scalable Fingerprinting of Large Language Models

Anshul Nasery, Jonathan Hayase, Creston Brooks, Peiyao Sheng, Himanshu Tyagi, Pramod Viswanath, Sewoong Oh

机构 * University of Washington(华盛顿大学) Sentient

专题命中 指令微调 :large language model(title);language model(title);post-training(abstract);分类 cs.LG

Comments Spotlight at NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.12244 2025-09-23 cs.CL 86%

Distribution Prompting: Understanding the Expressivity of Language Models Through the Next-Token Distributions They Can Produce

Haojin Wang, Zining Zhu, Freda Shi

机构 * University of Waterloo(多伦多大学) Stevens Institute of Technology(史蒂文斯理工学院) Vector Institute, Canada CIFAR AI Chair(加拿大向量研究所)

专题命中 指令微调 :language model(title,abstract);prompting(title);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.13090 2025-09-22 cs.CL 86%

The Effect of Language Diversity When Fine-Tuning Large Language Models for Translation

David Stap, Christof Monz

机构 * Language Technology Lab University of Amsterdam(语言技术实验室 阿姆斯特丹大学)

专题命中 指令微调 :large language model(title);language model(title);LLM(abstract);分类 cs.CL

Comments EMNLP 2025 Camera Ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.12108 2025-09-17 cs.CL 86%

GTA: Supervised-Guided Reinforcement Learning for Text Classification with Large Language Models

Min Zeng, Jingfei Sun, Xueyou Luo, Caiquan Liu, Shiqi Zhang, Li Xie, Xiaoxin Chen

机构 * vivo AI Lab(vivo人工智能实验室)

专题命中 指令微调 :large language model(title);language model(title);SFT(abstract);分类 cs.CL

Comments Accepted at EMNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.16822 2025-09-04 cs.AI 86%

Can Large Language Models Act as Ensembler for Multi-GNNs?

Hanqi Duan, Yao Cheng, Jianxiang Yu, Yao Liu, Xiang Li

机构 * East China Normal University(东华师范大学)

专题命中 指令微调 :large language model(title);language model(title);LLM(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.10332 2025-06-05 cs.CV cs.AI 86%

Prescribing the Right Remedy: Mitigating Hallucinations in Large Vision-Language Models via Targeted Instruction Tuning

Rui Hu, Yahan Tu, Shuyu Wei, Dongyuan Lu, Jitao Sang

机构 * Beijing Key Lab of Traffic Data Analysis and Mining(北京交通大数据分析与挖掘重点实验室) Beijing Jiaotong University(北京交通大学) School of Information Technology and Management(信息科学技术学院)

专题命中 指令微调 :language model(title,abstract);instruction tuning(title);分类 cs.AI

Comments Accepted in Information Sciences 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.02295 2025-06-04 cs.CV cs.AI 86%

QARI-OCR: High-Fidelity Arabic Text Recognition through Multimodal Large Language Model Adaptation

Ahmed Wasfy, Omer Nacar, Abdelakreem Elkhateb, Mahmoud Reda, Omar Elshehy, Adel Ammar, Wadii Boulila

机构 * NAMAA KAND CA Corp. Prince Sultan University

专题命中 指令微调 :language model(title,abstract);large language model(title);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.12545 2025-05-22 cs.CL 86%

Towards Reliable and Interpretable Traffic Crash Pattern Prediction and Safety Interventions Using Customized Large Language Models

Yang Zhao, Pu Wang, Yibo Zhao, Hongru Du, Hao Frank Yang

机构 * Center for Systems Science and Engineering(系统科学与工程中心) Johns Hopkins University(约翰霍普金斯大学)

专题命中 指令微调 :large language model(title);language model(title);LLM(abstract);分类 cs.CL

Comments Last revised 13 Feb 2025. Under review in Nature portfolio

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.12293 2025-05-16 cs.SE cs.LG 86%

Unified Modeling Language Code Generation from Diagram Images Using Multimodal Large Language Models

Averi Bates, Ryan Vavricka, Shane Carleton, Ruosi Shao, Chongle Pan

专题命中 指令微调 :language model(title,abstract);large language model(title);分类 cs.LG

Comments Published in the Journal of Machine Learning with Applications, Author Contributions: Averi Bates: Methodology, Development, Analysis, Data Curation, Drafting, Review. Ryan Vavricka: Data Curation, Development, Review. Shane Carleton: Supervision, Funding. Ruosi Shao: Review. Chongle Pan: Supervision, Review

Journal ref Mach. Learn. Appl. 20 (2025) 100660

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.14720 2025-04-03 cs.CL 86%

Optimizing Social Media Annotation of HPV Vaccine Skepticism and Misinformation Using Large Language Models: An Experimental Evaluation of In-Context Learning and Fine-Tuning Stance Detection Across Multiple Models

Luhang Sun, Varsha Pendyala, Yun-Shiuan Chuang, Shanglin Yang, Jonathan Feldman, Andrew Zhao, Munmun De Choudhury, Sijia Yang, Dhavan Shah

专题命中 指令微调 :language model(title,abstract);large language model(title);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏