arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2025-09-11 至 2025-09-11 共收录 6 信号源:cs.CL, cs.AI, cs.LG

1. 指令微调 6 篇

2509.08755 2025-09-11 cs.LG cs.AI cs.CL 85%

AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning

Zhiheng Xi, Jixuan Huang, Chenyang Liao, Baodai Huang, Honglin Guo, Jiaqi Liu, Rui Zheng, Junjie Ye, Jiazheng Zhang, Wenxiang Chen, Wei He, Yiwen Ding, Guanyu Li, Zehui Chen, Zhengyin Du, Xuesong Yao, Yufei Xu, Jiecao Chen, Tao Gui, Zuxuan Wu, Qi Zhang, Xuanjing Huang, Yu-Gang Jiang

机构 * Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院)

专题命中 指令微调 :LLM(title,abstract);SFT(abstract);分类 cs.CL、cs.AI、cs.LG

Comments preprint, 39 pages, 16 figures. Project: https://AgentGym-RL.github.io/. Framework and Code: https://github.com/woooodyy/AgentGym, https://github.com/woooodyy/AgentGym-RL

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.08000 2025-09-11 cs.CL 81%

AntiDote: Bi-level Adversarial Training for Tamper-Resistant LLMs

Debdeep Sanyal, Manodeep Ray, Murari Mandal

专题命中 指令微调 :LLM(abstract);large language model(abstract);language model(abstract);prompting(abstract)

Comments 19 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.10160 2025-09-11 cs.CV cs.AI 79%

PriorCLIP: Visual Prior Guided Vision-Language Model for Remote Sensing Image-Text Retrieval

Jiancheng Pan, Muyuan Ma, Qing Ma, Cong Bai, Shengyong Chen

机构 * IEEE Publication Technology Department(IEEE出版技术部)

专题命中 指令微调 :language model(title,abstract);分类 cs.AI

Comments 14 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.08381 2025-09-11 cs.CL cs.AI 73%

Low-Resource Fine-Tuning for Multi-Task Structured Information Extraction with a Billion-Parameter Instruction-Tuned Model

Yu Cheng Chih, Yong Hao Hou

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

Comments 13 pages, 8 figures, includes experiments on JSON extraction, knowledge graph extraction, and NER

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.14157 2025-09-11 cs.CL cs.AI 62%

Prior Prompt Engineering for Reinforcement Fine-Tuning

Pittawat Taveekitworachai, Potsawee Manakul, Sarana Nutanong, Kunat Pipatanakul

专题命中 指令微调 :language model(abstract);分类 cs.CL、cs.AI

Comments Accepted at EMNLP 2025, Main; 26 pages, 42 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16531 2025-09-11 cs.LG 57%

HOFT: Householder Orthogonal Fine-tuning

Alejandro Moreno Arcas, Albert Sanchis, Jorge Civera, Alfons Juan

机构 * MLLP group, Valencian Research Institute for Artificial Intelligence(瓦伦西亚人工智能研究 institute 的 MLLP 组) Universitat Politècnica de València, Spain(瓦伦西亚理工大学,西班牙)

专题命中 指令微调 :foundation model(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏