arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 11619 信号源:cs.CL, cs.AI, cs.LG

1. 指令微调 11619 篇

2512.17093 2025-12-22 cs.AI cs.CL 82%

A Solver-in-the-Loop Framework for Improving LLMs on Answer Set Programming for Logic Puzzle Solving

一种用于改进逻辑谜题求解的LLM在Answer Set Programming中的求解器循环框架

Timo Pierre Schrader, Lukas Lange, Tobias Kaminski, Simon Razniewski, Annemarie Friedrich

专题命中 指令微调 :LLM(abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本文提出了一种求解器循环框架,通过引导求解器进行指令微调,提升LLM在Answer Set Programming中生成逻辑谜题解答的性能。

Comments 15 pages, 7 figures, accepted at AAAI'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23045 2025-12-09 cs.AI cs.CL cs.SE 82%

Kimi-Dev: Agentless Training as Skill Prior for SWE-Agents

Kimi-Dev:无代理训练作为SWE-代理的技能先验

Zonghan Yang, Shengjie Wang, Kelin Fu, Wenyang He, Weimin Xiong, Yibo Liu, Yibo Miao, Bofei Gao, Yejie Wang, Yingwei Ma, Yanhao Li, Yue Liu, Zhenxing Hu, Kaitai Zhang, Shuyi Wang, Huarong Chen, Flood Sung, Yang Liu, Yang Gao, Zhilin Yang, Tianyu Liu

机构 * Moonshot AI THU(清华大学) PKU(北京大学) UCAS(中国科学技术大学) BUPT(北京邮电大学) NUS(新加坡国立大学)

专题命中 指令微调 :LLM(abstract);large language model(abstract);language model(abstract);SFT(abstract)

AI总结 Kimi-Dev通过无代理训练生成技能先验,使SWE-代理在SWE-bench Verified上取得60.4%的优异成绩,并通过额外SFT适应达到48.6%的pass@1,与Claude 3.5 Sonnet相当。

Comments 68 pages. GitHub repo at https://github.com/MoonshotAI/Kimi-Dev

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.09620 2025-12-09 cs.CV cs.AI cs.CL 82%

Exploring the Potential of Encoder-free Architectures in 3D LMMs

探索无编码器架构在3D大语言模型中的潜力

Yiwen Tang, Zoey Guo, Zhuhao Wang, Ray Zhang, Qizhi Chen, Junli Liu, Delin Qu, Zhigang Wang, Dong Wang, Bin Zhao, Xuelong Li

机构 * Northwestern Polytechnical University(西北工业大学) Shanghai AI Laboratory(上海人工智能实验室) The Chinese University of Hong Kong(香港中文大学) Tsinghua University(清华大学) Tele AI

专题命中 指令微调 :LLM(abstract);large language model(abstract);language model(abstract);instruction tuning(abstract)

AI总结 本文提出首个无编码器3D大语言模型ENEL,通过嵌入语义编码和分层几何聚合策略,在3D理解任务中达到与SOTA模型相当的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21050 2025-11-27 cs.LG cs.AI stat.ML 82%

Breaking the Safety-Capability Tradeoff: Reinforcement Learning with Verifiable Rewards Maintains Safety Guardrails in LLMs

打破安全性与能力的权衡:具有可验证奖励的强化学习在LLMs中维持安全护栏

Dongkyu Derek Cho, Huan Song, Arijit Ghosh Chowdhury, Haotian An, Yawei Wang, Rohit Thekkanal, Negin Sokhandan, Sharlina Keshava, Hannah Marlowe

专题命中 指令微调 :large language model(abstract);language model(abstract);SFT(abstract);RLHF(abstract)

AI总结 本文提出通过可验证奖励的强化学习方法,在提升LLM推理能力的同时维持安全性,挑战了传统安全性与能力权衡的假设。

Comments AAAI-26 Workshop on Post-AI Formal Methods

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.13761 2025-11-19 cs.DC cs.AI cs.LG 82%

What happens when nanochat meets DiLoCo?

Alexander Acker, Soeren Becker, Sasho Nedelkoski, Dominik Scheinert, Odej Kao, Philipp Wiesner

机构 * Team exalsius(exalsius团队) Technische Universität Berlin(柏林技术大学)

专题命中 指令微调 :LLM(abstract);pretraining(abstract);post-training(abstract);SFT(abstract)

Comments 8pages, 3 figures, technical report

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.14626 2025-11-17 cs.CL cs.AI 82%

LDC: Learning to Generate Research Idea with Dynamic Control

Ruochen Li, Liqiang Jing, Chi Han, Jiawei Zhou, Xinya Du

机构 * University of Texas at Dallas(德克萨斯大学达拉斯分校) UIUC(伊利诺伊大学香槟分校) Stony Brook University(史泰森布鲁克大学)

专题命中 指令微调 :large language model(abstract);language model(abstract);SFT(abstract);prompting(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.07464 2025-11-12 cs.CL cs.AI 82%

Motif 2 12.7B technical report

Junghwan Lim, Sungmin Lee, Dongseok Kim, Taehyun Kim, Eunhwan Park, Jeesoo Lee, Jeongdoo Lee, Junhyeok Lee, Wai Ting Cheung, Dahye Choi, Jaeheui Her, Jaeyeon Huh, Hanbin Jung, Changjin Kang, Beomgyu Kim, Minjae Kim, Taewhan Kim, Youngrok Kim, Hyukjin Kweon, Haesol Lee, Kungyu Lee, Dongpin Oh, Yeongjae Park, Bokki Ryu, Dongjoo Weon

机构 * Motif Technologies(Motif技术公司)

专题命中 指令微调 :large language model(abstract);language model(abstract);foundation model(abstract);post-training(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.06215 2025-11-11 cs.CL cs.AI 82%

Explicit Knowledge-Guided In-Context Learning for Early Detection of Alzheimer's Disease

Puzhen Su, Yongzhu Miao, Chunxi Guo, Jintao Tang, Shasha Li, Ting Wang

机构 * College of Computer Science and Technology, National University of Defense Technology(计算机科学与技术学院,国防科技大学)

专题命中 指令微调 :LLM(abstract);large language model(abstract);language model(abstract);small language model(abstract)

Comments This paper was accepted by IEEE BIBM 2025 conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.19563 2025-10-29 cs.LG cs.AI stat.AP stat.ML 82%

Robustness is Important: Limitations of LLMs for Data Fitting

Hejia Liu, Mochen Yang, Gediminas Adomavicius

机构 * Carlson School of Management, University of Minnesota(明尼苏达大学卡尔森管理学院)

专题命中 指令微调 :LLM(abstract);large language model(abstract);language model(abstract);foundation model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.09992 2025-10-21 cs.CL cs.LG 82%

Large Language Diffusion Models

Shen Nie, Fengqi Zhu, Zebin You, Xiaolu Zhang, Jingyang Ou, Jun Hu, Jun Zhou, Yankai Lin, Ji-Rong Wen, Chongxuan Li

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学人工智能学院) Beijing Key Laboratory of Research on Large Models and Intelligent Governance(北京大型模型与智能治理研究重点实验室) Engineering Research Center of Next-Generation Intelligent Search and Recommendation, MOE(下一代智能搜索与推荐工程研究中心) Ant Group(蚂蚁集团)

专题命中 指令微调 :LLM(abstract);large language model(abstract);language model(abstract);SFT(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.15047 2025-10-20 cs.LG cs.CL 82%

Internalizing World Models via Self-Play Finetuning for Agentic RL

Shiqi Chen, Tongyao Zhu, Zian Wang, Jinghan Zhang, Kangrui Wang, Siyang Gao, Teng Xiao, Yee Whye Teh, Junxian He, Manling Li

机构 * City University of Hong Kong(香港城市大学) Northwestern University(西北大学) The Hong Kong University of Science and Technology(香港科学与技术大学) Oxford University(牛津大学) Allen Institute for AI (AI2)(人工智能研究所) University of Washington(华盛顿大学) National University of Singapore(新加坡国立大学) The Hong Kong Polytechnic University(香港理工大学)

专题命中 指令微调 :LLM(abstract);large language model(abstract);language model(abstract);SFT(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.12859 2025-10-20 cs.CL cs.AI 82%

PAFT: Prompt-Agnostic Fine-Tuning

Chenxing Wei, Yao Shu, Mingwen Ou, Ying Tiffany He, Fei Richard Yu

机构 * College of Computer Science and Software Engineering, Shenzhen University, China(深圳大学计算机科学与软件工程学院) Tsinghua Shenzhen International Graduate School, Tsinghua University, China(清华大学深圳国际研究生院) Guangdong Lab of AI and Digital Economy (SZ), China(广东人工智能与数字经济实验室(深圳)) Hong Kong University of Science and Technology (Guangzhou), China(香港科技大学(广州)) School of Information Technology, Carleton University, Canada(卡尔顿大学信息科技学院)

专题命中 指令微调 :LLM(abstract);large language model(abstract);language model(abstract);SFT(abstract)

Comments 24 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.23227 2025-10-16 cs.CL cs.LG q-bio.QM 82%

Enabling Few-Shot Alzheimer's Disease Diagnosis on Biomarker Data with Tabular LLMs

Sophie Kearney, Shu Yang, Zixuan Wen, Bojian Hou, Duy Duong-Tran, Tianlong Chen, Jason Moore, Marylyn Ritchie, Li Shen

机构 * University of Pennsylvania(宾夕法尼亚大学) United States Naval Academy(美国海军学院) University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校) Cedars Sinai Medical Center(西好莱坞 Cedars Sinai 医院)

专题命中 指令微调 :LLM(abstract);large language model(abstract);language model(abstract);foundation model(abstract)

Comments accepted by ACM-BCB'25: ACM Conference on Bioinformatics, Computational Biology, and Health Informatics [ACM SIGBio Best Paper Award]

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.02575 2025-10-15 cs.CL cs.CR cs.LG 82%

Cross-Modal Safety Alignment: Is textual unlearning all you need?

Trishna Chakraborty, Erfan Shayegani, Zikui Cai, Nael Abu-Ghazaleh, M. Salman Asif, Yue Dong, Amit K. Roy-Chowdhury, Chengyu Song

机构 * University of California, Riverside(加州大学河滨分校)

专题命中 指令微调 :large language model(abstract);language model(abstract);SFT(abstract);RLHF(abstract)

Comments Accepted by EMNLP 2024 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10023 2025-10-14 cs.LG cs.AI 82%

Skill-Targeted Adaptive Training

Yinghui He, Abhishek Panigrahi, Yong Lin, Sanjeev Arora

机构 * Princeton Language and Intelligence(普林斯顿语言与智能)

专题命中 指令微调 :LLM(abstract);large language model(abstract);language model(abstract);SFT(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.17131 2025-10-13 cs.LG cs.AI 82%

Enabling Self-Improving Agents to Learn at Test Time With Human-In-The-Loop Guidance

Yufei He, Ruoyu Li, Alex Chen, Yue Liu, Yulin Chen, Yuan Sui, Cheng Chen, Yi Zhu, Luca Luo, Frank Yang, Bryan Hooi

机构 * National University of Singapore(新加坡国立大学) ByteDance Inc.(字节跳动公司)

专题命中 指令微调 :LLM(abstract);large language model(abstract);language model(abstract);prompting(abstract)

Comments EMNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22647 2025-09-29 cs.CV cs.AI cs.CL 82%

CapRL: Stimulating Dense Image Caption Capabilities via Reinforcement Learning

Long Xing, Xiaoyi Dong, Yuhang Zang, Yuhang Cao, Jianze Liang, Qidong Huang, Jiaqi Wang, Feng Wu, Dahua Lin

机构 * University of Science and Technology of China(中国科学技术大学) Shanghai AI Laboratory(上海人工智能实验室) The Chinese University of Hong Kong(香港中文大学) Shanghai Innovation Institute(上海创新研究院) Alibaba Cloud(阿里巴巴云)

专题命中 指令微调 :LLM(abstract);language model(abstract);pretraining(abstract);SFT(abstract)

Comments Code is available at https://github.com/InternLM/CapRL

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.12716 2025-09-29 cs.CL cs.AI 82%

Shadow-FT: Tuning Instruct Model via Training on Paired Base Model

Taiqiang Wu, Runming Yang, Jiayi Li, Pengfei Hu, Yik-Chung Wu, Ngai Wong, Yujiu Yang

机构 * The University of Hong Kong(香港大学) Tsinghua University(清华大学) Tencent(腾讯)

专题命中 指令微调 :large language model(abstract);language model(abstract);post-training(abstract);preference optimization(abstract)

Comments 24 pages, 12 tables, 8 figures. Previous name: Shadow-FT: Tuning Instruct via Base

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.12229 2025-09-17 cs.LG cs.AI cs.PF 82%

Profiling LoRA/QLoRA Fine-Tuning Efficiency on Consumer GPUs: An RTX 4060 Case Study

MSR Avinash

机构 * MSR Avinash(MSR) Juspay

专题命中 指令微调 :LLM(abstract);large language model(abstract);language model(abstract);foundation model(abstract)

Comments 8 pages, 3 figures, 2 tables. Primary category: cs.LG (Machine Learning); secondary: cs.AI (Artificial Intelligence). LaTeX source with figures included

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.11167 2025-09-16 cs.LG cs.AI 82%

Harnessing Optimization Dynamics for Curvature-Informed Model Merging

Pouria Mahdavinia, Hamed Mahdavi, Niloofar Mireshghallah, Mehrdad Mahdavi

机构 * The Pennsylvania State University(宾夕法尼亚州立大学) Carnegie Mellon University(卡内基梅隆大学)

专题命中 指令微调 :large language model(abstract);language model(abstract);post-training(abstract);SFT(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.20491 2025-09-03 cs.CV cs.CL cs.LG 82%

VPO: Aligning Text-to-Video Generation Models with Prompt Optimization

Jiale Cheng, Ruiliang Lyu, Xiaotao Gu, Xiao Liu, Jiazheng Xu, Yida Lu, Jiayan Teng, Zhuoyi Yang, Yuxiao Dong, Jie Tang, Hongning Wang, Minlie Huang

机构 * The Conversational Artificial Intelligence (CoAI) Group, Tsinghua University(清华大学对话人工智能(CoAI)小组) Zhipu AI(智谱AI) The Knowledge Engineering Group (KEG), Tsinghua University(清华大学知识工程小组(KEG))

专题命中 指令微调 :large language model(abstract);language model(abstract);SFT(abstract);RLHF(abstract)

Comments ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.19481 2025-08-28 cs.CL cs.AI 82%

Improving Low-Resource Translation with Dictionary-Guided Fine-Tuning and RL: A Spanish-to-Wayuunaiki Study

Manuel Mosquera, Melissa Robles, Johan Rodriguez, Ruben Manrique

机构 * Universidad de los Andes(洛斯安第斯大学)

专题命中 指令微调 :large language model(abstract);language model(abstract);instruction tuning(abstract);pretraining(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.16546 2025-08-25 cs.LG cs.AI 82%

RL Is Neither a Panacea Nor a Mirage: Understanding Supervised vs. Reinforcement Learning Fine-Tuning for LLMs

Hangzhan Jin, Sicheng Lv, Sifan Wu, Mohammad Hamdaqa

机构 * PolyTechnique Montreal(蒙特利尔大学) Mila(Mila研究院) McGill(麦吉尔大学) UDeM(UDeM大学)

专题命中 指令微调 :large language model(abstract);language model(abstract);post-training(abstract);SFT(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.11258 2025-08-18 cs.LG cs.CL cs.CY 82%

Group Fairness Meets the Black Box: Enabling Fair Algorithms on Closed LLMs via Post-Processing

Ruicheng Xian, Yuxuan Wan, Han Zhao

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 指令微调 :LLM(abstract);large language model(abstract);language model(abstract);prompting(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.10948 2025-08-18 cs.LG cs.AI 82%

Apriel-Nemotron-15B-Thinker

Shruthan Radhakrishna, Soham Parikh, Gopal Sarda, Anil Turkkan, Quaizar Vohra, Raymond Li, Dhruv Jhamb, Kelechi Ogueji, Aanjaneya Shukla, Oluwanifemi Bamgbose, Toby Liang, Luke Kumar, Oleksiy Ostapenko, Shiva Krishna Reddy Malay, Aman Tiwari, Tara Bogavelli, Vikas Yadav, Jash Mehta, Saloni Mittal, Akshay Kalkunte, Pulkit Pattnaik, Khalil Slimi, Anirudh Sreeram, Jishnu Nair, Akintunde Oladipo, Shashank Maiya, Khyati Mahajan, Rishabh Maheshwary, Masoud Hashemi, Sai Rajeswar Mudumba, Sathwik Tejaswi Madhusudhan, Torsten Scholak, Sebastien Paquet, Sagar Davasam, Srinivas Sunkara

机构 * Apriel-Nemotron-15B-Thinker

专题命中 指令微调 :large language model(abstract);language model(abstract);SLM(abstract);SFT(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.10045 2025-07-15 cs.AI cs.CL 82%

Automating SPARQL Query Translations between DBpedia and Wikidata

Malte Christian Bartels, Debayan Banerjee, Ricardo Usbeck

机构 * Leuphana University of Lüneburg(吕贝克大学)

专题命中 指令微调 :LLM(abstract);large language model(abstract);language model(abstract);prompting(abstract)

Comments 18 pages, 2 figues. Paper accepted at SEMANTiCS 2025 conference happening on September 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.05305 2025-07-09 cs.CY cs.AI cs.CL cs.SE 82%

Narrowing the Gap: Supervised Fine-Tuning of Open-Source LLMs as a Viable Alternative to Proprietary Models for Pedagogical Tools

Lorenzo Lee Solano, Charles Koutcheme, Juho Leinonen, Alexandra Vassar, Jake Renzella

机构 * University of New South Wales(新南威尔士大学) Aalto University(艾尔沃斯大学)

专题命中 指令微调 :LLM(abstract);large language model(abstract);language model(abstract);SFT(abstract)

Comments 7 pages, 3 tables, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.19525 2025-06-25 cs.CL cs.AI 82%

Automatic Posology Structuration : What role for LLMs?

Natalia Bobkova, Laura Zanella-Calzada, Anyes Tafoughalt, Raphaël Teboul, François Plesse, Félix Gaschi

机构 * SAS Posos Sorbonne Université(索邦大学)

专题命中 指令微调 :LLM(abstract);large language model(abstract);language model(abstract);prompting(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.10823 2025-06-24 cs.CL cs.LG q-fin.CP q-fin.TR 82%

FinGPT: Enhancing Sentiment-Based Stock Movement Prediction with Dissemination-Aware and Context-Enriched LLMs

Yixuan Liang, Yuncong Liu, Neng Wang, Hongyang Yang, Boyu Zhang, Christina Dan Wang

专题命中 指令微调 :LLM(abstract);large language model(abstract);language model(abstract);instruction tuning(abstract)

Comments 1st Workshop on Preparing Good Data for Generative AI: Challenges and Approaches@ AAAI 2025, ai4finance.org

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.14309 2025-06-05 cs.CL cs.AI 82%

LoGU: Long-form Generation with Uncertainty Expressions

Ruihan Yang, Caiqi Zhang, Zhisong Zhang, Xinting Huang, Sen Yang, Nigel Collier, Dong Yu, Deqing Yang

机构 * Fudan University(复旦大学) University of Cambridge(剑桥大学) Tencent AI Lab(腾讯AI实验室) The Chinese University of Hong Kong(香港中文大学)

专题命中 指令微调 :large language model(abstract);language model(abstract);SFT(abstract);preference optimization(abstract)

Comments ACL 2025 Main

详情

展开后加载摘要…

URL PDF HTML 收藏