arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2025-11-27 至 2025-11-27 共收录 15 信号源:cs.CL, cs.AI, cs.LG

1. 指令微调 15 篇

2412.15287 2025-11-27 cs.CL cs.AI cs.LG 90%

Inference-Aware Fine-Tuning for Best-of-N Sampling in Large Language Models

为大型语言模型的最佳-N采样进行推理感知微调

Yinlam Chow, Guy Tennenholtz, Izzeddin Gur, Vincent Zhuang, Bo Dai, Sridhar Thiagarajan, Craig Boutilier, Rishabh Agarwal, Aviral Kumar, Aleksandra Faust

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出了一种推理感知微调方法,通过改进最佳-N采样策略提升大型语言模型的性能和推理效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20072 2025-11-27 cs.CL 88%

MTA: A Merge-then-Adapt Framework for Personalized Large Language Model

MTA: 一种用于个性化大语言模型的融合后再适应框架

Xiaopeng Li, Yuanjin Zheng, Wanyu Wang, wenlin zhang, Pengyue Jia, Yiqi Wang, Maolin Wang, Xuetao Wei, Xiangyu Zhao

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 MTA通过融合后再适应框架,解决个性化大语言模型在存储成本和数据稀疏性方面的挑战,实现高效动态个性化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.10507 2025-11-27 cs.CL 85%

AdvancedIF: Rubric-Based Benchmarking and Reinforcement Learning for Advancing LLM Instruction Following

AdvancedIF:基于规则的基准测试与强化学习以推进大语言模型指令跟随

Yun He, Wenzhe Li, Hejia Zhang, Songlin Li, Karishma Mandyam, Sopan Khosla, Yuanhao Xiong, Nanshu Wang, Xiaoliang Peng, Beibin Li, Shengjie Bi, Shishir G. Patil, Qi Qi, Shengyu Feng, Julian Katz-Samuels, Richard Yuanzhe Pang, Sujan Gonugondla, Hunter Lang, Yue Yu, Yundi Qian, Maryam Fazel-Zarandi, Licheng Yu, Amine Benhalloum, Hany Awadalla, Manaal Faruqui

机构 * Meta Superintelligence Labs(Meta超智能实验室) Princeton University(普林斯顿大学)

专题命中 指令微调 :LLM(title);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 本研究提出AdvancedIF基准和RIFL方法,通过规则生成和奖励塑造提升大语言模型的指令跟随能力,在AdvancedIF上实现6.7%的提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20689 2025-11-27 q-bio.NC cs.AI 85%

Morality in AI. A plea to embed morality in LLM architectures and frameworks

人工智能中的道德。呼吁将道德嵌入大语言模型架构和框架中

Gunter Bombaerts, Bram Delisse, Uzay Kaymak

专题命中 指令微调 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文呼吁将道德嵌入大语言模型架构和框架中,通过自上而下设计原则,提出技术路径以实现道德处理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21050 2025-11-27 cs.LG cs.AI stat.ML 82%

Breaking the Safety-Capability Tradeoff: Reinforcement Learning with Verifiable Rewards Maintains Safety Guardrails in LLMs

打破安全性与能力的权衡:具有可验证奖励的强化学习在LLMs中维持安全护栏

Dongkyu Derek Cho, Huan Song, Arijit Ghosh Chowdhury, Haotian An, Yawei Wang, Rohit Thekkanal, Negin Sokhandan, Sharlina Keshava, Hannah Marlowe

专题命中 指令微调 :large language model(abstract);language model(abstract);SFT(abstract);RLHF(abstract)

AI总结 本文提出通过可验证奖励的强化学习方法,在提升LLM推理能力的同时维持安全性,挑战了传统安全性与能力权衡的假设。

Comments AAAI-26 Workshop on Post-AI Formal Methods

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.17591 2025-11-27 cs.CL cs.AI cs.LG cs.SE 82%

HGAdapter: Hypergraph-based Adapters in Language Models for Code Summarization and Clone Detection

HGAdapter: 基于超图的语言模型代码摘要与克隆检测适配器

Guang Yang, Yujie Zhu

机构 * Data Technology Group, Technology Research and Development Department, Guotai Haitong Securities, China(国泰君安证券数据技术部、技术研发部) School of Computer Science and Technology, East China Normal University, China(华东师范大学计算机科学与技术学院)

专题命中 指令微调 :language model(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 HGAdapter通过引入高阶数据相关性,改进超图神经网络架构,提升预训练语言模型在代码摘要与克隆检测任务中的性能。

Comments Accepted by the 2025 Conference on Empirical Methods in Natural Language Processing (EMNLP 2025) as a findings long paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02833 2025-11-27 cs.CR 75%

Attack via Overfitting: 10-shot Benign Fine-tuning to Jailbreak LLMs

通过过拟合攻击:10次良性微调以劫持LLMs

Zhixin Xie, Xurui Song, Jun Luo

专题命中 指令微调 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 通过10个良性QA对微调实现LLM劫持,利用过拟合增强敏感性,提升攻击效果与隐蔽性。

Comments Published as a conference paper at NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.21250 2025-11-27 cs.CL 70%

ReSCORE: Label-free Iterative Retriever Training for Multi-hop Question Answering with Relevance-Consistency Supervision

ReSCORE:无标签迭代检索器训练用于多跳问答的 relevancy-一致性监督

Dosung Lee, Wonjun Oh, Boyoung Kim, Minyoung Kim, Joonsuk Park, Paul Hongsuck Seo

机构 * Dept. of CSE, Korea University(韩国大学计算机科学与工程系) NAVER AI Lab(NAVER AI实验室) NAVER Cloud(NAVER云) University of Richmond(里奇蒙大学)

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 ReSCORE通过无标签数据训练密集检索器,提升多跳问答的检索与回答性能。

Comments 9 pages, 3 figures, ACL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21375 2025-11-27 cs.CV 67%

Thinking With Bounding Boxes: Enhancing Spatio-Temporal Video Grounding via Reinforcement Fine-Tuning

通过边界框思考:通过强化微调提升空间时间视频定位

Xin Gu, Haoji Zhang, Qihang Fan, Jingxuan Niu, Zhipeng Zhang, Libo Zhang, Guang Chen, Fan Chen, Longyin Wen, Sijie Zhu

机构 * ByteDance Intelligent Creation(字节跳动智能创作) Tsinghua University(清华大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Shanghai Jiao Tong University(上海交通大学) Institute of Software, Chinese Academy of Sciences(中国科学院软件研究所)

专题命中 指令微调 :large language model(abstract);language model(abstract)

AI总结 STVG-o1通过强化微调提升空间时间视频定位性能,实现无需架构修改的先进结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20382 2025-11-27 cs.LG q-bio.GN 57%

MoRE: Batch-Robust Multi-Omics Representations from Frozen Pre-trained Transformers

MoRE:从冻结预训练转换器中获得批量鲁棒多组学表示

Audrey Pei-Hsuan Chen

专题命中 指令微调 :foundation model(abstract);分类 cs.LG

AI总结 MoRE通过参数高效微调策略,实现多组学数据的鲁棒表示学习,减少可训练参数并提升跨细胞类型和平台的泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.09032 2025-11-27 cs.CL 57%

Exploring Cross-Lingual Knowledge Transfer via Transliteration-Based MLM Fine-Tuning for Critically Low-resource Chakma Language

通过基于转写词的MLM微调探索跨语言知识转移以应对资源极度匮乏的恰克马语

Adity Khisa, Nusrat Jahan Lia, Tasnim Mahfuz Nafis, Zarif Masud, Tanzir Pial, Shebuti Rayana, Ahmedul Kabir

机构 * IIT, University of Dhaka(达卡大学理工学院) Toronto Metropolitan University(多伦多 Metropolitan 大学) Stony Brook University(石溪大学) State University of New York at Old Westbury(纽约州立大学奥尔巴尼分校)

专题命中 指令微调 :language model(abstract);分类 cs.CL

AI总结 通过基于转写词的MLM微调,研究利用孟加拉语转写恰克马语语料库提升低资源语言的迁移学习效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21452 2025-11-27 eess.IV 50%

Semantic-Enhanced Feature Matching with Learnable Geometric Verification for Cross-Modal Neuron Registration

语义增强的特征匹配与可学习几何验证用于跨模态神经元配准

Wenwei Li, Lingyi Cai, Hui Gong, Qingming Luo, Anan Li

专题命中 指令微调 :foundation model(abstract)

AI总结 本文提出一种结合语义增强和可学习几何验证的深度学习框架,用于解决跨模态神经元配准中的模态差距、数据稀缺和组织形变问题,提升生物医学影像配准精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21202 2025-11-27 cs.CV 50%

Towards an Effective Action-Region Tracking Framework for Fine-grained Video Action Recognition

迈向细粒度视频动作识别的有效动作-区域跟踪框架

Baoli Sun, Yihan Wang, Xinzhu Ma, Zhihui Wang, Kun Lu, Zhiyong Wang

机构 * DUT-RU International School of Information Science & Engineering, Dalian University of Technology, China(大连理工大学国际信息科学与工程学院,大连理工大学,中国) Beihang University, China(北京航空航天大学,中国) The University of Sydney, Australia(悉尼大学,澳大利亚)

专题命中 指令微调 :language model(abstract)

AI总结 本文提出了一种动作-区域跟踪框架,通过查询-响应机制捕捉细粒度动作细节,提升视频动作识别性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.06220 2025-11-27 cs.CV 50%

Earth-Adapter: Bridge the Geospatial Domain Gaps with Mixture of Frequency Adaptation

Earth-Adapter: 通过频率适应混合填补地理域的空白

Xiaoxing Hu, Ziyang Gong, Yupei Wang, Yuru Jia, Fei Lin, Dexiang Gao, Ke An, Jianhong Han, Zhuoran Sun, Gen Luo, Gen Luo, Xue Yang

专题命中 指令微调 :foundation model(abstract)

AI总结 Earth-Adapter通过频率适应混合方法有效解决遥感图像中的伪影问题,提升基础模型在遥感任务中的性能。

Comments AAAI 2026 camera ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.04876 2025-11-27 physics.comp-ph cond-mat.mtrl-sci physics.chem-ph 50%

Modelling complex proton transport phenomena -- Exploring the limits of fine-tuning and transferability of foundational machine-learned force fields

复杂质子传输现象建模——探索基础机器学习力场的微调和可迁移性极限

Malte Grunert, Max Großmann, Jonas Hänseroth, Aaron Flötotto, Jules Oumard, Johannes Laurenz Wolf, Erich Runge, Christian Dreßler

专题命中 指令微调 :foundation model(abstract)

AI总结 本研究利用MACE力场模拟固体酸的质子传输,通过微调和多纳秒级MD模拟,实现了与实验数据一致的扩散系数和活化能结果。

Journal ref The Journal of Physical Chemistry C 2025 129 (21), 9662-9669

详情

展开后加载摘要…

URL PDF HTML 收藏