arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2025-12-09 至 2025-12-09 共收录 28 信号源:cs.CL, cs.AI, cs.LG

1. 指令微调 28 篇

2503.16929 2025-12-09 cs.CV cs.AI 93%

TEMPLE: Incentivizing Temporal Understanding of Video Large Language Models via Progressive Pre-SFT Alignment

TEMPLE:通过渐进式预SFT对齐激励视频大语言模型的时序理解

Shicheng Li, Lei Li, Kun Ouyang, Shuhuai Ren, Yuanxin Liu, Yuanxing Zhang, Fuzheng Zhang, Lingpeng Kong, Qi Liu, Xu Sun

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);SFT(title,abstract);LLM(abstract)

AI总结 TEMPLE通过渐进式预SFT对齐策略提升视频大语言模型的时序理解能力,利用直接偏好优化和课程学习增强模型对时间信息的感知。

Comments Accepted to AAAI 2026. Code available at https://github.com/lscpku/TEMPLE

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.11192 2025-12-09 cs.CL cs.AI 92%

I Learn Better If You Speak My Language: Understanding the Superior Performance of Fine-Tuning Large Language Models with LLM-Generated Responses

我如果能用我的语言说话会学得更好:理解通过微调大型语言模型与LLM生成响应的优越性能

Xuan Ren, Biao Wu, Lingqiao Liu

机构 * University of Adelaide(阿德莱德大学) University of Technology Sydney(悉尼科技大学)

专题命中 指令微调 :LLM(title,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 本文研究了LLM生成响应在微调大型语言模型时的优越性能,发现LLM对自身生成响应的熟悉性是提升学习效果的关键因素。

Comments The paper has been accepted to EMNLP 2024 (Main Conference) there is a follow up paper: Efficiently Selecting Response Generation Strategies for Synthetic Data Construction by Self-Aligned Perplexity Note: This is a revised version of arXiv:2402.11192 (v1, submitted 17 Feb 2024)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06483 2025-12-09 cs.CL cs.AI 90%

Classifying German Language Proficiency Levels Using Large Language Models

利用大型语言模型分类德语语言水平

Elias-Leander Ahlers, Witold Brunsmann, Malte Schilling

机构 * Computer Science Department University of Münster(穆尔斯特大学计算机科学系)

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

AI总结 本文利用大型语言模型对德语文本进行CEFR水平分类,通过多种方法提升分类性能,展示了LLMs在语言水平评估中的应用潜力。

Comments Accepted at 3rd International Conference on Foundation and Large Language Models (FLLM2025), Vienna (Austria)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07175 2025-12-09 cs.LG 88%

SPACE: Noise Contrastive Estimation Stabilizes Self-Play Fine-Tuning for Large Language Models

SPACE:噪声对比估计稳定了大语言模型的自我对战微调

Yibo Wang, Qing-Guo Chen, Zhao Xu, Weihua Luo, Kaifu Zhang, Lijun Zhang

机构 * National Key Laboratory for Novel Software Technology, Nanjing University(新型软件技术国家实验室,南京大学) School of Artificial Intelligence, Nanjing University(人工智能学院,南京大学) Alibaba International Digital Commerce(阿里巴巴国际数字商业) Pazhou Laboratory (Huangpu)(琶洲实验室(黄埔))

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);分类 cs.LG

AI总结 SPACE通过噪声对比估计稳定大语言模型的自我对战微调,提升下游任务性能

Comments NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.14997 2025-12-09 cs.CV cs.LG 88%

Language Integration in Fine-Tuning Multimodal Large Language Models for Image-Based Regression

基于图像回归的多模态大语言模型微调中的语言整合

Roy H. Jennings, Genady Paikin, Roy Shaul, Evgeny Soloveichik

机构 * Samsung Israel R&D Center(三星以色列研发中心)

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);分类 cs.LG

AI总结 本文提出RvTC方法,通过灵活的区间法替代传统词汇受限分类,提升多模态大语言模型在图像回归任务中的性能。

Comments WACV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06787 2025-12-09 cs.CL 88%

LLM4SFC: Sequential Function Chart Generation via Large Language Models

LLM4SFC: 通过大语言模型生成顺序功能图

Ofek Glick, Vladimir Tchuiev, Marah Ghoummaid, Michal Moshkovitz, Dotan Di-Castro

机构 * Bosch Research(博世研究)

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 LLM4SFC通过大语言模型生成可执行的顺序功能图,实现图形与文本PLC语言的高效转换。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.16159 2025-12-09 cs.CL cs.CE 88%

ZiGong 1.0: A Large Language Model for Financial Credit

ZiGong 1.0:一种用于金融信用的大型语言模型

Yu Lei, Zixuan Wang, Chu Liu, Tongyao Wang

机构 * Didi International Business(滴滴国际业务)

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 ZiGong 1.0通过多任务监督微调和数据修剪方法,提升大型语言模型在金融信用评估中的性能和鲁棒性。

Journal ref 2025 IEEE 41st International Conference on Data Engineering Workshops (ICDEW)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06678 2025-12-09 cs.LG cs.AI 86%

GradientSpace: Unsupervised Data Clustering for Improved Instruction Tuning

GradientSpace: 无监督数据聚类以提升指令微调

Shrihari Sridharan, Deepak Ravikumar, Anand Raghunathan, Kaushik Roy

专题命中 指令微调 :instruction tuning(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 GradientSpace通过直接在梯度空间中聚类样本,提升指令微调效果,减少推理延迟并提高准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07375 2025-12-09 cs.LG cs.CL 84%

LUNE: Efficient LLM Unlearning via LoRA Fine-Tuning with Negative Examples

LUNE: 通过LoRA微调与负例实现高效的LLM反学习

Yezi Liu, Hanning Chen, Wenjun Huang, Yang Ni, Mohsen Imani

机构 * University of California, Irvine(加州大学伊藤分校) Purdue University Northwest(普渡大学西北分校)

专题命中 指令微调 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 LUNE通过LoRA微调与负例实现高效LLM反学习,有效抑制特定知识,降低计算和内存消耗

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01132 2025-12-09 cs.LG cs.AI cs.CL 83%

A Practitioner's Guide to Multi-turn Agentic Reinforcement Learning

多轮代理强化学习实践指南

Ruiyi Wang, Prithviraj Ammanabrolu

机构 * University of California, San Diego(加州大学圣地亚哥分校) NVIDIA(英伟达)

专题命中 指令微调 :LLM(abstract);large language model(abstract);language model(abstract);SFT(abstract)

AI总结 本文提出多轮代理强化学习的训练方法,通过分析环境、奖励和策略三个支柱,总结出训练LLM代理的实践指南。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07667 2025-12-09 cs.LG 83%

Depth-Wise Activation Steering for Honest Language Models

深度方向激活引导用于诚实语言模型

Gracjan Góral, Marysia Winkels, Steven Basart

机构 * University of Warsaw(华沙大学) MARS(对齐研究学生导师计划) Center for AI Safety(人工智能安全中心)

专题命中 指令微调 :language model(title,abstract);large language model(abstract);分类 cs.LG

AI总结 深度方向激活引导方法通过高斯调度提升语言模型的诚实性,无需训练或微调,有效增强模型真实报告能力。

Comments See \url{https://github.com/marysia/gaussian-activation-steering}. for code and experiments

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.12845 2025-12-09 cs.LG 83%

ExLLM: Experience-Enhanced LLM Optimization for Molecular Design and Beyond

ExLLM:基于经验的LLM优化用于分子设计及其他

Nian Ran, Yue Wang, Xiaoyuan Zhang, Zhongzheng Li, Qingsong Ran, Wenhao Li, Richard Allmendinger

机构 * University of Manchester(曼彻斯特大学) Zhongzhengcun Academy(中关村学院)

专题命中 指令微调 :LLM(title,abstract);prompting(abstract);分类 cs.LG

AI总结 ExLLM通过引入经验增强机制,改进了LLM在分子设计及其他领域的优化性能,提升了探索效率和收敛速度。

Comments 10 pages, under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23045 2025-12-09 cs.AI cs.CL cs.SE 82%

Kimi-Dev: Agentless Training as Skill Prior for SWE-Agents

Kimi-Dev:无代理训练作为SWE-代理的技能先验

Zonghan Yang, Shengjie Wang, Kelin Fu, Wenyang He, Weimin Xiong, Yibo Liu, Yibo Miao, Bofei Gao, Yejie Wang, Yingwei Ma, Yanhao Li, Yue Liu, Zhenxing Hu, Kaitai Zhang, Shuyi Wang, Huarong Chen, Flood Sung, Yang Liu, Yang Gao, Zhilin Yang, Tianyu Liu

机构 * Moonshot AI THU(清华大学) PKU(北京大学) UCAS(中国科学技术大学) BUPT(北京邮电大学) NUS(新加坡国立大学)

专题命中 指令微调 :LLM(abstract);large language model(abstract);language model(abstract);SFT(abstract)

AI总结 Kimi-Dev通过无代理训练生成技能先验,使SWE-代理在SWE-bench Verified上取得60.4%的优异成绩,并通过额外SFT适应达到48.6%的pass@1,与Claude 3.5 Sonnet相当。

Comments 68 pages. GitHub repo at https://github.com/MoonshotAI/Kimi-Dev

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.09620 2025-12-09 cs.CV cs.AI cs.CL 82%

Exploring the Potential of Encoder-free Architectures in 3D LMMs

探索无编码器架构在3D大语言模型中的潜力

Yiwen Tang, Zoey Guo, Zhuhao Wang, Ray Zhang, Qizhi Chen, Junli Liu, Delin Qu, Zhigang Wang, Dong Wang, Bin Zhao, Xuelong Li

机构 * Northwestern Polytechnical University(西北工业大学) Shanghai AI Laboratory(上海人工智能实验室) The Chinese University of Hong Kong(香港中文大学) Tsinghua University(清华大学) Tele AI

专题命中 指令微调 :LLM(abstract);large language model(abstract);language model(abstract);instruction tuning(abstract)

AI总结 本文提出首个无编码器3D大语言模型ENEL,通过嵌入语义编码和分层几何聚合策略,在3D理解任务中达到与SOTA模型相当的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06328 2025-12-09 cs.CV 82%

ReCAD: Reinforcement Learning Enhanced Parametric CAD Model Generation with Vision-Language Models

ReCAD: 基于强化学习的参数化CAD模型生成增强框架

Jiahao Li, Yusheng Luo, Yunzhong Lou, Xiangdong Zhou

专题命中 指令微调 :language model(title,abstract);SFT(abstract)

AI总结 ReCAD通过强化学习增强参数化CAD模型生成,利用预训练模型生成高精度CAD模型,显著提升几何精度和语义保真度。

Comments Accepted as an Oral presentation at AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.20109 2025-12-09 cs.SE cs.AI 81%

Learning to Align Human Code Preferences

学习对齐人类代码偏好

Xin Yin, Chao Ni, Xiaohu Yang

机构 * Zhejiang University(浙江大学)

专题命中 指令微调 :large language model(abstract);language model(abstract);SFT(abstract);preference optimization(abstract)

AI总结 本文提出自适应偏好优化(APO)方法,通过动态整合SFT和DPO,提升模型在不同代码偏好场景下的对齐性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.17881 2025-12-09 cs.LG 81%

AdaRankGrad: Adaptive Gradient-Rank and Moments for Memory-Efficient LLMs Training and Fine-Tuning

AdaRankGrad: 适应性梯度-秩和矩用于内存高效的LLM训练和微调

Yehonathan Refael, Jonathan Svirsky, Boris Shustin, Wasim Huleihel, Ofir Lindenbaum

机构 * Department of Electrical Engineering-Systems at Tel Aviv University(特拉维夫大学电子工程系统系) Faculty of Engineering, Bar Ilan University(巴伊兰大学工程学院) Mathematical Institute, University of Oxford(牛津大学数学学院)

专题命中 指令微调 :large language model(abstract);language model(abstract);foundation model(abstract);pretraining(abstract)

AI总结 AdaRankGrad通过自适应低秩梯度更新实现内存高效的大语言模型训练和微调,减少内存需求并提升模型性能。

Journal ref ICLR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07624 2025-12-09 cs.LG cs.AI 81%

Time Series Foundation Models for Process Model Forecasting

用于过程模型预测的时间序列基础模型

Yongbo Yu, Jari Peeperkorn, Johannes De Smedt, Jochen De Weerdt

机构 * Research Center for Information Systems Engineering (LIRIS)(信息系统工程研究中心(LIRIS))

专题命中 指令微调 :foundation model(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出使用时间序列基础模型(TSFMs)进行过程模型预测,通过零样本方法在不额外训练的情况下实现更优的预测性能,展示了其在处理稀疏异质时间序列方面的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07374 2025-12-09 cs.LG cs.CL 81%

Recover-to-Forget: Gradient Reconstruction from LoRA for Efficient LLM Unlearning

恢复-遗忘:从LoRA恢复梯度以实现高效的LLM反学习

Yezi Liu, Hanning Chen, Wenjun Huang, Yang Ni, Mohsen Imani

机构 * University of California, Irvine(加州大学尔湾分校) Purdue University Northwest(普渡大学西北分校)

专题命中 指令微调 :LLM(title);foundation model(abstract);分类 cs.CL、cs.LG

AI总结 R2F通过从LoRA适配器更新中恢复梯度方向,实现高效LLM反学习,无需完整微调或内部参数访问。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06811 2025-12-09 cs.CV cs.AI cs.LG cs.MM 81%

RMAdapter: Reconstruction-based Multi-Modal Adapter for Vision-Language Models

RMAdapter: 基于重建的多模态适配器用于视觉-语言模型

Xiang Lin, Weixin Li, Shu Guo, Lihong Wang, Di Huang

专题命中 指令微调 :language model(title,abstract);分类 cs.AI、cs.LG

AI总结 RMAdapter通过双分支架构平衡通用与任务特定知识,提升视觉-语言模型在多模态迁移学习中的性能。

Comments Accepted by AAAI 2026(Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07273 2025-12-09 cs.CV 80%

RVLF: A Reinforcing Vision-Language Framework for Gloss-Free Sign Language Translation

RVLF:一种无需 gloss 的视觉-语言框架用于手语翻译

Zhi Rao, Yucheng Zhou, Benjia Zhou, Yiqing Huang, Sergio Escalera, Jun Wan

机构 * Macau University of Science and Technology(澳门科学技术大学) SKL-IOTSC, CIS, University of Macau(澳门大学智能物联网与通信系统研究所) Beijing Institute of Technology, Zhuhai(珠海北京理工大学) University of Barcelona(巴塞罗那大学)

专题命中 指令微调 :LLM(abstract);language model(abstract);instruction tuning(abstract);SFT(abstract)

AI总结 RVLF提出了一种无需gloss的手语翻译框架,通过融合骨架运动与视觉特征并结合强化学习优化,提升了翻译质量与语义一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.17432 2025-12-09 cs.CV 80%

Breaking the Modality Barrier: Universal Embedding Learning with Multimodal LLMs

突破模态壁垒:基于多模态大语言模型的通用嵌入学习

Tiancheng Gu, Kaicheng Yang, Ziyong Feng, Xingjun Wang, Yanzhao Zhang, Dingkun Long, Yingda Chen, Weidong Cai, Jiankang Deng

机构 * The University of Sydney(悉尼大学) DeepGlint Tongyi Lab, Alibaba Group(阿里云实验室) Imperial College London(伦敦帝国理工学院)

专题命中 指令微调 :LLM(abstract);large language model(abstract);language model(abstract);instruction tuning(abstract)

AI总结 UniME通过两阶段框架提升多模态表示学习,利用知识蒸馏和硬负样本微调增强判别能力与指令遵循性能。

Comments 13 pages, 8 figures, Accepted by ACM MM2025, Project page: https://garygutc.github.io/UniME

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06726 2025-12-09 cs.CV cs.AI cs.CL 73%

The Role of Entropy in Visual Grounding: Analysis and Optimization

熵在视觉定位中的作用:分析与优化

Shuo Li, Jiajun Sun, Zhihao Zhang, Xiaoran Fan, Senjie Jin, Hui Li, Yuming Yang, Junjie Ye, Lixing Shen, Tao Ji, Tao Gui, Qi Zhang, Xuanjing Huang

机构 * Fudan University(复旦大学) Hikvision Research Institute(海康威视研究院)

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出ECVGPO算法,通过熵控制优化视觉定位任务,提升探索与利用的平衡,实现多基准的性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.02216 2025-12-09 cs.LG stat.ML 70%

Flatten Graphs as Sequences: Transformers are Scalable Graph Generators

将图扁平化为序列:Transformer是可扩展的图生成器

Dexiong Chen, Markus Krimmel, Karsten Borgwardt

机构 * Max Planck Institute of Biochemistry(马克斯·普朗克生物化学研究所)

专题命中 指令微调 :language model(abstract);foundation model(abstract);分类 cs.LG

AI总结 AutoGraph利用Transformer模型将图扁平化为序列,实现高效可扩展的图生成,生成速度比扩散模型快100倍,并展示出良好的迁移能力。

Comments Camera-ready version published at NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.16302 2025-12-09 cs.LG cs.AI cs.CR cs.CV 62%

Towards Resilient Safety-driven Unlearning for Diffusion Models against Downstream Fine-tuning

面向对抗下游微调的鲁棒安全驱动遗忘方法用于扩散模型

Boheng Li, Renjie Gu, Junjie Wang, Leyi Qi, Yiming Li, Run Wang, Zhan Qin, Tianwei Zhang

机构 * Nanyang Technological University, Singapore(南洋理工大学,新加坡) Central South University, China(中南大学,中国) Key Laboratory of Aerospace Information Security and Trusted Computing, Ministry of Education, School of Cyber Science and Engineering, Wuhan University, China(航空航天信息安全部门,教育部,武汉大学,中国) State Key Laboratory of Blockchain and Data Security, Zhejiang University, China(区块链与数据安全国家重点实验室,浙江大学,中国)

专题命中 指令微调 :pretraining(abstract);分类 cs.AI、cs.LG

AI总结 本文提出ResAlign,一种针对扩散模型对抗下游微调的鲁棒安全驱动遗忘框架,通过隐含优化问题建模和元学习策略提升安全性和生成能力。

Comments Accepted to the 39th Conference on Neural Information Processing Systems (NeurIPS 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.11530 2025-12-09 cs.LG q-bio.QM 57%

SeqProFT: Sequence-only Protein Property Prediction with LoRA Finetuning

SeqProFT: 基于序列的蛋白质属性预测与LoRA微调

Shuo Zhang, Jian K. Liu

机构 * University of Birmingham(伯明翰大学)

专题命中 指令微调 :language model(abstract);分类 cs.LG

AI总结 SeqProFT通过LoRA微调实现基于序列的蛋白质属性预测,证明小型模型在性能和效率上可媲美大型模型,同时降低计算需求。

Journal ref IEEE Transactions on Artificial Intelligence, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06662 2025-12-09 cs.CV 50%

Personalized Image Descriptions from Attention Sequences

基于注意力序列的个性化图像描述

Ruoyu Xue, Hieu Le, Jingyi Xu, Sounak Mondal, Abe Leite, Gregory Zelinsky, Minh Hoai, Dimitris Samaras

机构 * Stony Brook University(石溪大学) UNC-Charlotte(北卡罗来纳大学夏洛特分校) The University of Adelaide(阿德莱德大学)

专题命中 指令微调 :language model(abstract)

AI总结 DEPER通过建模个性化注意力序列,实现了基于视觉-语言模型的个性化图像描述生成,提升了描述质量与人类对齐性。

Comments 10 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06155 2025-12-09 cs.CR cs.IR 50%

Sift or Get Off the PoC: Applying Information Retrieval to Vulnerability Research with SiftRank

Sift or Get Off the PoC:将信息检索应用于漏洞研究的SiftRank

Caleb Gross

专题命中 指令微调 :LLM(abstract)

AI总结 SiftRank利用LLM进行文档排序,通过高效算法实现大规模漏洞分析,可在99秒内识别漏洞修复函数。

详情

展开后加载摘要…

URL PDF HTML 收藏