arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2025-12-17 至 2025-12-17 共收录 170 信号源:cs.CL, cs.AI, cs.LG

1. 预训练与数据 11 篇

2512.14220 2025-12-17 cs.LG cs.AI 90%

Estimating problem difficulty without ground truth using Large Language Model comparisons

无需真实数据即可利用大语言模型比较估计问题难度

Marthe Ballon, Andres Algaba, Brecht Verbeken, Vincent Ginis

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI、cs.LG

AI总结 本文提出LLM compare方法,通过大语言模型的成对比较估计问题难度,克服传统方法在分布外问题上的局限性,具有高一致性与鲁棒性。

Comments 19 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13860 2025-12-17 cs.SE cs.AI 84%

Verification-Guided Context Optimization for Tool Calling via Hierarchical LLMs-as-Editors

通过分层大语言模型作为编辑器进行工具调用的验证引导上下文优化

Henger Li, Shuangjie You, Flavio Di Palo, Yiyue Qian, Ayush Jain

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);pretraining(abstract)

AI总结 通过分层LLM作为编辑器,验证引导上下文优化提升工具调用的准确性和泛化能力。

Comments Accepted by AAAI 2026 Workshop on Agentic AI Benchmarks and Applications for Enterprise Tasks

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.21123 2025-12-17 cs.CR 82%

ExpShield: Safeguarding Web Text from Unauthorized Crawling and LLM Exploitation

ExpShield: 保护网络文本免受未经授权的爬虫和大语言模型利用

Ruixuan Liu, Toan Tran, Tianhao Wang, Hongsheng Hu, Shuo Wang, Li Xiong

专题命中 预训练与数据 :LLM(title);large language model(abstract);language model(abstract)

AI总结 ExpShield通过不可见扰动减轻大语言模型对网络文本的记忆化,同时保持可读性,并通过实例利用指标和优化方法有效防御数据泄露风险。

Comments 18 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14500 2025-12-17 cs.CL cs.LG 79%

C-ing Clearly: Enhanced Binary Code Explanations using C code

C-ing Clearly: 通过C代码增强二进制代码解释

Teodor Poncu, Ioana Pintilie, Marius Dragoi, Dragos Tantaru, Florin Brad

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 通过生成C代码数据提升LLM对汇编语言的理解,改进二进制代码摘要和漏洞检测性能。

Comments 18 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14239 2025-12-17 cs.CL 70%

Two CFG Nahuatl for automatic corpora expansion

两种CFG用于自动语料库扩展

Juan-José Guzmán-Landa, Juan-Manuel Torres-Moreno, Miguel Figueroa-Saavedra, Ligia Quintana-Torres, Graham Ranger Martha-Lorena Avendaño-Garrido

机构 * Laboratoire Informatique d’Avignon(阿维尼翁信息实验室) Laboratoire Identités Culturelles, Textes et Théâtralité Avignon Université(阿维尼翁文化身份、文本与戏剧性实验室) Instituto de Investigaciones en Educación(教育研究 institute) Facultad de Matemáticas Universidad Veracruzana(韦拉克鲁斯大学数学学院)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出两种CFG用于扩展纳瓦特语语料库,以生成合成句子并提升嵌入学习效果。

Comments 15 pages, 5 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.09143 2025-12-17 cs.CV 67%

Exo2Ego: Exocentric Knowledge Guided MLLM for Egocentric Video Understanding

Exo2Ego:基于外部知识引导的多模态大语言模型用于第一人称视频理解

Haoyu Zhang, Qiaohui Chu, Meng Liu, Haoxiang Shi, Yaowei Wang, Liqiang Nie

专题命中 预训练与数据 :large language model(abstract);language model(abstract)

AI总结 Exo2Ego通过迁移学习提升内向视频理解能力,利用外向知识增强模型性能。

Comments This paper is accepted by AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.11252 2025-12-17 cs.CV eess.IV 67%

MFGDiffusion: Mask-Guided Smoke Synthesis for Enhanced Forest Fire Detection

MFGDiffusion:基于掩码的烟雾合成以提升森林火灾检测

Guanghao Wu, Yunqing Shang, Chen Xu, Hai Song, Chong Wang, Qixing Zhang

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 预训练与数据 :large language model(abstract);language model(abstract)

AI总结 MFGDiffusion通过掩码引导的烟雾合成提升森林火灾检测性能

Comments 14 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14585 2025-12-17 cs.CL cs.AI 62%

Towards Nepali-language LLMs: Efficient GPT training with a Nepali BPE tokenizer

面向尼泊尔语的大规模语言模型:基于GPT-3的高效训练方法

Adarsha Shrestha, Basanta Pokharel, Binit Shrestha, Smriti Adhikari, Dinesh Gothe

机构 * Khwopa College of Engineering(科瓦普学院工程学院)

专题命中 预训练与数据 :language model(abstract);分类 cs.CL、cs.AI

AI总结 本研究提出基于GPT-2的尼泊尔语模型,通过优化学习率调度、批量扩展和架构改进,结合定制BPE分词器和FlashAttention,实现高效训练并生成连贯的尼泊尔新闻文本。

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05442 2025-12-17 cs.LG cs.AI 62%

IdealTSF: Can Non-Ideal Data Contribute to Enhancing the Performance of Time Series Forecasting Models?

IdealTSF: 非理想数据能否提升时间序列预测模型的性能?

Hua Wang, Jinghao Lu, Fan Zhang

专题命中 预训练与数据 :pretraining(abstract);分类 cs.AI、cs.LG

AI总结 IdealTSF通过整合理想正负样本提升时间序列预测性能,利用非理想数据增强模型表现。

Comments Accepted at AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14480 2025-12-17 cs.CV 50%

SuperCLIP: CLIP with Simple Classification Supervision

SuperCLIP:带有简单分类监督的CLIP

Weiheng Zhao, Zilong Huang, Jiashi Feng, Xinggang Wang

机构 * School of EIC, Huazhong University of Science and Technology(华中科技大学电子与信息学院) ByteDance(字节跳动)

专题命中 预训练与数据 :pretraining(abstract)

AI总结 SuperCLIP通过添加轻量级分类监督提升CLIP的细粒度视觉-文本对齐能力,有效提升零样本分类和检索性能。

Comments Accepted by NeurIPS 2025. Code: https://github.com/hustvl/SuperCLIP

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.19981 2025-12-17 cs.CV 50%

FutrTrack: A Camera-LiDAR Fusion Transformer for 3D Multiple Object Tracking

FutrTrack: 一种基于相机与激光雷达融合的变压器用于三维多目标跟踪

Martha Teiko Teye, Ori Maoz, Matthias Rottmann

机构 * University of Wuppertal(乌珀塔尔大学) Institute of Computer Science, Osnabrück University(计算机科学研究所,奥斯纳布鲁克大学)

专题命中 预训练与数据 :pretraining(abstract)

AI总结 FutrTrack通过融合相机与激光雷达数据,利用基于变压器的跟踪框架,在多目标跟踪中实现了高效且鲁棒的跟踪性能。

Comments Accepted to VISAPP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 指令微调 10 篇

2512.13714 2025-12-17 cs.AI 88%

AI-Powered Annotation Pipelines for Stabilizing Large Language Models: A Human-AI Synergy Approach

基于AI的标注流程用于稳定大语言模型:一种人机协同方法

Gangesh Pathak, Prasanna Kumar

专题命中 指令微调 :large language model(title);language model(title);LLM(abstract);RLHF(abstract)

AI总结 本文提出了一种基于AI的标注流程,通过人机协同方法系统识别并修复大语言模型的不稳定性,提升模型的可靠性和鲁棒性。

Comments 16 Pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.07101 2025-12-17 cs.LG 83%

Small Batch Size Training for Language Models: When Vanilla SGD Works, and Why Gradient Accumulation Is Wasteful

小批量训练语言模型:当普通SGD有效,以及为何梯度累积是浪费

Martin Marek, Sanae Lotfi, Aditya Somasundaram, Andrew Gordon Wilson, Micah Goldblum

机构 * New York University(纽约大学) Columbia University(哥伦比亚大学)

专题命中 指令微调 :language model(title,abstract);pretraining(abstract);分类 cs.LG

AI总结 本研究发现小批量训练可稳定训练语言模型,优于大批次,且能使用普通SGD实现稳定训练,无需动量和优化器状态。

Comments NeurIPS 2025. Code available at: https://github.com/martin-marek/batch-size

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.13496 2025-12-17 cs.AI cs.CL cs.LG 82%

ADALog: Adaptive Unsupervised Anomaly detection in Logs with Self-attention Masked Language Model

ADALog: 基于自注意力机制的自监督日志异常检测

Przemek Pospieszny, Wojciech Mormul, Karolina Szyndler, Sanjeev Kumar

机构 * NeuroEdge AI Cognizant

专题命中 指令微调 :language model(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 ADALog通过自适应无监督方法在日志中检测异常,利用预训练双向编码器和自适应阈值处理,实现高效准确的异常检测。

Comments Conference paper accepted at ICMLT 2025; to appear in the IEEE Conference Proceedings

Journal ref IEEE ICMLT 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14237 2025-12-17 cs.CL cs.LG 79%

Ladder Up, Memory Down: Low-Cost Fine-Tuning With Side Nets

向上爬,记忆下降:低成本微调与侧边网络

Estelle Zheng, Nathan Cerisara, Sébastien Warichet, Emmanuel Helbert, Christophe Cerisara

专题命中 指令微调 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 LST通过轻量级侧边网络实现高效微调,比QLoRA更节省内存,同时在多个任务中保持竞争力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.00726 2025-12-17 cs.SE cs.AI cs.LG 79%

Free and Customizable Code Documentation with LLMs: A Fine-Tuning Approach

基于LLM的免费且可定制的代码文档生成:一种微调方法

Sayak Chakrabarty, Souradip Pal

机构 * Department of Computer Science and Engineering(计算机科学与工程系) Northwestern University(西北大学) School of Electrical & Computer Engineering(电气与计算机工程学院) Purdue University(普渡大学)

专题命中 指令微调 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出一种基于LLM的免费代码文档生成工具,通过微调方法解决现有开源应用在成本和可定制性上的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14666 2025-12-17 cs.RO cs.CV 75%

EVOLVE-VLA: Test-Time Training from Environment Feedback for Vision-Language-Action Models

EVOLVE-VLA: 通过环境反馈进行测试时训练以实现视觉-语言-动作模型

Zechen Bai, Chen Gao, Mike Zheng Shou

机构 * Show Lab National University of Singapore(新加坡国立大学Show实验室)

专题命中 指令微调 :large language model(abstract);language model(abstract);SFT(abstract)

AI总结 EVOLVE-VLA通过环境反馈实现测试时训练,使视觉-语言-动作模型能持续适应,提升任务性能并实现跨任务泛化。

Comments 15 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.12977 2025-12-17 cs.AI cs.CL 73%

MindForge: Empowering Embodied Agents with Theory of Mind for Lifelong Cultural Learning

MindForge: 通过显式视角转换赋能具身智能体的终身文化学习

Mircea Lică, Ojas Shirekar, Baptiste Colle, Chirag Raman

机构 * Delft University of Technology(代尔夫特理工大学)

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 MindForge通过显式视角转换和多组件记忆系统,使智能体在Minecraft中实现文化终身学习,显著提升基础任务表现并适应新任务。

Comments Accepted to NeurIPS 2025 main track as poster

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14527 2025-12-17 cs.AI 57%

Dynamic Learning Rate Scheduling based on Loss Changes Leads to Faster Convergence

基于损失变化的动态学习率调度实现更快收敛

Shreyas Subramanian, Bala Krishnamoorthy, Pranav Murthy

机构 * Amazon Web Services(亚马逊网络服务)

专题命中 指令微调 :LLM(abstract);分类 cs.AI

AI总结 本文提出GreedyLR调度器,通过动态调整学习率基于损失变化,提升训练收敛速度和性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14519 2025-12-17 math.AC 50%

Nonnil-S-Laskerian Rings

非nil-S-拉斯克环

Tushar Singh, Ajim Uddin Ansari, Shiv Datt Kumar

专题命中 指令微调 :SFT(abstract)

AI总结 本文提出非nil-S-拉斯克环的概念,证明其与非nil-S-诺特环的关系,并展示S-拉斯克环与S-SFT性质的联系。

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.11160 2025-12-17 cs.CV 50%

A Unified Framework with Multimodal Fine-tuning for Remote Sensing Semantic Segmentation

多模态微调的统一框架用于遥感语义分割

Xianping Ma, Xiaokang Zhang, Man-On Pun, Bo Huang

机构 * School of Science and Engineering, The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)科学与工程学院) School of Information Science and Engineering, Wuhan University of Science and Technology(武汉科技大学信息科学与工程学院) Department of Geography, The University of Hong Kong(香港大学地理系)

专题命中 指令微调 :foundation model(abstract)

AI总结 本文提出了一种多模态微调的统一框架,用于改进遥感语义分割的性能,通过引入新的MFNet和DFM模块,显著提升了多模态数据的分割效果。

Comments 15 pages, 11 figures

Journal ref IEEE Transactions on Geoscience and Remote Sensing, vol. 63, pp. 1-15, 2025, Art no. 5405015

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 后训练与偏好优化 10 篇

2512.13699 2025-12-17 cs.CY 90%

Us-vs-Them bias in Large Language Models

大语言模型中的‘我们 vs 他们’偏见

Tabia Tanzin Prama, Julia Witte Zimmerman, Christopher M. Danforth, Peter Sheridan Dodds

专题命中 后训练与偏好优化 :large language model(title,abstract);language model(title,abstract);LLM(abstract);preference optimization(abstract)

AI总结 本研究发现大语言模型在不同人设下表现出‘我们 vs 他们’偏见,通过微调和DPO方法可有效缓解这种偏见。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13762 2025-12-17 cs.AI cs.HC 89%

State-Dependent Refusal and Learned Incapacity in RLHF-Aligned Language Models

基于状态依赖拒绝和学习无能的强化学习人类反馈对齐语言模型

TK Lee

专题命中 后训练与偏好优化 :language model(title,abstract);RLHF(title);large language model(abstract,comments);分类 cs.AI

AI总结 本研究提出通过观察行为来审计强化学习人类反馈对齐语言模型中的状态依赖拒绝和学习无能现象。

Comments 23 pages, 6 figures. Qualitative interaction-level analysis of response patterns in a large language model. Code and processed interaction data are available at https://github.com/theMaker-EnvData/llm_learned_incapacity_corpus

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08786 2025-12-17 cs.CL cs.AI 88%

A Systematic Evaluation of Preference Aggregation in Federated RLHF for Pluralistic Alignment of LLMs

对联邦RLHF中偏好聚合的系统评估:为LLM的多元化对齐

Mahmoud Srewa, Tianyu Zhao, Salma Elmalaki

机构 * Department of Electrical Engineering and Computer Science University of California, Irvine(电气工程与计算机科学系 加州大学伊文斯分校)

专题命中 后训练与偏好优化 :RLHF(title,abstract);LLM(abstract,comments);large language model(abstract);language model(abstract)

AI总结 本文提出了一种自适应偏好聚合方法,通过动态调整权重提升联邦RLHF中LLM的公平性与对齐性能。

Comments This paper is accepted at the NeurIPS 2025 Workshop on Evaluating the Evolving LLM Lifecycle

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14100 2025-12-17 cs.LG cs.LO 87%

A First-Order Logic-Based Alternative to Reward Models in RLHF

基于一阶逻辑的强化学习人类反馈中奖励模型的替代方案

Chunjin Jian, Xinhua Zhu

机构 * School of Computer Science(计算机科学系) Engineering Guangxi Normal University Guilin, China(广西师范大学)

专题命中 后训练与偏好优化 :RLHF(title,abstract);large language model(abstract);language model(abstract);SFT(abstract)

AI总结 本文提出基于一阶逻辑的奖励机制,替代传统奖励建模,通过逻辑一致性提升模型对齐性能,实验显示其在性能和鲁棒性上优于标准微调方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.18127 2025-12-17 cs.IR cs.AI cs.CL cs.LG 83%

Holistic Utility Preference Learning for Listwise Alignment

整体效用偏好学习用于列表对齐

Jiacong Zhou, Xianyun Wang, Min Zhang, Jun Yu

机构 * School of Computer Science and Technology, Hangzhou Dianzi University(计算机科学与技术学院,杭州电子科技大学) Harbin Institute of Technology(哈尔滨工业大学)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);RLHF(abstract);preference optimization(abstract)

AI总结 DRPO通过整体效用学习提升列表对齐效果,优化响应排名质量

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11844 2025-12-17 cs.HC cs.CL cs.LG 82%

Love First, Know Later: Persona-Based Romantic Compatibility Through LLM Text World Engines

先爱后知:基于人设的浪漫兼容性通过LLM文本世界引擎

Haoyang Shang, Zhengyang Yan, Xuan Liu

机构 * BreathingCORE

专题命中 后训练与偏好优化 :LLM(title,abstract);分类 cs.CL、cs.LG

AI总结 本文提出一种基于LLM文本世界引擎的浪漫兼容性匹配方法,通过模拟互动预测人类偏好,实现个性化匹配系统。

Comments NeurIPS 2025 Workshop: First Workshop on LLM Persona Modeling (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10767 2025-12-17 cs.LG cs.AI math.OC 81%

Understanding Sampler Stochasticity in Training Diffusion Models for RLHF

理解训练扩散模型用于RLHF中的采样随机性

Jiayuan Sheng, Hanyang Zhao, Haoxian Chen, David D. Yao, Wenpin Tang

机构 * Columbia University, IEOR Department(哥伦比亚大学,工业工程与运营研究系)

专题命中 后训练与偏好优化 :RLHF(title,abstract);分类 cs.AI、cs.LG

AI总结 本文研究了在训练扩散模型用于RLHF时随机采样与确定性采样之间的不匹配问题,通过理论分析和实验验证,提出了非空的界限和更尖锐的收敛速率,并展示了高随机性SDE训练对ODE采样质量的提升作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14490 2025-12-17 cs.IR 78%

PushGen: Push Notifications Generation with LLM

PushGen: 基于LLM的推送通知生成

Shifu Bie, Jiangxia Cao, Zixiao Luo, Yichuan Zou, Lei Liang, Lu Zhang, Linxun Chen, Zhaojie Liu, Xuanping Li, Guorui Zhou, Kaiqiao Zhan, Kun Gai

专题命中 后训练与偏好优化 :LLM(title,abstract)

AI总结 PushGen通过可控提示技术和奖励模型,实现高质量推送通知生成,已应用于大规模用户场景。

Comments Accepted by WSDM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13837 2025-12-17 cs.LG 70%

Explainable reinforcement learning from human feedback to improve alignment

通过人类反馈改进强化学习的可解释性以提升对齐

Shicheng Liu, Siyuan Xu, Wenjie Qiu, Hangfan Zhang, Minghui Zhu

机构 * Department of Electrical Engineering, Pennsylvania State University(宾夕法尼亚州立大学电气工程系) Department of Computer Science, Rutgers University(罗格斯大学计算机科学系) College of Information Sciences and Technology, Pennsylvania State University(宾夕法尼亚州立大学信息科学与技术学院)

专题命中 后训练与偏好优化 :language model(abstract);RLHF(abstract);分类 cs.LG

AI总结 本文提出通过纠正RLHF中不满意响应的原因来提升语言模型对齐性的方法,结合事后解释与卸载技术改进模型响应质量。

详情

展开后加载摘要…

URL PDF HTML 收藏