arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2025-12-17 至 2025-12-17 共收录 10 信号源:cs.CL, cs.AI, cs.LG

1. 指令微调 10 篇

2512.13714 2025-12-17 cs.AI 88%

AI-Powered Annotation Pipelines for Stabilizing Large Language Models: A Human-AI Synergy Approach

基于AI的标注流程用于稳定大语言模型:一种人机协同方法

Gangesh Pathak, Prasanna Kumar

专题命中 指令微调 :large language model(title);language model(title);LLM(abstract);RLHF(abstract)

AI总结 本文提出了一种基于AI的标注流程,通过人机协同方法系统识别并修复大语言模型的不稳定性,提升模型的可靠性和鲁棒性。

Comments 16 Pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.07101 2025-12-17 cs.LG 83%

Small Batch Size Training for Language Models: When Vanilla SGD Works, and Why Gradient Accumulation Is Wasteful

小批量训练语言模型:当普通SGD有效,以及为何梯度累积是浪费

Martin Marek, Sanae Lotfi, Aditya Somasundaram, Andrew Gordon Wilson, Micah Goldblum

机构 * New York University(纽约大学) Columbia University(哥伦比亚大学)

专题命中 指令微调 :language model(title,abstract);pretraining(abstract);分类 cs.LG

AI总结 本研究发现小批量训练可稳定训练语言模型,优于大批次,且能使用普通SGD实现稳定训练,无需动量和优化器状态。

Comments NeurIPS 2025. Code available at: https://github.com/martin-marek/batch-size

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.13496 2025-12-17 cs.AI cs.CL cs.LG 82%

ADALog: Adaptive Unsupervised Anomaly detection in Logs with Self-attention Masked Language Model

ADALog: 基于自注意力机制的自监督日志异常检测

Przemek Pospieszny, Wojciech Mormul, Karolina Szyndler, Sanjeev Kumar

机构 * NeuroEdge AI Cognizant

专题命中 指令微调 :language model(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 ADALog通过自适应无监督方法在日志中检测异常,利用预训练双向编码器和自适应阈值处理,实现高效准确的异常检测。

Comments Conference paper accepted at ICMLT 2025; to appear in the IEEE Conference Proceedings

Journal ref IEEE ICMLT 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14237 2025-12-17 cs.CL cs.LG 79%

Ladder Up, Memory Down: Low-Cost Fine-Tuning With Side Nets

向上爬,记忆下降:低成本微调与侧边网络

Estelle Zheng, Nathan Cerisara, Sébastien Warichet, Emmanuel Helbert, Christophe Cerisara

专题命中 指令微调 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 LST通过轻量级侧边网络实现高效微调,比QLoRA更节省内存,同时在多个任务中保持竞争力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.00726 2025-12-17 cs.SE cs.AI cs.LG 79%

Free and Customizable Code Documentation with LLMs: A Fine-Tuning Approach

基于LLM的免费且可定制的代码文档生成:一种微调方法

Sayak Chakrabarty, Souradip Pal

机构 * Department of Computer Science and Engineering(计算机科学与工程系) Northwestern University(西北大学) School of Electrical & Computer Engineering(电气与计算机工程学院) Purdue University(普渡大学)

专题命中 指令微调 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出一种基于LLM的免费代码文档生成工具,通过微调方法解决现有开源应用在成本和可定制性上的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14666 2025-12-17 cs.RO cs.CV 75%

EVOLVE-VLA: Test-Time Training from Environment Feedback for Vision-Language-Action Models

EVOLVE-VLA: 通过环境反馈进行测试时训练以实现视觉-语言-动作模型

Zechen Bai, Chen Gao, Mike Zheng Shou

机构 * Show Lab National University of Singapore(新加坡国立大学Show实验室)

专题命中 指令微调 :large language model(abstract);language model(abstract);SFT(abstract)

AI总结 EVOLVE-VLA通过环境反馈实现测试时训练,使视觉-语言-动作模型能持续适应,提升任务性能并实现跨任务泛化。

Comments 15 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.12977 2025-12-17 cs.AI cs.CL 73%

MindForge: Empowering Embodied Agents with Theory of Mind for Lifelong Cultural Learning

MindForge: 通过显式视角转换赋能具身智能体的终身文化学习

Mircea Lică, Ojas Shirekar, Baptiste Colle, Chirag Raman

机构 * Delft University of Technology(代尔夫特理工大学)

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 MindForge通过显式视角转换和多组件记忆系统,使智能体在Minecraft中实现文化终身学习,显著提升基础任务表现并适应新任务。

Comments Accepted to NeurIPS 2025 main track as poster

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14527 2025-12-17 cs.AI 57%

Dynamic Learning Rate Scheduling based on Loss Changes Leads to Faster Convergence

基于损失变化的动态学习率调度实现更快收敛

Shreyas Subramanian, Bala Krishnamoorthy, Pranav Murthy

机构 * Amazon Web Services(亚马逊网络服务)

专题命中 指令微调 :LLM(abstract);分类 cs.AI

AI总结 本文提出GreedyLR调度器,通过动态调整学习率基于损失变化,提升训练收敛速度和性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14519 2025-12-17 math.AC 50%

Nonnil-S-Laskerian Rings

非nil-S-拉斯克环

Tushar Singh, Ajim Uddin Ansari, Shiv Datt Kumar

专题命中 指令微调 :SFT(abstract)

AI总结 本文提出非nil-S-拉斯克环的概念,证明其与非nil-S-诺特环的关系,并展示S-拉斯克环与S-SFT性质的联系。

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.11160 2025-12-17 cs.CV 50%

A Unified Framework with Multimodal Fine-tuning for Remote Sensing Semantic Segmentation

多模态微调的统一框架用于遥感语义分割

Xianping Ma, Xiaokang Zhang, Man-On Pun, Bo Huang

机构 * School of Science and Engineering, The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)科学与工程学院) School of Information Science and Engineering, Wuhan University of Science and Technology(武汉科技大学信息科学与工程学院) Department of Geography, The University of Hong Kong(香港大学地理系)

专题命中 指令微调 :foundation model(abstract)

AI总结 本文提出了一种多模态微调的统一框架,用于改进遥感语义分割的性能,通过引入新的MFNet和DFM模块,显著提升了多模态数据的分割效果。

Comments 15 pages, 11 figures

Journal ref IEEE Transactions on Geoscience and Remote Sensing, vol. 63, pp. 1-15, 2025, Art no. 5405015

详情

展开后加载摘要…

URL PDF HTML 收藏