arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-02-18 至 2026-02-18 共收录 10 信号源:cs.CL, cs.AI, cs.LG

1. 指令微调 10 篇

2602.15449 2026-02-18 cs.CL cs.LG cs.SE 88%

TAROT: Test-driven and Capability-adaptive Curriculum Reinforcement Fine-tuning for Code Generation with Large Language Models

TAROT: 为基于大语言模型的代码生成设计的测试驱动和能力适应课程强化微调

Chansung Park, Juyong Jiang, Fan Wang, Sayak Paul, Jiasi Shen, Jing Tang, Jianguo Li

机构 * Electronics and Telecommunications Research Institute(电信研究所) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) The Hong Kong University of Science and Technology(香港科技大学) Hugging Face Ant Group(蚂蚁集团)

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.LG

AI总结 TAROT通过测试驱动和能力适应的课程强化微调方法,提升大语言模型生成代码的功能正确性和稳健性。

Comments The first three authors contributed equally to this work; listing order is random

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15785 2026-02-18 cs.AI 85%

This human study did not involve human subjects: Validating LLM simulations as behavioral evidence

这项人研究未涉及人类受试者:验证LLM模拟作为行为证据

Jessica Hullman, David Broska, Huaman Sun, Aaron Shaw

机构 * Northwestern University(西北大学)

专题命中 指令微调 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文探讨了使用大型语言模型作为行为证据的有效性,对比了启发式方法与统计校准方法在社会科学实验中的应用及优劣。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15753 2026-02-18 cs.CL 85%

Under-resourced studies of under-resourced languages: lemmatization and POS-tagging with LLM annotators for historical Armenian, Georgian, Greek and Syriac

低资源语言的低资源研究:利用LLM标注者进行历史亚美尼亚、格鲁吉亚、希腊和叙利亚语的词形还原与词性标注

Chahan Vidal-Gorène, Bastien Kindt, Florian Cafiero

专题命中 指令微调 :LLM(title);large language model(abstract);language model(abstract);foundation model(abstract)

AI总结 本文研究了LLM在低资源语言词形还原和词性标注中的表现,发现其在少量样本设置中表现优异,尤其在缺乏数据时能有效辅助标注。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.13920 2026-02-18 eess.SY cs.SY 85%

LLMind 2.0: Distributed IoT Automation with Natural Language M2M Communication and Lightweight LLM Agents

LLMind 2.0:基于自然语言M2M通信和轻量级LLM代理的分布式物联网自动化

Yuyang Du, Qun Yang, Liujianfu Wang, Jingqi Lin, Hongwei Cui, Soung Chang Liew

专题命中 指令微调 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 LLMind 2.0通过自然语言M2M通信和轻量级LLM代理实现分布式物联网自动化,提升系统可扩展性、可靠性和响应性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.22914 2026-02-18 cs.CV cs.LG 84%

cadrille: Multi-modal CAD Reconstruction with Reinforcement Learning

cadrille: 多模态CAD重建与强化学习

Maksim Kolodiazhnyi, Denis Tarasov, Dmitrii Zhemchuzhnikov, Alexander Nikulin, Ilya Zisman, Anna Vorontsova, Anton Konushin, Vladislav Kurenkov, Danila Rukhovich

机构 * Lomonosov Moscow State University(罗蒙诺索夫莫斯科国立大学) AXXX ETH Zurich(苏黎世联邦理工学院) Innopolis University(因诺波利斯大学) Institute of Mechanics, Armenia(亚美尼亚力学研究所)

专题命中 指令微调 :LLM(abstract);large language model(abstract);language model(abstract);SFT(abstract)

AI总结 cadrille通过强化学习实现多模态CAD重建,首次在CAD任务中应用RL微调,提升重建性能并设定新基准。

Comments ICLR 2026 (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15671 2026-02-18 cs.CR 82%

Revisiting Backdoor Threat in Federated Instruction Tuning from a Signal Aggregation Perspective

重新审视联邦指令微调中的后门威胁:从信号聚合角度出发

Haodong Zhao, Jinming Hu, Gongshen Liu

专题命中 指令微调 :instruction tuning(title,abstract);language model(abstract)

AI总结 本文从信号聚合角度重新审视联邦指令微调中的后门威胁,揭示低浓度污染数据在良性客户端数据集中的危害,并证明现有防御机制对这种威胁无效,需开发新的防御方法。

Comments Accepted by ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15350 2026-02-18 eess.SY cs.AI cs.SY 81%

Fine-Tuning LLMs to Generate Economical and Reliable Actions for the Power Grid

对LLM进行微调以生成经济且可靠的电网动作

Mohamad Chehade, Hao Zhu

机构 * Chandra Family Department of Electrical and Computer Engineering(电气与计算机工程系)

专题命中 指令微调 :LLM(abstract);large language model(abstract);language model(abstract);preference optimization(abstract)

AI总结 本文提出一种多阶段适应管道,通过微调LLM生成经济且可靠的电网纠正切换计划,显著提高了电网运行效率和稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03262 2026-02-18 cs.SE cs.CL 77%

Is Vibe Coding Safe? Benchmarking Vulnerability of Agent-Generated Code in Real-World Tasks

Vibe 编程是否安全?在现实任务中对代理生成代码的漏洞基准测试

Songwen Zhao, Danqing Wang, Kexun Zhang, Jiaxuan Luo, Zhuo Li, Lei Li

机构 * Carnegie Mellon University Language Technologies Institute(卡内基梅隆大学语言技术研究所) Columbia University(哥伦比亚大学) Johns Hopkins University(约翰霍普金斯大学) HydroX AI

专题命中 指令微调 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文通过基准测试发现,Vibe 编程在现实任务中生成的代码安全性不足,尽管功能正确但存在安全漏洞,警示其在安全敏感领域应用的风险。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15124 2026-02-18 cs.CV 67%

Zero-shot HOI Detection with MLLM-based Detector-agnostic Interaction Recognition

基于多模态大语言模型的零样本人-物交互检测

Shiyu Xuan, Dongkai Wang, Zechao Li, Jinhui Tang

机构 * School of Computer Science and Engineering, Nanjing University of Science and Technology(南京理工大学计算机科学与工程学院) School of Computing and Artificial Intelligence, Southwestern University of Finance and Economics(西南财经大学计算机与人工智能学院) Nanjing Forestry University(南京林业大学)

专题命中 指令微调 :large language model(abstract);language model(abstract)

AI总结 本文提出基于多模态大语言模型的零样本人-物交互检测框架,通过解耦检测与识别任务,结合确定性生成方法和空间感知模块,实现高效准确的零样本交互识别。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15799 2026-02-18 cs.LG cs.AI 62%

The Geometry of Alignment Collapse: When Fine-Tuning Breaks Safety

对齐崩溃的几何学:当微调破坏安全性

Max Springer, Chung Peng Lee, Blossom Metevier, Jane Castleman, Bohdan Turbal, Hayoung Jung, Zeyu Shen, Aleksandra Korolova

专题命中 指令微调 :language model(abstract);分类 cs.AI、cs.LG

AI总结 研究揭示了微调过程中对齐脆弱性是梯度下降在曲面上的固有几何属性,提出四次方定律描述对齐损失随训练时间的增长,并呼吁发展曲率感知方法以提升安全性。

Comments 27 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏