arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2025-12-10 至 2025-12-10 共收录 8 信号源:cs.CL, cs.AI, cs.LG

1. 指令微调 8 篇

2412.08179 2025-12-10 q-fin.ST cs.AI 87%

RAG-IT: Retrieval-Augmented Instruction Tuning for Automated Financial Analysis -- A Case Study for the Semiconductor Sector

RAG-IT:基于检索的指令微调用于自动化财务分析——半导体行业案例研究

Hai-Thien To, Tien-Cuong Bui, Van-Duc Le

机构 * University of Transport Technology(运输技术大学) Arontier Co., Ltd.(阿隆蒂尔公司)

专题命中 指令微调 :instruction tuning(title,abstract);LLM(abstract);large language model(abstract);language model(abstract)

AI总结 RAG-IT通过检索增强和指令微调,提升LLM在半导体行业财务分析中的性能,实现与商业系统相当的财务报告生成能力。

Comments We updated title, abstract and added more details in experiment section. We also updated the list of authors

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08131 2025-12-10 cs.CL 79%

Universal Adversarial Suffixes for Language Models Using Reinforcement Learning with Calibrated Reward

语言模型中用于强化学习的通用对抗后缀

Sampriti Soor, Suklav Ghosh, Arijit Sur

机构 * Center for Intelligent Cyber Physical Systems, Indian Institute of Technology Guwahati, India(智能网络物理系统中心,印度理工学院古瓦哈提) Department of Computer Science and Engineering, Indian Institute of Technology Guwahati, India(计算机科学与工程系,印度理工学院古瓦哈提)

专题命中 指令微调 :language model(title,abstract);分类 cs.CL

AI总结 本文提出了一种基于强化学习的通用对抗后缀生成方法,通过校准交叉熵提升迁移性,并在多个NLP数据集上验证了其有效性。

Comments 5 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.04652 2025-12-10 cs.AI cs.SE 79%

LLM Collaboration With Multi-Agent Reinforcement Learning

大语言模型与多智能体强化学习的协同

Shuo Liu, Tianle Chen, Zeyu Liang, Xueguang Lyu, Christopher Amato

专题命中 指令微调 :LLM(title,abstract);分类 cs.AI

AI总结 本研究提出MAGRPO算法,将大语言模型协同工作建模为多智能体强化学习问题,通过有效协同提升生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.18321 2025-12-10 cs.CL cs.AI 79%

LLMs Can't Handle Peer Pressure: Crumbling under Multi-Agent Social Interactions

大语言模型难以应对同伴压力:在多智能体社交互动中崩溃

Maojia Song, Tej Deep Pala, Ruiwen Zhou, Weisheng Jin, Amir Zadeh, Chuan Li, Dorien Herremans, Soujanya Poria

机构 * Singapore University of Technology and Design(新加坡科技设计大学) Nanyang Technological University(南洋理工大学) National University of Singapore(国立新加坡大学) Lambda Labs(Lambda实验室)

专题命中 指令微调 :large language model(abstract);language model(abstract);prompting(abstract);分类 cs.CL、cs.AI

AI总结 研究探讨了大语言模型在多智能体社交互动中的表现,提出KAIROS基准用于评估模型在复杂社交动态中的决策能力,发现模型规模和训练方法对抵抗社交影响至关重要。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08223 2025-12-10 cs.CV 75%

SOP^2: Transfer Learning with Scene-Oriented Prompt Pool on 3D Object Detection

SOP²:基于场景导向提示池的3D目标检测迁移学习

Ching-Hung Cheng, Hsiu-Fu Wu, Bing-Chen Wu, Khanh-Phong Bui, Van-Tin Luu, Ching-Chun Huang

机构 * National Yang Ming Chiao Tung University(国家阳明交通大学) Internet of Things Laboratory(物联网实验室) Chunghwa Telecom Laboratories(中华电信实验室)

专题命中 指令微调 :large language model(abstract);language model(abstract);foundation model(abstract)

AI总结 本文提出SOP²,一种基于场景导向提示池的3D目标检测迁移学习方法,旨在提升模型在不同场景下的适应能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07814 2025-12-10 cs.SE cs.AI cs.CR 70%

Understanding Privacy Risks in Code Models Through Training Dynamics: A Causal Approach

通过训练动态理解代码模型中的隐私风险:一种因果方法

Hua Yang, Alejandro Velasco, Sen Fang, Bowen Xu, Denys Poshyvanyk

机构 * North Carolina State University(北卡罗来纳州立大学) William & Mary(威廉与玛丽学院)

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本研究通过因果方法分析代码模型中不同PII类型的泄露风险差异,揭示了泄露风险与可学习性之间的因果关系,并为开发类型感知的防御策略提供依据。

Comments 21 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08763 2025-12-10 cs.LG 57%

Learning and Editing Universal Graph Prompt Tuning via Reinforcement Learning

通过强化学习学习和编辑通用图提示微调

Jinfeng Xu, Zheyu Chen, Shuo Yang, Jinze Li, Hewei Wang, Yijie Li, Edith C. H. Ngai

机构 * The University of Hong Kong(香港大学) Beijing Institute of Technology(北京理工大学) Carnegie Mellon University(卡内基梅隆大学)

专题命中 指令微调 :prompting(abstract);分类 cs.LG

AI总结 本文提出LEAP模型,通过强化学习在保留通用图提示理论基础的同时,优化提示选择与编辑,提升图和节点任务的性能。

Comments Accepted by KDD 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08897 2025-12-10 cs.CV 50%

UniLayDiff: A Unified Diffusion Transformer for Content-Aware Layout Generation

UniLayDiff: 一种统一的扩散变换器用于内容感知的布局生成

Zeyang Liu, Le Wang, Sanping Zhou, Yuxuan Wu, Xiaolong Sun, Gang Hua, Haoxiang Li

机构 * College of Artificial Intelligence, Xi’an Jiaotong University(西安交通大学人工智能学院) Amazon.com, Inc.(亚马逊公司) Pixocial Technology(Pixocial技术)

专题命中 指令微调 :pretraining(abstract)

AI总结 UniLayDiff通过统一的扩散变换器框架,首次实现了内容感知布局生成任务的端到端统一生成,提升了布局质量和生成性能。

详情

展开后加载摘要…

URL PDF HTML 收藏