arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-01-09 至 2026-01-09 共收录 19 信号源:cs.CL, cs.AI, cs.LG

1. 指令微调 19 篇

2503.01839 2026-01-09 cs.CR cs.AI cs.CL cs.CV 88%

Jailbreaking Safeguarded Text-to-Image Models via Large Language Models

通过大型语言模型对受保护的文本到图像模型进行劫持

Zhengyuan Jiang, Yuepeng Hu, Yuchen Yang, Yinzhi Cao, Neil Zhenqiang Gong

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出了一种利用微调大型语言模型来劫持受安全防护的文本到图像模型的方法,有效绕过安全防护并优于现有攻击技术。

Comments Accepted by EACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.15480 2026-01-09 cs.CL cs.AI 88%

Instruction Tuning with and without Context: Behavioral Shifts and Downstream Impact

带有和不带上下文的指令微调:行为变化和下游影响

Hyunji Lee, Seunghyun Yoon, Yunjae Won, Hanseok Oh, Geewook Kim, Trung Bui, Franck Dernoncourt, Elias Stengel-Eskin, Mohit Bansal, Minjoon Seo

机构 * UNC Chapel Hill(北卡罗来纳大学教堂山分校) Adobe Research(Adobe研究) KAIST AI(韩国科学技术院人工智能实验室) Mila – Quebec AI Institute(魁北克人工智能研究所) NAVER Cloud AI(NAVER云人工智能)

专题命中 指令微调 :instruction tuning(title,abstract);LLM(abstract);large language model(abstract);language model(abstract)

AI总结 本文研究了指令微调中带上下文与不带上下文对模型行为和下游性能的影响,发现上下文增强训练能提升模型基础性并减少幻觉,同时提出在实际部署中分离上下文模型以获得更稳健的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04394 2026-01-09 cs.CL 86%

ARREST: Adversarial Resilient Regulation Enhancing Safety and Truth in Large Language Models

ARREST: 对抗鲁棒调节提升大语言模型的安全性与真实性

Sharanya Dasgupta, Arkaprabha Basu, Sujoy Nath, Swagatam Das

机构 * Electronics and Communication Sciences Unit (ECSU), Indian Statistical Institute Kolkata, University of Surrey, and Indian Institute Of Technology Delhi(电子与通信科学单元(ECSU)、印度统计研究所科钦分校、萨里大学和印度理工学院德里)

专题命中 指令微调 :large language model(title);language model(title);RLHF(abstract);分类 cs.CL

AI总结 ARREST通过对抗鲁棒调节提升大语言模型的安全性与真实性,通过外部网络纠正表征不匹配并生成软拒绝。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.13691 2026-01-09 cs.CL 85%

Is This Collection Worth My LLM's Time? Automatically Measuring Information Potential in Text Corpora

这集合值得我的LLM投入时间吗?自动测量文本语料库中的信息潜力

Tristan Karch, Luca Engel, Philippe Schwaller, Frédéric Kaplan

机构 * EPFL(瑞士联邦理工学院) DHLab(数字人文实验室)

专题命中 指令微调 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出了一种自动化方法,通过生成多项选择题并测量LLM在有无原始材料时的表现差异,来评估文本语料库的信息潜力,以优化数据获取和整合决策。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.11939 2026-01-09 cs.CL cs.AI cs.CV cs.MM 84%

POLYCHARTQA: Benchmarking Large Vision-Language Models with Multilingual Chart Question Answering

POLYCHARTQA: 通过多语言图表问答基准评估大视觉-语言模型

Yichen Xu, Liangyu Chen, Liang Zhang, Jianzhe Ma, Wenxuan Wang, Qin Jin

机构 * Renmin University of China(中国人民大学)

专题命中 指令微调 :language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

AI总结 PolyChartQA是首个大规模多语言图表问答基准,通过多语言图表生成和评估,揭示英语与其他语言在图表理解上的性能差距,并提供训练集提升多语言模型表现。

Comments Work in Progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02967 2026-01-09 cs.SD cs.AI eess.AS 83%

MoE Adapter for Large Audio Language Models: Sparsity, Disentanglement, and Gradient-Conflict-Free

用于大型音频语言模型的MoE适配器:稀疏性、解耦与梯度无冲突

Yishu Lei, Shuwei He, Jing Hu, Dan Zhang, Xianlong Luo, Danxiang Zhu, Shikun Feng, Rui Liu, Jingzhou He, Yu Sun, Hua Wu, Haifeng Wang

机构 * ERNIE Team, Baidu(百度ERNIE团队) College of Computer Science, Inner Mongolia University(内蒙古大学计算机学院) Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院)

专题命中 指令微调 :language model(title,abstract);large language model(abstract);分类 cs.AI

AI总结 本文提出MoE-Adapter,通过稀疏混合专家架构解耦音频信息,缓解梯度冲突,提升音频语义和非语言任务的性能。

Comments 13 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.09792 2026-01-09 cs.GR cs.AI cs.CV 83%

CADmium: Fine-Tuning Code Language Models for Text-Driven Sequential CAD Design

CADmium:通过代码语言模型进行文本驱动的顺序CAD设计微调

Prashant Govindarajan, Davide Baldelli, Jay Pathak, Quentin Fournier, Sarath Chandar

机构 * Chandar Research Lab(昌德拉研究实验室) Mila – Quebec AI Institute(魁北克人工智能研究所) Polytechnique Montréal(蒙特利尔理工学院) Ansys(安世仿真) Canada CIFAR AI Chair(加拿大CIFAR人工智能主席)

专题命中 指令微调 :language model(title,abstract);large language model(abstract);分类 cs.AI

AI总结 CADmium通过微调代码语言模型,利用大规模标注数据集实现文本驱动的CAD设计自动化,提升设计效率。

Comments Published in Transactions on Machine Learning Research (TMLR) 01/2026

Journal ref Transactions on Machine Learning Research (TMLR) 01/2026; https://openreview.net/forum?id=lExqWvQht8

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04381 2026-01-09 cs.CV cs.AI 79%

Few-Shot LoRA Adaptation of a Flow-Matching Foundation Model for Cross-Spectral Object Detection

为跨光谱目标检测的流匹配基础模型进行少样本LoRA适应

Maxim Clouser, Kia Khezeli, John Kalantari

机构 * Yrikka Inc.(Yrikka公司)

专题命中 指令微调 :foundation model(title,abstract);分类 cs.AI

AI总结 通过少样本LoRA适应流匹配基础模型,实现跨光谱目标检测的合成数据生成与提升

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.13368 2026-01-09 cs.CL cs.AI 79%

Donors and Recipients: On Asymmetric Transfer Across Tasks and Languages with Parameter-Efficient Fine-Tuning

捐赠者与接收者:在任务和语言之间进行非对称转移与参数高效微调

Kajetan Dymkiewicz, Ivan Vulic, Helen Yannakoudakis, Eilam Shapira, Roi Reichart, Anna Korhonen

机构 * University of Cambridge(剑桥大学) King’s College London(伦敦国王学院) Technion–Israel Institute of Technology(技术学院—以色列理工学院)

专题命中 指令微调 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本研究通过LoRA微调分析了跨任务和语言的非对称转移现象,发现匹配任务的跨语言转移最有效,高资源语言和广泛任务作为高效接收者吸收收益,而专门任务和低资源语言则较为孤立。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04208 2026-01-09 cs.CL cs.AI 79%

LLMs for Explainable Business Decision-Making: A Reinforcement Learning Fine-Tuning Approach

用于可解释性商业决策的大型语言模型:一种强化学习微调方法

Xiang Cheng, Wen Wang, Anindya Ghose

机构 * Robert H. Smith School of Business, University of Maryland(大学管理学院) Leonard N. Stern School of Business, New York University(纽约大学商学院)

专题命中 指令微调 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出LEXMA方法,通过强化学习微调生成多受众适用的自然语言解释,提升商业决策的可解释性与实用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.18693 2026-01-09 cs.CV 78%

MVT: Mask-Grounded Vision-Language Models for Taxonomy-Aligned Land-Cover Tagging

MVT:基于分类对齐的土地覆盖标签的掩码导向视觉-语言模型

Siyi Chen, Kai Wang, Weicong Pang, Ruiming Yang, Ziru Chen, Renjun Gao, Alexis Kai Hon Lau, Dasa Gu, Chenchen Zhang, Cheng Li

机构 * HKUST(香港科技大学) JHU(约翰·霍普金斯大学) CUHKSZ(香港中文大学) NUS(新加坡国立大学) MUST(穆斯林大学)

专题命中 指令微调 :language model(title);LLM(abstract)

AI总结 MVT通过三阶段框架结合类无关掩码证据与基于分类的场景解释,提升遥感土地覆盖标签的准确性和信息性。

Comments The project is available at https://charlescsyyy.github.io/MVT

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19455 2026-01-09 cs.CL 77%

SiamGPT: Quality-First Fine-Tuning for Stable Thai Text Generation

SiamGPT:面向稳定泰语文本生成的质量优先微调

Thittipat Pairatsuppawat, Abhibhu Tachaapornchai, Paweekorn Kusolsomboon, Chutikan Chaiwong, Thodsaporn Chay-intr, Kobkrit Viriyayudhakorn, Nongnuch Ketui, Aslan B. Wong

机构 * iApp Technology Co., Ltd.(iApp技术有限公司) Intelligent Informatics and Service Innovation Research Center, Thailand(智能信息与服务创新研究中心,泰国) Rajamangala University of Technology Lanna Nan, Thailand(拉玛安高校技术大学兰纳纳分校,泰国) National Electronics and Computer Technology Center (NECTEC)(国家电子与计算机技术中心) Artificial Intelligence Association of Thailand (AIAT)(泰国人工智能协会)

专题命中 指令微调 :large language model(abstract);language model(abstract);pretraining(abstract);分类 cs.CL

AI总结 SiamGPT通过质量优先策略提升泰语生成稳定性,实现指令遵循和多轮对话能力的增强。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.10509 2026-01-09 cs.LG 77%

From Actions to Words: Towards Abstractive-Textual Policy Summarization in RL

从动作到词语:迈向强化学习中基于抽象文本的策略摘要

Sahar Admoni, Assaf Hallak, Yftah Ziser, Omer Ben-Porat, Ofra Amir

机构 * Nvidia Research(英伟达研究)

专题命中 指令微调 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 SySLLM通过将策略解释转化为语言生成问题,利用大型语言模型生成连贯的摘要,以解释复杂强化学习行为。

Comments In Proceedings of AAMAS 2026 (The 25th International Conference on Autonomous Agents and Multi-Agent Systems)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04714 2026-01-09 cs.AI 77%

ThinkDrive: Chain-of-Thought Guided Progressive Reinforcement Learning Fine-Tuning for Autonomous Driving

ThinkDrive: 基于链式推理的渐进强化学习微调框架用于自动驾驶

Chang Zhao, Zheming Yang, Yunqing Hu, Qi Guo, Zijian Wang, Pengcheng Li, Wen Ji

专题命中 指令微调 :large language model(abstract);language model(abstract);SFT(abstract);分类 cs.AI

AI总结 ThinkDrive通过结合显式推理与难度感知的自适应策略优化,提升了自动驾驶中的决策透明度和泛化能力,实验显示其在多个指标上优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04963 2026-01-09 cs.CL cs.AI 73%

Text as a Universal Interface for Transferable Personalization

文本作为通用的可转移个性化接口

Yuting Liu, Jian Guan, Jia-Nan Li, Wei Wu, Jiang-Ming Yang, Jianzhe Zhao, Guibing Guo

机构 * Software College, Northeastern University(东北大学软件学院) Ant Group(蚂蚁集团) Ant International(蚂蚁国际) Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学商学院)

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出利用自然语言作为通用接口,通过两阶段训练框架开发出可转移的偏好推理模型,实现在多个任务和模型家族中的高性能表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04262 2026-01-09 cs.LG cs.AI 73%

Safety-Utility Conflicts Are Not Global: Surgical Alignment via Head-Level Diagnosis

安全与效用冲突并非全球性:通过头部层面诊断的手术对齐

Wang Cai, Yilin Wen, Jinchang Hou, Du Su, Guoqiu Wang, Zhonghou Lv, Chenfu Bao, Yunfang Wu

机构 * Baidu Inc.(百度公司) School of Software and Microelectronics, Peking University(北京大学软件与微电子学院) School of Computer Science, Peking University(北京大学计算机学院) State Key Laboratory of AI Safety, Institute of Computing Technology, CAS(中国科学院计算技术研究所人工智能安全重点实验室)

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出CAST框架,通过头部层面诊断与稀疏微调相结合,解决LLMs中安全与效用冲突问题,减少训练损失并提升安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.24164 2026-01-09 cs.LG cs.RO 70%

$π_0$: A Vision-Language-Action Flow Model for General Robot Control

π₀:一种面向通用机器人控制的视觉-语言-动作流模型

Kevin Black, Noah Brown, Danny Driess, Adnan Esmail, Michael Equi, Chelsea Finn, Niccolo Fusai, Lachy Groom, Karol Hausman, Brian Ichter, Szymon Jakubczak, Tim Jones, Liyiming Ke, Sergey Levine, Adrian Li-Bell, Mohith Mothukuri, Suraj Nair, Karl Pertsch, Lucy Xiaoyang Shi, James Tanner, Quan Vuong, Anna Walling, Haohuan Wang, Ury Zhilinsky

机构 * Physical Intelligence

专题命中 指令微调 :language model(abstract);foundation model(abstract);分类 cs.LG

AI总结 本文提出了一种基于预训练视觉-语言模型的流匹配架构,用于通用机器人控制,通过零样本学习和微调实现多样任务的执行。

Comments See project website for videos: https://physicalintelligence.company/blog/pi0 Published in RSS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04582 2026-01-09 cs.CL 57%

Aligning Text, Code, and Vision: A Multi-Objective Reinforcement Learning Framework for Text-to-Visualization

对齐文本、代码和视觉:一种多目标强化学习框架用于文本到可视化

Mizanur Rahman, Mohammed Saidul Islam, Md Tahmid Rahman Laskar, Shafiq Joty, Enamul Hoque

机构 * York University(约克大学) Salesforce AI Research(Salesforce人工智能研究) Nanyang Technological University(南洋理工大学)

专题命中 指令微调 :SFT(abstract);分类 cs.CL

AI总结 本文提出RL-Text2Vis框架,通过多目标强化学习提升文本到可视化的准确性和代码执行率。

Comments Accepted to EACL Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04395 2026-01-09 cs.IR 50%

The Overlooked Role of Graded Relevance Thresholds in Multilingual Dense Retrieval

多语言密集检索中分级相关性阈值被忽视的作用

Tomer Wullach, Ori Shapira, Amir DN Cohen

专题命中 指令微调 :LLM(abstract)

AI总结 本文探讨了多语言密集检索中分级相关性阈值对性能的影响,发现阈值选择需根据语言和任务调整,以提升检索效果并减少微调数据需求。

详情

展开后加载摘要…

URL PDF HTML 收藏