arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-01-01 至 2026-01-01 共收录 15 信号源:cs.CL, cs.AI, cs.LG

1. 指令微调 15 篇

2508.05667 2026-01-01 cs.IR cs.AI 92%

ITDR: An Instruction Tuning Dataset for Enhancing Large Language Models in Recommendations

ITDR: 一个用于增强推荐系统中大语言模型的指令微调数据集

Zekun Liu, Xiaowen Huang, Jitao Sang

机构 * Beijing Jiaotong University School of Computer Science Technology Beijing Key Laboratory of Traffic Data Mining Embodied Intelligence Key Laboratory of Big Data \& Artificial Intelligence in Transportation, Ministry of Education Beijing China Beijing Jiaotong University

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);instruction tuning(title,abstract);分类 cs.AI

AI总结 ITDR数据集通过七个子任务提升推荐系统中大语言模型的性能,包含20万实例,适用于多种开源和闭源模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.16628 2026-01-01 cs.LG cs.CL 88%

ParetoHqD: Fast Offline Multiobjective Alignment of Large Language Models using Pareto High-quality Data

ParetoHqD: 利用帕累托高质量数据快速实现大语言模型的多目标对齐

Haoran Gu, Handing Wang, Yi Mei, Mengjie Zhang, Yaochu Jin

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.LG

AI总结 ParetoHqD通过利用帕累托高质量数据实现大语言模型的多目标对齐,提升对齐效果和效率。

Comments Accepted as a main conference paper at AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23881 2026-01-01 cs.SD cs.AI cs.CR 88%

Breaking Audio Large Language Models by Attacking Only the Encoder: A Universal Targeted Latent-Space Audio Attack

通过仅攻击编码器打破音频大语言模型:一种通用的目标潜在空间音频攻击

Roee Ziv, Raz Lapid, Moshe Sipper

机构 * Ben Gurion University of the Negev(贝纳乔大学奈夫分校) Deepkeep

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 本文提出了一种针对音频大语言模型编码器的通用潜在空间攻击方法,通过操纵音频潜在表示实现目标输出,展示了编码器层面的安全漏洞。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.07307 2026-01-01 cs.CV cs.AI 85%

MCITlib: Multimodal Continual Instruction Tuning Library and Benchmark

MCITlib: 多模态持续指令微调库与基准

Haiyang Guo, Fei Zhu, Hongbo Zhao, Fanhu Zeng, Wenzhuo Liu, Shijie Ma, Da-Han Wang, Xu-Yao Zhang

机构 * School of Advanced Interdisciplinary Sciences, University of Chinese Academy of Sciences(中国科学院大学先进交叉学科学院) State Key Laboratory of Multimodal Artificial Intelligence Systems, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所多模态人工智能系统国家重点实验室) Centre for Artificial Intelligence and Robotics, Hong Kong Institute of Science and Innovation, Chinese Academy of Sciences(中国科学院香港创新科学研究院人工智能与机器人中心) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) Fujian Key Laboratory of Pattern Recognition and Image Understanding, School of Computer and Information Engineering, Xiamen University of Technology(福建 pattern recognition and image understanding 工程学院,厦门大学科技学院)

专题命中 指令微调 :instruction tuning(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 MCITlib提供多模态持续学习的库和基准,支持8种算法并评估3个基准,旨在解决灾难性遗忘和跨模态协调问题。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24991 2026-01-01 cs.LG 83%

Efficiently Estimating Data Efficiency for Language Model Fine-tuning

高效估计语言模型微调的数据效率

Gyung Hyun Je, Colin Raffel

专题命中 指令微调 :language model(title,abstract);large language model(abstract);分类 cs.LG

AI总结 本文提出通过梯度余弦相似度预测语言模型微调的数据效率,减少不必要的标注成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24263 2026-01-01 cs.AI 83%

Constrained Language Model Policy Optimization via Risk-aware Stepwise Alignment

通过风险感知的逐步对齐实现约束语言模型策略优化

Lijun Zhang, Lin Li, Wei Wei, Yajie Qi, Huizhong Song, Jun Wang, Yaodong Yang, Jiye Liang

机构 * Key Laboratory of Computational Intelligence and Chinese Information Processing of Ministry of Education, School of Computer and Information Technology, Shanxi University(教育部计算智能与中文信息处理重点实验室,计算机与信息技术学院,山西大学) University College London(伦敦大学学院) Institute for AI, Peking University(北京大学人工智能研究院)

专题命中 指令微调 :language model(title,abstract);RLHF(abstract);分类 cs.AI

AI总结 本文提出风险感知的逐步对齐方法,通过嵌套风险度量提升语言模型策略优化的安全性与鲁棒性,有效抑制高影响有害行为。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.17884 2026-01-01 cs.CR cs.AI cs.LG 79%

When Intelligence Fails: An Empirical Study on Why LLMs Struggle with Password Cracking

当智能失效:一项关于LLMs在密码破解中挣扎原因的实证研究

Mohammad Abdul Rehman, Syed Imad Ali Shah, Abbas Anwar, Noor Islam, Hamid Khan

机构 * Future Data Minds Research Lab(未来数据智能研究实验室)

专题命中 指令微调 :large language model(abstract);language model(abstract);prompting(abstract);分类 cs.AI、cs.LG

AI总结 本研究发现LLMs在密码破解任务中表现不佳,指出其在领域适应和记忆能力上的不足,强调需要改进的密码推断方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24615 2026-01-01 cs.AI 77%

Youtu-Agent: Scaling Agent Productivity with Automated Generation and Hybrid Policy Optimization

Youtu-Agent:通过自动化生成和混合策略优化提升代理生产力

Yuchen Shi, Yuzheng Cai, Siqi Cai, Zihan Xu, Lichao Chen, Yulei Qin, Zhijian Zhou, Xiang Fei, Chaofan Qiu, Xiaoyu Tan, Gang Li, Zongyi Li, Haojia Lin, Guocan Cai, Yong Mao, Yunsheng Wu, Ke Li, Xing Sun

机构 * Youtu-Agent Team(优图代理团队)

专题命中 指令微调 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 Youtu-Agent通过自动化生成和混合策略优化提升LLM代理的生产力和性能

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24271 2026-01-01 cs.CV cs.AI 77%

Taming Hallucinations: Boosting MLLMs' Video Understanding via Counterfactual Video Generation

驯服幻觉:通过反事实视频生成提升MLLMs的视频理解

Zhe Huang, Hao Wen, Aiming Hao, Bingze Song, Meiqi Wu, Jiahong Wu, Xiangxiang Chu, Sheng Lu, Haoqian Wang

机构 * Tsinghua University(清华大学) Beihang University(北航) AMAP, Alibaba Group(阿里妈妈实验室,阿里巴巴集团)

专题命中 指令微调 :large language model(abstract);language model(abstract);SFT(abstract);分类 cs.AI

AI总结 通过反事实视频生成和对比训练,提升MLLMs对视频的理解能力并减少幻觉。

Comments 18 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.04903 2026-01-01 cs.CL 77%

ACE-RL: Adaptive Constraint-Enhanced Reward for Long-form Generation Reinforcement Learning

ACE-RL:自适应约束增强的长形式生成强化学习

Jianghao Chen, Wei Sun, Qixiang Yin, Zhixing Tan, Jiajun Zhang

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) Zhongguancun Academy, Beijing, China(中关村学院,北京,中国) Tsinghua University(清华大学) Wuhan AI Research(武汉人工智能研究所)

专题命中 指令微调 :large language model(abstract);language model(abstract);SFT(abstract);分类 cs.CL

AI总结 ACE-RL通过自适应约束增强的强化学习方法,提升长形式生成任务的训练效果,实验显示在WritingBench上优于现有基线模型。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24410 2026-01-01 cs.CL cs.AI 73%

Comparing Approaches to Automatic Summarization in Less-Resourced Languages

在资源较少的语言中自动摘要方法的比较

Chester Palen-Michel, Constantine Lignos

专题命中 指令微调 :LLM(abstract);prompting(abstract);分类 cs.CL、cs.AI

AI总结 本文比较了不同方法在资源较少语言中自动摘要的效果,发现多语言微调的mT5基线表现最佳,而LLM作为评判者在资源较少语言上可靠性较低。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24023 2026-01-01 cs.CV cs.AI 70%

RSAgent: Learning to Reason and Act for Text-Guided Segmentation via Multi-Turn Tool Invocations

RSAgent: 通过多轮工具调用学习推理与行动进行文本引导的分割

Xingqi He, Yujie Zhang, Shuyong Gao, Wenjie Li, Lingyi Hong, Mingxi Chen, Kaixun Jiang, Jiyuan Fu, Wenqiang Zhang

机构 * Shanghai Key Lab of Intelligent Information Processing, College of Computer Science and Artificial Intelligence, Fudan University(上海智能信息处理关键实验室,计算机科学与人工智能学院,复旦大学) Artificial Intelligence, Fudan University(人工智能,复旦大学)

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 RSAgent通过多轮工具调用实现文本引导分割的推理与行动,采用两阶段框架提升分割性能,达到领域内和领域外基准的最先进水平。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24591 2026-01-01 cs.CV 67%

Improving Few-Shot Change Detection Visual Question Answering via Decision-Ambiguity-guided Reinforcement Fine-Tuning

通过决策模糊性引导的强化微调提升少样本变化检测视觉问答

Fuyu Dong, Ke Li, Di Wang, Nan Luo, Yiming Zhang, Kaiyu Li, Jianfei Yang, Quan Wang

机构 * School of Computer Science and Technology, Xidian University(西安电子科技大学计算机科学与技术学院) Department of Mathematics, University of California, San Diego(加州大学圣地亚哥分校数学系) School of Software Engineering, Xi'an Jiaotong University(西安交通大学软件工程学院)

专题命中 指令微调 :language model(abstract);SFT(abstract)

AI总结 DARFT通过决策模糊性引导的强化微调提升CDVQA的判别性和鲁棒性,尤其在少样本场景中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24849 2026-01-01 cond-mat.mtrl-sci cond-mat.supr-con 50%

SSCHA-based evolutionary crystal structure prediction at finite temperatures with account for quantum nuclear motion

基于SSCHA的有限温度下晶体结构预测及量子核运动考虑

Daniil Poletaev, Artem Oganov

专题命中 指令微调 :foundation model(abstract)

AI总结 本文提出基于SSCHA和MLIPs的有限温度晶体结构预测方法,通过比较AL-MLIPs和uMLIPs在LaH₁₀中的应用,展示量子非谐性对稳定性排名的重要性,扩展了CSP的应用范围。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.03734 2026-01-01 cs.RO cs.CV 50%

OTTER: A Vision-Language-Action Model with Text-Aware Visual Feature Extraction

OTTER: 一种具有文本感知视觉特征提取的视觉-语言-动作模型

Huang Huang, Fangchen Liu, Letian Fu, Tingfan Wu, Mustafa Mukadam, Jitendra Malik, Ken Goldberg, Pieter Abbeel

机构 * University of California, Berkeley(加州大学伯克利分校) Meta AI

专题命中 指令微调 :language model(abstract)

AI总结 OTTER通过文本感知的视觉特征提取,提升视觉-语言-动作模型的零样本泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏