arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 11653 信号源:cs.CL, cs.AI, cs.LG

1. 指令微调 11653 篇

2401.12215 2024-01-23 cs.CV 85%

Less Could Be Better: Parameter-efficient Fine-tuning Advances Medical Vision Foundation Models

Chenyu Lian, Hong-Yu Zhou, Yizhou Yu, Liansheng Wang

专题命中 指令微调 :foundation model(title,abstract);large language model(abstract);language model(abstract)

Comments Technical report

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.08787 2024-01-18 cs.CV 85%

Segment Anything Model Can Not Segment Anything: Assessing AI Foundation Model's Generalizability in Permafrost Mapping

Wenwen Li, Chia-Yu Hsu, Sizhe Wang, Yezhou Yang, Hyunho Lee, Anna Liljedahl, Chandi Witharana, Yili Yang, Brendan M. Rogers, Samantha T. Arundel, Matthew B. Jones, Kenton McHenry, Patricia Solis

专题命中 指令微调 :foundation model(title,abstract);large language model(abstract);language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.06323 2023-12-12 cs.CV 85%

Learning Hierarchical Prompt with Structured Linguistic Knowledge for Vision-Language Models

Yubin Wang, Xinyang Jiang, De Cheng, Dongsheng Li, Cairong Zhao

专题命中 指令微调 :language model(title,abstract);large language model(abstract);foundation model(abstract)

Comments AAAI2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.02251 2023-12-06 cs.DB cs.AI cs.CL cs.LG 85%

Fine-Tuning Language Models for Context-Specific SQL Query Generation

Amine Rebei

专题命中 指令微调 :language model(title,abstract);large language model(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.05845 2023-11-13 cs.CL cs.AI cs.LG 85%

Tamil-Llama: A New Tamil Language Model Based on Llama 2

Abhinand Balachandran

专题命中 指令微调 :language model(title,abstract);large language model(abstract);分类 cs.CL、cs.AI、cs.LG

Comments 19 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.02126 2023-11-07 cs.CV 85%

PILL: Plug Into LLM with Adapter Expert and Attention Gate

Fangyuan Zhang, Tingting Liang, Zhengyuan Wu, Yuyu Yin

专题命中 指令微调 :LLM(title,abstract);large language model(abstract);language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.10944 2023-11-06 astro-ph.IM astro-ph.GA astro-ph.SR 85%

Towards an astronomical foundation model for stars with a Transformer-based model

Henry W. Leung, Jo Bovy

专题命中 指令微调 :foundation model(title,abstract);large language model(abstract);language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.03693 2023-10-06 cs.CL cs.AI cs.CR cs.LG 85%

Fine-tuning Aligned Language Models Compromises Safety, Even When Users Do Not Intend To!

Xiangyu Qi, Yi Zeng, Tinghao Xie, Pin-Yu Chen, Ruoxi Jia, Prateek Mittal, Peter Henderson

专题命中 指令微调 :language model(title,abstract);large language model(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.04158 2023-09-11 cs.CV 85%

Context-Aware Prompt Tuning for Vision-Language Model with Dual-Alignment

Hongyu Hu, Tiancheng Lin, Jie Wang, Zhenbang Sun, Yi Xu

专题命中 指令微调 :language model(title,abstract);LLM(abstract);large language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.04275 2023-08-09 cs.CL cs.AI cs.LG 85%

In-Context Alignment: Chat with Vanilla Language Models Before Fine-Tuning

Xiaochuang Han

专题命中 指令微调 :language model(title,abstract);prompting(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2307.14692 2023-07-28 cs.CR 85%

Backdoor Attacks for In-Context Learning with Language Models

Nikhil Kandpal, Matthew Jagielski, Florian Tramèr, Nicholas Carlini

专题命中 指令微调 :language model(title,abstract);large language model(abstract);prompting(abstract)

Comments AdvML Frontiers Workshop 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.11455 2023-05-22 cs.CL cs.AI cs.LG 85%

Shattering the Agent-Environment Interface for Fine-Tuning Inclusive Language Models

Wanqiao Xu, Shi Dong, Dilip Arumugam, Benjamin Van Roy

专题命中 指令微调 :language model(title,abstract);RLHF(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2206.08349 2023-05-03 cs.LG cs.AI cs.CL 85%

Know your audience: specializing grounded language models with listener subtraction

Aaditya K. Singh, David Ding, Andrew Saxe, Felix Hill, Andrew K. Lampinen

专题命中 指令微调 :language model(title,abstract);large language model(abstract);分类 cs.CL、cs.AI、cs.LG

Comments 28 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2304.07058 2023-04-17 cs.RO 85%

FM-Loc: Using Foundation Models for Improved Vision-based Localization

Reihaneh Mirjalili, Michael Krawez, Wolfram Burgard

专题命中 指令微调 :foundation model(title,abstract);large language model(abstract);language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2203.02155 2022-03-07 cs.CL cs.AI cs.LG 85%

Training language models to follow instructions with human feedback

Long Ouyang, Jeff Wu, Xu Jiang, Diogo Almeida, Carroll L. Wainwright, Pamela Mishkin, Chong Zhang, Sandhini Agarwal, Katarina Slama, Alex Ray, John Schulman, Jacob Hilton, Fraser Kelton, Luke Miller, Maddie Simens, Amanda Askell, Peter Welinder, Paul Christiano, Jan Leike, Ryan Lowe

专题命中 指令微调 :language model(title,abstract);large language model(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.05346 2025-06-06 cs.CR cs.CL cs.LG 84%

Why LLM Safety Guardrails Collapse After Fine-tuning: A Similarity Analysis Between Alignment and Fine-tuning Datasets

Lei Hsiung, Tianyu Pang, Yung-Chen Tang, Linyue Song, Tsung-Yi Ho, Pin-Yu Chen, Yaoqing Yang

机构 * Dartmouth College(达特茅斯学院) EPFL(苏黎世联邦理工学院) UC Berkeley(加州大学伯克利分校) CUHK(香港大学) IBM Research(IBM研究院)

专题命中 指令微调 :LLM(title,comments);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

Comments Project Page: https://hsiung.cc/llm-similarity-risk/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21305 2026-08-24 cs.CV cs.AI 新提交 84%

Re$^3$Cap: Retrieval-Guided Refinement for Image Captioning Enhancement via Reinforcement Learning

Re³Cap:基于强化学习的图像字幕增强的检索引导优化

Haonan Jia, Shichao Dong, Zenghui Sun, Jiawen Zheng, Ziqi Miao, Gege Shi, Qiuyu Zhao, Jinsong Lan, Xiaoyong Zhu, Bo Zheng

机构 * Taobao & Tmall Group of Alibaba(阿里巴巴淘宝和天猫集团) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 指令微调 :SFT(summary_cn,abstract);language model(abstract);分类 cs.AI

AI总结 本文提出Re³Cap方法,利用多模态检索作为推理信号,通过CRS和CQA优化图像字幕,在COCO-LN500基准上关系推理性能较GRPO提升8.64%,优于SFT。

Comments Accepted to EMNLP 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16467 2026-08-18 cs.HC cs.CL cs.CY 新提交 84%

Computational KJ-Ho: An Analyst-Bias-Free Insight Extraction Framework from Large-Scale Qualitative Data Using Domain-Specialized LLMs

计算KJ-Ho:利用领域专用大型语言模型从大规模定性数据中提取无分析师偏差见解的框架

Kasumi Ban

专题命中 指令微调 :LLM(summary_cn,abstract);SFT(abstract,abstract_cn);分类 cs.CL

AI总结 本文提出计算KJ-Ho框架,结合领域专用LLM实现无分析师偏差的定性数据见解提取,整合三种方法论并作出五项贡献,属概念性研究。

Comments Concept paper. 38 pages, 1 figure, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15594 2026-08-18 cs.AI 新提交 84%

TRACE: Trajectory Aware Reasoning for Multi-Turn Adversarial Conversation Evaluation

TRACE:面向多轮对抗对话评估的轨迹感知推理

Md Messal Monem Miah, Adrita Anika, Zhiyuan Yu, Ruihong Huang

机构 * Texas A&M University(德克萨斯农工大学) Amazon(亚马逊公司)

专题命中 指令微调 :LLM(summary_cn,abstract_cn);SFT(abstract,abstract_cn);分类 cs.AI

AI总结 针对LLM多轮越狱攻击,提出具备轨迹感知推理的Trace防御方法,训练Llama-3.1-8B-Instruct实现安全与实用平衡,在多轮攻击基准中显著降低攻击成功率并提升合规率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14492 2026-08-17 cs.LG 新提交 84%

Approximate Muon with low-rank adapters

基于低秩适配器的近似Muon优化器

Ben Anson, Conor Houghton, Edward Milsom

机构 * University of Bristol(布里斯托大学) School of Mathematics(数学学院) School of Engineering Mathematics and Technology(工程数学与技术学院) University of Bath(巴斯大学)

专题命中 指令微调 :SFT(summary_cn,abstract);pretraining(abstract);分类 cs.LG

AI总结 本文针对Muon优化器难以与LoRA结合用于低秩微调的问题,提出sMuon方法,经实验验证其在SFT和ReLoRA预训练中表现良好,可适度提升低秩微调性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.26690 2026-08-13 cs.LG 版本更新 84%

LoRAQuant: Mixed-Precision Quantization of LoRA to Ultra-Low Bits

LoRAQuant:将LoRA混合精度量化至超低比特

Amir Reza Mirzaei, Yuqiao Wen, Yanshuai Cao, Lili Mou

机构 * Dept. Computing Science & Alberta Machine Intelligence Institute (Amii), University of Alberta(计算科学系及阿尔伯塔人工智能研究所(Amii),阿尔伯塔大学) RBC Borealis Canada CIFAR AI Chair(加拿大CIFAR人工智能 chair)

专题命中 指令微调 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 针对多LoRA适配器规模化部署的高存储成本问题,提出专为LoRA定制的混合精度后训练量化方法LoRAQuant,在LLaMA 2、Mistral模型的多任务上,以更低比特实现了相当或更优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.03742 2026-08-11 cs.CL 版本更新 84%

Benchmarking Parameter-Efficient Fine-Tuning of Large Language Models for Low-Resource Tajik Text Generation with the Tajik Web Corpus

针对低资源塔吉克语文本生成的大语言模型参数高效微调基准测试:基于塔吉克网络语料库

Mullosharaf K. Arabov

专题命中 指令微调 :large language model(title);language model(title);分类 cs.CL

AI总结 该研究发布塔吉克网络语料库,测试9种架构17种配置的三种微调策略,得出Mistral 7B搭配QLoRA r=8为最优方案,是首个针对塔吉克语文本生成的PEFT基准测试。

Comments LaTeLL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08746 2026-08-11 cs.AI 新提交 84%

Scale-to-Dialogue: Low-Burden Elicitation of Daily Premenstrual Symptom Ratings with Small Language Models

对话式量表:用小型语言模型低负担引出日常经前症状评分

Yifan Wang

机构 * The Chinese University of Hong Kong, Shenzhen (CUHK-Shenzhen)(香港中文大学(深圳))

专题命中 指令微调 :language model(title);small language model(title);分类 cs.AI

AI总结 该研究将经前症状追踪转化为对话式有序标签恢复问题,用ModernBERT和Qwen2.5-1.5B-Instruct模型,实现低负担的日常经前症状评分,三簇策略效果接近固定六项策略且提问量减半。

Comments 10 pages, 4 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07570 2026-08-11 cs.CV cs.AI 新提交 84%

COMEX: A Composition-Grounded Benchmark and Learning Framework for Explainable Aesthetic Image Cropping

COMEX:用于可解释美学图像裁剪的基于构图的基准测试与学习框架

Rui Yang, Wei Zhou, Dingyong Gou, Xiaohui Cui, Cong Li, Yinyin Gong, Yipo Huang, Jiliang Zhao

机构 * ZTE Corporation(中兴通讯)

专题命中 指令微调 :SFT(summary_cn,abstract);language model(abstract);分类 cs.AI

AI总结 该研究提出基于构图的COMEX基准与SFT+GRPO两阶段框架,用于可解释美学图像裁剪,通过多组实验验证了框架的有效性与可迁移性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11149 2026-08-11 cs.CL 版本更新 84%

Data Repetition Beats Data Scaling in Long-CoT Supervised Fine-Tuning

数据重复胜过数据扩展在长链推理监督微调中

Dawid J. Kopiczko, Sagar Vaze, Tijmen Blankevoort, Yuki M. Asano

机构 * University of Technology Nuremberg(图恩大学) NVIDIA(英伟达)

专题命中 指令微调 :SFT(abstract,abstract_cn);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 本研究发现,在长链推理监督微调中,数据重复训练比数据扩展更有效,通过token准确率作为停止标准可替代昂贵的数据扩展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04200 2026-08-06 q-fin.MF cs.LG 新提交 84%

From Financial Sentiment Classification to Return Predictability: A QLoRA Benchmark of Large Language Models

从金融情感分类到收益可预测性:大型语言模型的QLoRA基准测试

Fusheng Luo

专题命中 指令微调 :large language model(title);language model(title);分类 cs.LG

AI总结 该研究构建金融情感分类基准,对比TF-IDF朴素贝叶斯等模型,发现QLoRA可提升Qwen2.5性能,但分类准确率高的模型在收益预测的经济有效性上无显著优势,揭示分类准确率与可交易信号的差距。

Comments Waiting to submit to a conference (ICAIF)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00181 2026-08-04 cs.SE cs.AI 新提交 84%

Cross-Benchmark Generalization in Long-Horizon Agents

长视野智能体的跨基准泛化

Sushant Mehta, Logan Ritchie, Liudas Panavas, Edwin Chen

专题命中 指令微调 :SFT(summary_cn,abstract);post-training(abstract);分类 cs.AI

AI总结 本研究针对长视野智能体,通过两阶段SFT-再-RL流程后训练Qwen3.5-122B-A10B模型,在5项外部基准实现性能提升,证明长视野多工具后训练的工作方式可跨领域迁移。

Comments Accepted at the COLM 2026 Workshop on Agent Behavior. 11 pages, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16637 2026-08-04 cs.AI 版本更新 84%

TopoTuner: Topological Finetuning of Large Language Models

TopoTuner:大语言模型的拓扑微调

Abdulkadir Erol, Yash Mahajan, Vepaul Hariprashad, Baha Rababah, Santu Karmaker, Cuneyt G. Akcora, Mubarak Shah

机构 * University of Central Florida(中佛罗里达大学) University of Manitoba(曼尼托巴大学)

专题命中 指令微调 :large language model(title);language model(title);分类 cs.AI

AI总结 研究针对大语言模型微调成本高及LoRA不足的问题,提出TopoTuner框架,通过拓扑引导选择性冻结注意力投影矩阵,从源数据集学习可复用冻结配置文件,在多模型上效果优于LoRA且大幅减少训练时间和参数更新量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28661 2026-08-03 cs.CL 新提交 84%

Are the Financial Reasoning from LLMs Credible? A Real World Test over Long-Horizon Statements

大型语言模型(LLMs)的财务推理是否可信?针对长期财务报表的现实测试

Xinke Tong, Xuanming Zhang, Tianyi Tang, An Yang, Jiatu Hu, Guojie Lin, Zhenzhen Shi, Lingfeng Zeng, Boyu Yang, Bing Zhao, Hu Wei, Lin Qu, Dayiheng Liu

专题命中 指令微调 :SFT(abstract,abstract_cn);LLM(abstract);large language model(abstract);language model(abstract)

AI总结 该研究针对LLMs的财务推理可信度,构建含对抗陷阱的FinIndices基准测试,发现其存在知识与结构瓶颈,监督微调可部分恢复结构化逻辑。

Comments The FinIndices dataset is publicly available at https://huggingface.co/datasets/User158072/Finindice

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27557 2026-07-31 cs.CL 新提交 84%

Training Skills Like Parameters via Self-Supervised Semantic Diffusion

通过自监督语义扩散将技能像参数一样训练

Mo Li, Zixin Yin, Ting Cao, Yunxin Liu

机构 * Tsinghua University(清华大学) Shanghai AI Laboratory(上海人工智能实验室) The Hong Kong University of Science and Technology(香港科技大学)

专题命中 指令微调 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 该研究提出受扩散模型启发的无监督自进化智能体框架,通过自监督信号更新外部文本技能库,提升了智能体在短剧剧本创作领域的生成能力。

Comments Preprint, work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏