arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-02-26 至 2026-02-26 共收录 9 信号源:cs.CL, cs.AI, cs.LG

1. 指令微调 9 篇

2602.22124 2026-02-26 cs.SE cs.AI cs.CL cs.LG 91%

SWE-Protégé: Learning to Selectively Collaborate With an Expert Unlocks Small Language Models as Software Engineering Agents

SWE-Protégé: 通过选择性协作专家解锁小型语言模型作为软件工程代理

Patrick Tser Jern Kon, Archana Pradeep, Ang Chen, Alexander P. Ellis, Warren Hunt, Zijian Wang, John Yang, Samuel Thompson

机构 * Meta University of Michigan(密歇根大学) Stanford University(斯坦福大学)

专题命中 指令微调 :language model(title,abstract);small language model(title,abstract);SLM(abstract);post-training(abstract)

AI总结 SWE-Protégé通过选择性协作专家,使小型语言模型在软件工程任务中取得显著提升,实现42.4%的Pass@1成绩。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21223 2026-02-26 cs.CL cs.AI 88%

Measuring Pragmatic Influence in Large Language Model Instructions

在大型语言模型指令中测量隐含影响

Yilin Geng, Omri Abend, Eduard Hovy, Lea Frermann

机构 * University of Melbourne(墨尔本大学) Hebrew University of Jerusalem(耶路撒冷希伯来大学)

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出了一种框架分解和分类方法,系统测量大型语言模型指令中的隐含影响,揭示了框架对指令优先级的可预测影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.06060 2026-02-26 cs.CL cs.AI 88%

Simple Yet Effective: Extracting Private Data Across Clients in Federated Fine-Tuning of Large Language Models

简单而有效的:在联邦微调大型语言模型中提取客户端私有数据

Yingqi Hu, Zhuo Zhang, Jingyuan Zhang, Jinghua Wang, Qifan Wang, Lizhen Qu, Zenglin Xu

机构 * Harbin Institute of Technology(哈尔滨工业大学) Kuaishou Technology(快手科技) Meta AI Monash University(墨尔本大学) Fudan University(复旦大学) Shanghai Academy of Artificial Intelligence for Science(上海人工智能科学研究院)

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出三种简单有效的方法,用于在联邦微调大型语言模型中提取客户端私有数据,揭示了FedLLMs中的隐私风险并建立了评估框架。

Comments IJCNLP 2025 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.01617 2026-02-26 cs.CV 75%

LLaDA-MedV: Exploring Large Language Diffusion Models for Biomedical Image Understanding

LLaDA-MedV:探索大规模语言扩散模型用于生物医学图像理解

Xuanzhao Dong, Wenhui Zhu, Xiwen Chen, Zhipeng Wang, Peijie Qiu, Shao Tang, Xin Li, Yalin Wang

机构 * Arizona State University(亚利桑那州立大学) Clemson University(克莱姆森大学) LinkedIn Corporation(领英公司) Washington University in St. Louis(圣路易斯华盛顿大学) Morgan Stanley(摩根大通)

专题命中 指令微调 :LLM(abstract);language model(abstract);instruction tuning(abstract)

AI总结 LLaDA-MedV通过视觉指令微调,首次在生物医学图像理解中应用大规模语言扩散模型,实现了在生物医学视觉对话任务中的性能提升,并在多个VQA基准测试中取得新高准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21222 2026-02-26 cs.CL cs.AI cs.LG 75%

Task-Aware LoRA Adapter Composition via Similarity Retrieval in Vector Databases

基于向量数据库相似性检索的任务感知LoRA适配器组合

Riya Adsul, Balachandra Devarangadi Sunil, Isha Nalawade, Sudharshan Govindan

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出基于向量数据库相似性检索的LoRA适配器组合框架,通过动态合并适配器实现多任务学习,线性合并方法在PIQA和RTE任务上取得显著性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21420 2026-02-26 cs.LG cs.AI 73%

Overconfident Errors Need Stronger Correction: Asymmetric Confidence Penalties for Reinforcement Learning

过度自信的错误需要更强的纠正:强化学习中的非对称置信度惩罚

Yuanda Xu, Hejian Sang, Zhengze Zhou, Ran He, Zhipeng Wang

机构 * LinkedIn Corporation(领英公司)

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出非对称置信度感知错误惩罚(ACE)以解决强化学习中过度自信错误的问题,通过动态调节负优势提升模型推理能力与生成多样性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17306 2026-02-26 cs.CL 70%

Refusal Direction is Universal Across Safety-Aligned Languages

拒绝方向在安全对齐语言中是普遍的

Xinpeng Wang, Mingyang Wang, Yihong Liu, Hinrich Schütze, Barbara Plank

机构 * LMU Munich(慕尼黑大学) Munich Center for Machine Learning(慕尼黑机器学习中心)

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文研究了多语言LLMs中拒绝方向的跨语言普遍性,发现英文提取的向量可有效绕过其他语言的拒绝,揭示了跨语言安全机制的机制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21716 2026-02-26 cs.CV 67%

TranX-Adapter: Bridging Artifacts and Semantics within MLLMs for Robust AI-generated Image Detection

TranX-Adapter: 在MLLMs中弥合artifact与语义以实现鲁棒的AI生成图像检测

Wenbin Wang, Yuge Huang, Jianqing Xu, Yue Yu, Jiangtao Yan, Shouhong Ding, Pan Zhou, Yong Luo

机构 * Wuhan University(武汉大学) Tencent YouTu Lab(腾讯YouTu实验室) Singapore Management University(新加坡管理学院)

专题命中 指令微调 :large language model(abstract);language model(abstract)

AI总结 TranX-Adapter通过引入任务感知的最优传输融合和X-Fusion机制,在MLLMs中提升AI生成图像检测的鲁棒性和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.10082 2026-02-26 cs.CV 50%

LoRA-Edit: Controllable First-Frame-Guided Video Editing via Mask-Aware LoRA Fine-Tuning

LoRA-Edit: 通过掩码感知LoRA微调实现可控的第一帧引导视频编辑

Chenjian Gao, Lihe Ding, Xin Cai, Zhanpeng Huang, Zibin Wang, Tianfan Xue

机构 * Multimedia Laboratory, The Chinese University of Hong Kong(香港中文大学多媒体实验室) SenseTime Research(商汤科技研究院)

专题命中 指令微调 :pretraining(abstract)

AI总结 LoRA-Edit通过时空掩码引导LoRA微调,实现对视频编辑全过程的可控编辑,支持生成动态变化的视频内容。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏