arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 11714 信号源:cs.CL, cs.AI, cs.LG

1. 指令微调 11714 篇

2602.24283 2026-03-02 cs.LG cs.AI cs.CL 75%

Taming Momentum: Rethinking Optimizer States Through Low-Rank Approximation

驯服动量:通过低秩近似重新思考优化器状态

Zhengbo Wang, Jian Liang, Ran He, Zilei Wang, Tieniu Tan

机构 * University of Science and Technology of China(中国科学技术大学) NLPR & MAIS, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院)

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 LoRA-Pre通过低秩近似优化器状态,提升预训练和微调效率,实现内存节省与性能提升

Comments Camera-ready version. Accepted as Oral at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22357 2026-02-27 astro-ph.IM 75%

STILTS-NLI: A Natural Language Interface for STILTS

STILTS-NLI:一种用于STILTS的自然语言接口

R. A. Shaw, S. Fotopoulou, M. Taylor, M. Bremer

专题命中 指令微调 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 STILTS-NLI通过微调开源大语言模型,为天文学数据处理提供自然语言接口,降低用户学习门槛并提升使用效率。

Comments Accepted for publication in RASTI

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.01617 2026-02-26 cs.CV 75%

LLaDA-MedV: Exploring Large Language Diffusion Models for Biomedical Image Understanding

LLaDA-MedV:探索大规模语言扩散模型用于生物医学图像理解

Xuanzhao Dong, Wenhui Zhu, Xiwen Chen, Zhipeng Wang, Peijie Qiu, Shao Tang, Xin Li, Yalin Wang

机构 * Arizona State University(亚利桑那州立大学) Clemson University(克莱姆森大学) LinkedIn Corporation(领英公司) Washington University in St. Louis(圣路易斯华盛顿大学) Morgan Stanley(摩根大通)

专题命中 指令微调 :LLM(abstract);language model(abstract);instruction tuning(abstract)

AI总结 LLaDA-MedV通过视觉指令微调,首次在生物医学图像理解中应用大规模语言扩散模型,实现了在生物医学视觉对话任务中的性能提升,并在多个VQA基准测试中取得新高准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21222 2026-02-26 cs.CL cs.AI cs.LG 75%

Task-Aware LoRA Adapter Composition via Similarity Retrieval in Vector Databases

基于向量数据库相似性检索的任务感知LoRA适配器组合

Riya Adsul, Balachandra Devarangadi Sunil, Isha Nalawade, Sudharshan Govindan

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出基于向量数据库相似性检索的LoRA适配器组合框架,通过动态合并适配器实现多任务学习,线性合并方法在PIQA和RTE任务上取得显著性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16789 2026-02-24 cs.CL cs.AI cs.LG 75%

Accidental Vulnerability: Factors in Fine-Tuning that Shift Model Safeguards

意外漏洞:影响微调的因子

Punya Syon Pandey, Samuel Simko, Kellin Pelrine, Zhijing Jin

机构 * University of Toronto(多伦多大学) Vector Institute(向量研究所) ETH Zürich(苏黎世联邦理工学院) FAR AI(FAR人工智能公司) McGill University(麦吉尔大学) MILA(蒙特利尔人工智能研究院) Max Planck Institute for Intelligent Systems, Tübingen, Germany(图宾根德国智能系统研究所)

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究意外漏洞,揭示微调数据集特征对模型安全性和对抗鲁棒性的影响

Comments Second Conference of the International Association for Safe and Ethical Artificial Intelligence (IASEAI 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18915 2026-02-24 q-bio.QM cs.AI cs.CL cs.LG 75%

AAVGen: Precision Engineering of Adeno-associated Viral Capsids for Renal Selective Targeting

AAVGen:用于肾脏选择性靶向的腺相关病毒衣壳的精准工程

Mohammadreza Ghaffarzadeh-Esfahani, Yousof Gheisari

机构 * Regenerative Medicine Research Center Isfahan University of Medical Sciences(伊斯法罕医科大学再生医学研究中心) Department of Genetics and Molecular Biology Isfahan University of Medical Sciences(伊斯法罕医科大学遗传学与分子生物学系)

专题命中 指令微调 :language model(abstract);SFT(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 AAVGen通过生成式人工智能框架设计新型AAV衣壳,提升肾脏靶向性和生产效率,实现多目标优化。

Comments 22 pages, 6 figures, and 5 supplementary files. Corresponding author: ygheisari@med.mui.ac.ir, Kaggle notebook is available at https://www.kaggle.com/code/mohammadgh009/aavgen

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.16985 2026-02-24 cs.CL cs.AI cs.LG 75%

Parameter-Efficient Fine-Tuning for Low-Resource Languages: A Comparative Study of LLMs for Bengali Hate Speech Detection

低资源语言参数高效微调:一种用于孟加拉语仇恨言论检测LLMs的比较研究

Akif Islam, Mohd Ruhul Ameen

机构 * Department of Computer Science and Engineering(计算机科学与工程系) University of Rajshahi(拉贾沙希大学) College of Engineering and Computer Sciences(工程与计算机科学学院) Marshall University(马歇尔大学)

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文通过参数高效微调方法,在孟加拉语仇恨言论检测中实现了高精度的F1分数,展示了低资源语言模型的有效性。

Comments Accepted to IEEE COMPAS 2025. 6 pages, 3 figures, 6 tables

Journal ref 2025 IEEE International Conference on Computing, Applications and Systems (COMPAS), 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16936 2026-02-20 cs.DC 75%

Heterogeneous Federated Fine-Tuning with Parallel One-Rank Adaptation

异构联邦微调与并行一秩适应

Zikai Zhang, Rui Hu, Jiahao Xu

专题命中 指令微调 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 Fed-PLoRA通过并行一秩适应和Select-N-Fold策略,解决异构联邦微调中的初始化和聚合噪声问题,提升LLM微调的准确性和效率。

Comments To appear in ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14490 2026-02-17 cs.LG cs.AI cs.CL cs.NE 75%

Parameter-Efficient Fine-Tuning of LLMs with Mixture of Space Experts

使用混合空间专家进行大语言模型的参数高效微调

Buze Zhang, Jinkai Tao, Zilang Zeng, Neil He, Ali Maatouk, Menglin Yang, Rex Ying

机构 * Yale university(耶鲁大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Hong Kong University of Science(香港科学大学) Xi’an Jiaotong University(西安交通大学) Central University of Finance(中央财经大学)

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出MoSLoRA,通过混合多种几何空间提升大语言模型的参数高效微调效果,实验显示在多个基准测试中表现优于现有方法。

Comments 15 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10490 2026-02-12 cs.IR 75%

ChainRec: An Agentic Recommender Learning to Route Tool Chains for Diverse and Evolving Interests

ChainRec: 一个用于路由工具链的代理推荐学习系统,以应对多样化和演变的兴趣

Fuchun Li, Qian Li, Xingyu Gao, Bocheng Pan, Yang Wu, Jun Zhang, Huan Yu, Jie Jiang, Jinsheng Xiao, Hailong Shi

专题命中 指令微调 :large language model(abstract);language model(abstract);preference optimization(abstract)

AI总结 ChainRec通过动态选择推理工具的代理推荐系统,提升冷启动和兴趣演变场景下的推荐性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10404 2026-02-12 cs.LG cs.AI cs.CL 75%

Modular Multi-Task Learning for Chemical Reaction Prediction

模块化多任务学习用于化学反应预测

Jiayun Pang, Ahmed M. Zaitoun, Xacobe Couso Cambeiro, Ivan Vulić

机构 * University of Greenwich(格林威治大学) University of Cambridge(剑桥大学)

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出使用LoRA进行模块化多任务学习,以提高有机反应预测的准确性和泛化能力。

Comments 19 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.19844 2026-02-12 cs.CV 75%

ProAPO: Progressively Automatic Prompt Optimization for Visual Classification

ProAPO:逐步自动提示优化用于视觉分类

Xiangyan Qu, Gaopeng Gou, Jiamin Zhuang, Jing Yu, Kun Song, Qihao Wang, Yili Li, Gang Xiong

机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络安全学院) School of Information Engineering, Minzu University of China(民族大学信息工程学院) University of Science and Technology Beijing(北京科技大学)

专题命中 指令微调 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 ProAPO通过逐步自动优化提示,提升视觉分类性能,优于现有方法并在多个数据集上取得显著改进。

Comments Accepted to the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08439 2026-02-10 cs.CV 75%

Demo-ICL: In-Context Learning for Procedural Video Knowledge Acquisition

Demo-ICL: 用于过程视频知识获取的上下文学习

Yuhao Dong, Shulin Tian, Shuai Liu, Shuangrui Ding, Yuhang Zang, Xiaoyi Dong, Yuhang Cao, Jiaqi Wang, Ziwei Liu

机构 * S-Lab, Nanyang Technological University(南洋理工大学S实验室) Shanghai AI Lab(上海人工智能实验室) CUHK-MMLab(香港大学多媒体实验室)

专题命中 指令微调 :large language model(abstract);language model(abstract);preference optimization(abstract)

AI总结 Demo-ICL通过两阶段训练策略提升模型从上下文示例中学习的能力,针对视频理解中的新挑战提出Demo-ICL-Bench基准测试。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.14185 2026-02-10 cs.LG cs.AI cs.CL 75%

Safety Subspaces are Not Linearly Distinct: A Fine-Tuning Case Study

安全子空间并非线性区分:一项微调案例研究

Kaustubh Ponkshe, Shaan Shah, Raghav Singhal, Praneeth Vepakomma

机构 * Mohamed bin Zayed University of Artificial Intelligence(莫扎德·本·扎耶德人工智能大学) University of California San Diego(加州大学圣地亚哥分校) Massachusetts Institute of Technology(麻省理工学院)

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本研究通过微调案例发现,安全行为与通用学习组件高度交织,基于子空间的防御策略存在根本限制。

Comments ICLR 2026. Kaustubh Ponkshe, Shaan Shah, and Raghav Singhal contributed equally to this work

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04735 2026-02-05 cs.LG cs.AI cs.CL cs.CY cs.IR 75%

From Data to Behavior: Predicting Unintended Model Behaviors Before Training

从数据到行为:在训练前预测未预料的模型行为

Mengru Wang, Zhenqian Xu, Junfeng Fang, Yunzhi Yao, Shumin Deng, Huajun Chen, Ningyu Zhang

机构 * Zhejiang University(浙江大学) National University of Singapore(新加坡国立大学)

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出MDF方法,通过数据均值表示预测模型预训练阶段的潜在偏见和安全风险,实现高效检测。

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04089 2026-02-05 cs.AI cs.CL cs.LG 75%

Scaling In-Context Online Learning Capability of LLMs via Cross-Episode Meta-RL

通过跨回合元强化学习提升大语言模型的上下文在线学习能力

Xiaofeng Lin, Sirou Zhu, Yilei Chen, Mingyu Chen, Hejian Sang, Ioannis Paschalidis, Zhipeng Wang, Aldo Pacchiano, Xuezhou Zhang

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 ORBIT通过元强化学习框架提升LLMs在动态环境中的上下文在线学习能力,使开源模型在未见环境中性能超越传统RL微调。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.19207 2026-02-05 cs.CR 75%

Defending Against Prompt Injection with DataFilter

用DataFilter抵御提示注入

Yizhu Wang, Sizhe Chen, Raghad Alkhudair, Basel Alomair, David Wagner

专题命中 指令微调 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 DataFilter通过在数据到达LLM前移除恶意指令,有效防御提示注入攻击,同时保持模型的效用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.25801 2026-02-02 cs.LG cs.AI cs.CL cs.CV 75%

Metis-SPECS: Decoupling Multimodal Learning via Self-distilled Preference-based Cold Start

Metis-SPECS: 通过基于偏好自我蒸馏的冷启动解耦多模态学习

Kun Chen, Peng Shi, Haibo Qiu, Zhixiong Zeng, Siqi Yang, Wenji Mao, Lin Ma

机构 * School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) MAIS, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所MAIS) Meituan(美团)

专题命中 指令微调 :language model(abstract);SFT(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 Metis-SPECS通过基于偏好的自我蒸馏冷启动框架解耦多模态学习,提升泛化能力和下游RL表现。

Comments Published as a conference paper at ICLR 2026!

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18190 2026-01-27 cs.CV 75%

Multi-Perspective Subimage CLIP with Keyword Guidance for Remote Sensing Image-Text Retrieval

多视角子图像CLIP与关键词引导的遥感图像-文本检索

Yifan Li, Shiying Wang, Jianqiang Huang

机构 * School of Computer Technology and Applications(计算机技术与应用学院) Qinghai University(青海大学) Qinghai Provincial Laboratory for Intelligent Computing and Application(青海省智能计算与应用实验室)

专题命中 指令微调 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 MPS-CLIP通过关键词引导的多视角细粒度对齐提升遥感图像-文本检索性能,实现35.18%和48.40%的mR成绩。

Comments 7 pages, 3 figures. Code: https://github.com/Lcrucial1f/MPS-CLIP

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.11137 2026-01-23 cs.CR 75%

CoSPED: Consistent Soft Prompt Targeted Data Extraction and Defense

CoSPED:一致的软提示定向数据提取与防御

Zhuochen Yang, Kar Wai Fok, Vrizlynn L. L. Thing

专题命中 指令微调 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 CoSPED通过动态损失、加性损失等创新组件提升软提示调优一致性,实现高提取率并有效防御软提示攻击。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13682 2026-01-21 cs.SE cs.PL 75%

CodeContests-O: Powering LLMs via Feedback-Driven Iterative Test Case Generation

CodeContests-O: 通过反馈驱动的迭代测试用例生成增强大语言模型

Jianfeng Cai, Jinhua Zhu, Ruopei Sun, Kangwen Zhao, Dongyun Xue, Mingxiao Feng, Wengang Zhou, Houqiang Li

专题命中 指令微调 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 通过反馈驱动的迭代测试用例生成框架,提升大语言模型的验证质量,构建高质量的CodeContests-O数据集,显著提高模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13247 2026-01-21 cs.CL cs.AI cs.CV cs.LG cs.MM 75%

Aligning Agentic World Models via Knowledgeable Experience Learning

通过知识性经验学习对齐代理世界模型

Baochang Ren, Yunzhi Yao, Rui Sun, Shuofei Qiao, Ningyu Zhang, Huajun Chen

机构 * Zhejiang University(浙江大学) University of California, Los Angeles(加州大学洛杉矶分校)

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 WorldMind通过知识性经验学习对齐代理世界模型,解决物理模拟中的幻觉问题,实现跨环境的高效迁移。

Comments Ongoing work

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11398 2026-01-19 cs.CR 75%

Understanding Help Seeking for Digital Privacy, Safety, and Security

理解数字隐私、安全和安全性的求助行为

Kurt Thomas, Sai Teja Peddinti, Sarah Meiklejohn, Tara Matthews, Amelia Hassoun, Animesh Srivastava, Jessica McClearn, Patrick Gage Kelley, Sunny Consolvo, Nina Taft

专题命中 指令微调 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 研究通过分析Reddit帖子了解用户在数字隐私、安全和安全问题上的求助行为,并为开发更好的用户资源提供依据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09684 2026-01-15 cs.LG cs.AI cs.CL 75%

Disentangling Task Conflicts in Multi-Task LoRA via Orthogonal Gradient Projection

通过正交梯度投影解耦多任务LoRA中的任务冲突

Ziyu Yang, Guibin Chen, Yuxin Yang, Aoxiong Zeng, Xiangquan Yang

机构 * Shanghai University(上海大学) East China Normal University(东华大学)

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 Ortho-LoRA通过正交梯度投影方法有效缓解多任务LoRA中的任务冲突问题,提升模型性能并减少计算开销。

Comments preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.16913 2026-01-14 cs.SE 75%

FGIT: Fault-Guided Fine-Tuning for Code Generation

FGIT:基于故障的微调用于代码生成

Lishui Fan, Zhongxin Liu, Haoye Wang, Lingfeng Bao, Xin Xia, Shanping Li

专题命中 指令微调 :large language model(abstract);language model(abstract);SFT(abstract)

AI总结 FGIT通过提取正确与错误代码差异并动态加权提升代码生成准确性,实现性能提升。

Comments 13 pages, accepted by ASE 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.09681 2026-01-13 cs.IR cs.AI cs.CL cs.LG 75%

DB3 Team's Solution For Meta KDD Cup' 25

DB3团队的Meta KDD杯'25解决方案

Yikuan Xia, Jiazun Chen, Yirui Zhan, Suifeng Zhao, Weipeng Jiang, Chaorui Zhang, Wei Han, Bo Bai, Jun Gao

机构 * Key Laboratory of High Confidence Software Technologies, CS, Peking University, China(高可信软件技术重点实验室,中国科学院,北京大学) Theory Lab, Central Research Institute, 2012 Labs, Huawei Technologies Co., Ltd, Shenzhen, China(理论实验室,中央研究院,2012实验室,华为技术有限公司,深圳)

专题命中 指令微调 :LLM(abstract);SFT(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 DB3团队通过多模态检索框架和拒绝训练方法,在KDD杯'25的CRAG-MM挑战中取得优异成绩,尤其在处理第一人称视角问题上表现突出。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03277 2026-01-08 q-bio.OT cs.AI cs.CL cs.LG 75%

MixRx: Predicting Drug Combination Interactions with LLMs

MixRx:利用大语言模型预测药物组合相互作用

Risha Surana, Cameron Saidock, Hugo Chacon

机构 * University of Southern California(南加州大学)

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 MixRx利用大语言模型预测药物组合相互作用,通过微调模型在标准和扰动数据集上达到81.5%的准确率,探索LLMs在生物预测任务中的应用潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01915 2026-01-06 cs.CV 75%

TalkPhoto: A Versatile Training-Free Conversational Assistant for Intelligent Image Editing

TalkPhoto: 一种多功能的无需训练的对话式智能图像编辑助手

Yujie Hu, Zecheng Tang, Xu Jiang, Weiqi Li, Jian Zhang

机构 * School of Electronic and Computer Engineering, Peking University(电子与计算机工程学院,北京大学)

专题命中 指令微调 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 TalkPhoto通过对话交互实现无需训练的多功能图像编辑,利用提示模板分层调用现有高级编辑方法,提升编辑精度与质量。

Comments a Conversational Assistant for Intelligent Image Editing

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01184 2026-01-06 cs.CR 75%

SecureCodeRL: Security-Aware Reinforcement Learning for Code Generation with Partial-Credit Rewards

SecureCodeRL: 为代码生成的具有安全意识的强化学习

Suryansh Singh Sijwali, Suman Saha

专题命中 指令微调 :large language model(abstract);language model(abstract);SFT(abstract)

AI总结 SecureCodeRL通过部分信用奖励提升代码生成的语法正确性和安全性,实现更高的测试通过率和更清洁的代码输出。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23457 2025-12-30 cs.AI cs.CL cs.LG 75%

Replay Failures as Successes: Sample-Efficient Reinforcement Learning for Instruction Following

重播失败作为成功:用于指令跟随的样本高效强化学习

Kongcheng Zhang, Qi Yao, Shunyu Liu, Wenjian Zhang, Min Cen, Yang Zhou, Wenkai Fang, Yiru Zhao, Baisheng Lai, Mingli Song

机构 * Zhejiang University(浙江大学) Nanyang Technological University(南洋理工大学) Dalian University of Technology(大连理工大学) University of Science and Technology of China(中国科学技术大学) Alibaba Cloud Computing(阿里云计算) Chinese Academy of Sciences(中国科学院)

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 HiR 提出了一种样本高效强化学习框架,通过将失败尝试视为成功来提升指令跟随任务的性能,利用双偏好学习实现高效优化。

详情

展开后加载摘要…

URL PDF HTML 收藏