Can Finetuing LLMs on Small Human Samples Increase Heterogeneity, Alignment, and Belief-Action Coherence?
能否通过在小样本人类数据上微调LLM增加异质性、对齐性和信念-行为一致性?
Steven Wang, Kyle Hunt, Shaojie Tang, Kenneth Joseph
机构
*
Department of Management Science and Systems, University at Buffalo(管理科学与系统系,布法罗大学)
;
Department of Computer Science and Engineering, University at Buffalo(计算机科学与工程系,布法罗大学)
专题命中
指令微调
:LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL
Replay Failures as Successes: Sample-Efficient Reinforcement Learning for Instruction Following
重播失败作为成功:用于指令跟随的样本高效强化学习
Kongcheng Zhang, Qi Yao, Shunyu Liu, Wenjian Zhang, Min Cen, Yang Zhou, Wenkai Fang, Yiru Zhao, Baisheng Lai, Mingli Song
机构
*
Zhejiang University(浙江大学)
;
Nanyang Technological University(南洋理工大学)
;
Dalian University of Technology(大连理工大学)
;
University of Science and Technology of China(中国科学技术大学)
;
Alibaba Cloud Computing(阿里云计算)
;
Chinese Academy of Sciences(中国科学院)
专题命中
指令微调
:large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结
HiR 提出了一种样本高效强化学习框架,通过将失败尝试视为成功来提升指令跟随任务的性能,利用双偏好学习实现高效优化。
Verifiable Fine-Tuning for LLMs: Zero-Knowledge Training Proofs Bound to Data Provenance and Policy
可验证的大型语言模型微调:零知识训练证明与数据来源和政策绑定
Hasan Akgul, Daniel Borg, Arta Berisha, Amina Rahimova, Andrej Novak, Mila Petrov
机构
*
1 Department of Computer Engineering, Istanbul Technical University (ITU), 34469 Istanbul, Turkey Email
;
2 Department of Computer Science, University of Malta, MSD 2080 Msida, Malta Email
;
3 Faculty of Electrical \& Computer Engineering, University of Prishtina ``Hasan Prishtina'', 10000 Prishtina, Kosovo Email
;
4 School of IT \& Engineering, ADA University, AZ1008 Baku, Azerbaijan Email
;
5 Faculty of Mathematics, Natural Sciences
;
Information Technologies (FAMNIT), University of Primorska, 6000 Koper, Slovenia Email
;
6 Faculty of Computer Science \& Engineering (FINKI), Ss.\ Cyril
;
Methodius University in Skopje, 1000 Skopje, North Macedonia Email
专题命中
指令微调
:large language model(abstract);language model(abstract);分类 cs.CL
机构
*
School of Intelligent Engineering, Sun Yat-sen University, China(中山大学智能工程学院)
;
School of Computer Science and Technology, Hainan University, China(海南大学计算机科学与技术学院)
C2PO: Diagnosing and Disentangling Bias Shortcuts in LLMs
C2PO:诊断和解构大语言模型中的偏见捷径
Xuan Feng, Bo An, Tianlong Gu, Liang Chang, Fengrui Hao, Peipeng Yu, Shuai Zhao
机构
*
Jinan University(济南大学)
;
Nanyang Technological University(南洋理工大学)
;
Engineering Research Center of Trustworthy AI (Ministry of Education)(可信人工智能工程研究中心)
;
Guangxi Key Laboratory of Trusted Software(广西可信软件重点实验室)
专题命中
后训练与偏好优化
:large language model(abstract);language model(abstract);preference optimization(abstract);分类 cs.CL
Think, Act, Learn: A Framework for Autonomous Robotic Agents using Closed-Loop Large Language Models
思考、行动、学习:一种利用闭环大语言模型的自主机器人代理框架
Anjali R. Menon, Rohit K. Sharma, Priya Singh, Chengyu Wang, Aurora M. Ferreira, Mateja Novak
机构
*
Dept. of Electronics & Comm. Eng.(电子与通信工程系)
;
Government Engineering College(政府工程学院)
;
Dept. of Electrical & Electronics Eng.(电气与电子工程系)
;
Poornima College of Engineering(波奥尼玛工程学院)
;
Dept. of Electronics & Telecom. Eng.(电子与电信工程系)
;
Shivaji University College of Eng.(希瓦吉大学工程学院)
;
Department of Computer Science(计算机科学系)
;
San Francisco State University(旧金山州立大学)
;
Dept. of Electrical Eng.(电气工程系)
;
Instituto Federal do Maranhão(马里兰联邦学院)
;
Dept. of Electrical & Computer Eng.(电气与计算机工程系)
;
Technical University of Košice(科希丘夫技术大学)
专题命中
长上下文与记忆
:large language model(title,abstract);language model(title,abstract);LLM(abstract)
Lessons from Neuroscience for AI: How integrating Actions, Compositional Structure and Episodic Memory could enable Safe, Interpretable and Human-Like AI
从神经科学中汲取教训:如何通过整合动作、组合结构和事件记忆来实现安全、可解释和类人的人工智能
Rajesh P. N. Rao, Vishwas Sathish, Linxing Preston Jiang, Matthew Bryan, Prashant Rangarajan
专题命中
长上下文与记忆
:large language model(abstract);language model(abstract);foundation model(abstract);分类 cs.AI