Reinforcement Learning via Conservative Agent for Environments with Random Delays
通过保守代理进行具有随机延迟的环境强化学习
Jongsoo Lee, Jangwon Kim, Jiseok Jeong, Soohee Han
机构
*
Department of Convergence IT Engineering, Pohang University of Science and Technology(融合信息技术工程系,POSTECH)
;
Department of Electrical Engineering, Pohang University of Science and Technology(电气工程系,POSTECH)
机构
*
Birbhum Institute of Engineering and Technology(比尔布尔工程科技学院)
;
Universiti Malaya(马来亚大学)
;
City University of Hong Kong(香港城市大学)
;
Wake Forest University(威克森林大学)
Learning Markov Decision Processes under Fully Bandit Feedback
在完全老虎机反馈下学习马尔可夫决策过程
Zhengjia Zhuo, Anupam Gupta, Viswanath Nagarajan
机构
*
Department of Industrial and Operations Engineering, University of Michigan(工业与运作工程系,密歇根大学)
;
Computer Science Department, New York University(计算机科学系,纽约大学)
机构
*
UCAS-Terminus AI Lab, University of Chinese Academy of Sciences(中国科学院大学Terminus AI实验室,中国科学院大学)
;
Centre for Artificial Intelligence and Robotics, HKISI-CAS(人工智能与机器人中心,中国科学院香港研究院)
;
School of Computer Science and Engineering, Nanjing University of Science and Technology(南京理工大学计算机科学与工程学院)
How Implicit Bias Accumulates and Propagates in LLM Long-term Memory
隐性偏见如何在LLM长期记忆中积累和传播
Yiming Ma, Lixu Wang, Lionel Z. Wang, Hongkun Yang, Haoming Sun, Xin Xu, Jiaqi Wu, Bin Chen, Wei Dong
机构
*
International Research Center for Artificial Intelligence, Harbin Institute of Technology (Shenzhen), Shenzhen, China
;
Chongqing Research Institute of Harbin Institute of Technology, Chongqing, China
;
College of Computing
;
Data Science, Nanyang Technological University, Singapore
;
Department of Management
;
Marketing, The Hong Kong Polytechnic University, Hong Kong
;
Haide College, Ocean University of China, Qingdao, China
;
School of Computer Science, The University of Sheffield, Sheffield, UK
;
Department of Automation, Tsinghua University, Beijing, China
专题命中
记忆与上下文管理
:agentic(abstract);分类 cs.LG
AI总结
本文研究了LLM长期记忆中隐性偏见的积累与传播,提出动态内存标记方法以缓解偏见问题。
CommentsUnder review, and the first two authors contribute equally
Can Transformer Memory Be Corrupted? Investigating Cache-Side Vulnerabilities in Large Language Models
Transformer记忆能否被破坏?调查大型语言模型中的缓存侧漏洞
Elias Hossain, Swayamjit Saha, Somshubhra Roy, Ravi Prasad
机构
*
College of Engineering and Computer Science, University of Central Florida(中央佛罗里达大学工程与计算机科学学院)
;
Department of Computer Science and Engineering, Mississippi State University(密苏里州立大学计算机科学与工程系)
;
Department of Electrical and Computer Engineering, North Carolina State University(北卡罗来纳州立大学电子与计算机工程系)
APEX: A Decoupled Memory-based Explorer for Asynchronous Aerial Object Goal Navigation
APEX:一种解耦的记忆型探索者用于异步空中目标导航
Daoxuan Zhang, Ping Chen, Xiaobo Xia, Xiu Su, Ruichen Zhen, Jianqiang Xiao, Shuo Yang
机构
*
Harbin Institute of Technology(哈尔滨工业大学)
;
National University of Singapore(新加坡国立大学)
;
Central South University(中南大学)
;
Meituan Academy of Robotics(美团机器人研究院)