机构
*
MBZUAI
;
The University of Tokyo(东京大学)
;
University of Mons(蒙斯大学)
;
Tohoku University(东北大学)
;
RIKEN(日本理化学研究所)
;
The University of Melbourne(墨尔本大学)
专题命中
知识编辑与模型理解
:language model(title,abstract);large language model(title);分类 cs.CL
CommentsThis is a pre-MIT Press publication version of the paper
Exploring Multilingual Concepts of Human Value in Large Language Models: Is Value Alignment Consistent, Transferable and Controllable across Languages?
Perturbation-based Regional Interpretability through Subtraction Mapping (PRISM): naming-error dissociations in language models and post-stroke aphasia
基于减法映射的扰动型区域可解释性方法(PRISM):语言模型与卒中后失语症中的命名错误分离现象
Xiang Guan, Roger D. Newman-Norlund, Yong Yang, Saeed Ahmadi, Regan Willis, Nadra Salman, Kalil Warren, Srihari Nelakuditi, Chris Rorden, Leonardo Bonilha, Julius Fridriksson
机构
*
University of South Carolina(南卡罗来纳大学)
;
ALLT.AI, LLC(ALLT.AI有限责任公司)
;
USC School of Medicine(南卡罗来纳大学医学院)
专题命中
知识编辑与模型理解
:language model(title,abstract);LLM(abstract);large language model(abstract);分类 cs.CL、cs.LG
CommentsAppendix and link to Code repo provided; this version also contains a refined Discussion section and a small error regarding Table 1 was corrected
Towards Mitigation of Hallucination for LLM-empowered Agents: Progressive Generalization Bound Exploration and Watchdog Monitor
迈向减轻基于大语言模型的智能体幻觉:渐进泛化边界探索与看门狗监测
Siyuan Liu, Wenjing Liu, Zhiwei Xu, Xin Wang, Bo Chen, Tao Li
机构
*
College of Computer Science, Nankai University(南开大学计算机科学学院)
;
Haihe Lab of ITAI College of intelligent Science and Technology, Inner Mongolia University of Technology(内蒙古工业大学智能科学与技术学院海河实验室)
;
Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所)
;
Department of Electrical and Computer Engineering, Stony Brook University(石溪大学电气与计算机工程系)
;
Department of Computer Science, Michigan Technological University(密歇根技术大学计算机科学系)
专题命中
知识编辑与模型理解
:LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG
Societal Alignment Frameworks Can Improve LLM Alignment
社会对齐框架可以改进大语言模型对齐
Karolina Stańczak, Nicholas Meade, Mehar Bhatia, Hattie Zhou, Konstantin Böttinger, Jeremy Barnes, Jason Stanley, Jessica Montgomery, Richard Zemel, Nicolas Papernot, Nicolas Chapados, Denis Therien, Timothy P. Lillicrap, Ana Marasović, Sylvie Delacroix, Gillian K. Hadfield, Siva Reddy
机构
*
ETH Zurich(苏黎世联邦理工学院)
;
Mila, McGill University(麦吉尔大学米尔人工智能实验室)
;
University of Cambridge(剑桥大学)
;
Columbia University(哥伦比亚大学)
;
University of Toronto, Google DeepMind(多伦多大学与DeepMind)
;
McGill University, ServiceNow(麦吉尔大学与ServiceNow)
;
Google DeepMind(谷歌DeepMind)
;
University of Utah(犹他大学)
;
King's College London(伦敦国王学院)
;
Johns Hopkins University(约翰霍普金斯大学)
;
Mila, McGill University, ServiceNow(麦吉尔大学米尔人工智能实验室与ServiceNow)
专题命中
知识编辑与模型理解
:LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
A Monosemantic Attribution Framework for Stable Interpretability in Clinical Neuroscience Transformer-Based Language Models
面向临床神经科学中基于Transformer的语言模型的稳定可解释性的单语义归因框架
Michail Mamalakis, Tiago Azevedo, Cristian Cosentino, Chiara D'Ercoli, Subati Abulikemu, Zhongtian Sun, Richard Bethlehem, Pietro Lio
机构
*
Department of Computer Science and Technology(计算机科学与技术系)
;
Cancer Research UK(癌症研究英国公司)
;
Cambridge Institute(剑桥研究所)
;
University of Cambridge(剑桥大学)
;
United Kingdom(英国)
;
DIMES(迪梅斯)
;
University of Calabria(卡拉布里亚大学)
;
Italy(意大利)
;
Department of Computer Automatic and Management Engineering (DIAG)(计算机自动与管理工程系)
;
Sapienza Università di Roma(罗马大学萨皮恩扎)
;
Department of Psychiatry(精神病学系)
;
School of Computing(计算学院)
;
University of Kent(肯特大学)
;
Department of Psychology(心理学系)
Jailbreaking Vision-Language Models Through the Visual Modality
通过视觉模态 jailbreak 视觉-语言模型
Aharon Azulay, Jan Dubiński, Zhuoyun Li, Atharv Mittal, Yossi Gandelsman
机构
*
Warsaw University of Technology(华沙理工大学)
;
NASK National Research Institute(波兰国家研究研究院)
;
University of Liverpool(利物浦大学)
;
Indian Institute of Technology Roorkee(印度理工学院拉胡尔分校)
;
Toyota Technological Institute at Chicago(芝加哥丰田技术研究所)
机构
*
Microsoft Security Response Center(微软安全响应中心)
;
AIDOS Lab, University of Fribourg(弗里堡大学AIDOS实验室)
;
Department of Mathematics, Imperial College London(伦敦帝国理工学院数学系)
;
Queen Mary University of London(伦敦大学量子玛丽学院)
;
Imperial College London(伦敦帝国理工学院)
;
Language Technology Lab, University of Cambridge(剑桥大学语言技术实验室)
;
The Alan Turing Institute(艾伦·图灵研究所)
专题命中
知识编辑与模型理解
:LLM(title,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG
机构
*
University of Science
;
United Arab Emirates University
;
Nanyang Technological University
;
Zayed University
;
Intelligent Science \& Technology Academy of CASIC
专题命中
知识编辑与模型理解
:language model(title,abstract);LLM(abstract);large language model(abstract);分类 cs.AI、cs.LG