PITA: Preference-Guided Inference-Time Alignment for LLM Post-Training
机构 * Texas A&M University(德克萨斯A&M大学) ; Inria(法国国家信息与自动化研究所)
专题命中 偏好对齐 :alignment(title,abstract);分类 cs.CL、cs.AI、cs.LG
AI 大模型
大模型对齐、安全、越狱、红队、提示注入和可信评测。
机构 * Texas A&M University(德克萨斯A&M大学) ; Inria(法国国家信息与自动化研究所)
专题命中 偏好对齐 :alignment(title,abstract);分类 cs.CL、cs.AI、cs.LG
机构 * Toyota Technological Institute at Chicago(丰田技术研究所(芝加哥)) ; IBM(IBM公司)
专题命中 偏好对齐 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG
Comments Appears in AAAI 2026 in the Main Technical Track
机构 * Duke University(杜克大学) ; Carnegie Mellon University(卡内基梅隆大学)
专题命中 偏好对齐 :alignment(abstract,comments);分类 cs.AI、cs.CY
Comments To appear in the AAAI 2026 Alignment Track
机构 * University of Melbourne(墨尔本大学)
专题命中 偏好对齐 :alignment(abstract)
机构 * Jagiellonian University(杰尔乔夫大学) ; University of Oxford(牛津大学)
专题命中 安全训练 :safety(abstract);分类 cs.CL、cs.AI、cs.LG
机构 * Automatic Control Laboratory (IfA)(自动控制实验室)
专题命中 安全训练 :safety(abstract)
专题命中 安全训练 :red teaming(abstract)
机构 * Ant Group(蚂蚁集团) ; Nanyang Technological University(南洋理工大学)
专题命中 越狱攻击 :alignment(title,abstract);safety(title,abstract);分类 cs.CL
Comments Accepted by IEEE Symposium on Security and Privacy (S&P) 2026
机构 * Department of Computing The Hong Kong Polytechnic University Hong Kong SAR, China ; Centre for Artificial Intelligence ; Robotics Hong Kong Institute of Science \& Innovation Chinese Academy of Sciences Hong Kong SAR, China
专题命中 越狱攻击 :jailbreak(title,abstract);DPO(abstract);safety(abstract);分类 cs.CL、cs.AI
Comments Accepted at ACSAC 2025
机构 * Amazon Bedrock Science(亚马逊Bedrock科学) ; Drexel University(德雷塞尔大学) ; University of Virginia(弗吉尼亚大学)
专题命中 越狱攻击 :jailbreak(title,abstract);safety(abstract,comments);分类 cs.CL、cs.AI
Comments 14 pages, 5 figures; published in EMNLP 2025 ; Code at: https://github.com/dsbuddy/GAP-LLM-Safety
机构 * Independent Researcher(独立研究者)
专题命中 越狱攻击 :jailbreak(title,abstract);safety(abstract);分类 cs.CL、cs.AI
机构 * Department of Mechanical Engineering National University of Singapore(机械工程系国立新加坡大学)
专题命中 越狱攻击 :safety(abstract);分类 cs.AI、cs.LG
专题命中 幻觉与事实性 :alignment(abstract)
机构 * Emory University(埃默里大学) ; University of California, Los Angeles(加州大学洛杉矶分校) ; University of Wisconsin–Madison(威斯康星大学麦迪逊分校)
专题命中 隐私与版权 :alignment(abstract);分类 cs.AI、cs.LG
专题命中 隐私与版权 :alignment(abstract);分类 cs.CL
Comments This paper has been accepted for publication at AAAI-26
机构 * Department of Computer Science, National Center for Text Mining, The University of Manchester(计算机科学系,文本挖掘国家中心,曼彻斯特大学) ; Department of Computer Science and Engineering, Islamic University of Technology(计算机科学与工程系,伊斯兰技术大学)
专题命中 安全评测 :alignment(title,abstract);分类 cs.CL、cs.AI、cs.CY
Comments Accepted at EMNLP 2025 (Main)
Journal ref Proceedings of the 2025 Conference on Empirical Methods in Natural Language Processing
专题命中 安全评测 :alignment(title,abstract);分类 cs.AI
专题命中 安全评测 :alignment(title,abstract);分类 cs.CL
机构 * School of Geospatial Engineering and Science, Sun Yat-sen University(地理空间工程与科学学院,中山大学) ; School of Geographical and Earth Sciences, University of Glasgow(地理与地球科学学院,格拉斯哥大学) ; School of Economics and Management, Shanxi University(经济学与管理学院,山西大学)
专题命中 安全评测 :safety(title,abstract);分类 cs.LG
Comments 11 pages, 10 figures, The 8th ACM SIGSPATIAL International Workshop on AI for Geographic Knowledge Discovery (GeoAI '25), November 3--6, 2025, Minneapolis, MN, USA
专题命中 安全评测 :trustworthy(title);分类 cs.LG
Comments 14 pages, 4 figures, 4 tables
机构 * Fraunhofer IAIS - Department of Media Engineering(弗劳恩霍夫人工智能研究所-媒体工程部门) ; University of Bonn - Department of Computer Science(波恩大学-计算机科学系) ; Lamarr Institute for Machine Learning(拉马尔人工智能与机器学习研究所)
专题命中 安全评测 :trustworthy(abstract);分类 cs.CL、cs.AI
Comments Accepted in IEEE BigData 2025
机构 * SATIE - CNRS UMR 8029 Paris-Saclay University, France(巴黎-萨克雷大学)
专题命中 安全评测 :safety(abstract);分类 cs.AI
Comments Paper accepted at WACV 2026
专题命中 安全评测 :trustworthy(abstract);分类 cs.LG
专题命中 安全评测 :alignment(abstract);分类 cs.CL
专题命中 安全评测 :safety(abstract);分类 cs.AI
Comments 12 pages, 3 figures, 3 tables
专题命中 安全评测 :alignment(abstract);分类 cs.AI
Comments 7 figures, 3 tables
机构 * YUX Design(YUX设计)
专题命中 AI治理与伦理 :alignment(title,abstract);分类 cs.AI、cs.CY
Comments 19 pages, 3 figures, 3 tables
专题命中 AI治理与伦理 :alignment(abstract);safety(abstract);trustworthy(abstract);分类 cs.CL、cs.AI、cs.LG
专题命中 AI治理与伦理 :safety(abstract);trustworthy(abstract);分类 cs.CL、cs.AI
机构 * National Key Laboratory for Novel Software Technology(新型软件技术国家重点实验室) ; Nanjing University(南京大学)
专题命中 其他安全 :alignment(title,abstract);分类 cs.CL、cs.AI
Comments Pre-MIT Press publication version