arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2025-09-29 至 2025-09-29 共收录 52 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 偏好对齐 11 篇

2502.00666 2025-09-29 cs.LG cs.AI stat.ML 84%

Avoiding $\mathbf{exp(R_{max})}$ scaling in RLHF through Preference-based Exploration

Mingyu Chen, Yiding Chen, Wen Sun, Xuezhou Zhang

机构 * Department of Electrical & Computer Engineering(电气与计算机工程系) Boston University(波士顿大学) Department of Computer Science(计算机科学系) Cornell University(康奈尔大学) Faculty of Computing & Data Sciences(计算与数据科学学院)

专题命中 偏好对齐 :RLHF(title,abstract);alignment(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21528 2025-09-29 cs.LG cs.AI 79%

Preemptive Detection and Steering of LLM Misalignment via Latent Reachability

Sathwik Karnik, Somil Bansal

机构 * Safe and Intelligent Autonomy Lab, Stanford University(斯坦福大学安全与智能自主实验室)

专题命中 偏好对齐 :alignment(abstract);RLHF(abstract);safety(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21351 2025-09-29 cs.CV cs.AI cs.CL 73%

Random Direct Preference Optimization for Radiography Report Generation

Valentin Samokhin, Boris Shirokikh, Mikhail Goncharov, Dmitriy Umerenkov, Maksim Bobrin, Ivan Oseledets, Dmitry Dylov, Mikhail Belyaev

机构 * Artificial Intelligence Research Institute (AIRI)(人工智能研究院) Skolkovo Institute of Science and Technology(斯克罗夫学院) Institute for Information Transmission Problems(信息传输问题研究所)

专题命中 偏好对齐 :alignment(abstract);DPO(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22633 2025-09-29 stat.ML cs.AI cs.CL cs.LG math.ST stat.TH 67%

Towards Efficient Online Exploration for Reinforcement Learning with Human Feedback

Gen Li, Yuling Yan

机构 * Department of Statistics and Data Science, The Chinese University of Hong Kong(统计与数据科学系,香港中文大学) Department of Statistics, University of Wisconsin-Madison(统计系,威斯康星大学麦迪逊分校)

专题命中 偏好对齐 :RLHF(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22281 2025-09-29 cs.CV cs.RO 67%

MesaTask: Towards Task-Driven Tabletop Scene Generation via 3D Spatial Reasoning

Jinkun Hao, Naifu Liang, Zhen Luo, Xudong Xu, Weipeng Zhong, Ran Yi, Yichen Jin, Zhaoyang Lyu, Feng Zheng, Lizhuang Ma, Jiangmiao Pang

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai AI Laboratory(上海人工智能实验室) SII Southern University of Science and Technology(南方科技大学) Peking University(北京大学)

专题命中 偏好对齐 :alignment(abstract);DPO(abstract)

Comments Accepted by NeurIPS 2025; Project page: https://mesatask.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.12716 2025-09-29 cs.CL cs.AI 62%

Shadow-FT: Tuning Instruct Model via Training on Paired Base Model

Taiqiang Wu, Runming Yang, Jiayi Li, Pengfei Hu, Yik-Chung Wu, Ngai Wong, Yujiu Yang

机构 * The University of Hong Kong(香港大学) Tsinghua University(清华大学) Tencent(腾讯)

专题命中 偏好对齐 :DPO(abstract);分类 cs.CL、cs.AI

Comments 24 pages, 12 tables, 8 figures. Previous name: Shadow-FT: Tuning Instruct via Base

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.07780 2025-09-29 cs.LG cs.CL 62%

A Critical Look At Tokenwise Reward-Guided Text Generation

Ahmad Rashid, Ruotian Wu, Julia Grosse, Agustinus Kristiadi, Pascal Poupart

机构 * University of Waterloo(滑铁卢大学) Vector Institute(向量研究所) University of Tübingen(图宾根大学) Tübingen AI Center(图宾根人工智能中心) Western University(西方大学)

专题命中 偏好对齐 :RLHF(abstract);分类 cs.CL、cs.LG

Comments Work accepted at COLM 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22624 2025-09-29 cs.CV cs.LG 57%

SPARK: Synergistic Policy And Reward Co-Evolving Framework

Ziyu Liu, Yuhang Zang, Shengyuan Ding, Yuhang Cao, Xiaoyi Dong, Haodong Duan, Dahua Lin, Jiaqi Wang

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Fudan University(复旦大学) The Chinese University of Hong Kong(香港中文大学) Shanghai Innovation Institute(上海创新研究院)

专题命中 偏好对齐 :RLHF(abstract);分类 cs.LG

Comments Project:https://github.com/InternLM/Spark

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22325 2025-09-29 cs.IR cs.CL 57%

Can Synthetic Query Rewrites Capture User Intent Better than Humans in Retrieval-Augmented Generation?

JiaYing Zheng, HaiNan Zhang, Liang Pang, YongXin Tong, ZhiMing Zheng

专题命中 偏好对齐 :DPO(abstract);分类 cs.CL

Comments 10 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.15220 2025-09-29 cs.CV cs.CL cs.SD 57%

video-SALMONN 2: Caption-Enhanced Audio-Visual Large Language Models

Changli Tang, Yixuan Li, Yudong Yang, Jimin Zhuang, Guangzhi Sun, Wei Li, Zejun Ma, Chao Zhang

机构 * Tsinghua University(清华大学) University of Cambridge(剑桥大学) ByteDance(字节跳动)

专题命中 偏好对齐 :DPO(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.20725 2025-09-29 cs.GR cs.CV 50%

SeamCrafter: Enhancing Mesh Seam Generation for Artist UV Unwrapping via Reinforcement Learning

Duoteng Xu, Yuguang Chen, Jing Li, Xinhai Liu, Xueqi Ma, Zhuo Chen, Dongyu Zhang, Chunchao Guo

机构 * Tencent Hunyuan(腾讯文英) SYSU(南方科技大学) SZU(深圳大学) USTC(中国科学技术大学)

专题命中 偏好对齐 :DPO(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 安全训练 4 篇

2509.22250 2025-09-29 cs.CL cs.AI 84%

Safety Compliance: Rethinking LLM Safety Reasoning through the Lens of Compliance

Wenbin Hu, Huihao Jing, Haochen Shi, Haoran Li, Yangqiu Song

机构 * Hong Kong University of Science and Technology(香港理工大学)

专题命中 安全训练 :safety(title,abstract);AI safety(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.15241 2025-09-29 cs.CL 79%

MrGuard: A Multilingual Reasoning Guardrail for Universal LLM Safety

Yahan Yang, Soham Dan, Shuo Li, Dan Roth, Insup Lee

机构 * University of Pennsylvania(宾夕法尼亚大学) Microsoft(微软公司) Oracle AI

专题命中 安全训练 :safety(title,abstract);分类 cs.CL

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.11020 2025-09-29 cs.CL cs.AI 62%

Improving the Language Understanding Capabilities of Large Language Models Using Reinforcement Learning

Bokai Hu, Sai Ashish Somayajula, Xin Pan, Pengtao Xie

机构 * UC San Diego(加州大学圣地亚哥分校)

专题命中 安全训练 :alignment(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.19301 2025-09-29 cs.RO cs.LG 57%

Residual Off-Policy RL for Finetuning Behavior Cloning Policies

Lars Ankile, Zhenyu Jiang, Rocky Duan, Guanya Shi, Pieter Abbeel, Anusha Nagabandi

机构 * Amazon FAR (Frontier AI & Robotics)(亚马逊前沿人工智能与机器人实验室) Stanford University(斯坦福大学) Carnegie Mellon University(卡内基梅隆大学) UC Berkeley(加州大学伯克利分校)

专题命中 安全训练 :safety(abstract);分类 cs.LG

Comments Project website: https://residual-offpolicy-rl.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 越狱攻击 2 篇

2509.21360 2025-09-29 cs.CV cs.AI 83%

Multimodal Prompt Decoupling Attack on the Safety Filters in Text-to-Image Models

Xingkai Peng, Jun Jiang, Meng Tong, Shuai Li, Weiming Zhang, Nenghai Yu, Kejiang Chen

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 越狱攻击 :safety(title,abstract);jailbreak(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21400 2025-09-29 cs.CR 82%

SafeSteer: Adaptive Subspace Steering for Efficient Jailbreak Defense in Vision-Language Models

Xiyu Zeng, Siyuan Liang, Liming Lu, Haotian Zhu, Enguang Liu, Jisheng Dang, Yongbin Zhou, Shuchao Pang

专题命中 越狱攻击 :jailbreak(title,abstract);safety(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 提示注入 1 篇

2509.21367 2025-09-29 cs.CR cs.AI 83%

Design and Implementation of a Secure RAG-Enhanced AI Chatbot for Smart Tourism Customer Service: Defending Against Prompt Injection Attacks -- A Case Study of Hsinchu, Taiwan

Yu-Kai Shih, You-Kai Kang

机构 * Department of Information Management, National Dong Hwa University(信息管理系,国立东华大学) By The Student (BTS) Experimental Education Program (Non-School Type)(学生(BTS)实验教育计划(非学校类型))

专题命中 提示注入 :prompt injection(title,abstract);trustworthy(abstract);分类 cs.AI

Comments 12 pages, 7 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 幻觉与事实性 4 篇

2509.22251 2025-09-29 cs.CL cs.AI 76%

Beyond Textual Context: Structural Graph Encoding with Adaptive Space Alignment to alleviate the hallucination of LLMs

Yifang Zhang, Pengfei Duan, Yiwen Yang, Shengwu Xiong

机构 * Wuhan University of Technology(武汉理工大学)

专题命中 幻觉与事实性 :alignment(title);分类 cs.CL、cs.AI

Comments 11 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.19517 2025-09-29 cs.AI cs.CL cs.LG 67%

Cognitive Load Limits in Large Language Models: Benchmarking Multi-Hop Reasoning

Sai Teja Reddy Adapala

机构 * University of North Carolina at Charlotte(北卡罗来纳大学夏洛特分校)

专题命中 幻觉与事实性 :safety(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21593 2025-09-29 cs.AI physics.soc-ph 57%

GeoEvolve: Automating Geospatial Model Discovery via Multi-Agent Large Language Models

Peng Luo, Xiayin Lou, Yu Zheng, Zhuo Zheng, Stefano Ermon

机构 * Massachusetts Institute of Technology(麻省理工学院) Technical University of Munich(慕尼黑技术大学) Stanford University(斯坦福大学)

专题命中 幻觉与事实性 :trustworthy(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21336 2025-09-29 cs.IR cs.CL 57%

HetaRAG: Hybrid Deep Retrieval-Augmented Generation across Heterogeneous Data Stores

Guohang Yan, Yue Zhang, Pinlong Cai, Ding Wang, Song Mao, Hongwei Zhang, Yaoze Zhang, Hairong Zhang, Xinyu Cai, Botian Shi

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 幻觉与事实性 :trustworthy(abstract);分类 cs.CL

Comments 15 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 隐私与版权 3 篇

2509.21695 2025-09-29 cs.LG 74%

Wav2Arrest 2.0: Long-Horizon Cardiac Arrest Prediction with Time-to-Event Modeling, Identity-Invariance, and Pseudo-Lab Alignment

Saurabh Kataria, Davood Fattahi, Minxiao Wang, Ran Xiao, Matthew Clark, Timothy Ruchti, Mark Mai, Xiao Hu

机构 * Nell Hodgson Woodruff School of Nursing, Emory University(埃默里大学护理学院) Department of Pediatrics, Emory School of Medicine(埃默里医学院儿科部)

专题命中 隐私与版权 :alignment(title);分类 cs.LG

Comments Submitted to BPSC

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.00276 2025-09-29 cs.LG cs.AI cs.CE physics.data-an 62%

Machine Learning-Assisted Sustainable Remanufacturing, Reusing and Recycling for Lithium-ion Batteries

Shengyu Tao

专题命中 隐私与版权 :alignment(abstract);分类 cs.AI、cs.LG

Comments This is a PhD thesis from Dr. Shengyu Tao at Tinsghua University and University of California at Berkeley

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21712 2025-09-29 cs.CR cs.AI 57%

Not My Agent, Not My Boundary? Elicitation of Personal Privacy Boundaries in AI-Delegated Information Sharing

Bingcan Guo, Eryue Xu, Zhiping Zhang, Tianshi Li

机构 * Department of Human Centered Design & Engineering, University of Washington(华盛顿大学人中心设计与工程系) School of Information Sciences, University of Illinois(伊利诺伊大学香槟分校信息科学学院) Khoury College of Computer Sciences, Northeastern University(东北大学计算机科学学院)

专题命中 隐私与版权 :alignment(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏

7. 安全评测 15 篇

2509.10655 2025-09-29 cs.CR cs.CY 83%

Safety and Security Analysis of Large Language Models: Benchmarking Risk Profile and Harm Potential

Charankumar Akiri, Harrison Simpson, Kshitiz Aryal, Aarav Khanna, Maanak Gupta

专题命中 安全评测 :safety(title,abstract);alignment(abstract);分类 cs.CY

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.13577 2025-09-29 cs.SD cs.AI eess.AS 79%

VocalAgent: Large Language Models for Vocal Health Diagnostics with Safety-Aware Evaluation

Yubin Kim, Taehan Kim, Wonjune Kang, Eugene Park, Joonsik Yoon, Dongjae Lee, Xin Liu, Daniel McDuff, Hyeonhoon Lee, Cynthia Breazeal, Hae Won Park

机构 * Massachusetts Institute of Technology, USA(麻省理工学院, 美国) Seoul National University Hospital, South Korea(首尔国立大学医院, 韩国) Doctor Diary, South Korea(Doctor Diary, 韩国) Google Research, USA(谷歌研究, 美国) Independent Researcher(独立研究者)

专题命中 安全评测 :safety(title,abstract);分类 cs.AI

Comments Accepted by Proceedings of Interspeech 2025; Website: https://han811.github.io/VocalAgent2025/

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21368 2025-09-29 cs.CV cs.AI 79%

Safety Assessment of Scaffolding on Construction Site using AI

Sameer Prabhu, Amit Patwardhan, Ramin Karim

专题命中 安全评测 :safety(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22651 2025-09-29 cs.CL cs.AI cs.CV cs.HC cs.SD 73%

VoiceAssistant-Eval: Benchmarking AI Assistants across Listening, Speaking, and Viewing

Ke Wang, Houxing Ren, Zimu Lu, Mingjie Zhan, Hongsheng Li

机构 * CUHK MMLab(香港中文大学多媒体实验室) SenseTime Research(商汤科技研究院) CPII under InnoHK(创新香港下的CPII)

专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.05418 2025-09-29 cs.CL cs.AI cs.LG 67%

Learn Globally, Speak Locally: Bridging the Gaps in Multilingual Reasoning

Jaedong Hwang, Kumar Tanmay, Seok-Jin Lee, Ayush Agrawal, Hamid Palangi, Kumar Ayush, Ila Fiete, Paul Pu Liang

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏