arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2025-10-09 至 2025-10-09 共收录 39 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 偏好对齐 5 篇

2510.07000 2025-10-09 cs.CL cs.AI 73%

Pragyaan: Designing and Curating High-Quality Cultural Post-Training Datasets for Indian Languages

Neel Prabhanjan Rachamalla, Aravind Konakalla, Gautam Rajeev, Ashish Kulkarni, Chandra Khatri, Shubham Agarwal

机构 * Krutrim AI

专题命中 偏好对齐 :alignment(abstract);safety(abstract);分类 cs.CL、cs.AI

Comments EMNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06652 2025-10-09 cs.CL 70%

Aligning Large Language Models via Fully Self-Synthetic Data

Shangjian Yin, Zhepei Wei, Xinyu Zhu, Wei-Lin Chen, Yu Meng

机构 * University of California, Riverside(加州大学河滨分校) University of Virginia(弗吉尼亚大学)

专题命中 偏好对齐 :alignment(abstract);RLHF(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.03654 2025-10-09 cs.CL cs.AI cs.LG 67%

Improving Neutral Point-of-View Generation with Data- and Parameter-Efficient RL

Jessica Hoffmann, Christiane Ahlheim, Zac Yu, Aria Walfrand, Jarvis Jin, Marie Tano, Ahmad Beirami, Erin van Liemt, Nithum Thain, Hakim Sidahmed, Lucas Dixon

机构 * Google DeepMind(谷歌DeepMind)

专题命中 偏好对齐 :RLHF(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06391 2025-10-09 cs.CL cs.AI 62%

Reward Model Perspectives: Whose Opinions Do Reward Models Reward?

Elle

机构 * Elle University of Oxford(埃勒 奥克舍大学)

专题命中 偏好对齐 :alignment(abstract);分类 cs.CL、cs.AI

Comments Published at EMNLP 2025 under the full author name "Elle"

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06627 2025-10-09 cs.LG 57%

POME: Post Optimization Model Edit via Muon-style Projection

Yong Liu, Di Fu, Yang Luo, Zirui Zhu, Minhao Cheng, Cho-Jui Hsieh, Yang You

机构 * National University of Singapore(新加坡国立大学) Penn State University(宾夕法尼亚州立大学) University of California, Los Angeles(加州大学洛杉矶分校)

专题命中 偏好对齐 :RLHF(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 安全训练 5 篇

2505.02293 2025-10-09 cs.RO cs.MA cs.SY eess.SY 78%

Resolving Conflicting Constraints in Multi-Agent Reinforcement Learning with Layered Safety

Jason J. Choi, Jasmine Jerry Aloor, Jingqi Li, Maria G. Mendoza, Hamsa Balakrishnan, Claire J. Tomlin

机构 * University of California, Berkeley(加州大学伯克利分校) Massachusetts Institute of Technology(麻省理工学院)

专题命中 安全训练 :safety(title,abstract)

Comments Accepted for publication at the 2025 Robotics: Science and Systems Conference. 18 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.00051 2025-10-09 cs.CY 70%

Beyond Monoliths: Expert Orchestration for More Capable, Democratic, and Safe Language Models

Philip Quirke, Narmeen Oozeer, Chaithanya Bandi, Amir Abdullah, Jason Hoelscher-Obermaier, Jeff M. Phillips, Joshua Greaves, Clement Neo, Michael Lan, Fazl Barez, Shriyash Upadhyay

专题命中 安全训练 :alignment(abstract);safety(abstract);分类 cs.CY

Comments 8 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06756 2025-10-09 cs.AI 57%

Verifying Memoryless Sequential Decision-making of Large Language Models

Dennis Gross, Helge Spieker, Arnaud Gotlieb

机构 * Simula Research Laboratory(Simula研究实验室)

专题命中 安全训练 :safety(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07206 2025-10-09 cs.CV 50%

EigenScore: OOD Detection using Covariance in Diffusion Models

Shirin Shoushtari, Yi Wang, Xiao Shi, M. Salman Asif, Ulugbek S. Kamilov

机构 * Washington University in St. Louis(华盛顿大学圣路易斯分校) University of California, Riverside(加州大学河滨分校)

专题命中 安全训练 :safety(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06666 2025-10-09 math.OC 50%

Trajectory-Optimized Density Control with Flow Matching

Xu Duan, Dongmei Chen

专题命中 安全训练 :alignment(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 越狱攻击 2 篇

2510.05379 2025-10-09 cs.CR cs.AI 74%

AutoDAN-Reasoning: Enhancing Strategies Exploration based Jailbreak Attacks with Test-Time Scaling

Xiaogeng Liu, Chaowei Xiao

机构 * Johns Hopkins University(约翰霍普金斯大学)

专题命中 越狱攻击 :jailbreak(title);分类 cs.AI

Comments Technical report. Code is available at https://github.com/SaFoLab-WISC/AutoDAN-Reasoning

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07192 2025-10-09 cs.LG 57%

Poisoning Attacks on LLMs Require a Near-constant Number of Poison Samples

Alexandra Souly, Javier Rando, Ed Chapman, Xander Davies, Burak Hasircioglu, Ezzeldin Shereen, Carlos Mougan, Vasilios Mavroudis, Erik Jones, Chris Hicks, Nicholas Carlini, Yarin Gal, Robert Kirk

机构 * UK AI Security Institute(英国人工智能安全研究所) Anthropic Alan Turing Institute(艾伦·图灵研究所) OATML, University of Oxford(OATML,牛津大学) ETH Zurich(苏黎世联邦理工学院)

专题命中 越狱攻击 :safety(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 红队测试 1 篇

2510.06994 2025-10-09 cs.CR cs.CL 83%

RedTWIZ: Diverse LLM Red Teaming via Adaptive Attack Planning

Artur Horal, Daniel Pina, Henrique Paz, Iago Paulo, João Soares, Rafael Ferreira, Diogo Tavares, Diogo Glória-Silva, João Magalhães, David Semedo

专题命中 红队测试 :red teaming(title,abstract);jailbreak(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 幻觉与事实性 1 篇

2510.06541 2025-10-09 cs.CV cs.LG 57%

Cluster Paths: Navigating Interpretability in Neural Networks

Nicholas M. Kroeger, Vincent Bindschaedler

机构 * Department of Computer Science University of Florida(计算机科学系佛罗里达大学)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 隐私与版权 1 篇

2510.06480 2025-10-09 cs.HC 50%

AI Eyes on the Road: Cross-Cultural Perspectives on Traffic Surveillance

Ziming Wang, Shiwei Yang, Rebecca Currano, Morten Fjeld, David Sirkin

专题命中 隐私与版权 :safety(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏

7. 安全评测 10 篇

2510.06559 2025-10-09 cs.CL cs.AI cs.LO 73%

The Algebra of Meaning: Why Machines Need Montague More Than Moore's Law

Cheonkam Jeong, Sungdo Kim, Jewoo Park

机构 * Savassan(萨瓦桑)

专题命中 安全评测 :alignment(abstract);trustworthy(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06240 2025-10-09 cs.CL cs.AI cs.DB 73%

Knowledge Graph-Guided Multi-Agent Distillation for Reliable Industrial Question Answering with Datasets

Jiqun Pan, Zhenke Duan, Jiani Tu, Anzhi Cheng, Yanqing Wang

机构 * Zhongnan University of Economics and Law(中南财经政法大学)

专题命中 安全评测 :safety(abstract);trustworthy(abstract);分类 cs.CL、cs.AI

Comments 41 pages, 12 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07243 2025-10-09 cs.CL cs.AI 62%

LeMAJ (Legal LLM-as-a-Judge): Bridging Legal Reasoning and LLM Evaluation

Joseph Enguehard, Morgane Van Ermengem, Kate Atkinson, Sujeong Cha, Arijit Ghosh Chowdhury, Prashanth Kallur Ramaswamy, Jeremy Roghair, Hannah R Marlowe, Carina Suzana Negreanu, Kitty Boxall, Diana Mincu

机构 * Robin AI Amazon Web Services(亚马逊网络服务)

专题命中 安全评测 :trustworthy(abstract);分类 cs.CL、cs.AI

Comments Published in Natural Legal Language Processing - EMNLP Workshop 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.03487 2025-10-09 cs.LG cs.AI cs.CR q-bio.BM q-bio.QM 62%

SafeProtein: Red-Teaming Framework and Benchmark for Protein Foundation Models

Jigang Fan, Zhenghong Zhou, Ruofan Jin, Le Cong, Mengdi Wang, Zaixi Zhang

机构 * Peking University(北京大学) Stanford University(斯坦福大学) Princeton University(普林斯顿大学) Shanghai Jiao Tong University(上海交通大学) Zhejiang University(浙江大学)

专题命中 安全评测 :safety(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06253 2025-10-09 cs.CY cs.AI 62%

LLM-Driven Rubric-Based Assessment of Algebraic Competence in Multi-Stage Block Coding Tasks with Design and Field Evaluation

Yong Oh Lee, Byeonghun Bang, Sejun Oh

专题命中 安全评测 :alignment(abstract);分类 cs.AI、cs.CY

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.14146 2025-10-09 cs.CL 57%

MMReview: A Multidisciplinary and Multimodal Benchmark for LLM-Based Peer Review Automation

Xian Gao, Jiacheng Ruan, Zongyun Zhang, Jingsheng Gao, Ting Liu, Yuzhuo Fu

机构 * Shanghai Jiao Tong University(上海交通大学)

专题命中 安全评测 :alignment(abstract);分类 cs.CL

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06411 2025-10-09 cs.CL 57%

Instructional Goal-Aligned Question Generation for Student Evaluation in Virtual Lab Settings: How Closely Do LLMs Actually Align?

R. Alexander Knipper, Indrani Dey, Souvika Sarkar, Hari Narayanan, Sadhana Puntambekar, Santu Karmaker

机构 * Department of EdPsych, University of Wisconsin-Madison(威斯康星大学麦迪逊分校教育心理学系) Department of CS, Wichita State University(威斯康星州立大学Wichita分校计算机科学系) Department of CSSE, Auburn University(阿伯茨罕大学计算机科学与工程系)

专题命中 安全评测 :alignment(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25282 2025-10-09 cs.AI cs.HC cs.SE 57%

Toward Causal-Visual Programming: Enhancing Agentic Reasoning in Low-Code Environments

Jiexi Xu, Jiaqi Liu, Lanruo Wang, Su Liu

机构 * School of Information \& Computer Science University of California, Irvine Irvine, CA, USA Independent Researcher University of Texas at Dallas Dallas, TX, USA Georgia Institute of Technology Atlanta, GA, USA

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI

Comments 5 pages, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.19333 2025-10-09 cs.IR cs.CL 57%

Injecting External Knowledge into the Reasoning Process Enhances Retrieval-Augmented Generation

Minghao Tang, Shiyu Ni, Jiafeng Guo, Keping Bi

机构 * State Key Laboratory of AI Safety(人工智能安全国家重点实验室) Institute of Computing Technology(计算技术研究所) Chinese Academy of Sciences(中国科学院) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 安全评测 :trustworthy(abstract);分类 cs.CL

Comments SIGIR-AP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.19017 2025-10-09 cs.CL 57%

Benchmarking Gaslighting Negation Attacks Against Multimodal Large Language Models

Bin Zhu, Yinxuan Gui, Huiyan Qi, Jingjing Chen, Chong-Wah Ngo, Ee-Peng Lim

机构 * Singapore Management University(新加坡管理大学) Fudan University(复旦大学)

专题命中 安全评测 :trustworthy(abstract);分类 cs.CL

Comments Project website: https://yxg1005.github.io/GaslightingNegationAttacks/

详情

展开后加载摘要…

URL PDF HTML 收藏

8. AI治理与伦理 4 篇

2510.06623 2025-10-09 cs.LG 57%

DPA-Net: A Dual-Path Attention Neural Network for Inferring Glycemic Control Metrics from Self-Monitored Blood Glucose Data

Canyu Lei, Benjamin Lobo, Jianxin Xie

机构 * Binghamton University, Department of Computer Science(宾夕法尼亚州立大学比恩代特分校计算机科学系) University of Virginia, School of Data Science(弗吉尼亚大学数据科学学院)

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.LG

Comments 14 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06556 2025-10-09 econ.TH 50%

Artificial Intelligence in Port Logistics: A Bibliometric Analysis of Technological Integration and Research Dynamics

Abdelhafid Khazzar, Yassine Sekaki, Yasser Lachhab, Said El-marzouki

专题命中 AI治理与伦理 :safety(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06306 2025-10-09 cs.HC 50%

"Grillz on a hijabi": Intersectional Identities in Fostering Critical AI Literacy

Jaemarie Solyst, Chloe Fong, Faisal Nurdin, Rotem Landesman, R. Benjamin Shapiro

专题命中 AI治理与伦理 :safety(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06222 2025-10-09 cs.HC econ.GN q-fin.EC 50%

Inducing State Anxiety in LLM Agents Reproduces Human-Like Biases in Consumer Decision-Making

Ziv Ben-Zion, Zohar Elyoseph, Tobias Spiller, Teddy Lazebnik

专题命中 AI治理与伦理 :safety(abstract)

Comments Manuscript Main Text - 20 pages, including 3 Figures and 1 Table. Supplementary Materials - 10 pages, including 4 Supplemental Tables

详情

展开后加载摘要…

URL PDF HTML 收藏

9. 其他安全 10 篇

2510.06554 2025-10-09 q-bio.QM 78%

UniOTalign: A Global Matching Framework for Protein Alignment via Optimal Transport

Yue Hu, Zanxia Cao, Yingchao Liu

专题命中 其他安全 :alignment(title,abstract)

Comments 7 pages, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏