arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-01-21 至 2026-01-21 共收录 16 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全训练 16 篇

2509.16444 2026-01-21 cs.AI cs.LG 84%

Domain-Specific Constitutional AI: Enhancing Safety in LLM-Powered Mental Health Chatbots

领域特定的宪法AI:增强LLM驱动的心理健康聊天机器人安全性

Chenhan Lyu, Yutong Song, Pengfei Zhang, Amir M. Rahmani

专题命中 安全训练 :safety(title,abstract);AI safety(abstract);分类 cs.AI、cs.LG

AI总结 本文提出利用领域特定心理健康原则的宪法AI训练方法,以提升心理健康聊天机器人在安全性和领域适应性方面的表现。

Comments Accepted to 2025 IEEE 21st International Conference on Body Sensor Networks (BSN)

Journal ref 2025 IEEE 21st International Conference on Body Sensor Networks (BSN), pp. 1-4

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11574 2026-01-21 cs.LG cs.AI 84%

GRADE: Replacing Policy Gradients with Backpropagation for LLM Alignment

GRADE: 用反向传播替代策略梯度以实现大语言模型对齐

Lukas Abrie Nel

机构 * Lotus Health AI(Lotus健康AI)

专题命中 安全训练 :alignment(title,abstract);RLHF(abstract);分类 cs.AI、cs.LG

AI总结 GRADE通过可微松弛的离散令牌采样过程替代策略梯度,实现大语言模型对齐的更稳定和高效方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13589 2026-01-21 cs.AI cs.SD 79%

Motion-to-Response Content Generation via Multi-Agent AI System with Real-Time Safety Verification

基于多智能体AI系统的运动到响应内容生成及实时安全验证

HyeYoung Lee

机构 * Department of Artificial Intelligence(人工智能系) Korean University(韩国大学)

专题命中 安全训练 :safety(title,abstract);分类 cs.AI

AI总结 本文提出了一种基于多智能体AI系统的实时内容生成方法,通过情感识别与安全验证代理,实现安全可控的响应内容生成,适用于儿童媒体和智能设备。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12616 2026-01-21 eess.SY cs.SY 78%

Allocating Corrective Control to Mitigate Multi-agent Safety Violations Under Private Preferences

为缓解多智能体安全违规分配纠正控制

Johnathan Corbin, Sarah H. Q. Li, Jonathan Rogers

专题命中 安全训练 :safety(title,abstract)

AI总结 本文提出一种基于隐私保护拍卖机制的多智能体安全纠正控制框架,通过规避信用机制实现高效安全纠正分配。

Comments 8 pages, 3 figures, Submitted to IEEE Robotics and Automation Letters (RA-L)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23473 2026-01-21 cs.AI 70%

EVOREFUSE: Evolutionary Prompt Optimization for Evaluation and Mitigation of LLM Over-Refusal to Pseudo-Malicious Instructions

EVOREFUSE: 进化提示优化用于评估和缓解大语言模型对伪恶意指令的过度拒绝

Xiaorui Wu, Fei Li, Xiaofeng Mao, Xin Zhang, Li Zheng, Yuxiang Peng, Chong Teng, Donghong Ji, Zhuang Li

机构 * Key Laboratory of Aerospace Information Security and Trusted Computing, Ministry of Education, School of Cyber Science and Engineering, Wuhan University(航天信息安全部门、教育部、武汉大学计算机科学与工程学院) Ant Group(蚂蚁集团) Ant International(蚂蚁国际) School of Computing Technologies, Royal Melbourne Institute of Technology(皇家墨尔本理工学院计算机技术学院)

专题命中 安全训练 :alignment(abstract);safety(abstract);分类 cs.AI

AI总结 EVOREFUSE通过进化算法生成多样化伪恶意指令,提升LLM对恶意指令的拒绝触发率并减少过度拒绝

Comments NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03994 2026-01-21 cs.LG 70%

Training-Free Policy Violation Detection via Activation-Space Whitening in LLMs

无需训练的策略违规检测:通过激活空间白化在大语言模型中

Oren Rachmil, Avishag Shapira, Roy Betser, Itay Gershon, Omer Hofman, Asaf Shabtai, Yuval Elovici, Roman Vainshtein

机构 * Fujitsu Research of Europe(富士通欧洲研究机构) Ben-Gurion University of the Negev(贝内杰尔大学)

专题命中 安全训练 :alignment(abstract);safety(abstract);分类 cs.LG

AI总结 本文提出一种无需训练的策略违规检测方法,通过激活空间白化技术在大语言模型中实现高效检测。

Comments Accepted to the AAAI 2026 Deployable AI (DAI) Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12817 2026-01-21 econ.GN q-fin.EC 67%

Liability Sharing and Staffing in AI-Assisted Online Medical Consultation

人工智能辅助在线医疗咨询中的责任分担与人员配置

Yang Xiao

专题命中 安全训练 :alignment(abstract);safety(abstract)

AI总结 本文研究了人工智能辅助在线医疗咨询中责任分担与人员配置的交互作用,揭示了责任分担比例与拥堵成本对医生模式选择的影响,以及如何通过优化政策平衡风险转移与合规成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12754 2026-01-21 cs.HC cs.AI cs.CL cs.CY 67%

PAIR-SAFE: A Paired-Agent Approach for Runtime Auditing and Refining AI-Mediated Mental Health Support

PAIR-SAFE: 一种配对代理方法用于运行时审计和改进AI介导的心理健康支持

Jiwon Kim, Violeta J. Rodriguez, Dong Whi Yoo, Eshwar Chandrasekharan, Koustuv Saha

专题命中 安全训练 :alignment(abstract);分类 cs.CL、cs.AI、cs.CY

AI总结 PAIR-SAFE通过配对代理框架,在运行时对AI生成的心理健康支持进行审计和改进,结合MITI-4框架提升临床相关性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14228 2026-01-21 cs.LG 57%

Attention-Based Offline Reinforcement Learning and Clustering for Interpretable Sepsis Treatment

基于注意力机制的离线强化学习与聚类用于可解释的脓毒症治疗

Punit Kumar, Vaibhav Saran, Divyesh Patel, Nitin Kulkarni, Alina Vereshchaka

机构 * Department of Computer Science(计算机科学系) Engineering University at Buffalo Buffalo, New York, USA(布法罗大学工程学院)

专题命中 安全训练 :safety(abstract);分类 cs.LG

AI总结 本文提出基于注意力机制的离线强化学习与聚类方法,用于可解释的脓毒症治疗决策支持,通过多模块整合提升治疗准确性和可解释性。

Comments 8 pages, 6 figures, Conference: IEEE International Conference on Machine Learning and Applications 2025 (ICMLA 2025): https://www.icmla-conference.org/icmla25/

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12822 2026-01-21 cs.AI 57%

MirrorGuard: Toward Secure Computer-Use Agents via Simulation-to-Real Reasoning Correction

MirrorGuard:通过模拟到现实推理校正实现安全的计算机使用代理

Wenqi Zhang, Yulin Shen, Changyue Jiang, Jiarun Dai, Geng Hong, Xudong Pan

机构 * Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院)

专题命中 安全训练 :prompt injection(abstract);分类 cs.AI

AI总结 MirrorGuard通过模拟到现实推理校正提升计算机使用代理的安全性,有效降低系统风险并保持代理实用性

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12126 2026-01-21 cs.AI 57%

UniMo: Unified Motion Generation and Understanding with Chain of Thought

UniMo: 基于推理链的统一运动生成与理解

Guocun Wang, Kenkun Liu, Jing Lin, Guorui Song, Jian Li, Xiaoguang Han

专题命中 安全训练 :alignment(abstract);分类 cs.AI

AI总结 UniMo通过整合运动-语言信息和可解释的推理链,提升3D人体运动生成与理解的性能和可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12008 2026-01-21 cs.LG 57%

Extreme Value Policy Optimization for Safe Reinforcement Learning

极值政策优化用于安全强化学习

Shiqing Gao, Yihang Zhou, Shuai Shao, Haoyu Luo, Yiheng Bing, Jiaxin Ding, Luoyi Fu, Xinbing Wang

机构 * Shanghai Jiao Tong University, Shanghai, China.(上海交通大学)

专题命中 安全训练 :safety(abstract);分类 cs.LG

AI总结 本文提出极值政策优化算法,通过极值理论建模和极值优先机制,有效减少约束违反并提升安全强化学习性能。

Comments Published in the 42nd International Conference on Machine Learning (ICML 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13057 2026-01-21 eess.SY cs.SY 50%

Convex Model Predictive Control for Safe Output Consensus of Nonlinear Multi-Agent Systems

凸优化模型预测控制用于非线性多智能体系统的安全输出一致性

Chao Wang, Shuyuan Zhang, Lei Wang

专题命中 安全训练 :safety(abstract)

AI总结 本文提出基于SQP方案的凸模型预测控制方法,通过线性化和凸化非线性约束,有效降低计算复杂度,实现在非线性多智能体系统中的安全输出一致性控制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12672 2026-01-21 cs.CV 50%

VILTA: A VLM-in-the-Loop Adversary for Enhancing Driving Policy Robustness

VILTA:一种用于增强驾驶策略鲁棒性的视觉语言模型闭环对抗者

Qimao Chen, Fang Li, Shaoqing Xu, Zhiyi Lai, Zixun Xie, Yuechen Luo, Shengyin Jiang, Hanbing Li, Long Chen, Bing Wang, Yi Zhang, Zhi-Xin Yang

专题命中 安全训练 :safety(abstract)

AI总结 VILTA通过整合视觉语言模型到闭环训练中,提升自动驾驶策略在长尾事件中的安全性和鲁棒性。

Comments Accepted to AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12634 2026-01-21 cs.CR cs.SE 50%

The Cost of Convenience: Identifying, Analyzing, and Mitigating Predatory Loan Applications on Android

便利的代价:识别、分析和缓解Android上的掠夺性贷款申请

Olawale Amos Akanji, Manuel Egele, Gianluca Stringhini

专题命中 安全训练 :safety(abstract)

AI总结 本文研究了Android上贷款应用的合规性问题,发现大量应用违反国家和谷歌政策,通过分析揭示敏感数据滥用,并建议加强隐私保护和技术保障。

Comments 15 pages, accepted at ACM ASIA CCS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11983 2026-01-21 cs.CV 50%

An AI-IoT Based Smart Wheelchair with Gesture-Controlled Mobility, Deep Learning-Based Obstacle Detection, Multi-Sensor Health Monitoring, and Emergency Alert System

基于AI-IoT的智能轮椅:具有手势控制移动、深度学习障碍检测、多传感器健康监测和紧急警报系统

Md. Asiful Islam, Abdul Hasib, Tousif Mahmud Emon, Khandaker Tabin Hasan, A. S. M. Ahsanul Sarkar Akib

机构 * Department of Computer Science and Engineering(计算机科学与工程系) Military Institute of Science and Technology(军事科学与技术学院) University of Frontier Technology(前沿技术大学) American International University-Bangladesh(美国国际大学-孟加拉国) Robo Tech Valley(机器人技术谷)

专题命中 安全训练 :safety(abstract)

AI总结 本文提出了一种基于AI-IoT的智能轮椅系统,结合手势控制、深度学习障碍检测、多传感器健康监测和紧急警报,实现安全导航与健康监测的集成解决方案。

详情

展开后加载摘要…

URL PDF HTML 收藏