arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2025-12-16 至 2025-12-16 共收录 8 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全训练 8 篇

2406.16743 2025-12-16 cs.CL 89%

Safety Alignment of Large Language Models via Contrasting Safe and Harmful Distributions

通过对比安全与有害分布实现大语言模型的安全对齐

Xiaoyun Zhang, Zhengyue Zhao, Wenxuan Shi, Kaidi Xu, Di Huang, Xing Hu

专题命中 安全训练 :alignment(title,abstract);safety(title,abstract);RLHF(abstract);分类 cs.CL

AI总结 本文提出ACD方法,通过生成安全与对抗性提示,实现大语言模型的安全对齐,提升安全性的同时保持生成能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12901 2025-12-16 cs.LG 79%

Predicted-occupancy grids for vehicle safety applications based on autoencoders and the Random Forest algorithm

基于自编码器和随机森林算法的预测占用网格用于车辆安全应用

Parthasarathy Nadarajan, Michael Botsch, Sebastian Sardina

机构 * RMIT University(皇家墨尔本理工大学)

专题命中 安全训练 :safety(title,abstract);分类 cs.LG

AI总结 本文提出基于自编码器和随机森林算法的预测占用网格方法,用于复杂交通场景中的车辆安全应用,通过降维和分类提高预测准确性。

Comments 2017 International Joint Conference on Neural Networks (IJCNN)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12387 2025-12-16 cs.LG 79%

Anchoring Values in Temporal and Group Dimensions for Flow Matching Model Alignment

在时间和群体维度上锚定值以实现流匹配模型对齐

Yawen Shao, Jie Xiao, Kai Zhu, Yu Liu, Wei Zhai, Yang Cao, Zheng-Jun Zha

机构 * University of Science and Technology of China(中国科学技术大学) Tongyi Lab(通义实验室)

专题命中 安全训练 :alignment(title,abstract);分类 cs.LG

AI总结 VGPO通过在时间和群体维度上锚定值,改进流匹配模型对齐,提升图像生成质量与任务准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13561 2025-12-16 cs.RO 78%

Near-Field Perception for Safety Enhancement of Autonomous Mobile Robots in Manufacturing Environments

近场感知用于制造环境中自主移动机器人的安全增强

Li-Wei Shih, Ruo-Syuan Mei, Jesse Heidrich, Hui-Ping Wang, Joel Hooton, Joshua Solomon, Jorge Arinez, Guangze Li, Chenhui Shao

机构 * Department of Mechanical Engineering, University of Michigan, MI 48109, USA Materials \& Manufacturing Systems Research, General Motors R \& D, Warren, MI 48092, USA

专题命中 安全训练 :safety(title,abstract)

AI总结 本文提出三级近场感知框架,通过光断续检测、光位移测量和计算机视觉分类,提升自主移动机器人在制造环境中的安全性能。

Comments Submitted to the 54th SME North American Manufacturing Research Conference (NAMRC 54)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13080 2025-12-16 cs.RO 78%

Spatial-Aware VLA Pretraining through Visual-Physical Alignment from Human Videos

通过人类视频中的视觉-物理对齐实现空间感知的VLA预训练

Yicheng Feng, Wanpeng Zhang, Ye Wang, Hao Luo, Haoqi Yuan, Sipeng Zheng, Zongqing Lu

机构 * Peking University(北京大学) Renmin University of China(中国人民大学) BeingBeyond

专题命中 安全训练 :alignment(title,abstract)

AI总结 通过人类视频中的视觉-物理对齐实现空间感知的VLA预训练,提升机器人任务的稳健性和通用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12692 2025-12-16 cs.AI cs.CL cs.LG 67%

WebOperator: Action-Aware Tree Search for Autonomous Agents in Web Environment

WebOperator: 基于动作意识的树搜索用于网络环境中的自主代理

Mahir Labib Dihan, Tanzima Hashem, Mohammed Eunus Ali, Md Rizwan Parvez

机构 * Department of Computer Science and Engineering(计算机科学与工程系) Bangladesh University of Engineering and Technology (BUET)(孟加拉工程与技术大学) Faculty of Information Technology(信息技术学院) Monash University(莫纳什大学) Qatar Computing Research Institute (QCRI)(卡塔尔计算研究所)

专题命中 安全训练 :safety(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 WebOperator通过引入树搜索框架,实现可靠的回溯和战略探索,提升自主代理在网页环境中的任务成功率。

Comments Under review at ICLR 2026. Project page: https://kagnlp.github.io/WebOperator/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12806 2025-12-16 cs.AI 57%

Fault-Tolerant Sandboxing for AI Coding Agents: A Transactional Approach to Safe Autonomous Execution

面向AI编码代理的容错沙盒:一种用于安全自主执行的事务方法

Boyang Yan

机构 * University of Virginia(弗吉尼亚大学)

专题命中 安全训练 :safety(abstract);分类 cs.AI

AI总结 本文提出一种基于事务的容错沙盒框架,通过事务性文件系统快照和策略拦截层,实现对AI编码代理自主执行的安全保障,显著降低延迟并提高安全性。

Comments 7 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13276 2025-12-16 cs.CV 50%

CogniEdit: Dense Gradient Flow Optimization for Fine-Grained Image Editing

CogniEdit: 密集梯度流优化用于细粒度图像编辑

Yan Li, Lin Liu, Xiaopeng Zhang, Wei Xue, Wenhan Luo, Yike Guo, Qi Tian

机构 * Hongkong University of Science and Technology(香港科学与技术大学) Huawei Company(华为公司)

专题命中 安全训练 :alignment(abstract)

AI总结 CogniEdit通过密集梯度流优化实现细粒度图像编辑,结合多模态推理与动态令牌焦点重新定位,提升指令遵循与视觉质量的平衡

详情

展开后加载摘要…

URL PDF HTML 收藏