arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2025-12-19 至 2025-12-19 共收录 9 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全训练 9 篇

2512.16279 2025-12-19 cs.AI cs.CL 81%

QuadSentinel: Sequent Safety for Machine-Checkable Control in Multi-agent Systems

QuadSentinel: 多智能体系统中机器可验证的顺序安全控制

Yiliu Yang, Yilei Jiang, Qunzhong Wang, Yingshui Tan, Xiaoyong Zhu, Sherman S. M. Chow, Bo Zheng, Xiangyu Yue

机构 * The Chinese University of Hong Kong(香港中文大学) Alibaba Group(阿里巴巴集团)

专题命中 安全训练 :safety(title,abstract);分类 cs.CL、cs.AI

AI总结 QuadSentinel通过四智能体守卫系统,将安全政策转化为机器可验证规则,提升多智能体系统的安全控制效果。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16795 2025-12-19 cs.CL cs.AI cs.CY cs.IR 67%

From Facts to Conclusions : Integrating Deductive Reasoning in Retrieval-Augmented LLMs

从事实到结论:在检索增强的大语言模型中整合演绎推理

Shubham Mishra, Samyek Jain, Gorang Mehrishi, Shiv Tiwari, Harsh Sharma, Pratik Narang, Dhruv Kumar

专题命中 安全训练 :alignment(abstract);分类 cs.CL、cs.AI、cs.CY

AI总结 本文提出了一种增强RAG框架,通过结构化推理和冲突分析提升模型在冲突信息下的回答准确性与可解释性。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.01384 2025-12-19 stat.ML cs.AI cs.CL cs.LG 67%

Fine-Tuning Discrete Diffusion Models with Policy Gradient Methods

使用策略梯度方法微调离散扩散模型

Oussama Zekri, Nicolas Boullé

专题命中 安全训练 :RLHF(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出SEPO算法,用于高效微调离散扩散模型,通过理论支持和实验验证展示了其在非可微奖励下的有效性。

Comments 33 pages, 8 figures, 8 tables

Journal ref NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15784 2025-12-19 cs.AI cs.LG 62%

Beyond Training: Enabling Self-Evolution of Agents with MOBIMEM

超越训练:通过MOBIMEM实现智能体的自我进化

Zibin Liu, Cheng Zhang, Xi Zhao, Yunfei Feng, Bingyu Bai, Dahu Feng, Erhu Feng, Yubin Xia, Haibo Chen

机构 * Institute of Parallel and Distributed Systems, Shanghai Jiao Tong University(并行与分布式系统研究所,上海交通大学)

专题命中 安全训练 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 MOBIMEM通过引入内存原语和操作系统启发的服务,实现了无需模型重训练的智能体自我进化,显著提升了任务成功率和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.17468 2025-12-19 cs.CV cs.AI cs.LG cs.RO 62%

A Synthetic Dataset for Manometry Recognition in Robotic Applications

用于机器人应用的测压识别合成数据集

Pedro Antonio Rabelo Saraiva, Enzo Ferreira de Souza, Joao Manoel Herrera Pinheiro, Thiago H. Segreto, Ricardo V. Godoy, Marcelo Becker

机构 * University of São Paulo(圣保罗大学)

专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG

AI总结 本文提出了一种混合数据合成方法,通过结合过程渲染和AI驱动视频生成,提升机器人应用中测压识别的训练效果和可靠性。

Journal ref 2025 Latin American Robotics Symposium (LARS)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16650 2025-12-19 cs.AI cs.CR 57%

Prefix Probing: Lightweight Harmful Content Detection for Large Language Models

前缀探查:用于大型语言模型的轻量有害内容检测

Jirui Yang, Hengqi Guo, Zhihui Lu, Yi Zhao, Yuansen Zhang, Shijing Hu, Qiang Duan, Yinggui Wang, Tao Wei

机构 * Fudan University(复旦大学) Ant Group(蚂蚁集团) Pennsylvania State University(宾夕法尼亚州立大学)

专题命中 安全训练 :safety(abstract);分类 cs.AI

AI总结 Prefix Probing通过高效前缀探查实现轻量有害内容检测,在保持检测效果的同时大幅降低计算成本和部署需求。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08158 2025-12-19 cs.CL 57%

Beyond Over-Refusal: Scenario-Based Diagnostics and Post-Hoc Mitigation for Exaggerated Refusals in LLMs

超越过度拒绝:基于场景的诊断与事后缓解措施以应对大语言模型中的夸大拒绝

Shuzhou Yuan, Ercong Nie, Yinuo Sun, Chenxuan Zhao, William LaCroix, Michael Färber

机构 * ScaDS.AI and TU Dresden(ScaDS.AI 和图腾德斯雷克大学) LMU Munich and MCML(慕尼黑大学和MCML) Saarland University(萨尔兰州大学)

专题命中 安全训练 :safety(abstract);分类 cs.CL

AI总结 本文提出基于场景的诊断与事后缓解方法,以减少大语言模型中的夸大拒绝问题,通过两个基准测试和三种轻量级策略提升合规性与安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.14994 2025-12-19 cs.RO cs.CV cs.LG cs.SY eess.SY 57%

A Vision-Based Shared-Control Teleoperation Scheme for Controlling the Robotic Arm of a Four-Legged Robot

基于视觉的共享控制远程操作方案用于控制四足机器人的机械臂

Murilo Vinicius da Silva, Matheus Hipolito Carvalho, Juliano Negri, Thiago Segreto, Gustavo J. G. Lahr, Ricardo V. Godoy, Marcelo Becker

机构 * Department of Mechanical Engineering, University of São Paulo(机械工程系,圣保罗大学) Instituto Israelita de Ensino e Pesquisa Albert Einstein, Hospital Israelita Albert Einstein(艾利哈德研究所,以色列医院)

专题命中 安全训练 :safety(abstract);分类 cs.LG

AI总结 本文提出了一种基于视觉的姿态估计方法,通过检测操作员手腕位置来实现四足机器人机械臂的直观远程控制,提高了安全性和易用性。

Journal ref 2025 Latin American Robotics Symposium (LARS)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.23165 2025-12-19 cs.LG cs.NE 57%

Mirror Descent Policy Optimisation for Robust Constrained Markov Decision Processes

镜像下降策略优化用于鲁棒约束马尔可夫决策过程

David M. Bossens, Atsushi Nitanda

机构 * Centre for Frontier AI Research, Agency for Science, Technology and Research (A*STAR)(前沿人工智能研究中心,科技研究局(A*STAR)) Singapore Institute of High Performance Computing, Agency for Science, Technology and Research (A*STAR)(新加坡高性能计算研究所,科技研究局(A*STAR)) College of Computing and Data Science, Nanyang Technological University, Singapore(计算与数据科学学院,南洋理工大学,新加坡)

专题命中 安全训练 :safety(abstract);分类 cs.LG

AI总结 本文提出一种镜像下降策略优化方法,用于鲁棒约束马尔可夫决策过程,通过优化策略和转移核实现收敛率和鲁棒性提升。

Journal ref Transactions on Machine Learning Research (TMLR 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏