arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-02-16 至 2026-02-16 共收录 4 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全训练 4 篇

2602.12846 2026-02-16 cs.LG cs.AI 62%

Amortized Reasoning Tree Search: Decoupling Proposal and Decision in Large Language Models

渐进推理树搜索:在大语言模型中解耦提案与决策

Zesheng Hong, Jiadong Yu, Hui Pan

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

专题命中 安全训练 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 ARTS通过解耦生成与验证,有效解决大语言模型中推理路径被压制的问题,实现74.6%的性能,优于完全微调策略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04884 2026-02-16 cs.CL cs.CV cs.LG 62%

Reinforced Attention Learning

强化注意力学习

Bangzheng Li, Jianmo Ni, Chen Qu, Ian Miao, Liu Yang, Xingyu Fu, Muhao Chen, Derek Zhiyuan Cheng

机构 * UC Davis(加州大学戴维斯分校) Google(谷歌) DeepMind(深Mind) Google DeepMind(谷歌DeepMind) Princeton University(普林斯顿大学)

专题命中 安全训练 :alignment(abstract);分类 cs.CL、cs.LG

AI总结 强化注意力学习通过优化内部注意力分布提升多模态模型的感知能力,实验显示其在多模态后期训练中优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00602 2026-02-16 cs.LG cs.SY eess.SY 57%

Multi-Agent Stage-wise Conservative Linear Bandits

多智能体分阶段保守线性老虎机

Amirhossein Afsharrad, Ahmadreza Moradipari, Sanjay Lall

机构 * Stanford University(斯坦福大学) University of California, Santa Barbara(加州大学圣巴巴拉分校)

专题命中 安全训练 :safety(abstract);分类 cs.LG

AI总结 本文提出MA-SCLUCB算法,通过分阶段保守约束实现多智能体在安全保证下的高效分布式学习。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12638 2026-02-16 eess.SY cs.SY 50%

Safe Controller Synthesis Using Lyapunov-based Barriers for Linear Hybrid Systems with Simplex Architecture

利用Lyapunov基屏障的安全控制器合成用于具有简单架构的线性混合系统

Sunandan Adhikary, Soumyajit Dey

专题命中 安全训练 :safety(abstract)

AI总结 本文提出了一种基于Lyapunov基屏障的安全控制器合成方法,旨在通过切换不同执行速率的BSC来实现最大安全性和及时恢复,同时优化控制计算的带宽使用。

详情

展开后加载摘要…

URL PDF HTML 收藏