arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-01-21 至 2026-01-21 共收录 6 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 幻觉与事实性 6 篇

2601.12002 2026-01-21 cs.AI cs.LG cs.SY eess.SY 81%

Kernel-Based Learning of Safety Barriers

基于核的方法的安全屏障学习

Oliver Schön, Zhengang Zhong, Sadegh Soudjani

专题命中 幻觉与事实性 :safety(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出基于核的方法,用于安全屏障学习,通过数据驱动方法和控制屏障证书,提升安全验证的鲁棒性和可扩展性。

Comments 44 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12804 2026-01-21 cs.AI cs.LG 73%

SL-CBM: Enhancing Concept Bottleneck Models with Semantic Locality for Better Interpretability

SL-CBM: 通过语义局部性增强概念瓶颈模型以提升可解释性

Hanwei Zhang, Luo Cheng, Rui Wen, Yang Zhang, Lijun Zhang, Holger Hermanns

专题命中 幻觉与事实性 :alignment(abstract);trustworthy(abstract);分类 cs.AI、cs.LG

AI总结 SL-CBM通过引入语义局部性增强概念瓶颈模型,提升可解释性和干预效果,同时保持分类准确度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12442 2026-01-21 cs.LG cs.AI cs.CV 62%

Constraint-Aware Neurosymbolic Uncertainty Quantification with Bayesian Deep Learning for Scientific Discovery

具有贝叶斯深度学习的约束感知神经符号不确定性量化框架用于科学发现

Shahnawaz Alam, Mohammed Mudassir Uddin, Mohammed Kaif Pasha

机构 * Department of Computer Science and Engineering Muffakham Jah College of Engineering and Technology (MJCET)(计算机科学与工程系穆法卡姆·贾赫工程与技术学院)

专题命中 幻觉与事实性 :trustworthy(abstract);分类 cs.AI、cs.LG

AI总结 CANUF通过结合贝叶斯深度学习与可微符号推理,首次实现科学预测中的不确定性量化、约束满足和可解释性解释。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14208 2026-01-21 cs.CV cs.GR cs.LG 57%

Rig-Aware 3D Reconstruction of Vehicle Undercarriages using Gaussian Splatting

基于相机 rig 的车辆底盘 3D 重建使用高斯溅射

Nitin Kulkarni, Akhil Devarashetti, Charlie Cluss, Livio Forte, Dan Buckmaster, Philip Schneider, Chunming Qiao, Alina Vereshchaka

机构 * University at Buffalo(布法罗大学)

专题命中 幻觉与事实性 :safety(abstract);分类 cs.LG

AI总结 提出一种基于相机 rig 的 3D 重建方法,利用高斯溅射生成逼真的车辆底盘模型,提升检查效率和买家信任度。

Comments 8 pages, 9 figures, Conference: IEEE International Conference on Machine Learning and Applications 2025 (ICMLA 2025): https://www.icmla-conference.org/icmla25/

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11563 2026-01-21 cs.CY 57%

Human-like Social Compliance in Large Language Models: Unifying Sycophancy and Conformity through Signal Competition Dynamics

大语言模型中的类人社会合规:通过信号竞争动态统一讨好与顺从

Long Zhang, Wei-neng Chen

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CY

AI总结 本研究提出信号竞争机制,揭示大语言模型中讨好与顺从的几何流形机制,并通过整合认知对齐框架提升模型的社会合规性鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06860 2026-01-21 cs.AI 57%

ET-Agent: Incentivizing Effective Tool-Integrated Reasoning Agent via Behavior Calibration

ET-Agent:通过行为校准激励有效的工具集成推理代理

Yifei Chen, Guanting Dong, Zhicheng Dou

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学人工智能学院)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.AI

AI总结 ET-Agent通过自我进化数据飞轮和行为校准训练框架,提升工具集成推理代理的准确性与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏