arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-02-10 至 2026-02-10 共收录 3 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. AI治理与伦理 3 篇

2602.08145 2026-02-10 cs.LG cs.AI cs.CL cs.CV cs.CY 77%

Reliable and Responsible Foundation Models: A Comprehensive Survey

可靠且负责任的基础模型:全面综述

Xinyu Yang, Junlin Han, Rishi Bommasani, Jinqi Luo, Wenjie Qu, Wangchunshu Zhou, Adel Bibi, Xiyao Wang, Jaehong Yoon, Elias Stengel-Eskin, Shengbang Tong, Lingfeng Shen, Rafael Rafailov, Runjia Li, Zhaoyang Wang, Yiyang Zhou, Chenhang Cui, Yu Wang, Wenhao Zheng, Huichi Zhou, Jindong Gu, Zhaorun Chen, Peng Xia, Tony Lee, Thomas Zollo, Vikash Sehwag, Jixuan Leng, Jiuhai Chen, Yuxin Wen, Huan Zhang, Zhun Deng, Linjun Zhang, Pavel Izmailov, Pang Wei Koh, Yulia Tsvetkov, Andrew Wilson, Jiaheng Zhang, James Zou, Cihang Xie, Hao Wang, Philip Torr, Julian McAuley, David Alvarez-Melis, Florian Tramèr, Kaidi Xu, Suman Jana, Chris Callison-Burch, Rene Vidal, Filippos Kokkinos, Mohit Bansal, Beidi Chen, Huaxiu Yao

专题命中 AI治理与伦理 :alignment(abstract);trustworthy(abstract);分类 cs.CL、cs.AI、cs.CY

AI总结 本文综述了基础模型的可靠和负责任发展,探讨了偏见、安全、不确定性等关键问题,并提出了未来研究方向。

Comments TMLR camera-ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07799 2026-02-10 cs.LG cs.AI 62%

Fairness Aware Reward Optimization

公平感知的奖励优化

Ching Lam Choi, Vighnesh Subramaniam, Phillip Isola, Antonio Torralba, Stefanie Jegelka

机构 * CSAIL, Department of EECS, Massachusetts Institute of Technology(计算机科学与人工智能实验室,电气工程与计算机科学系,麻省理工学院) School of CIT, MCML, MDSI, Technical University of Munich(信息科技学院,MCML,MDSI,慕尼黑技术大学)

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 Faro通过在处理过程中训练奖励模型,实现公平性、准确性与校准性的平衡,减少偏见并提升模型质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07312 2026-02-10 cs.HC 50%

Navigating Algorithmic Opacity: Folk Theories and User Agency in Semi-Autonomous Vehicles

穿越算法隐匿性:半自动驾驶车辆中用户自主性的folk理论

Yehuda Perry, Tawfiq Ammari

专题命中 AI治理与伦理 :safety(abstract)

AI总结 研究探讨了半自动驾驶车辆司机如何通过folk理论理解算法行为,揭示了司机在算法治理中的被动地位,并提出参与式算法治理框架以提升透明度和用户参与度。

详情

展开后加载摘要…

URL PDF HTML 收藏