arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2025-07-23 至 2025-07-23 共收录 7 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全评测 7 篇

2507.16033 2025-07-23 cs.HC cs.AI 79%

"Just a strange pic": Evaluating 'safety' in GenAI Image safety annotation tasks from diverse annotators' perspectives

Ding Wang, Mark Díaz, Charvi Rastogi, Aida Davani, Vinodkumar Prabhakaran, Pushkar Mishra, Roma Patel, Alicia Parrish, Zoe Ashwood, Michela Paganini, Tian Huey Teh, Verena Rieser, Lora Aroyo

专题命中 安全评测 :safety(title,abstract);分类 cs.AI

Comments Accepted to AAAI/ACM Conference on Artificial Intelligence, Ethics, and Society 2025 (AIES 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.10706 2025-07-23 cs.CL cs.AI cs.CY cs.HC cs.RO 75%

SciFi-Benchmark: Leveraging Science Fiction To Improve Robot Behavior

Pierre Sermanet, Anirudha Majumdar, Vikas Sindhwani

专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.CL、cs.AI、cs.CY

Comments Minor improvements over previous version

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.16206 2025-07-23 cs.LG cs.AI 73%

METER: Multi-modal Evidence-based Thinking and Explainable Reasoning -- Algorithm and Benchmark

Xu Yang, Qi Zhang, Shuming Jiang, Yaowen Xu, Zhaofan Zou, Hao Sun, Xuelong Li

机构 * Institute of Artificial Intelligence (TeleAI), China Telecom(电信人工智能研究院) Institute of Artificial Intelligence and Robotics(IAIR), Xi’an Jiaotong University(人工智能与机器人研究院) Advanced Technique of Artificial Intelligence(ATAI), Chongqing University of Technology(人工智能先进技术研究院)

专题命中 安全评测 :DPO(abstract);safety(abstract);分类 cs.AI、cs.LG

Comments 9 pages,3 figures ICCV format

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.05119 2025-07-23 cs.LG cs.AI cs.AR cs.CV eess.IV 62%

Balancing Robustness and Efficiency in Embedded DNNs Through Activation Function Selection

Jon Gutiérrez-Zaballa, Koldo Basterretxea, Javier Echanobe

机构 * Department of Electronics Technology, University of the Basque Country (UPV/EHU)(电子技术系,巴斯克国家大学(UPV/EHU)) Department of Electricity and Electronics, University of the Basque Country (UPV/EHU)(电力与电子系,巴斯克国家大学(UPV/EHU))

专题命中 安全评测 :safety(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.15874 2025-07-23 cs.AI cs.CL 62%

Why Braking? Scenario Extraction and Reasoning Utilizing LLM

Yin Wu, Daniel Slieter, Vivek Subramanian, Ahmed Abouelazm, Robin Bohn, J. Marius Zöllner

机构 * CARIAD SE(CARIAD公司) Karlsruhe Institute of Technology(卡尔斯鲁厄理工学院) FZI Research Center for Information Technology(弗劳恩霍夫信息技术研究中心)

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.15868 2025-07-23 cs.CL cs.AI 62%

Small Edits, Big Consequences: Telling Good from Bad Robustness in Large Language Models

Altynbek Ismailov, Salia Asanova

机构 * Berkeley(伯克利)

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.16572 2025-07-23 cs.CL 57%

Pixels to Principles: Probing Intuitive Physics Understanding in Multimodal Language Models

Mohamad Ballout, Serwan Jassim, Elia Bruni

机构 * Institute of Cognitive Science, University of Osnabrück(认知科学研究所,奥斯纳布吕克大学)

专题命中 安全评测 :alignment(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏