arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2025-09-25 至 2025-09-25 共收录 12 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全评测 12 篇

2509.20146 2025-09-25 cs.CV cs.AI 70%

EchoBench: Benchmarking Sycophancy in Medical Large Vision-Language Models

Botai Yuan, Yutian Zhou, Yingjie Wang, Fushuo Huo, Yongcheng Jing, Li Shen, Ying Wei, Zhiqi Shen, Ziwei Liu, Tianwei Zhang, Jie Yang, Dacheng Tao

机构 * Nanyang Technological University(南洋理工大学) Shanghai Jiao Tong University(上海交通大学) Fudan University(复旦大学) Sun Yat-sen University(中山大学) Zhejiang University(浙江大学)

专题命中 安全评测 :safety(abstract);trustworthy(abstract);分类 cs.AI

Comments 29 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.19325 2025-09-25 cs.CL 70%

How Much of Your Data Can Suck? Thresholds for Domain Performance and Emergent Misalignment in LLMs

Jian Ouyang, Arman T, Ge Jin

机构 * Invisible Technologies(隐形技术)

专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23745 2025-09-25 cs.CV cs.AI cs.LG 62%

To Trust Or Not To Trust Your Vision-Language Model's Prediction

Hao Dong, Moru Liu, Jian Liang, Eleni Chatzi, Olga Fink

专题命中 安全评测 :safety(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.08810 2025-09-25 cs.CR cs.AI 57%

Machine Learning-Based Detection of DDoS Attacks in VANETs for Emergency Vehicle Communication

Bappa Muktar, Vincent Fono, Adama Nouboukpo

机构 * Department of Computer Science University of Quebec in Outaouais (UQO)(计算机科学系魁北克大学 Outaouais 分校)

专题命中 安全评测 :safety(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.19604 2025-09-25 cs.LG 57%

Improved Therapeutic Antibody Reformatting through Multimodal Machine Learning

Jiayi Xin, Aniruddh Raghu, Nick Bhattacharya, Adam Carr, Melanie Montgomery, Hunter Elliott

机构 * University of Pennsylvania(宾夕法尼亚大学) BigHat Biosciences(BigHat生物技术公司)

专题命中 安全评测 :safety(abstract);分类 cs.LG

Comments NeurIPS 2025 AI4Science Workshop and NeurIPS 2025 Multi-modal Foundation Models and Large Language Models for Life Sciences Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.01301 2025-09-25 cs.CL 57%

Culture is Everywhere: A Call for Intentionally Cultural Evaluation

Juhyun Oh, Inha Cha, Michael Saxon, Hyunseung Lim, Shaily Bhatt, Alice Oh

专题命中 安全评测 :alignment(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.00935 2025-09-25 cs.CR cs.AI 57%

Measuring Harmfulness of Computer-Using Agents

Aaron Xuxiang Tian, Ruofan Zhang, Janet Tang, Ji Wang, Tianyu Shi, Jiaxin Wen

机构 * Arizona State University(亚利桑那州立大学) University of California, Berkeley(加州大学伯克利分校)

专题命中 安全评测 :safety(abstract);分类 cs.AI

Comments 17 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23368 2025-09-25 cs.CL 57%

Threading the Needle: Reweaving Chain-of-Thought Reasoning to Explain Human Label Variation

Beiduo Chen, Yang Janet Liu, Anna Korhonen, Barbara Plank

专题命中 安全评测 :alignment(abstract);分类 cs.CL

Comments Accepted by EMNLP 2025 Main (Oral), 25 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16180 2025-09-25 cs.CV cs.CL 57%

Redemption Score: A Multi-Modal Evaluation Framework for Image Captioning via Distributional, Perceptual, and Linguistic Signal Triangulation

Ashim Dahal, Ankit Ghimire, Saydul Akbar Murad, Nick Rahimi

机构 * University of Southern Mississippi(密苏里州南方大学)

专题命中 安全评测 :alignment(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.18485 2025-09-25 q-bio.NC cs.CV 50%

Deciphering Functions of Neurons in Vision-Language Models

Jiaqi Xu, Cuiling Lan, Yan Lu

机构 * University of Science and Technology of China(中国科学技术大学) Microsoft Research Asia(微软亚洲研究院)

专题命中 安全评测 :trustworthy(abstract)

Comments Accepted by the 31st ACM International Conference on Multimedia (ACM MM 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.19958 2025-09-25 cs.RO 50%

Generalist Robot Manipulation beyond Action Labeled Data

Alexander Spiridonov, Jan-Nico Zaech, Nikolay Nikolov, Luc Van Gool, Danda Pani Paudel

机构 * ETH Zurich, Switzerland(苏黎世联邦理工学院,瑞士)

专题命中 安全评测 :alignment(abstract)

Comments Accepted at Conference on Robot Learning 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.19831 2025-09-25 eess.AS 50%

SCORE: Scaling audio generation using Standardized COmposite REwards

Jaemin Jung, Jaehun Kim, Inkyu Shin, Joon Son Chung

专题命中 安全评测 :alignment(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏