arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2025-10-30 至 2025-10-30 共收录 14 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全评测 14 篇

2506.14866 2025-10-30 cs.SE cs.LG 83%

OS-Harm: A Benchmark for Measuring Safety of Computer Use Agents

Thomas Kuntz, Agatha Duzan, Hao Zhao, Francesco Croce, Zico Kolter, Nicolas Flammarion, Maksym Andriushchenko

机构 * EPFL(苏黎世联邦理工学院) Carnegie Mellon University(卡内基梅隆大学)

专题命中 安全评测 :safety(title,abstract);prompt injection(abstract);分类 cs.LG

Comments NeurIPS 2025 Datasets & Benchmarks Track (Spotlight)

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.06497 2025-10-30 cs.CV cs.AI 79%

Evaluation of Safety Cognition Capability in Vision-Language Models for Autonomous Driving

Enming Zhang, Peizhe Gong, Xingyuan Dai, Min Huang, Yisheng Lv, Qinghai Miao

机构 * School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) State Key Laboratory of Multimodal Artificial Intelligence Systems, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所多模态人工智能系统国家重点实验室)

专题命中 安全评测 :safety(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.19169 2025-10-30 cs.CR cs.CL 70%

OpenGuardrails: A Configurable, Unified, and Scalable Guardrails Platform for Large Language Models

Thomas Wang, Haowen Li

机构 * The Hong Kong Polytechnic University(香港理工大学)

专题命中 安全评测 :safety(abstract);prompt injection(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.24898 2025-10-30 eess.SY cs.SY 67%

Delay Tolerant Control for Autonomous Driving Using CDOB

Xincheng Cao, Haochong Chen, Levent Guvenc, Bilin Aksun-Guvenc

专题命中 安全评测 :alignment(abstract);safety(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.24811 2025-10-30 cs.CL cs.AI cs.LG 67%

ProofSketch: Efficient Verified Reasoning for Large Language Models

Disha Sheshanarayana, Tanishka Magar

机构 * Manipal University Jaipur(马普尔大学斋普尔)

专题命中 安全评测 :trustworthy(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Accepted at NeurIPS 2025, ER Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.25771 2025-10-30 cs.CL cs.AI 62%

Gaperon: A Peppered English-French Generative Language Model Suite

Nathan Godey, Wissam Antoun, Rian Touchent, Rachel Bawden, Éric de la Clergerie, Benoît Sagot, Djamé Seddah

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.25571 2025-10-30 cs.LG cs.DS cs.NA math.NA math.SP math.ST stat.TH 57%

Perturbation Bounds for Low-Rank Inverse Approximations under Noise

Phuc Tran, Nisheeth K. Vishnoi

机构 * Yale University(耶鲁大学)

专题命中 安全评测 :alignment(abstract);分类 cs.LG

Comments NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.25413 2025-10-30 cs.CL 57%

Seeing, Signing, and Saying: A Vision-Language Model-Assisted Pipeline for Sign Language Data Acquisition and Curation from Social Media

Shakib Yazdani, Yasser Hamidullah, Cristina España-Bonet, Josef van Genabith

机构 * German Research Center for Artificial Intelligence (DFKI GmbH)(德国人工智能研究中心(DFKI GmbH)) Saarland Informatics Campus(萨尔兰州信息技术校区) Barcelona Supercomputing Center (BSC-CNS)(巴塞罗那超级计算中心(BSC-CNS))

专题命中 安全评测 :alignment(abstract);分类 cs.CL

Comments Accepted by RANLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.25091 2025-10-30 cs.AI 57%

H3M-SSMoEs: Hypergraph-based Multimodal Learning with LLM Reasoning and Style-Structured Mixture of Experts

Peilin Tan, Liang Xie, Churan Zhi, Dian Tu, Chuanqi Shi

机构 * University of California, San Diego(加州大学圣迭戈分校) Wuhan University of Technology(武汉科技大学)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.24951 2025-10-30 cs.LG cs.AR cs.NE 57%

Resource-Efficient and Robust Inference of Deep and Bayesian Neural Networks on Embedded and Analog Computing Platforms

Bernhard Klein

专题命中 安全评测 :trustworthy(abstract);分类 cs.LG

Comments Ph.D. dissertation, Heidelberg University, October 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.24749 2025-10-30 cs.SE cs.AI 57%

Beyond Function-Level Search: Repository-Aware Dual-Encoder Code Retrieval with Adversarial Verification

Aofan Liu, Shiyuan Song, Haoxuan Li, Cehao Yang, Yiyan Qi

机构 * International Digital Economy Academy (IDEA)(国际数字经济学院) School of Electronic and Computer Engineering, Peking University(电子与计算机工程学院,北京大学) Shenzhen International Graduate School, Tsinghua University(深圳国际研究生院,清华大学)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

Comments Accepted by EMNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.10266 2025-10-30 cs.CV cs.AI 57%

SignMouth: Leveraging Mouthing Cues for Sign Language Translation by Multimodal Contrastive Fusion

Wenfang Wu, Tingting Yuan, Yupeng Li, Daling Wang, Xiaoming Fu

专题命中 安全评测 :alignment(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.24999 2025-10-30 cs.CR 50%

SLIP-SEC: Formalizing Secure Protocols for Model IP Protection

Racchit Jain, Satya Lokam, Yehonathan Refael, Adam Hakim, Lev Greenberg, Jay Tenenbaum

专题命中 安全评测 :safety(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.03089 2025-10-30 cs.CV q-bio.NC 50%

Explicitly Modeling Subcortical Vision with a Neuro-Inspired Front-End Improves CNN Robustness

Lucas Piper, Arlindo L. Oliveira, Tiago Marques

机构 * INESC-ID Instituto Superior Técnico(理工学院) Universidade de Lisboa(里斯本大学) Breast Cancer Research Program(乳腺癌研究计划) Champalimaud Foundation(恰帕拉马德基金会) Faculdade de Medicina de Lisboa(里斯本医学院)

专题命中 安全评测 :alignment(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏