arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2025-08-05 至 2025-08-05 共收录 48 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 其他安全 19 篇

2504.07360 2025-08-05 cs.CL cs.AI cs.LG 82%

Enhancing Time Series Forecasting via Multi-Level Text Alignment with LLMs

Taibiao Zhao, Xiaobing Chen, Mingxuan Sun

机构 * Louisiana State University(路易斯安那州立大学)

专题命中 其他安全 :alignment(title,abstract);分类 cs.CL、cs.AI、cs.LG

Comments This paper is accepted by DASFAA2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.01279 2025-08-05 cs.HC 78%

ViseGPT: Towards Better Alignment of LLM-generated Data Wrangling Scripts and User Prompts

Jiajun Zhu, Xinyu Cheng, Zhongsu Luo, Yunfan Zhou, Xinhuan Shu, Di Weng, Yingcai Wu

专题命中 其他安全 :alignment(title,abstract)

Comments Accepted at Annual ACM Symposium on User Interface Software and Technology (UIST'25), September 28-October 1, 2025, Busan, Republic of Korea

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.00945 2025-08-05 cs.CV 78%

Optimizing Vision-Language Consistency via Cross-Layer Regional Attention Alignment

Yifan Wang, Hongfeng Ai, Quangao Liu, Maowei Jiang, Ruiyuan Kang, Ruiqi Li, Jiahua Dong, Mengting Xiao, Cheng Jiang, Chenzhong Li

机构 * School of Medicine, The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)医学院) Shenyang Institute of Automation, Chinese Academy of Sciences(中国科学院沈阳自动化研究所) Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) Wave and Machine Intelligence Department, Technology Innovation Institute(技术创新研究院波浪与机器智能部门) University of the Chinese Academy of Sciences(中国科学院大学) McGill University(麦吉尔大学)

专题命中 其他安全 :alignment(title,abstract)

Comments 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.16772 2025-08-05 cs.CY cs.AI cs.LG 78%

Assessing Social Alignment: Do Personality-Prompted Large Language Models Behave Like Humans?

Ivan Zakazov, Mikolaj Boronski, Lorenzo Drudi, Robert West

机构 * EPFL(苏黎世联邦理工学院)

专题命中 其他安全 :alignment(title);分类 cs.AI、cs.CY、cs.LG

Comments Accepted to NeurIPS 2024 Workshop on Behavioral Machine Learning

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.07448 2025-08-05 cs.LG cs.AI cs.CL 75%

LoRI: Reducing Cross-Task Interference in Multi-Task Low-Rank Adaptation

Juzheng Zhang, Jiacheng You, Ashwinee Panda, Tom Goldstein

机构 * University of Maryland(马里兰大学) Tsinghua University(清华大学)

专题命中 其他安全 :alignment(abstract);safety(abstract);分类 cs.CL、cs.AI、cs.LG

Comments COLM 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.03687 2025-08-05 cs.IR 71%

Fine-grained Alignment of Large Language Models for General Medication Recommendation without Overprescription

Zihao Zhao, Chenxiao Fan, Junlong Liu, Zheng Wang, Xiangnan He, Chongming Gao, Juan Li, Fuli Feng

专题命中 其他安全 :alignment(title)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.01059 2025-08-05 cs.CR cs.AI 70%

Llama-3.1-FoundationAI-SecurityLLM-8B-Instruct Technical Report

Sajana Weerawardhena, Paul Kassianik, Blaine Nelson, Baturay Saglam, Anu Vellore, Aman Priyanshu, Supriti Vijay, Massimo Aufiero, Arthur Goldblatt, Fraser Burch, Ed Li, Jianliang He, Dhruv Kedia, Kojin Oshiba, Zhouran Yang, Yaron Singer, Amin Karbasi

专题命中 其他安全 :alignment(abstract);safety(abstract);分类 cs.AI

Comments 34 pages - Technical Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.02215 2025-08-05 cs.LG cs.AI cs.CL 67%

LeanK: Learnable K Cache Channel Pruning for Efficient Decoding

Yike Zhang, Zhiyuan He, Huiqiang Jiang, Chengruidong Zhang, Yuqing Yang, Jianyong Wang, Lili Qiu

机构 * Tsinghua University(清华大学) Microsoft Research(微软研究院)

专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.19151 2025-08-05 cs.RO cs.AI cs.LG cs.MA 62%

ReCoDe: Reinforcement Learning-based Dynamic Constraint Design for Multi-Agent Coordination

Michael Amir, Guang Yang, Zhan Gao, Keisuke Okumura, Heedo Woo, Amanda Prorok

专题命中 其他安全 :safety(abstract);分类 cs.AI、cs.LG

Comments To appear in CoRL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.02027 2025-08-05 cs.LG 57%

An Evolving Scenario Generation Method based on Dual-modal Driver Model Trained by Multi-Agent Reinforcement Learning

Xinzheng Wu, Junyi Chen, Shaolingfeng Ye, Wei Jiang, Yong Shen

机构 * School of Automitive Studies, Tongji University(自动化学院,同济大学)

专题命中 其他安全 :safety(abstract);分类 cs.LG

Comments 16 pages, 17 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.23463 2025-08-05 cs.CL 57%

What to Keep and What to Drop: Adaptive Table Filtering Framework

WonJune Jang

机构 * Department of Mathematics(数学系)

专题命中 其他安全 :alignment(abstract);分类 cs.CL

Comments 26 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.00876 2025-08-05 cs.LG cond-mat.mtrl-sci 57%

A Data-Driven Machine Learning Approach for Predicting Axial Load Capacity in Steel Storage Rack Columns

Bakhtiyar Mammadli, Casim Yazici, Muhammed Gürbüz, İrfan Kocaman, F. Javier Dominguez-Gutierrez, Fatih Mehmet Özkal

专题命中 其他安全 :safety(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.02335 2025-08-05 cs.SE cs.DL 50%

Interoperable verification and dissemination of software assets in repositories using COAR Notify

Matteo Cancellieri, Martin Docekal, David Pride, Morane Gruenpeter, David Douard, Petr Knoth

专题命中 其他安全 :alignment(abstract)

Comments 8 pages. Presented at the 20th International Conference on Open Repositories, June 15-18 2025, Chicago, Illinois, USA

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.01805 2025-08-05 cs.NI 50%

M3LLM: Model Context Protocol-aided Mixture of Vision Experts For Multimodal LLMs in Networks

Yongjie Zeng, Hongyang Du

专题命中 其他安全 :alignment(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.01226 2025-08-05 cs.IR cs.MM 50%

CM$^3$: Calibrating Multimodal Recommendation

Xin Zhou, Yongjie Wang, Zhiqi Shen

专题命中 其他安全 :alignment(abstract)

Comments Working Paper: https://github.com/enoche/CM3

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.02331 2025-08-05 cs.CV cs.SD 50%

VAEmo: Efficient Representation Learning for Visual-Audio Emotion with Knowledge Injection

Hao Cheng, Zhiwei Zhao, Yichao He, Zhenzhen Hu, Jia Li, Meng Wang, Richang Hong

机构 * Hefei University of Technology(合肥工业大学)

专题命中 其他安全 :alignment(abstract)

Comments Source code and pre-trained models will be available at https://github.com/MSA-LMC/VAEmo

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.11020 2025-08-05 cs.NI cs.GR 50%

Enhancing Vehicular Networks with Generative AI: Opportunities and Challenges

Teef David, Kassi Muhammad, Kevin Nassisid, Bronny Farus

专题命中 其他安全 :safety(abstract)

Comments arXiv admin note: This paper has been withdrawn by arXiv due to disputed and unverifiable authorship and affiliation

详情

展开后加载摘要…

URL PDF HTML 收藏
2307.15640 2025-08-05 cs.CV cs.MM 50%

CLIP Brings Better Features to Visual Aesthetics Learners

Liwu Xu, Jinjin Xu, Yuzhe Yang, Xilu Wang, Yijie Huang, Yaqian Li

机构 * OPPO AI Center(OPPO人工智能中心) University of Surrey(塞弗尔大学)

专题命中 其他安全 :alignment(abstract)

Comments ICME 2025 Oral

详情

展开后加载摘要…

URL PDF HTML 收藏