arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 8057 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 其他安全 8057 篇

2508.03042 2025-08-06 cs.LG 57%

Urban In-Context Learning: Bridging Pretraining and Inference through Masked Diffusion for Urban Profiling

Ruixing Zhang, Bo Wang, Tongyu Zhu, Leilei Sun, Weifeng Lv

专题命中 其他安全 :alignment(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.02755 2025-08-06 physics.hist-ph cs.AI 57%

Beyond the Wavefunction: Qualia Abstraction Language Mechanics and the Grammar of Awareness

Mikołaj Sienicki, Krzysztof Sienicki

机构 * Polish-Japanese Academy of Information Technology(波兰-日本信息科技学院) Chair of Theoretical Physics of Naturally Intelligent Systems(自然智能系统理论物理系)

专题命中 其他安全 :alignment(abstract);分类 cs.AI

Comments 65 pages, 49 references, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17696 2025-08-06 cs.AI cs.SY eess.SY 57%

Enhancing AI System Resiliency: Formulation and Guarantee for LSTM Resilience Based on Control Theory

Sota Yoshihara, Ryosuke Yamamoto, Hiroyuki Kusumoto, Masanari Shimura

机构 * Graduate School of Mathematics, Nagoya University, Aichi, Japan(名古屋大学数学研究科)

专题命中 其他安全 :safety(abstract);分类 cs.AI

Comments 9 pages, 6 figures. Appendix: 16 pages. First three listed authors have equal contributions

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.02027 2025-08-05 cs.LG 57%

An Evolving Scenario Generation Method based on Dual-modal Driver Model Trained by Multi-Agent Reinforcement Learning

Xinzheng Wu, Junyi Chen, Shaolingfeng Ye, Wei Jiang, Yong Shen

机构 * School of Automitive Studies, Tongji University(自动化学院,同济大学)

专题命中 其他安全 :safety(abstract);分类 cs.LG

Comments 16 pages, 17 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.23463 2025-08-05 cs.CL 57%

What to Keep and What to Drop: Adaptive Table Filtering Framework

WonJune Jang

机构 * Department of Mathematics(数学系)

专题命中 其他安全 :alignment(abstract);分类 cs.CL

Comments 26 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.00876 2025-08-05 cs.LG cond-mat.mtrl-sci 57%

A Data-Driven Machine Learning Approach for Predicting Axial Load Capacity in Steel Storage Rack Columns

Bakhtiyar Mammadli, Casim Yazici, Muhammed Gürbüz, İrfan Kocaman, F. Javier Dominguez-Gutierrez, Fatih Mehmet Özkal

专题命中 其他安全 :safety(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.00395 2025-08-04 cs.CV cs.AI 57%

Decouple before Align: Visual Disentanglement Enhances Prompt Tuning

Fei Zhang, Tianfei Zhou, Jiangchao Yao, Ya Zhang, Ivor W. Tsang, Yanfeng Wang

机构 * Cooperative Medianet Innovation Center, Shanghai Jiao Tong University(合作中位网创新中心,上海交通大学) School of Artificial Intelligence, Shanghai Jiao Tong University(人工智能学院,上海交通大学) Shanghai Innovation Institute(上海创新研究院) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Beijing Institute of Technology(北京理工大学) A*STAR Centre for Frontier AI Research(A*STAR前沿人工智能研究中心)

专题命中 其他安全 :alignment(abstract);分类 cs.AI

Comments 16 pages, Accepted at IEEE Transactions on Pattern Analysis and Machine Intelligence (TPAMI)

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.22879 2025-08-01 cs.IR cs.CL 57%

RecGPT Technical Report

Chao Yi, Dian Chen, Gaoyang Guo, Jiakai Tang, Jian Wu, Jing Yu, Mao Zhang, Sunhao Dai, Wen Chen, Wenjun Yang, Yuning Jiang, Zhujin Gao, Bo Zheng, Chi Li, Dimin Wang, Dixuan Wang, Fan Li, Fan Zhang, Haibin Chen, Haozhuang Liu, Jialin Zhu, Jiamang Wang, Jiawei Wu, Jin Cui, Ju Huang, Kai Zhang, Kan Liu, Lang Tian, Liang Rao, Longbin Li, Lulu Zhao, Na He, Peiyang Wang, Qiqi Huang, Tao Luo, Wenbo Su, Xiaoxiao He, Xin Tong, Xu Chen, Xunke Xi, Yang Li, Yaxuan Wu, Yeqiu Yang, Yi Hu, Yinnan Song, Yuchen Li, Yujie Luo, Yujin Yuan, Yuliang Yan, Zhengyang Wang, Zhibo Xiao, Zhixin Ma, Zile Zhou, Ziqi Zhang

专题命中 其他安全 :alignment(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.07797 2025-08-01 cs.LG 57%

A Theoretical Framework for Explaining Reinforcement Learning with Shapley Values

Daniel Beechey, Thomas M. S. Smith, Özgür Şimşek

机构 * University of Bath(巴斯大学)

专题命中 其他安全 :safety(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.23058 2025-08-01 cs.CV cs.AI 57%

Reference-Guided Diffusion Inpainting For Multimodal Counterfactual Generation

Alexandru Buburuzan

机构 * Department of Computer Science(计算机科学系)

专题命中 其他安全 :safety(abstract);分类 cs.AI

Comments A dissertation submitted to The University of Manchester for the degree of Bachelor of Science in Artificial Intelligence

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.20536 2025-07-30 cs.CV cs.AI cs.HC 57%

T2I-Copilot: A Training-Free Multi-Agent Text-to-Image System for Enhanced Prompt Interpretation and Interactive Generation

Chieh-Yun Chen, Min Shi, Gong Zhang, Humphrey Shi

专题命中 其他安全 :alignment(abstract);分类 cs.AI

Comments ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.20786 2025-07-29 cs.CL 57%

Automating Thematic Review of Prevention of Future Deaths Reports: Replicating the ONS Child Suicide Study using Large Language Models

Sam Osian, Arpan Dutta, Sahil Bhandari, Iain E. Buchan, Dan W. Joyce

专题命中 其他安全 :safety(abstract);分类 cs.CL

Comments 8 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.20156 2025-07-29 cs.CV cs.AI 57%

Trust the Model: Compact VLMs as In-Context Judges for Image-Text Data Quality

Daulet Toibazar, Kesen Wang, Sherif Mohamed, Abdulaziz Al-Badawi, Abdulrahman Alfulayt, Pedro J. Moreno

机构 * Humain Riyadh, KSA(利雅得人类,沙特阿拉伯)

专题命中 其他安全 :alignment(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.01615 2025-07-29 cs.CL 57%

Large Language Models Are Human-Like Internally

Tatsuki Kuribayashi, Yohei Oseki, Souhaib Ben Taieb, Kentaro Inui, Timothy Baldwin

机构 * MBZUAI The University of Tokyo(东京大学) University of Mons(蒙斯大学) Tohoku University(东北大学) RIKEN(日本理化学研究所) The University of Melbourne(墨尔本大学)

专题命中 其他安全 :alignment(abstract);分类 cs.CL

Comments This is a pre-MIT Press publication version of the paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.07919 2025-07-28 cs.CL q-bio.BM 57%

Advancing biomolecular understanding and design following human instructions

Xiang Zhuang, Keyan Ding, Tianwen Lyu, Yinuo Jiang, Xiaotong Li, Zhuoyi Xiang, Zeyuan Wang, Ming Qin, Kehua Feng, Jike Wang, Qiang Zhang, Huajun Chen

专题命中 其他安全 :alignment(abstract);分类 cs.CL

Journal ref Nature Machine Intelligence volume 7, pages1154-1167 (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.17874 2025-07-25 cs.AI 57%

I2I-STRADA -- Information to Insights via Structured Reasoning Agent for Data Analysis

SaiBarath Sundar, Pranav Satheesan, Udayaadithya Avadhanam

机构 * Mphasis Limited(默比斯有限公司)

专题命中 其他安全 :alignment(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.17080 2025-07-24 cs.IR cs.AI cs.CV 57%

VL-CLIP: Enhancing Multimodal Recommendations via Visual Grounding and LLM-Augmented CLIP Embeddings

Ramin Giahi, Kehui Yao, Sriram Kollipara, Kai Zhao, Vahid Mirjalili, Jianpeng Xu, Topojoy Biswas, Evren Korpeoglu, Kannan Achan

机构 * Walmart Global Tech(沃尔玛全球技术)

专题命中 其他安全 :alignment(abstract);分类 cs.AI

Comments Accepted at RecSys 2025; DOI:https://doi.org/10.1145/3705328.3748064

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.17055 2025-07-24 cs.RO cs.LG 57%

Shared Control of Holonomic Wheelchairs through Reinforcement Learning

Jannis Bähler, Diego Paez-Granados, Jorge Peña-Queralta

机构 * Swiss Paraplegic Research, SPF(瑞士瘫痪研究机构) SCAI Lab, D-HEST, Swiss Federal School of Technology in Zurich - ETH Zurich(SCAI实验室,瑞士联邦理工学院-苏黎世-ETH Zurich) Centre for Artificial Ingelligece, Zurich University of Applied Sciences - ZHAW. Switzerland(人工智能中心,瑞士应用科学大学-ZHAW)

专题命中 其他安全 :safety(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.16947 2025-07-24 cs.CL 57%

AI-based Clinical Decision Support for Primary Care: A Real-World Study

Robert Korom, Sarah Kiptinness, Najib Adan, Kassim Said, Catherine Ithuli, Oliver Rotich, Boniface Kimani, Irene King'ori, Stellah Kamau, Elizabeth Atemba, Muna Aden, Preston Bowman, Michael Sharman, Rebecca Soskin Hicks, Rebecca Distler, Johannes Heidecke, Rahul K. Arora, Karan Singhal

机构 * Penda Health(Penda健康) Nairobi County(内罗毕县) OpenAI

专题命中 其他安全 :safety(abstract);分类 cs.CL

Comments Blog: https://openai.com/index/ai-clinical-copilot-penda-health/

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.12122 2025-07-24 cs.RO cs.AI 57%

ICCO: Learning an Instruction-conditioned Coordinator for Language-guided Task-aligned Multi-robot Control

Yoshiki Yano, Kazuki Shibata, Maarten Kokshoorn, Takamitsu Matsubara

机构 * Division of Information Science, Graduate School of Science and Technology, Nara Institute of Science and Technology (NAIST)(信息科学系,科学技术研究生学校,科学与技术国立研究所) Department of Cognitive Robotics, Faculty of Mechanical Engineering, Delft University of Technology(认知机器人系,机械工程学院,代尔夫特理工大学)

专题命中 其他安全 :alignment(abstract);分类 cs.AI

Comments 8 pages, 9 figures, to be published in the 2025 IEEE/RSJ International Conference on Intelligent Robots and Systems

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.18527 2025-07-23 cs.IR cs.LG 57%

Probing Ranking LLMs: A Mechanistic Analysis for Information Retrieval

Tanya Chowdhury, Atharva Nijasure, James Allan

机构 * University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校)

专题命中 其他安全 :alignment(abstract);分类 cs.LG

Comments 9 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.02304 2025-07-23 cs.CL cs.CV 57%

Generative Sign-description Prompts with Multi-positive Contrastive Learning for Sign Language Recognition

Siyu Liang, Yunan Li, Wentian Xin, Huizhou Chen, Xujie Liu, Kang Liu, Qiguang Miao

机构 * Xidian University(西安电子科技大学)

专题命中 其他安全 :alignment(abstract);分类 cs.CL

Comments 9 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.15851 2025-07-22 cs.AI 57%

The Other Mind: How Language Models Exhibit Human Temporal Cognition

Lingyu Li, Yang Yao, Yixu Wang, Chubo Li, Yan Teng, Yingchun Wang

专题命中 其他安全 :alignment(abstract);分类 cs.AI

Comments 12 pages, 9 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.10406 2025-07-22 cs.CV cs.AI 57%

RealGeneral: Unifying Visual Generation via Temporal In-Context Learning with Video Models

Yijing Lin, Mengqi Huang, Shuhan Zhuang, Zhendong Mao

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 其他安全 :alignment(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.04510 2025-07-22 cs.SE cs.AI 57%

CGP-Tuning: Structure-Aware Soft Prompt Tuning for Code Vulnerability Detection

Ruijun Feng, Hammond Pearce, Pietro Liguori, Yulei Sui

机构 * School of Computer Science and Engineering, University of New South Wales (UNSW)(新南威尔士大学计算机科学与工程学院) Department of Electrical Engineering and Information Technology, University of Naples Federico II(那不勒斯费德里克二世大学电气工程与信息技术系)

专题命中 其他安全 :alignment(abstract);分类 cs.AI

Comments Accepted by IEEE Transactions on Software Engineering

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.01639 2025-07-22 cs.LG cs.SE 57%

ModelVerification.jl: a Comprehensive Toolbox for Formally Verifying Deep Neural Networks

Tianhao Wei, Hanjiang Hu, Luca Marzari, Kai S. Yun, Peizhi Niu, Xusheng Luo, Changliu Liu

机构 * Carnegie Mellon University(卡内基梅隆大学) University of Verona(威尼斯大学)

专题命中 其他安全 :safety(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.14260 2025-07-22 physics.optics cs.LG 57%

Automating Experimental Optics with Sample Efficient Machine Learning Methods

Arindam Saha, Baramee Charoensombutamon, Thibault Michel, V. Vijendran, Lachlan Walker, Akira Furusawa, Syed M. Assad, Ben C. Buchler, Ping Koy Lam, Aaron D. Tranter

机构 * Australian National University(澳大利亚国立大学) University of Tokyo(东京大学) Agency for Science, Technology and Research(科技研究局) pi Software(2pi软件)

专题命中 其他安全 :alignment(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.16824 2025-07-22 cs.CV cs.AI 57%

PerspectiveNet: Multi-View Perception for Dynamic Scene Understanding

Vinh Nguyen

机构 * Uppsala University(乌普萨拉大学) Florida Institute of Technology(佛罗里达理工学院)

专题命中 其他安全 :safety(abstract);分类 cs.AI

Comments 6 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.12950 2025-07-21 cs.LG 57%

Insights into a radiology-specialised multimodal large language model with sparse autoencoders

Kenza Bouzid, Shruthi Bannur, Felix Meissen, Daniel Coelho de Castro, Anton Schwaighofer, Javier Alvarez-Valle, Stephanie L. Hyland

机构 * Microsoft Research, Health Futures, Cambridge, United Kingdom(微软研究院,健康未来,剑桥,英国)

专题命中 其他安全 :safety(abstract);分类 cs.LG

Comments Actionable Interpretability Workshop at ICML 2025. 24 pages, 7 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.17241 2025-07-17 cs.CL 57%

Understanding Language Model Circuits through Knowledge Editing

Huaizhi Ge, Frank Rudzicz, Zining Zhu

机构 * Columbia University(哥伦比亚大学) Dalhousie University(达尔豪斯大学) Stevens Institute of Technology(史蒂文斯理工学院)

专题命中 其他安全 :safety(abstract);分类 cs.CL

Comments A previous version of this document contained a hidden prompt entered by Z Zhu without knowledge of -- or consent by -- his co-authors. This version does not contain the prompt

详情

展开后加载摘要…

URL PDF HTML 收藏