arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2025-08-25 至 2025-08-25 共收录 32 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 偏好对齐 5 篇

2508.15805 2025-08-25 cs.CL cs.AI cs.LG 67%

ALAS: Autonomous Learning Agent for Self-Updating Language Models

Dhruv Atreja

机构 * Dhruv Atreja(独立研究者)

专题命中 偏好对齐 :DPO(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.10652 2025-08-25 cs.CL cs.AI cs.CY 67%

Can Large Language Models Simulate Human Responses? A Case Study of Stated Preference Experiments in the Context of Heating-related Choices

Han Wang, Jacek Pawlak, Aruna Sivakumar

专题命中 偏好对齐 :alignment(abstract);分类 cs.CL、cs.AI、cs.CY

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.15790 2025-08-25 cs.CL cs.AI 62%

KG-o1: Enhancing Multi-hop Question Answering in Large Language Models via Knowledge Graph Integration

Nan Wang, Yongqi Fan, yansha zhu, ZongYu Wang, Xuezhi Cao, Xinyan He, Haiyun Jiang, Tong Ruan, Jingping Liu

专题命中 偏好对齐 :DPO(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.01819 2025-08-25 cs.LG cs.AI math.OC 62%

Score as Action: Fine-Tuning Diffusion Generative Models by Continuous-time Reinforcement Learning

Hanyang Zhao, Haoxian Chen, Ji Zhang, David D. Yao, Wenpin Tang

机构 * StonyBrook(石溪大学)

专题命中 偏好对齐 :RLHF(abstract);分类 cs.AI、cs.LG

Comments arXiv admin note: text overlap with arXiv:2409.08400

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.03789 2025-08-25 cs.CV 50%

HPSv3: Towards Wide-Spectrum Human Preference Score

Yuhang Ma, Yunhao Shui, Xiaoshi Wu, Keqiang Sun, Hongsheng Li

机构 * Mizzen AI CUHK MMLab(香港大学MMLab) King’s College London(伦敦国王学院) Shanghai Jiaotong University(上海交通大学) Shanghai AI Laboratory(上海人工智能实验室) CPII, InnoHK(创新香港科技促进会)

专题命中 偏好对齐 :alignment(abstract)

Comments ICCV2025

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 安全训练 1 篇

2502.11244 2025-08-25 cs.CL cs.AI 87%

Soteria: Language-Specific Functional Parameter Steering for Multilingual Safety Alignment

Somnath Banerjee, Sayan Layek, Pratyush Chatterjee, Animesh Mukherjee, Rima Hazra

机构 * Indian Institute of Technology Kharagpur(印度理工学院卡里格普尔分校) Eindhoven University of Technology(埃因霍温理工大学)

专题命中 安全训练 :safety(title,abstract);alignment(title);分类 cs.CL、cs.AI

Comments Accepted at EMNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 越狱攻击 1 篇

2508.16484 2025-08-25 cs.CL 70%

HAMSA: Hijacking Aligned Compact Models via Stealthy Automation

Alexey Krylov, Iskander Vagizov, Dmitrii Korzh, Maryam Douiba, Azidine Guezzaz, Vladimir Kokh, Sergey D. Erokhin, Elena V. Tutubalina, Oleg Y. Rogov

机构 * MIPT(莫斯科国立信息安全学院) Sberbank(俄罗斯储蓄银行) AIRI(人工智能研究机构) MTUCI(莫斯科联邦大学) ISP RAS(俄罗斯科学院信息与通信技术研究所) Cadi Ayyad University(卡迪·艾亚德大学)

专题命中 越狱攻击 :alignment(abstract);jailbreak(abstract);分类 cs.CL

Comments 9 pages, 1 figure; article under review

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 幻觉与事实性 1 篇

2508.01225 2025-08-25 cs.CV cs.AI 57%

Multi-Cache Enhanced Prototype Learning for Test-Time Generalization of Vision-Language Models

Xinyu Chen, Haotian Zhai, Can Zhang, Xiupeng Shi, Ruirui Li

机构 * Shanghai University(上海大学) Beijing University of Chemical Technology(北京化工大学) University of Minnesota(明尼苏达大学)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.AI

Comments Accepted by ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 安全评测 12 篇

2508.16157 2025-08-25 cs.CV cs.AI 79%

Beyond Human-prompting: Adaptive Prompt Tuning with Semantic Alignment for Anomaly Detection

Pi-Wei Chen, Jerry Chun-Wei Lin, Wei-Han Chen, Jia Ji, Zih-Ching Chen, Feng-Hao Yeh, Chao-Chun Chen

机构 * Silesian University of Technology(西里西亚技术大学) National Cheng Kung University(国立成功大学) Nvidia AI Technology Center(Nvidia AI技术中心)

专题命中 安全评测 :alignment(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.16213 2025-08-25 cs.CV 78%

MedOmni-45°: A Safety-Performance Benchmark for Reasoning-Oriented LLMs in Medicine

Kaiyuan Ji, Yijin Guo, Zicheng Zhang, Xiangyang Zhu, Yuan Tian, Ning Liu, Guangtao Zhai

专题命中 安全评测 :safety(title,abstract)

Comments 9 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.15839 2025-08-25 cs.CR cs.AI 77%

CIA+TA Risk Assessment for AI Reasoning Vulnerabilities

Yuksel Aydin

机构 * Independent Researcher(独立研究者)

专题命中 安全评测 :safety(abstract);trustworthy(abstract);AI safety(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.15797 2025-08-25 cs.CL cs.AI cs.LG 67%

Benchmarking the Medical Understanding and Reasoning of Large Language Models in Arabic Healthcare Tasks

Nouar AlDahoul, Yasir Zaki

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

Comments 5 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.15910 2025-08-25 cs.CL cs.AI cs.IR 62%

Evaluating Structured Decoding for Text-to-Table Generation: Evidence from Three Datasets

Julian Oestreich, Lydia Müller

机构 * Institute for Applied Informatics (InfAI) at Leipzig University(应用信息学院(InfAI))

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI

Comments to be published in the workshop proceedings of the "From Rules to Language Models: Comparative Performance Evaluation" workshop, held alongside RANLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.15876 2025-08-25 cs.CL cs.AI cs.MA 62%

DeepMEL: A Multi-Agent Collaboration Framework for Multimodal Entity Linking

Fang Wang, Tianwei Yan, Zonghao Yang, Minghao Hu, Jun Zhang, Zhunchen Luo, Xiaoying Bai

机构 * School of Computer Science, Peking University(北京大学计算机科学学院) School of Information Science and Engineering, Chongqing Jiaotong University(重庆交通大学信息科学与工程学院) China Research and Development Academy of Machinery Equipment(机械电子研究发展院) Center of Information Research, Academy of Military Science(军事科学信息研究中心)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.15853 2025-08-25 cs.CL cs.AI cs.SD eess.AS 62%

MGSC: A Multi-granularity Consistency Framework for Robust End-to-end Asr

Xuwen Yang

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI

Comments 12 pages, 5figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.16097 2025-08-25 cs.LG stat.ML 57%

Machine Learning for Medicine Must Be Interpretable, Shareable, Reproducible and Accountable by Design

Ayyüce Begüm Bektaş, Mithat Gönen

专题命中 安全评测 :trustworthy(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.15983 2025-08-25 cond-mat.mtrl-sci cs.LG physics.comp-ph 57%

A simulation-based training framework for machine-learning applications in ARPES

MengXing Na, Chris Zhou, Sydney K. Y. Dufresne, Matteo Michiardi, Andrea Damascelli

机构 * Quantum Matter Institute, University of British Columbia, Vancouver, British Columbia, V6T 1Z4, Canada Department of Physics \& Astronomy, University of British Columbia, Vancouver, British Columbia, V6T 1Z1, Canada

专题命中 安全评测 :alignment(abstract);分类 cs.LG

Comments 9 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.15926 2025-08-25 cs.CE cs.AI 57%

Noise, Adaptation, and Strategy: Assessing LLM Fidelity in Decision-Making

Yuanjun Feng, Vivek Choudhary, Yash Raj Shrestha

机构 * University of Lausanne(洛桑大学) Nanyang Technological University(南洋理工大学)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

Comments Accepted to EMNLP 2025 (Main Conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.17173 2025-08-25 cs.LG cs.DC 57%

Robustness of deep learning classification to adversarial input on GPUs: asynchronous parallel accumulation is a source of vulnerability

Sanjif Shanmugavelu, Mathieu Taillefumier, Christopher Culver, Vijay Ganesh, Oscar Hernandez, Ada Sedova

机构 * Maxeler Technologies, a Groq Company(Maxeler Technologies,Groq公司) ETH Zurich / CSCS(苏黎世联邦理工学院 / CSCS) Georgia Institute of Technology(佐治亚理工学院) Oak Ridge National Laboratory(橡树岭国家实验室)

专题命中 安全评测 :safety(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.15429 2025-08-25 cs.SD 50%

AudioSet-R: A Refined AudioSet with Multi-Stage LLM Label Reannotation

Yulin Sun, Qisheng Xu, Yi Su, Qian Zhu, Yong Dou, Xinwang Liu, Kele Xu

机构 * College of Computer Science and Technology, National University of Defense Technology(计算机科学与技术学院,国防科技大学)

专题命中 安全评测 :alignment(abstract)

Comments 8 pages, 5 figures, accepted in ACM MM 2025 dataset track

详情

展开后加载摘要…

URL PDF HTML 收藏

6. AI治理与伦理 2 篇

2508.15798 2025-08-25 cs.CL cs.AI 79%

Persuasiveness and Bias in LLM: Investigating the Impact of Persuasiveness and Reinforcement of Bias in Language Models

Saumya Roy

机构 * Department of Mathematics and Computer Science(数学与计算机科学系) Data and Artificial Intelligence Research Group(数据与人工智能研究组)

专题命中 AI治理与伦理 :alignment(abstract);safety(abstract);trustworthy(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.16013 2025-08-25 cs.CL 57%

Political Ideology Shifts in Large Language Models

Pietro Bernardelle, Stefano Civelli, Leon Fröhling, Riccardo Lunardi, Kevin Roitero, Gianluca Demartini

机构 * The University of Queensland(昆士兰大学) University of Udine(乌迪内大学)

专题命中 AI治理与伦理 :safety(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏

7. 其他安全 10 篇

2508.15963 2025-08-25 cs.LG cs.CE cs.SY eess.SP eess.SY physics.ins-det 79%

Advancing rail safety: An onboard measurement system of rolling stock wheel flange wear based on dynamic machine learning algorithms

Celestin Nkundineza, James Ndodana Njaji, Samrawit Abubeker, Omar Gatera, Damien Hanyurwimfura

专题命中 其他安全 :safety(title,abstract);分类 cs.LG

Comments Journal article published in Transportation Research Record: The Journal of Transportation Research Board

Journal ref Transportation Research Record, 2679(7), 791-810 (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.15841 2025-08-25 cs.CL cs.LG 73%

A Review of Developmental Interpretability in Large Language Models

Ihor Kendiukhov

专题命中 其他安全 :safety(abstract);AI safety(abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.15796 2025-08-25 cs.CL cs.AI cs.CY cs.LG 70%

Benchmarking the Legal Reasoning of LLMs in Arabic Islamic Inheritance Cases

Nouar AlDahoul, Yasir Zaki

专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI、cs.CY

Comments 5 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.16059 2025-08-25 cs.AI cs.CL cs.LG 67%

Integrating Time Series into LLMs via Multi-layer Steerable Embedding Fusion for Enhanced Forecasting

Zhuomin Chen, Dan Li, Jiahui Zhou, Shunyu Wu, Haozheng Ye, Jian Lou, See-Kiong Ng

机构 * School of Software Engineering Sun Yat-Sen University(软件工程学院中山大学) Institute of Data Science(数据科学研究院) School of Computing(计算机学院) National University of Singapore(新加坡国立大学)

专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

Comments To be published in CIKM 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.16135 2025-08-25 cs.LG cs.AI cs.ET eess.IV 62%

Machine Learning in Micromobility: A Systematic Review of Datasets, Techniques, and Applications

Sen Yan, Chinmaya Kaundanya, Noel E. O'Connor, Suzanne Little, Mingming Liu

专题命中 其他安全 :safety(abstract);分类 cs.AI、cs.LG

Comments 14 pages, 3 tables, and 4 figures, submitted to IEEE Transactions on Intelligent Vehicles

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.15847 2025-08-25 cs.CL cs.LG 62%

Mechanistic Exploration of Backdoored Large Language Model Attention Patterns

Mohammed Abu Baker, Lakshmi Babu-Saheer

机构 * Department of Computer Science, Anglia Ruskin University(计算机科学系,安格利亚 Ruskin 大学)

专题命中 其他安全 :safety(abstract);分类 cs.CL、cs.LG

Comments 13 pages. Mechanistic analysis of backdoored LLMs (Qwen2.5-3B). Code: https://github.com/mshahoyi/sa_attn_analysis. Base model: unsloth/Qwen2.5-3B-Instruct-unsloth-bnb-4bit. Finetuned models: https://huggingface.co/collections/mshahoyi/simple-sleeper-agents-68a1df3a7aaff310aa0e5336

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.16352 2025-08-25 cs.AI eess.SP 57%

Causal Beam Selection for Reliable Initial Access in AI-driven Beam Management

Nasir Khan, Asmaa Abdallah, Abdulkadir Celik, Ahmed M. Eltawil, Sinem Coleri

机构 * Department of Electrical and Electronics Engineering, Koç University(电子与电气工程系,科克大学) CEMSE Division, King Abdullah University of Science and Technology(KAUST能源科学与工程分校,国王 Abdullah 科学技术大学) School of Electronics and Computer Science, University of Southampton(电子与计算机科学学院,南安普顿大学)

专题命中 其他安全 :alignment(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.16244 2025-08-25 cs.LG 57%

When Simpler Wins: Facebooks Prophet vs LSTM for Air Pollution Forecasting in Data-Constrained Northern Nigeria

Habeeb Balogun, Yahaya Zakari

专题命中 其他安全 :alignment(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏