arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2025-08-25 至 2025-08-25 共收录 12 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全评测 12 篇

2508.16157 2025-08-25 cs.CV cs.AI 79%

Beyond Human-prompting: Adaptive Prompt Tuning with Semantic Alignment for Anomaly Detection

Pi-Wei Chen, Jerry Chun-Wei Lin, Wei-Han Chen, Jia Ji, Zih-Ching Chen, Feng-Hao Yeh, Chao-Chun Chen

机构 * Silesian University of Technology(西里西亚技术大学) National Cheng Kung University(国立成功大学) Nvidia AI Technology Center(Nvidia AI技术中心)

专题命中 安全评测 :alignment(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.16213 2025-08-25 cs.CV 78%

MedOmni-45°: A Safety-Performance Benchmark for Reasoning-Oriented LLMs in Medicine

Kaiyuan Ji, Yijin Guo, Zicheng Zhang, Xiangyang Zhu, Yuan Tian, Ning Liu, Guangtao Zhai

专题命中 安全评测 :safety(title,abstract)

Comments 9 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.15839 2025-08-25 cs.CR cs.AI 77%

CIA+TA Risk Assessment for AI Reasoning Vulnerabilities

Yuksel Aydin

机构 * Independent Researcher(独立研究者)

专题命中 安全评测 :safety(abstract);trustworthy(abstract);AI safety(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.15797 2025-08-25 cs.CL cs.AI cs.LG 67%

Benchmarking the Medical Understanding and Reasoning of Large Language Models in Arabic Healthcare Tasks

Nouar AlDahoul, Yasir Zaki

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

Comments 5 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.15910 2025-08-25 cs.CL cs.AI cs.IR 62%

Evaluating Structured Decoding for Text-to-Table Generation: Evidence from Three Datasets

Julian Oestreich, Lydia Müller

机构 * Institute for Applied Informatics (InfAI) at Leipzig University(应用信息学院(InfAI))

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI

Comments to be published in the workshop proceedings of the "From Rules to Language Models: Comparative Performance Evaluation" workshop, held alongside RANLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.15876 2025-08-25 cs.CL cs.AI cs.MA 62%

DeepMEL: A Multi-Agent Collaboration Framework for Multimodal Entity Linking

Fang Wang, Tianwei Yan, Zonghao Yang, Minghao Hu, Jun Zhang, Zhunchen Luo, Xiaoying Bai

机构 * School of Computer Science, Peking University(北京大学计算机科学学院) School of Information Science and Engineering, Chongqing Jiaotong University(重庆交通大学信息科学与工程学院) China Research and Development Academy of Machinery Equipment(机械电子研究发展院) Center of Information Research, Academy of Military Science(军事科学信息研究中心)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.15853 2025-08-25 cs.CL cs.AI cs.SD eess.AS 62%

MGSC: A Multi-granularity Consistency Framework for Robust End-to-end Asr

Xuwen Yang

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI

Comments 12 pages, 5figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.16097 2025-08-25 cs.LG stat.ML 57%

Machine Learning for Medicine Must Be Interpretable, Shareable, Reproducible and Accountable by Design

Ayyüce Begüm Bektaş, Mithat Gönen

专题命中 安全评测 :trustworthy(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.15983 2025-08-25 cond-mat.mtrl-sci cs.LG physics.comp-ph 57%

A simulation-based training framework for machine-learning applications in ARPES

MengXing Na, Chris Zhou, Sydney K. Y. Dufresne, Matteo Michiardi, Andrea Damascelli

机构 * Quantum Matter Institute, University of British Columbia, Vancouver, British Columbia, V6T 1Z4, Canada Department of Physics \& Astronomy, University of British Columbia, Vancouver, British Columbia, V6T 1Z1, Canada

专题命中 安全评测 :alignment(abstract);分类 cs.LG

Comments 9 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.15926 2025-08-25 cs.CE cs.AI 57%

Noise, Adaptation, and Strategy: Assessing LLM Fidelity in Decision-Making

Yuanjun Feng, Vivek Choudhary, Yash Raj Shrestha

机构 * University of Lausanne(洛桑大学) Nanyang Technological University(南洋理工大学)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

Comments Accepted to EMNLP 2025 (Main Conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.17173 2025-08-25 cs.LG cs.DC 57%

Robustness of deep learning classification to adversarial input on GPUs: asynchronous parallel accumulation is a source of vulnerability

Sanjif Shanmugavelu, Mathieu Taillefumier, Christopher Culver, Vijay Ganesh, Oscar Hernandez, Ada Sedova

机构 * Maxeler Technologies, a Groq Company(Maxeler Technologies,Groq公司) ETH Zurich / CSCS(苏黎世联邦理工学院 / CSCS) Georgia Institute of Technology(佐治亚理工学院) Oak Ridge National Laboratory(橡树岭国家实验室)

专题命中 安全评测 :safety(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.15429 2025-08-25 cs.SD 50%

AudioSet-R: A Refined AudioSet with Multi-Stage LLM Label Reannotation

Yulin Sun, Qisheng Xu, Yi Su, Qian Zhu, Yong Dou, Xinwang Liu, Kele Xu

机构 * College of Computer Science and Technology, National University of Defense Technology(计算机科学与技术学院,国防科技大学)

专题命中 安全评测 :alignment(abstract)

Comments 8 pages, 5 figures, accepted in ACM MM 2025 dataset track

详情

展开后加载摘要…

URL PDF HTML 收藏