arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2025-08-27 至 2025-08-27 共收录 12 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全评测 12 篇

2508.19096 2025-08-27 cs.AI 79%

Trustworthy Agents for Electronic Health Records through Confidence Estimation

Yongwoo Song, Minbyul Jeong, Mujeen Sung

机构 * Kyung Hee University(庆熙大学)

专题命中 安全评测 :trustworthy(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.18891 2025-08-27 cs.LG cs.AI 62%

pyFAST: A Modular PyTorch Framework for Time Series Modeling with Multi-source and Sparse Data

Zhijin Wang, Senzhen Wu, Yue Hu, Xiufeng Liu

机构 * College of Computer Engineering, Jimei University(嘉应大学计算机工程学院) Chengyi College, Jimei University(嘉应大学 Chengyi 学院) Department of Technology, Management and Economics, Technical University of Denmark(丹麦技术大学技术、管理与经济系)

专题命中 安全评测 :alignment(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.08846 2025-08-27 cs.CR cs.CL cs.LG 62%

Fingerprint Vector: Enabling Scalable and Efficient Model Fingerprint Transfer via Vector Addition

Zhenhua Xu, Qichen Liu, Zhebo Wang, Wenpeng Xing, Dezhang Kong, Mohan Li, Meng Han

专题命中 安全评测 :harmlessness(abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.19163 2025-08-27 cs.AI cs.HC cs.MA 57%

MATRIX: Multi-Agent simulaTion fRamework for safe Interactions and conteXtual clinical conversational evaluation

Ernest Lim, Yajie Vera He, Jared Joselowitz, Kate Preston, Mohita Chowdhury, Louis Williams, Aisling Higham, Katrina Mason, Mariane Melo, Tom Lawton, Yan Jia, Ibrahim Habli

机构 * Ufonia Limited(乌菲尼亚有限公司) University of York(约克大学) NHS Improvement Academy(国家健康服务改进学院)

专题命中 安全评测 :safety(abstract);分类 cs.AI

Comments 36 pages, 16 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.19097 2025-08-27 cs.AI 57%

Reasoning LLMs in the Medical Domain: A Literature Survey

Armin Berger, Sarthak Khanna, David Berghaus, Rafet Sifa

机构 * Fraunhofer IAIS - Department of Media Engineering(弗劳恩霍夫研究所媒体工程部门) University of Bonn - Department of Computer Science(波恩大学计算机科学系) West-AI - Federal Ministry of Education and Research(西德人工智能 - 教育与研究部)

专题命中 安全评测 :safety(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.18715 2025-08-27 cs.CL 57%

EMMM, Explain Me My Model! Explainable Machine Generated Text Detection in Dialogues

Angela Yifei Yuan, Haoyi Li, Soyeon Caren Han, Christopher Leckie

专题命中 安全评测 :trustworthy(abstract);分类 cs.CL

Comments 15 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.18687 2025-08-27 cs.CL 57%

Knowing or Guessing? Robust Medical Visual Question Answering via Joint Consistency and Contrastive Learning

Songtao Jiang, Yuxi Chen, Sibo Song, Yan Zhang, Yeying Jin, Yang Feng, Jian Wu, Zuozhu Liu

机构 * Zhejiang University, Zhejiang, China(浙江大学) Alibaba Group, Zhejiang, China(阿里巴巴集团) Angelalign Technology Inc., Shanghai, China(Angelalign技术有限公司) ChohoTech Inc., Hangzhou, China(楚合科技有限公司) Zhejiang Key Laboratory of Medical Imaging Artificial Intelligence, Zhejiang, China(浙江省医学影像人工智能重点实验室)

专题命中 安全评测 :alignment(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.18430 2025-08-27 cs.CV cs.AI 57%

CLARIFY: A Specialist-Generalist Framework for Accurate and Lightweight Dermatological Visual Question Answering

Aranya Saha, Tanvir Ahmed Khan, Ismam Nur Swapnil, Mohammad Ariful Haque

机构 * Aranya Saha ∗ , Tanvir Ahmed Khan ∗ , Ismam Nur Swapnil ∗ , and Mohammad Ariful Haque ∗(无明确机构)

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI

Comments 10 pages, 8 figures, Prepared for submission to IEEE Transactions on Human-Machine Systems

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.18292 2025-08-27 cs.MA cs.AI 57%

Consensus Is All You Need: Gossip-Based Reasoning Among Large Language Models

Saksham Arora

机构 * Sunnyvale, California(加州松林市)

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI

Comments 4 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17367 2025-08-27 cs.CV cs.AI 57%

EVM-Fusion: An Explainable Vision Mamba Architecture with Neural Algorithmic Fusion

Zichuan Yang, Yongzhi Wang

机构 * School of Mathematical Sciences, Tongji University(数学科学学院,同济大学)

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI

Comments 8 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.18725 2025-08-27 cs.NI cs.IT math.IT 50%

Toward Edge General Intelligence with Agentic AI and Agentification: Concepts, Technologies, and Future Directions

Ruichen Zhang, Guangyuan Liu, Yinqiu Liu, Changyuan Zhao, Jiacheng Wang, Yunting Xu, Dusit Niyato, Jiawen Kang, Yonghui Li, Shiwen Mao, Sumei Sun, Xuemin Shen, Dong In Kim

专题命中 安全评测 :trustworthy(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.20353 2025-08-27 cs.RO 50%

Trajectory-to-Action Pipeline (TAP): Automated Scenario Description Extraction for Autonomous Vehicle Behavior Comparison

Aron Harder, Madhur Behl

机构 * Department of Computer Science, University of Virginia(弗吉尼亚大学计算机科学系)

专题命中 安全评测 :safety(abstract)

Comments 11 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏