arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 9434 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全评测 9434 篇

2407.06083 2025-08-07 cs.LG cs.IR 57%

A Survey of Controllable Learning: Methods and Applications in Information Retrieval

Chenglei Shen, Xiao Zhang, Teng Shi, Changshuo Zhang, Guofu Xie, Jun Xu

机构 * Gaoling School of Artificial Intelligence, Renmin University of China, Beijing 100872, China(中国人民大学人工智能学院) AI Lab at Lenovo Research, Beijing 100085, China(联想研究院人工智能实验室)

专题命中 安全评测 :trustworthy(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.14961 2025-08-06 cs.LG cs.CR cs.LO 57%

Set-Based Training for Neural Network Verification

Lukas Koller, Tobias Ladner, Matthias Althoff

专题命中 安全评测 :safety(abstract);分类 cs.LG

Comments published at Transactions on Machine Learning Research (TMLR)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.02947 2025-08-06 cs.RO cs.AI 57%

AeroSafe: Mobile Indoor Air Purification using Aerosol Residence Time Analysis and Robotic Cough Emulator Testbed

M Tanjid Hasan Tonmoy, Rahath Malladi, Kaustubh Singh, Forsad Al Hossain, Rajesh Gupta, Andrés E. Tejada-Martínez, Tauhidur Rahman

机构 * University of California San Diego(加州大学圣地亚哥分校) Plaksha University(Plaksha大学) University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校) University of South Florida(佛罗里达州立大学)

专题命中 安全评测 :safety(abstract);分类 cs.AI

Comments Accepted at IEEE International Conference on Robotics and Automation (ICRA) 2025. Author Accepted Manuscript

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.02827 2025-08-06 cs.SE cs.AI 57%

Automated Validation of LLM-based Evaluators for Software Engineering Artifacts

Ora Nova Fandina, Eitan Farchi, Shmulik Froimovich, Rami Katan, Alice Podolsky, Orna Raz, Avi Ziv

机构 * IBM Research(IBM研究院)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.18905 2025-08-06 cs.CL cs.HC 57%

Large language models provide unsafe answers to patient-posed medical questions

Rachel L. Draelos, Samina Afreen, Barbara Blasko, Tiffany L. Brazile, Natasha Chase, Dimple Patel Desai, Jessica Evert, Heather L. Gardner, Lauren Herrmann, Aswathy Vaikom House, Stephanie Kass, Marianne Kavan, Kirshma Khemani, Amanda Koire, Lauren M. McDonald, Zahraa Rabeeah, Amy Shah

专题命中 安全评测 :safety(abstract);分类 cs.CL

Comments 20 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.05347 2025-08-06 cs.CL cs.MA 57%

GEMA-Score: Granular Explainable Multi-Agent Scoring Framework for Radiology Report Evaluation

Zhenxuan Zhang, Kinhei Lee, Peiyuan Jing, Weihang Deng, Huichi Zhou, Zihao Jin, Jiahao Huang, Zhifan Gao, Dominic C Marshall, Yingying Fang, Guang Yang

专题命中 安全评测 :safety(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.20847 2025-08-06 cs.CY 57%

Who Should Run Advanced AI Evaluations -- AISIs?

Merlin Stein, Milan Gandhi, Theresa Kriecherbauer, Amin Oueslati, Robert Trager

专题命中 安全评测 :safety(abstract);分类 cs.CY

Comments Accepted to AIES 2024 proceedings

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.02525 2025-08-05 cs.AI 57%

Accurate and Interpretable Postmenstrual Age Prediction via Multimodal Large Language Model

Qifan Chen, Jin Cui, Cindy Duan, Yushuo Han, Yifei Shi

机构 * King’s College London(伦敦国王学院) Imperial College London(帝国理工学院) Columbia University(哥伦比亚大学)

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI

Comments Submitted to the NeurIPS 2025 Workshop GenAI4Health. Conference website: https://aihealth.ischool.utexas.edu/GenAI4HealthNeurips2025/

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.01370 2025-08-05 cs.CL cs.IR 57%

MaRGen: Multi-Agent LLM Approach for Self-Directed Market Research and Analysis

Roman Koshkin, Pengyu Dai, Nozomi Fujikawa, Masahito Togami, Marco Visentini-Scarzanella

机构 * Okinawa Institute of Science and Technology(冲绳科学技术研究所) Institute of Science Tokyo(东京科学研究所) Amazon(亚马逊)

专题命中 安全评测 :alignment(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.12441 2025-08-05 cs.CV cs.LG 57%

Describe Anything Model for Visual Question Answering on Text-rich Images

Yen-Linh Vu, Dinh-Thang Duong, Truong-Binh Duong, Anh-Khoi Nguyen, Thanh-Huy Nguyen, Le Thien Phuc Nguyen, Jianhua Xing, Xingjian Li, Tianyang Wang, Ulas Bagci, Min Xu

机构 * AI VIETNAM Lab(AI越南实验室) Carnegie Mellon University(卡内基梅隆大学) University of Wisconsin - Madison(威斯康星大学麦迪逊分校) University of Pittsburgh(匹兹堡大学) University of Alabama at Birmingham(阿拉巴马大学伯明翰分校) Northwestern University(西北大学)

专题命中 安全评测 :alignment(abstract);分类 cs.LG

Comments 11 pages, 5 figures. Accepted to VisionDocs @ ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.10130 2025-08-05 cs.AI 57%

A Conjecture on a Fundamental Trade-Off between Certainty and Scope in Symbolic and Generative AI

Luciano Floridi

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI

Comments version 3

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.06762 2025-08-05 cs.LG cs.RO 57%

Investigating Robotaxi Crash Severity with Geographical Random Forest and the Urban Environment

Junfeng Jiao, Seung Gyu Baik, Seung Jun Choi, Yiming Xu

机构 * Urban Information Lab, The University of Texas at Austin(德克萨斯大学奥斯汀分校城市信息实验室)

专题命中 安全评测 :safety(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.00081 2025-08-04 cs.AI 57%

Rethinking Evidence Hierarchies in Medical Language Benchmarks: A Critical Evaluation of HealthBench

Fred Mutisya, Shikoh Gitau, Nasubo Ongoma, Keith Mbae, Elizabeth Wamicha

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.18004 2025-08-04 cs.AI 57%

E.A.R.T.H.: Structuring Creative Evolution through Model Error in Generative AI

Yusen Peng, Shuhua Mao

机构 * University of Warwick(沃里克大学) Wuhan University of Technology(武汉理工大学)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

Comments 44 pages,11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.17130 2025-08-04 cs.AI 57%

Chain-of-Trust: A Progressive Trust Evaluation Framework Enabled by Generative AI

Botao Zhu, Xianbin Wang, Lei Zhang, Xuemin, Shen

机构 * Department of Electrical and Computer Engineering, Western University(西方大学电气与计算机工程系) James Watt School of Engineering, University of Glasgow(格拉斯哥大学詹姆斯·瓦特工程学院) Department of Electrical and Computer Engineering, University of Waterloo(滑铁卢大学电气与计算机工程系)

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI

Journal ref IEEE Network, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.23000 2025-08-01 cs.LG cs.CV 57%

Planning for Cooler Cities: A Multimodal AI Framework for Predicting and Mitigating Urban Heat Stress through Urban Landscape Transformation

Shengao Yi, Xiaojiang Li, Wei Tu, Tianhong Zhao

机构 * Department of City and Regional Planning, University of Pennsylvania(城市与区域规划系,宾夕法尼亚大学) Guangdong Key Laboratory for Urban Informatics, Guangdong-Hong Kong-Macao Joint Laboratory for Smart Cities(广东城市信息关键实验室、粤港澳大湾区智慧城市联合实验室) Shenzhen Key Laboratory of Spatial Information Smart Sensing(深圳空间信息智能感知关键实验室) Department of Urban Informatics, School of Architecture and Urban Planning, Shenzhen University(城市信息系,深圳大学) College of Big Data and Internet, Shenzhen Technology University(大数据与互联网学院,深圳科技大学)

专题命中 安全评测 :alignment(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.17186 2025-08-01 cs.CL 57%

FinGAIA: A Chinese Benchmark for AI Agents in Real-World Financial Domain

Lingfeng Zeng, Fangqi Lou, Zixuan Wang, Jiajie Xu, Jinyi Niu, Mengping Li, Yifan Dong, Qi Qi, Wei Zhang, Ziwei Yang, Jun Han, Ruilun Feng, Ruiqi Hu, Lejie Zhang, Zhengbo Feng, Yicheng Ren, Xin Guo, Zhaowei Liu, Dongpo Cheng, Weige Cai, Liwen Zhang

专题命中 安全评测 :alignment(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.12284 2025-08-01 cs.LG stat.ML 57%

GrokAlign: Geometric Characterisation and Acceleration of Grokking

Thomas Walker, Ahmed Imtiaz Humayun, Randall Balestriero, Richard Baraniuk

机构 * Department of Electrical and Computer Engineering, Rice University(电气与计算机工程系, Rice大学) Google Research(谷歌研究院) Department of Computer Science, Brown University(计算机科学系, Brown大学)

专题命中 安全评测 :alignment(abstract);分类 cs.LG

Comments 23 pages, 11 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.02123 2025-08-01 cs.CV cs.LG 57%

FovEx: Human-Inspired Explanations for Vision Transformers and Convolutional Neural Networks

Mahadev Prasad Panda, Matteo Tiezzi, Martina Vilas, Gemma Roig, Bjoern M. Eskofier, Dario Zanca

机构 * Department AIBE, FAU Erlangen-Nürnberg(FAU埃朗根-纽伦堡大学AIBE部门) PAVIS, Istituto Italiano di Tecnologia (IIT), Genova, Italy(意大利技术研究院(IIT)帕维斯部门,热那亚,意大利) Ernst Strüngmann Institute for Neuroscience, Frankfurt, Germany(神经科学埃朗根-纽伦堡研究所,法兰克福,德国) Goethe-Universität Frankfurt am Main(法兰克福大学) Institute of AI for Health, Helmholtz Zentrum München, Munich, Germany(健康人工智能研究所,海德堡中心慕尼黑,德国)

专题命中 安全评测 :alignment(abstract);分类 cs.LG

Comments Accepted in the International Journal of Computer Vision (Springer Nature)

Journal ref Int J Comput Vis (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.01282 2025-07-31 cs.CL 57%

Prompt-Reverse Inconsistency: LLM Self-Inconsistency Beyond Generative Randomness and Prompt Paraphrasing

Jihyun Janice Ahn, Wenpeng Yin

机构 * Department of Computer Science & Engineering(计算机科学与工程系) The Pennsylvania State University(宾夕法尼亚州立大学)

专题命中 安全评测 :trustworthy(abstract);分类 cs.CL

Comments accepted in COLM2025, 9 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.18044 2025-07-31 cs.LG 57%

The Geometry of Queries: Query-Based Innovations in Retrieval-Augmented Generation for Healthcare QA

Eric Yang, Jonathan Amar, Jong Ha Lee, Bhawesh Kumar, Yugang Jia

机构 * Verily Life Sciences(Verily 生物科技)

专题命中 安全评测 :trustworthy(abstract);分类 cs.LG

Comments 27 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.22076 2025-07-31 cs.LG 57%

Test-time Prompt Refinement for Text-to-Image Models

Mohammad Abdul Hafeez Khan, Yash Jain, Siddhartha Bhattacharyya, Vibhav Vineet

机构 * Florida Institute of Technology(佛罗里达理工学院) Microsoft Research(微软研究院)

专题命中 安全评测 :alignment(abstract);分类 cs.LG

Comments Accepted to ICCV 2025, MARS2 Workshop. Total 14 pages, 12 figures and 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.21488 2025-07-30 cs.AI 57%

Learning to Imitate with Less: Efficient Individual Behavior Modeling in Chess

Zhenwei Tang, Difan Jiao, Eric Xue, Reid McIlroy-Young, Jon Kleinberg, Siddhartha Sen, Ashton Anderson

机构 * University of Toronto(多伦多大学) Harvard University(哈佛大学) Cornell University(康奈尔大学) Microsoft Research(微软研究院)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.21076 2025-07-30 cs.CY 57%

Making a Case for Research Collaboration Between Artificial Intelligence and Operations Research Experts

Radhika Kulkarni, Gianluca Brero, Yu Ding, Swati Gupta, Sven Koenig, Ramayya Krishnan, Thiago Serra, Phebe Vayanos, Segev Wasserkrug, Holly Wiberg

专题命中 安全评测 :trustworthy(abstract);分类 cs.CY

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.03274 2025-07-30 cs.AI 57%

A Scalable Approach to Probabilistic Neuro-Symbolic Robustness Verification

Vasileios Manginas, Nikolaos Manginas, Edward Stevinson, Sherwin Varghese, Nikos Katzouris, Georgios Paliouras, Alessio Lomuscio

机构 * Department of Computer Science and Leuven.AI KU Leuven Belgium(比利时列日大学计算机科学系) Department of Computing Imperial College London UK(伦敦帝国学院计算机系)

专题命中 安全评测 :safety(abstract);分类 cs.AI

Comments 19th Conference on Neurosymbolic Learning and Reasoning

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.20850 2025-07-29 cs.RO cs.AI 57%

Free Energy-Inspired Cognitive Risk Integration for AV Navigation in Pedestrian-Rich Environments

Meiting Dang, Yanping Wu, Yafei Wang, Dezong Zhao, David Flynn, Chongfeng Wei

专题命中 安全评测 :safety(abstract);分类 cs.AI

Comments 14 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.20774 2025-07-29 cs.AI 57%

evalSmarT: An LLM-Based Framework for Evaluating Smart Contract Generated Comments

Fatou Ndiaye Mbodji

机构 * SnT – University of Luxembourg(卢森堡大学SnT学院) Université Cheikh Anta Diop(谢赫·安塔·迪奥普大学) Huawei(华为)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

Comments 4 pages, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.20451 2025-07-29 cs.AI 57%

STARN-GAT: A Multi-Modal Spatio-Temporal Graph Attention Network for Accident Severity Prediction

Pritom Ray Nobin, Imran Ahammad Rifat

专题命中 安全评测 :safety(abstract);分类 cs.AI

Comments 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.20046 2025-07-29 cs.CL 57%

Infogen: Generating Complex Statistical Infographics from Documents

Akash Ghosh, Aparna Garimella, Pritika Ramu, Sambaran Bandyopadhyay, Sriparna Saha

机构 * Indian Institute of Technology Patna(印度帕纳大学理工学院) Adobe Research(Adobe研究)

专题命中 安全评测 :alignment(abstract);分类 cs.CL

Comments ACL Main 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.16674 2025-07-29 cs.LG q-bio.NC 57%

GASPnet: Global Agreement to Synchronize Phases

Andrea Alamia, Sabine Muzellec, Thomas Serre, Rufin VanRullen

机构 * CerCo, CNRS(CerCo与CNRS) Carney Institute for Brain Science, Brown University(脑科学研究所与布朗大学)

专题命中 安全评测 :alignment(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏