arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2025-11-10 至 2025-11-10 共收录 14 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全评测 14 篇

2501.03265 2025-11-10 cs.LG cs.AI 73%

Cognitive Edge Computing: A Comprehensive Survey on Optimizing Large Models and AI Agents for Pervasive Deployment

Xubin Wang, Qing Li, Weijia Jia

专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.04886 2025-11-10 cs.CV cs.AI 70%

Beta Distribution Learning for Reliable Roadway Crash Risk Assessment

Ahmad Elallaf, Nathan Jacobs, Xinyue Ye, Mei Chen, Gongbo Liang

机构 * Texas A&M University-San Antonio(德克萨斯A&M大学-圣安东尼奥分校) Washington University in St. Louis(华盛顿大学圣路易斯分校) University of Alabama(阿拉巴马大学) University of Kentucky(肯塔基大学)

专题命中 安全评测 :safety(abstract);trustworthy(abstract);分类 cs.AI

Comments Accepted to AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.15144 2025-11-10 cs.AI cs.CL cs.CY 67%

HugAgent: Benchmarking LLMs for Simulation of Individualized Human Reasoning

Chance Jiajie Li, Zhenze Mo, Yuhan Tang, Ao Qu, Jiayi Wu, Kaiya Ivy Zhao, Yulu Gan, Jie Fan, Jiangbo Yu, Hang Jiang, Paul Pu Liang, Jinhua Zhao, Luis Alberto Alonso Pastor, Kent Larson

机构 * MIT Media Lab(MIT媒体实验室) MIT EECS(MIT电子工程与计算机科学系) MIT BCS(MIT生物科学系) MIT IDSS(MIT国际设计系统研究所) MIT CEE(MIT土木与环境工程系) MIT DUSP(MIT设计学教授职位) MIT Architecture(MIT建筑系) Northeastern University(东北大学) Brown University(布朗大学) McGill University(麦吉尔大学)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI、cs.CY

Comments To appear in NeurIPS 2025 Workshop on Bridging Language, Agent, and World Models (LAW)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.17797 2025-11-10 cs.CL cs.AI 62%

Enterprise Deep Research: Steerable Multi-Agent Deep Research for Enterprise Analytics

Akshara Prabhakar, Roshan Ram, Zixiang Chen, Silvio Savarese, Frank Wang, Caiming Xiong, Huan Wang, Weiran Yao

机构 * Salesforce AI Research(Salesforce AI研究院)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI

Comments Technical report; 13 pages plus references and appendices

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.04956 2025-11-10 cs.AI cs.CL 62%

ORCHID: Orchestrated Retrieval-Augmented Classification with Human-in-the-Loop Intelligent Decision-Making for High-Risk Property

Maria Mahbub, Vanessa Lama, Sanjay Das, Brian Starks, Christopher Polchek, Saffell Silvers, Lauren Deck, Prasanna Balaprakash, Tirthankar Ghosal

机构 * Oak Ridge National Laboratory(橡树岭国家实验室) Pacific Northwest National Laboratory(太平洋西北国家实验室)

专题命中 安全评测 :trustworthy(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.04703 2025-11-10 cs.CL cs.AI 62%

Measuring what Matters: Construct Validity in Large Language Model Benchmarks

Andrew M. Bean, Ryan Othniel Kearns, Angelika Romanou, Franziska Sofia Hafner, Harry Mayne, Jan Batzner, Negar Foroutan, Chris Schmitz, Karolina Korgul, Hunar Batra, Oishi Deb, Emma Beharry, Cornelius Emde, Thomas Foster, Anna Gausen, María Grandury, Simeng Han, Valentin Hofmann, Lujain Ibrahim, Hazel Kim, Hannah Rose Kirk, Fangru Lin, Gabrielle Kaili-May Liu, Lennart Luettgau, Jabez Magomere, Jonathan Rystrøm, Anna Sotnikova, Yushi Yang, Yilun Zhao, Adel Bibi, Antoine Bosselut, Ronald Clark, Arman Cohan, Jakob Foerster, Yarin Gal, Scott A. Hale, Inioluwa Deborah Raji, Christopher Summerfield, Philip H. S. Torr, Cozmin Ududec, Luc Rocher, Adam Mahdi

机构 * University of Oxford(牛津大学) EPFL(苏黎世联邦理工学院) Weizenbaum Institute Berlin(柏林Weizenbaum研究所) Technical University Munich(慕尼黑技术大学) Centre for Digital Governance, Hertie School(赫尔姆霍兹学院数字治理中心) Stanford University(斯坦福大学) UK AI Security Institute(英国人工智能安全研究所) SomosNLP Universdad Politécnica de Madrid(马德里理工大学) Yale University(耶鲁大学) Allen Institute for AI(人工智能研究所) University of Washington(华盛顿大学) Meedan UC Berkeley(加州大学伯克利分校)

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI

Comments 39th Conference on Neural Information Processing Systems (NeurIPS 2025) Track on Datasets and Benchmarks

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.04247 2025-11-10 cs.MM cs.AI cs.IR 57%

On the Brittleness of CLIP Text Encoders

Allie Tran, Luca Rossetto

机构 * Dublin City University(都柏林城市大学)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

Comments Accepted for publication at MMM'26. Analysis code can be found here: https://github.com/allie-tran/clip-brittleness

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.05299 2025-11-10 cs.CV cs.AI 57%

LiveStar: Live Streaming Assistant for Real-World Online Video Understanding

Zhenyu Yang, Kairui Zhang, Yuhang Hu, Bing Wang, Shengsheng Qian, Bin Wen, Fan Yang, Tingting Gao, Weiming Dong, Changsheng Xu

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) University of Chinese Academy of Sciences(中国科学院大学) ShanghaiTech University(上海科技大学) Kuaishou Technology(快手科技) Peng Cheng Laboratory(鹏城实验室)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

Comments NeurIPS 2025 Accepted

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.05269 2025-11-10 cs.MA cs.AI 57%

TAMAS: Benchmarking Adversarial Risks in Multi-Agent LLM Systems

Ishan Kavathekar, Hemang Jain, Ameya Rathod, Ponnurangam Kumaraguru, Tanuja Ganu

机构 * International Institute of Information Technology, Hyderabad(国际信息科技研究所,海得拉巴) Microsoft Research, India(微软研究院,印度)

专题命中 安全评测 :safety(abstract);分类 cs.AI

Comments Accepted at ICML 2025 MAS Workshop. This version includes additional experiments and analysis

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.05000 2025-11-10 cs.IR cs.AI 57%

Query Generation Pipeline with Enhanced Answerability Assessment for Financial Information Retrieval

Hyunkyu Kim, Yeeun Yoo, Youngjun Kwak

机构 * Kakaobank Seongnam-si Republic of Korea(韩国首尔市韩国 Kakao银行)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

Comments Accepted(Oral) by ICAIF 2025. Hyunkyu Kim and Yeeun Yoo contributed equally to this work

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.04690 2025-11-10 cs.MM cs.CL 57%

Automatización de Informes Geotécnicos para Macizos Rocosos con IA

Christofer Valencia, Alexis Llumigusín, Silvia Alvarez, Abrahan Arias, Christian Mejia-Escobar

专题命中 安全评测 :safety(abstract);分类 cs.CL

Comments 17 pages, in Spanish language

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.21069 2025-11-10 cs.CV cs.AI cs.HC 57%

GAITEX: Human motion dataset of impaired gait and rehabilitation exercises using inertial and optical sensors

Andreas Spilz, Heiko Oppel, Jochen Werner, Kathrin Stucke-Straub, Felix Capanni, Michael Munz

机构 * AI for Sensor Data Analytics Research Group(人工智能传感器数据解析研究组) Ulm University of Applied Sciences(乌尔姆应用科学大学) Biomechatronic Research Group(生物机械研究组) Institute of Computer Science(计算机科学研究所)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.11137 2025-11-10 cs.CL 57%

Scalable Medication Extraction and Discontinuation Identification from Electronic Health Records Using Large Language Models

Chong Shao, Douglas Snyder, Chiran Li, Bowen Gu, Kerry Ngan, Chun-Ting Yang, Jiageng Wu, Richard Wyss, Kueiyu Joshua Lin, Jie Yang

专题命中 安全评测 :safety(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.17086 2025-11-10 cs.CL 57%

Mind the Blind Spots: A Focus-Level Evaluation Framework for LLM Reviews

Hyungyu Shin, Jingyu Tang, Yoonjoo Lee, Nayoung Kim, Hyunseung Lim, Ji Yong Cho, Hwajung Hong, Moontae Lee, Juho Kim

机构 * KAIST(韩国科学技术院) Huazhong University of Science and Technology(华中科技大学) LG AI Research(LG人工智能研究) University of Illinois Chicago(伊利诺伊大学香槟分校)

专题命中 安全评测 :trustworthy(abstract);分类 cs.CL

Comments EMNLP 2025 Oral

详情

展开后加载摘要…

URL PDF HTML 收藏