arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 9434 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全评测 9434 篇

2507.08501 2025-07-14 cs.AI 57%

From Language to Logic: A Bi-Level Framework for Structured Reasoning

Keying Yang, Hao Wang, Kai Yang

机构 * Tongji University(同济大学)

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.07988 2025-07-11 cs.CL 57%

Automating Expert-Level Medical Reasoning Evaluation of Large Language Models

Shuang Zhou, Wenya Xie, Jiaxi Li, Zaifu Zhan, Meijia Song, Han Yang, Cheyenna Espinoza, Lindsay Welton, Xinnie Mai, Yanwei Jin, Zidu Xu, Yuen-Hei Chung, Yiyun Xing, Meng-Han Tsai, Emma Schaffer, Yucheng Shi, Ninghao Liu, Zirui Liu, Rui Zhang

专题命中 安全评测 :trustworthy(abstract);分类 cs.CL

Comments 22 pages,6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.07870 2025-07-11 cs.CL 57%

DocCHA: Towards LLM-Augmented Interactive Online diagnosis System

Xinyi Liu, Dachun Sun, Yi R. Fung, Dilek Hakkani-Tür, Tarek Abdelzaher

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) The Hong Kong University of Science and Technology(香港科学与技术大学)

专题命中 安全评测 :trustworthy(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.05020 2025-07-11 cs.CV cs.AI 57%

Adaptation of Multi-modal Representation Models for Multi-task Surgical Computer Vision

Soham Walimbe, Britty Baby, Vinkle Srivastav, Nicolas Padoy

机构 * University of Strasbourg, CNRS, INSERM, ICube, UMR7357, Strasbourg, France(斯特拉斯堡大学,法国国家科学研究中心(CNRS),法国国家卫生研究院(INSERM),ICube,UMR7357,斯特拉斯堡) Institute of Image-Guided Surgery, IHU Strasbourg, Strasbourg, France(影像引导手术研究所,斯特拉斯堡IHU,斯特拉斯堡)

专题命中 安全评测 :safety(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19598 2025-07-11 cs.CL 57%

Evaluating Robustness of Large Audio Language Models to Audio Injection: An Empirical Study

Guanyu Hou, Jiaming He, Yinhang Zhou, Ji Guo, Yitong Qiao, Rui Zhang, Wenbo Jiang

机构 * University of Electronic Science and Technology of China(电子科技大学) Chengdu University of Technology(成都理工大学) Sun Yat-Sen University(中山大学)

专题命中 安全评测 :safety(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.07203 2025-07-11 cs.AI 57%

State-Inference-Based Prompting for Natural Language Trading with Game NPCs

Minkyung Kim, Junsik Kim, Hwidong Bae, Woongcheol Yang, Sangdon Park, Sohee Bae

机构 * Amazon(亚马逊)

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI

Comments 9 pages main content, 4 pages appendix, 3 figures. Accepted to the KDD 2025 Workshop on Prompt Optimization

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.16248 2025-07-10 cs.CR cs.AI 57%

Real AI Agents with Fake Memories: Fatal Context Manipulation Attacks on Web3 Agents

Atharv Singh Patlan, Peiyao Sheng, S. Ashwin Hebbar, Prateek Mittal, Pramod Viswanath

机构 * Princeton University Princeton University \& Sentient Foundation

专题命中 安全评测 :prompt injection(abstract);分类 cs.AI

Comments 19 pages, 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.06013 2025-07-09 cs.AI 57%

CogniSQL-R1-Zero: Lightweight Reinforced Reasoning for Efficient SQL Generation

Kushal Gajjar, Harshit Sikchi, Arpit Singh Gautam, Marc Hammons, Saurabh Jha

机构 * Dell Technologies(戴尔技术)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.05587 2025-07-09 cs.AI 57%

Towards Measurement Theory for Artificial Intelligence

Elija Perrier

专题命中 安全评测 :safety(abstract);分类 cs.AI

Comments Under review for Iliad Conference 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.05307 2025-07-09 cs.SE cs.AI 57%

ASSURE: Metamorphic Testing for AI-powered Browser Extensions

Xuanqi Gao, Juan Zhai, Shiqing Ma, Siyi Xie, Chao Shen

机构 * Xi'an Jiaotong University(西安交通大学) University of Massachusetts at Amherst(马萨诸塞大学阿姆赫斯特分校)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.01931 2025-07-09 cs.CL 57%

On the Role of Feedback in Test-Time Scaling of Agentic AI Workflows

Souradip Chakraborty, Mohammadreza Pourreza, Ruoxi Sun, Yiwen Song, Nino Scherrer, Furong Huang, Amrit Singh Bedi, Ahmad Beirami, Jindong Gu, Hamid Palangi, Tomas Pfister

机构 * Google(谷歌) University of Maryland(马里兰大学) University of Central Florida(中央佛罗里达大学)

专题命中 安全评测 :alignment(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.05162 2025-07-08 cs.CV cs.AI cs.CR 57%

LAID: Lightweight AI-Generated Image Detection in Spatial and Spectral Domains

Nicholas Chivaran, Jianbing Ni

机构 * Department of Electrical and Computer Engineering, Queen's University(电气与计算机工程系,皇后大学)

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI

Comments To appear in the proceedings of PST2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.04751 2025-07-08 cs.CL 57%

LLMs as Architects and Critics for Multi-Source Opinion Summarization

Anuj Attri, Arnav Attri, Pushpak Bhattacharyya, Suman Banerjee, Amey Patil, Muthusamy Chelliah, Nikesh Garera

机构 * Computer Science and Engineering, IIT Bombay, India(计算机科学与工程系,印度班加罗尔理工学院) Flipkart, India(印度Flipkart)

专题命中 安全评测 :alignment(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.04105 2025-07-08 cs.AI cs.MA 57%

Enhancing Robustness of LLM-Driven Multi-Agent Systems through Randomized Smoothing

Jinwei Hu, Yi Dong, Zhengtao Ding, Xiaowei Huang

机构 * Department of Computer Science(计算机科学系) Department of Electrical and Electronic Engineering(电子与电气工程系)

专题命中 安全评测 :safety(abstract);分类 cs.AI

Comments Preprint accepted by Chinese Journal of Aeronautics

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.04000 2025-07-08 cs.IR cs.AI 57%

Leveraging Multimodal Data and Side Users for Diffusion Cross-Domain Recommendation

Fan Zhang, Jinpeng Chen, Huan Li, Senzhang Wang, Yuan Cao, Kaimin Wei, JianXiang He, Feifei Kou, Jinqing Wang

机构 * School of Computer Science (National Pilot Software Engineering School), Beijing University of Posts and Telecommunications(北京邮电大学计算机学院(国家级试点软件工程学院)) The State Key Laboratory of Blockchain and Data Security, Zhejiang University(浙江大学区块链与数据安全国家重点实验室) Central South University(中南大学) National University of Singapore(新加坡国立大学) Jinan University(暨南大学)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.03839 2025-07-08 cs.AI cs.GR 57%

Participatory Evolution of Artificial Life Systems via Semantic Feedback

Shuowen Li, Kexin Wang, Minglu Fang, Danqi Huang, Ali Asadipour, Haipeng Mi, Yitong Sun

机构 * Tsinghua University(清华大学) MIT CSAIL(麻省理工学院计算机科学与人工智能实验室) China Academy of Art(中国美术学院) Royal College of Art, Computer Science Research Centre(皇家艺术学院计算机科学研究中心)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

Comments 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.01932 2025-07-08 cs.LG 57%

Fully Automatic Neural Network Reduction for Formal Verification

Tobias Ladner, Matthias Althoff

专题命中 安全评测 :safety(abstract);分类 cs.LG

Comments published at Transactions on Machine Learning Research (TMLR) 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.02537 2025-07-04 cs.HC cs.AI 57%

Are You Listening to Me? Fine-Tuning Chatbots for Empathetic Dialogue

Paulo Ricardo Knob, Leonardo Scholler, Juliano Rigatti, Soraia Raupp Musse

机构 * Nelogica Sistemas de Software Ltda(Nelogica软件系统有限公司)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.01420 2025-07-04 cs.LG 57%

Evaluating Frontier Models for Stealth and Situational Awareness

Mary Phuong, Roland S. Zimmermann, Ziyue Wang, David Lindner, Victoria Krakovna, Sarah Cogan, Allan Dafoe, Lewis Ho, Rohin Shah

机构 * Google DeepMind(谷歌DeepMind)

专题命中 安全评测 :safety(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.15582 2025-07-04 stat.ML cond-mat.dis-nn cond-mat.stat-mech cs.LG 57%

Generalization vs. Specialization under Concept Shift

Alex Nguyen, David J. Schwab, Vudtiwat Ngampruetikorn

机构 * Princeton University(普林斯顿大学) CUNY Graduate Center(纽约大学研究生中心) University of Sydney(悉尼大学)

专题命中 安全评测 :safety(abstract);分类 cs.LG

Comments 8 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.00914 2025-07-02 cs.MA cs.AI 57%

Large Language Model Powered Intelligent Urban Agents: Concepts, Capabilities, and Applications

Jindong Han, Yansong Ning, Zirui Yuan, Hang Ni, Fan Liu, Tengfei Lyu, Hao Liu

机构 * Shandong University(山东大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) The Hong Kong University of Science and Technology(香港科技大学)

专题命中 安全评测 :safety(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.00894 2025-07-02 stat.ML cs.LG 57%

An in depth look at the Procrustes-Wasserstein distance: properties and barycenters

Davide Adamo, Marco Corneli, Manon Vuillien, Emmanuelle Vila

机构 * Universit\'e C\ ote d'Azur, UMR 7264 CEPAM, CNRS, Nice, France Universit\'e C\ ote d'Azur, Inria, CNRS, Laboratoire J.A. Dieudonn\'e, Maasai team, Nice, France Universit\'e Lumi\'ere Lyon II, UMR 5133 Arch\'eorient CNRS, Lyon, France

专题命中 安全评测 :alignment(abstract);分类 cs.LG

Comments 16 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.00525 2025-07-02 cs.CV cs.AI 57%

Box-QAymo: Box-Referring VQA Dataset for Autonomous Driving

Djamahl Etchegaray, Yuxia Fu, Zi Huang, Yadan Luo

机构 * The University of Queensland(昆士兰大学)

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.00347 2025-07-02 cs.SE cs.AI 57%

VTS-Guided AI Interaction Workflow for Business Insights

Sun Ding, Ude Enebeli, Atilhan, Manay, Ryan Pua, Kamal Kotak

专题命中 安全评测 :safety(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.22968 2025-07-02 cs.HC cs.AI 57%

Against 'softmaxing' culture

Daniel Mwesigwa

专题命中 安全评测 :alignment(abstract);分类 cs.AI

Comments 7 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.05175 2025-07-02 cs.LG 57%

Outlier Weighed Layerwise Sparsity (OWL): A Missing Secret Sauce for Pruning LLMs to High Sparsity

Lu Yin, You Wu, Zhenyu Zhang, Cheng-Yu Hsieh, Yaqing Wang, Yiling Jia, Gen Li, Ajay Jaiswal, Mykola Pechenizkiy, Yi Liang, Michael Bendersky, Zhangyang Wang, Shiwei Liu

机构 * Eindhoven University of Technology, the Netherlands(埃因霍温理工大学) University of Surrey(萨里大学) Google Research, USA(谷歌研究院) University of Texas at Austin, USA(德克萨斯大学奥斯汀分校) Clemson University, USA(克莱姆森大学) University of Washington, USA(华盛顿大学) University of Oxford, UK(牛津大学)

专题命中 安全评测 :alignment(abstract);分类 cs.LG

Comments Published at ICML 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.23864 2025-07-01 cs.CL 57%

Garbage In, Reasoning Out? Why Benchmark Scores are Unreliable and What to Do About It

Seyed Mahed Mousavi, Edoardo Cecchinato, Lucia Hornikova, Giuseppe Riccardi

机构 * Masaryk University(马萨里克大学) Signals and Interactive Systems Lab, University of Trento(特伦托大学信号与交互系统实验室)

专题命中 安全评测 :alignment(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.23408 2025-07-01 cs.LG cs.LO 57%

Do LLMs Dream of Discrete Algorithms?

Claudionor Coelho, Yanen Li, Philip Tee

机构 * Zscaler Inc(Zscaler公司) ECE Department, Santa Clara University(圣克拉拉大学电子工程与计算机科学系) Department of Informatics, University of Sussex(苏塞克斯大学信息学院) The Beyond Center for Fundamental Science, Arizona State University(亚利桑那州立大学基础科学中心)

专题命中 安全评测 :trustworthy(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.13010 2025-07-01 cs.CL cs.MA 57%

Agentic Medical Knowledge Graphs Enhance Medical Question Answering: Bridging the Gap Between LLMs and Evolving Medical Knowledge

Mohammad Reza Rezaei, Reza Saadati Fard, Jayson L. Parker, Rahul G. Krishnan, Milad Lankarany

机构 * University of Toronto(多伦多大学) Vector Institute(向量研究所) Worcester Polytechnic Institute(沃思菲技术学院)

专题命中 安全评测 :trustworthy(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.10266 2025-07-01 cs.CL 57%

Reasoner Outperforms: Generative Stance Detection with Rationalization for Social Media

Jiaqing Yuan, Ruijie Xi, Munindar P. Singh

机构 * North Carolina State University(北卡罗来纳州立大学)

专题命中 安全评测 :trustworthy(abstract);分类 cs.CL

Comments Accepted by ACM Hypertext 2025

详情

展开后加载摘要…

URL PDF HTML 收藏