arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 9434 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全评测 9434 篇

2509.14936 2025-09-19 cs.LG 57%

A Comparative Analysis of Transformer Models in Social Bot Detection

Rohan Veit, Michael Lones

机构 * Department of Computer Science, Heriot-Watt University(计算机科学系,赫瑞斯学院)

专题命中 安全评测 :alignment(abstract);分类 cs.LG

Comments To appear in proceedings of UKCI 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.14304 2025-09-19 cs.SD cs.AI eess.AS 57%

Deploying UDM Series in Real-Life Stuttered Speech Applications: A Clinical Evaluation Framework

Eric Zhang, Li Wei, Sarah Chen, Michael Wang

机构 * SSHealth Team(SSHealth团队) AI for Healthcare Laboratory(人工智能医疗实验室)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16538 2025-09-19 cs.CL 57%

Mechanistic Understanding and Mitigation of Language Confusion in English-Centric Large Language Models

Ercong Nie, Helmut Schmid, Hinrich Schütze

机构 * Center for Information and Language Processing (CIS)(信息与语言处理中心) Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心)

专题命中 安全评测 :alignment(abstract);分类 cs.CL

Comments Accepted to EMNLP 2025 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.13680 2025-09-18 cs.SE cs.AI 57%

Prompt Stability in Code LLMs: Measuring Sensitivity across Emotion- and Personality-Driven Variations

Wei Ma, Yixiao Yang, Jingquan Ge, Xiaofei Xie, Lingxiao Jiang

机构 * Singapore Management University(新加坡国立大学) Capital Normal University(首都师范大学) Nanyang Technological University(南洋理工大学)

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.13369 2025-09-18 eess.SY cs.CY cs.HC cs.SY 57%

Right-to-Override for Critical Urban Control Systems: A Deliberative Audit Method for Buildings, Power, and Transport

Rashid Mushkani

专题命中 安全评测 :safety(abstract);分类 cs.CY

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.08364 2025-09-18 cs.AI 57%

Learning Like Humans: Advancing LLM Reasoning Capabilities via Adaptive Difficulty Curriculum Learning and Expert-Guided Self-Reformulation

Enci Zhang, Xingang Yan, Wei Lin, Tianxiang Zhang, Qianchun Lu

专题命中 安全评测 :alignment(abstract);分类 cs.AI

Comments 14 pages, 3 figs

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.17671 2025-09-18 cs.MA cs.AI 57%

ComfyGPT: A Self-Optimizing Multi-Agent System for Comprehensive ComfyUI Workflow Generation

Oucheng Huang, Yuhang Ma, Zeng Zhao, Mingrui Wu, Jiayi Ji, Rongsheng Zhang, Zhipeng Hu, Xiaoshuai Sun, Rongrong Ji

专题命中 安全评测 :alignment(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.15022 2025-09-18 cs.CL 57%

Mind the Style Gap: Meta-Evaluation of Style and Attribute Transfer Metrics

Amalie Brogaard Pauli, Isabelle Augenstein, Ira Assent

机构 * Department of Computer Science, Aarhus University, Denmark(计算机科学系,奥胡斯大学) Department of Computer Science, University of Copenhagen, Denmark(计算机科学系,哥本哈根大学)

专题命中 安全评测 :alignment(abstract);分类 cs.CL

Comments Accepted at EMNLP Findings 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.12612 2025-09-17 cs.AI 57%

GBV-SQL: Guided Generation and SQL2Text Back-Translation Validation for Multi-Agent Text2SQL

Daojun Chen, Xi Wang, Shenyuan Ren, Qingzhi Ma, Pengpeng Zhao, An Liu

专题命中 安全评测 :alignment(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.12459 2025-09-17 cs.CL 57%

Does Language Model Understand Language?

Suvojit Acharjee, Utathya Aich, Asfak Ali

机构 * Institute of Engineering and Management(工程与管理研究所) Jadavpur University(贾达沃大学)

专题命中 安全评测 :alignment(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.10483 2025-09-17 cs.SE cs.AI cs.PL 57%

Enhancing Automated Loop Invariant Generation for Complex Programs with Large Language Models

Ruibang Liu, Minyu Chen, Ling-I Wu, Jingyu Ke, Guoqiang Li

机构 * Shanghai Jiao Tong University(上海交通大学)

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI

Comments 26 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.12137 2025-09-16 eess.SY cs.AI cs.SY 57%

Control Analysis and Design for Autonomous Vehicles Subject to Imperfect AI-Based Perception

Tao Yan, Zheyu Zhang, Jingjing Jiang, Wen-Hua Chen

机构 * Department of Aeronautical and Automotive Engineering, Loughborough University(航空与汽车工程系,洛辛厄姆大学)

专题命中 安全评测 :safety(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.08638 2025-09-16 eess.AS cs.AI cs.MM cs.SD 57%

YuE: Scaling Open Foundation Models for Long-Form Music Generation

Ruibin Yuan, Hanfeng Lin, Shuyue Guo, Ge Zhang, Jiahao Pan, Yongyi Zang, Haohe Liu, Yiming Liang, Wenye Ma, Xingjian Du, Xinrun Du, Zhen Ye, Tianyu Zheng, Zhengxuan Jiang, Yinghao Ma, Minghao Liu, Zeyue Tian, Ziya Zhou, Liumeng Xue, Xingwei Qu, Yizhi Li, Shangda Wu, Tianhao Shen, Ziyang Ma, Jun Zhan, Chunhui Wang, Yatian Wang, Xiaowei Chi, Xinyue Zhang, Zhenzhu Yang, Xiangzhou Wang, Shansong Liu, Lingrui Mei, Peng Li, Junjie Wang, Jianwei Yu, Guojian Pang, Xu Li, Zihao Wang, Xiaohuan Zhou, Lijun Yu, Emmanouil Benetos, Yong Chen, Chenghua Lin, Xie Chen, Gus Xia, Zhaoxiang Zhang, Chao Zhang, Wenhu Chen, Xinyu Zhou, Xipeng Qiu, Roger Dannenberg, Jiaheng Liu, Jian Yang, Wenhao Huang, Wei Xue, Xu Tan, Yike Guo

机构 * HKUST(香港科技大学) MAP(多模态艺术投影)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

Comments https://github.com/multimodal-art-projection/YuE

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.11802 2025-09-16 cs.CL 57%

When Curiosity Signals Danger: Predicting Health Crises Through Online Medication Inquiries

Dvora Goncharok, Arbel Shifman, Alexander Apartsin, Yehudit Aperstein

专题命中 安全评测 :safety(abstract);分类 cs.CL

Comments 5 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.10937 2025-09-16 cs.CL 57%

An Interpretable Benchmark for Clickbait Detection and Tactic Attribution

Lihi Nofar, Tomer Portal, Aviv Elbaz, Alexander Apartsin, Yehudit Aperstein

专题命中 安全评测 :trustworthy(abstract);分类 cs.CL

Comments 7 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.10843 2025-09-16 cs.CL 57%

Evaluating Large Language Models for Evidence-Based Clinical Question Answering

Can Wang, Yiqun Chen

专题命中 安全评测 :alignment(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.06336 2025-09-16 cs.CV cs.AI cs.CR 57%

Multi-View Slot Attention Using Paraphrased Texts for Face Anti-Spoofing

Jeongmin Yu, Susang Kim, Kisu Lee, Taekyoung Kwon, Won-Yong Shin, Ha Young Kim

机构 * Yonsei University(延世大学)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

Comments Accepted to ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.06646 2025-09-16 econ.GN cs.CL q-fin.EC 57%

Evaluating and Aligning Human Economic Risk Preferences in LLMs

Jiaxin Liu, Yixuan Tang, Yi Yang, Kar Yan Tam

专题命中 安全评测 :alignment(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.14633 2025-09-16 q-bio.NC cs.AI cs.CV 57%

Evaluating Representational Similarity Measures from the Lens of Functional Correspondence

Yiqing Bo, Ansh Soni, Sudhanshu Srivastava, Meenakshi Khosla

机构 * University of California, San Diego(加州大学圣地亚哥分校) University of Pennsylvania(宾夕法尼亚大学)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

Comments Published in CCN 2025 Proceedings (Talk & Poster), May 14, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.10059 2025-09-15 cs.CV cs.AI 57%

Multimodal Mathematical Reasoning Embedded in Aerial Vehicle Imagery: Benchmarking, Analysis, and Exploration

Yue Zhou, Litong Feng, Mengcheng Lan, Xue Yang, Qingyun Li, Yiping Ke, Xue Jiang, Wayne Zhang

机构 * Department of Physics, J.K. Institute of Science(J.K.科学研究院物理系) World Scientific University(世界科学大学) University of Intelligent Studies(智能研究大学) East China Normal University(华东师范大学) Nanyang Technological University(南洋理工大学) SenseTime Research(商汤科技研究院) Shanghai Jiao Tong University(上海交通大学) Harbin Institute of Technology(哈尔滨工业大学)

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI

Comments 17 pages, 16 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.09799 2025-09-15 cs.LG cs.HC 57%

Distinguishing Startle from Surprise Events Based on Physiological Signals

Mansi Sharma, Alexandre Duchevet, Florian Daiber, Jean-Paul Imbert, Maurice Rekrut

机构 * German Research Center for Artificial Intelligence (DFKI), Cognitive Assistants Lab, Saarland Informatics Campus(德国人工智能研究中心(DFKI)、认知助理实验室、萨尔兰州信息技术校区) Fédération ENAC ISAE-SUPAERO ONERA, Université de Toulouse(ENAC ISAE-SUPAERO ONERA联合会、图卢兹大学)

专题命中 安全评测 :safety(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.16708 2025-09-15 cs.CL 57%

Atomic Fact Decomposition Helps Attributed Question Answering

Zhichao Yan, Jiapu Wang, Jiaoyan Chen, Xiaoli Li, Ru Li, Jeff Z. Pan

机构 * School of Computer and Information Technology, Shanxi University(山西大学计算机与信息学院) Beijing Key Laboratory of Multimedia and Intelligent Software Technology, Beijing Institute of Artificial Intelligence, School of Information Science and Technology, Beijing University of Technology(北京人工智能研究院多媒体与智能软件技术重点实验室,北京理工大学信息科学技术学院) University of Manchester(曼彻斯特大学) Singapore University of Technology and Design(新加坡科技设计大学) ILCC, School of Informatics, University of Edinburgh(爱丁堡大学信息学院ILCC)

专题命中 安全评测 :trustworthy(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.09680 2025-09-12 cs.CV cs.CL 57%

FLUX-Reason-6M & PRISM-Bench: A Million-Scale Text-to-Image Reasoning Dataset and Comprehensive Benchmark

Rongyao Fang, Aldrich Yu, Chengqi Duan, Linjiang Huang, Shuai Bai, Yuxuan Cai, Kun Wang, Si Liu, Xihui Liu, Hongsheng Li

机构 * CUHK(香港中文大学) HKU(香港大学) BUAA(北京航空航天大学) Alibaba(阿里巴巴)

专题命中 安全评测 :alignment(abstract);分类 cs.CL

Comments Project page: https://flux-reason-6m.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.03700 2025-09-12 cs.HC cs.AI 57%

MagicGUI: A Foundational Mobile GUI Agent with Scalable Data Pipeline and Reinforcement Fine-tuning

Liujian Tang, Shaokang Dong, Yijia Huang, Minqi Xiang, Hongtao Ruan, Bin Wang, Shuo Li, Zhiheng Xi, Zhihui Cao, Hailiang Pang, Heng Kong, He Yang, Mingxu Chai, Zhilin Gao, Xingyu Liu, Yingnan Fu, Jiaming Liu, Xuanjing Huang, Yu-Gang Jiang, Tao Gui, Qi Zhang, Kang Wang, Yunke Zhang, Yuran Wang

专题命中 安全评测 :alignment(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.01523 2025-09-12 cs.CL 57%

CondAmbigQA: A Benchmark and Dataset for Conditional Ambiguous Question Answering

Zongxi Li, Yang Li, Haoran Xie, S. Joe Qin

机构 * School of Data Science, Lingnan University(数据科学学院) School of Science and Technology, Hong Kong Metropolitan University(科技学院)

专题命中 安全评测 :alignment(abstract);分类 cs.CL

Comments Accepted by EMNLP 2025 (Main Conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.08493 2025-09-11 cs.CR cs.AI 57%

Send to which account? Evaluation of an LLM-based Scambaiting System

Hossein Siadati, Haadi Jafarian, Sima Jafarikhah

机构 * AI Research, Cybera Global Inc./ UNCW(AI研究、Cybera全球公司/UNCW) Department of Computer Science and Engineering, UC Denver(计算机科学与工程系,UC Denver) Department of Computer Science, UNCW(计算机科学系,UNCW)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.16838 2025-09-11 cs.CL 57%

REGen: A Reliable Evaluation Framework for Generative Event Argument Extraction

Omar Sharif, Joseph Gatto, Madhusudan Basak, Sarah M. Preum

机构 * Department of Computer Science, Dartmouth College(计算机科学系,达特茅斯学院)

专题命中 安全评测 :alignment(abstract);分类 cs.CL

Comments Accepted at EMNLP-2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.07473 2025-09-10 cs.AI 57%

SheetDesigner: MLLM-Powered Spreadsheet Layout Generation with Rule-Based and Vision-Based Reflection

Qin Chen, Yuanyi Ren, Xiaojun Ma, Mugeng Liu, Han Shi, Dongmei Zhang

机构 * Peking University(北京大学) Microsoft(微软)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

Comments Accepted to EMNLP 2025 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.07127 2025-09-10 cs.GR cs.AI cs.CV 57%

SVGauge: Towards Human-Aligned Evaluation for SVG Generation

Leonardo Zini, Elia Frigieri, Sebastiano Aloscari, Marcello Generali, Lorenzo Dodi, Robert Dosen, Lorenzo Baraldi

机构 * University of Modena and Reggio Emilia(摩德纳和雷吉奥艾米利亚大学) Doxee S.p.A.(Doxee公司)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

Comments Accepted at 23rd edition of International Conference on Image Analysis and Processing 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.05702 2025-09-10 cs.MA cs.AI cs.SY eess.SY 57%

Grid-Agent: An LLM-Powered Multi-Agent System for Power Grid Control

Yan Zhang, Ahmad Mohammad Saber, Amr Youssef, Deepa Kundur

机构 * Department of Electrical and Computer Engineering, University of Toronto(电气与计算机工程系,多伦多大学) Concordia Institute for Information Systems Engineering(康卡迪亚信息系统工程研究所) Concordia University(康卡迪亚大学)

专题命中 安全评测 :safety(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏