arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2025-12-18 至 2025-12-18 共收录 36 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 偏好对齐 1 篇

2512.15302 2025-12-18 cs.CL 57%

Towards Proactive Personalization through Profile Customization for Individual Users in Dialogues

通过用户个性化配置实现对话中的前瞻性个性化

Xiaotian Zhang, Yuan Wang, Ruizhe Chen, Zeya Wang, Runchen Hou, Zuozhu Liu

机构 * Zhejiang University(浙江大学) Zhejiang Key Laboratory of Medical Imaging Artificial Intelligence(浙江省医学影像人工智能重点实验室)

专题命中 偏好对齐 :alignment(abstract);分类 cs.CL

AI总结 本文提出PersonalAgent,通过构建和动态完善用户档案,实现对话中的长期个性化和用户偏好推断,提升对话代理的适应性和连贯性。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 安全训练 4 篇

2512.14860 2025-12-18 cs.CR cs.AI 70%

Penetration Testing of Agentic AI: A Comparative Security Analysis Across Models and Frameworks

代理AI的渗透测试:跨模型和框架的比较安全分析

Viet K. Nguyen, Mohammad I. Husain

专题命中 安全训练 :safety(abstract);prompt injection(abstract);分类 cs.AI

AI总结 本文通过测试五个代理AI模型和两个框架,揭示了代理AI在安全方面的显著差异,发现超过一半的恶意提示成功,提出了新的防御策略和部署建议。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14761 2025-12-18 cs.SE cs.AI cs.LG 62%

CAPE: Capability Achievement via Policy Execution

通过策略执行实现能力:CAPE

David Ball

机构 * Superficial Labs(超浅实验室)

专题命中 安全训练 :DPO(abstract);分类 cs.AI、cs.LG

AI总结 CAPE通过策略执行实现能力,系统性地将要求转化为可执行规范并训练模型默认满足,减少违规率81%,提升能力评估效率。

Comments 32 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14985 2025-12-18 stat.ME cs.CY 57%

Measuring Nonlinear Relationships and Spatial Heterogeneity of Influencing Factors on Traffic Crash Density Using GeoXAI

利用GeoXAI测量交通碰撞密度影响因素的非线性关系与空间异质性

Jiaqing Lu, Ziqi Li, Lei Han, Qianwen Guo

专题命中 安全训练 :safety(abstract);分类 cs.CY

AI总结 本研究利用GeoXAI框架分析佛罗里达州交通碰撞密度的影响因素,揭示非线性关系与空间异质性,并提出针对性的地理敏感政策建议。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14744 2025-12-18 q-fin.CP cs.AI 57%

VERAFI: Verified Agentic Financial Intelligence through Neurosymbolic Policy Generation

VERAFI:通过神经符号策略生成实现验证的代理金融智能

Adewale Akinfaderin, Shreyas Subramanian

专题命中 安全训练 :trustworthy(abstract);分类 cs.AI

AI总结 VERAFI通过神经符号策略生成实现验证的代理金融智能,显著提升金融领域事实正确性与合规性。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 越狱攻击 4 篇

2512.15353 2025-12-18 cs.CL cs.AI 88%

Adversarial versification in portuguese as a jailbreak operator in LLMs

葡萄牙对抗性韵律作为LLMs中的对抗性操作符

Joao Queiroz

专题命中 越狱攻击 :jailbreak(title,abstract);alignment(abstract);RLHF(abstract);safety(abstract)

AI总结 研究发现,将提示改写为诗歌能显著提高LLMs的安全漏洞,揭示当前对齐机制的不足,并指出葡萄牙语评估的缺失。

Comments 15 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01353 2025-12-18 cs.CR 67%

The Trojan Knowledge: Bypassing Commercial LLM Guardrails via Harmless Prompt Weaving and Adaptive Tree Search

恶意知识:通过无害提示编织和自适应树搜索绕过商业大语言模型的安全防护

Rongzhe Wei, Peizhi Niu, Xinjie Shen, Tony Tu, Yifan Li, Ruihan Wu, Eli Chien, Pin-Yu Chen, Olgica Milenkovic, Pan Li

专题命中 越狱攻击 :safety(abstract);jailbreak(abstract)

AI总结 通过无害提示编织和自适应树搜索,研究提出CKA-Agent攻击方法,成功绕过商业大语言模型的安全防护,揭示了知识分解攻击的严重性。

Comments Updated with new baselines and experimental results

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15081 2025-12-18 cs.CR cs.AI cs.CL 62%

Quantifying Return on Security Controls in LLM Systems

对LLM系统中安全控制的回报进行量化

Richard Helder Moulton, Austin O'Brien, John D. Hastings

专题命中 越狱攻击 :prompt injection(abstract);分类 cs.CL、cs.AI

AI总结 本文提出了一种量化LLM系统安全控制回报的方法,通过模拟攻击和风险评估,比较了ABAC、NER删除和NeMo Guardrails三种安全措施的效果,发现ABAC显著降低风险,RoC达到9.83。

Comments 13 pages, 9 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14741 2025-12-18 cs.CR cs.AI 57%

Persistent Backdoor Attacks under Continual Fine-Tuning of LLMs

在LLM持续微调下的持久后门攻击

Jing Cui, Yufei Han, Jianbin Jiao, Junge Zhang

专题命中 越狱攻击 :safety(abstract);分类 cs.AI

AI总结 本文提出P-Trojan算法,研究在LLM持续微调中后门的持久性问题,实验显示其在保持清洁任务准确性的同时实现高持久性。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 红队测试 1 篇

2512.14745 2025-12-18 cs.CR cs.AI 57%

Factor(U,T): Controlling Untrusted AI by Monitoring their Plans

Factor(U,T): 通过监控其计划来控制不可信的AI

Edward Lue Chee Lip, Anthony Channg, Diana Kim, Aaron Sandoval, Kevin Zhu

专题命中 红队测试 :safety(abstract);分类 cs.AI

AI总结 Factor(U,T)通过监控AI分解计划来控制不可信AI,实验表明在仅观察自然语言指令时,监控恶意活动效果有限,而结合子任务监控则能实现高区分度和安全性。

Comments Accepted to AAAI 2026 Workshop on Trust and Control in Agentic AI (TrustAgent). 6 pages body, 8 pages total, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 提示注入 2 篇

2507.07417 2025-12-18 cs.CR cs.AI cs.CL 81%

May I have your Attention? Breaking Fine-Tuning based Prompt Injection Defenses using Architecture-Aware Attacks

请允许我注意:利用架构感知攻击打破基于微调的提示注入防御

Nishit V. Pandya, Andrey Labunets, Sicun Gao, Earlence Fernandes

专题命中 提示注入 :prompt injection(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出一种基于注意力的攻击算法,揭示了现有白盒提示注入防御的不足,攻击成功率高达85-95%

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.14285 2025-12-18 cs.CR cs.LG 79%

A Multi-Agent LLM Defense Pipeline Against Prompt Injection Attacks

针对提示注入攻击的多智能体LLM防御管道

S M Asif Hossain, Ruksat Khan Shayoni, Mohd Ruhul Ameen, Akif Islam, M. F. Mridha, Jungpil Shin

机构 * School of Computing, Wichita State University, Kansas, USA(威斯康星州立大学计算机学院) College of Engineering and Computer Sciences, Marshall University, Huntington, WV, USA(马歇尔大学工程与计算机科学学院) Department of Computer Science and Engineering, University of Rajshahi, Bangladesh(拉贾沙希大学计算机科学与工程系) Department of Computer Science and Engineering, American International University-Bangladesh, Dhaka, Bangladesh(美国国际大学-孟加拉国计算机科学与工程系) School of Computer Science and Engineering, The University of Aizu, Aizuwakamatsu, Japan(立命馆大学计算机科学与工程学院)

专题命中 提示注入 :prompt injection(title,abstract);分类 cs.LG

AI总结 本文提出了一种多智能体防御框架,通过协调的LLM代理实时检测并中和提示注入攻击,显著提升了安全性和系统功能。

Comments Accepted at the 11th IEEE WIECON-ECE 2025

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 幻觉与事实性 2 篇

2512.15663 2025-12-18 cs.AI cs.CL 62%

Explaining the Reasoning of Large Language Models Using Attribution Graphs

通过归因图解释大语言模型的推理过程

Chase Walker, Rickard Ewetz

机构 * University of Florida(佛罗里达大学)

专题命中 幻觉与事实性 :safety(abstract);分类 cs.CL、cs.AI

AI总结 CAGE框架通过归因图解释大语言模型的推理过程,提升上下文归因的准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14851 2025-12-18 cs.LG 57%

Unreliable Uncertainty Estimates with Monte Carlo Dropout

基于蒙特卡洛滴落的不可靠不确定性估计

Aslak Djupskås, Alexander Johannes Stasik, Signe Riemer-Sørensen

机构 * Department of Data Science, Norwegian University of Life Sciences(数据科学系,挪威生命科学大学) SINTEF AS, Department of Mathematics and Cybernetics(SINTEF公司,数学与自动化系)

专题命中 幻觉与事实性 :safety(abstract);分类 cs.LG

AI总结 本文指出蒙特卡洛滴落在估计不确定性时不可靠,尤其在插值和外推区域表现不佳,不如传统贝叶斯方法可靠。

Comments Accepted for the Northern Lights Deep Learning 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

7. 隐私与版权 2 篇

2507.10532 2025-12-18 cs.LG cs.AI cs.CL 67%

Reasoning or Memorization? Unreliable Results of Reinforcement Learning Due to Data Contamination

推理还是记忆?由于数据污染导致强化学习不可靠的结果

Mingqi Wu, Zhihao Zhang, Qiaole Dong, Zhiheng Xi, Jun Zhao, Senjie Jin, Xiaoran Fan, Yuhao Zhou, Huijie Lv, Ming Zhang, Yanwei Fu, Qin Liu, Songyang Zhang, Qi Zhang

专题命中 隐私与版权 :trustworthy(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文发现Qwen2.5系列模型易受数据污染影响,通过生成清洁算术问题验证了准确奖励信号对数学推理性能的提升作用

Comments 28 pages, AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.03338 2025-12-18 cs.CV cs.AI cs.CY 62%

Safer Prompts: Reducing Risks from Memorization in Visual Generative AI

更安全的提示:减少视觉生成AI中记忆化风险

Lena Reissinger, Yuanyuan Li, Anna-Carolina Haensch, Neeraj Sarna

机构 * Ludwig Maximilian University of Munich(慕尼黑路易斯·马克西米利安大学) Munich RE(慕尼黑RE)

专题命中 隐私与版权 :safety(abstract);分类 cs.AI、cs.CY

AI总结 本文提出通过提示工程技术减少视觉生成AI中因记忆训练数据导致的安全风险,提升生成图像与训练数据的相似性降低,同时保持输出的相关性和美观性。

详情

展开后加载摘要…

URL PDF HTML 收藏

8. 安全评测 12 篇

2512.15617 2025-12-18 cs.CL cs.AI 81%

Evaluating Metrics for Safety with LLM-as-Judges

用LLM作为裁判评估安全度的指标

Kester Clegg, Richard Hawkins, Ibrahim Habli, Tom Lawton

机构 * Centre for Assuring Autonomy, University of York(自主性保障中心、约克大学) Bradford Royal Infirmary(布拉德福德皇家医院)

专题命中 安全评测 :safety(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出通过加权指标和置信度阈值来提升LLM作为裁判在关键信息流中的安全性和可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.15538 2025-12-18 cs.AI cs.MA 79%

TrafficGamer: Reliable and Flexible Traffic Simulation for Safety-Critical Scenarios with Game-Theoretic Oracles

TrafficGamer: 用于安全关键场景的可靠且灵活的交通仿真方法,基于博弈论 oracle

Guanren Qiao, Guorui Quan, Jiawei Yu, Shujun Jia, Guiliang Liu

机构 * School of Data Science, the Chinese University of Hong Kong, Shenzhen(数据科学学院,香港中文大学(深圳)) University of Manchester(曼彻斯特大学) Shenyang MXNavi Co.,Ltd.(沈阳MXNavi有限公司)

专题命中 安全评测 :safety(title,abstract);分类 cs.AI

AI总结 TrafficGamer通过将道路驾驶视为多智能体游戏,实现安全关键场景的可靠且灵活的交通仿真,利用博弈论方法提高仿真保真度和均衡捕捉能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.09603 2025-12-18 cs.CV 78%

Do MLLMs Exhibit Human-like Perceptual Behaviors? HVSBench: A Benchmark for MLLM Alignment with Human Perceptual Behavior

多模态大语言模型是否表现出类人感知行为?HVSBench:一个用于多模态大语言模型对齐人类视觉行为的基准测试

Jiaying Lin, Shuquan Ye, Dan Xu, Wanli Ouyang, Rynson W. H. Lau

专题命中 安全评测 :alignment(title,abstract)

AI总结 HVSBench通过测试多模态大语言模型与人类视觉行为的对齐性,揭示了其在感知任务上的显著差距,并强调了开发更符合人类认知的AI的重要性。

Comments Project page: https://jiaying.link/HVSBench/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15033 2025-12-18 cs.AI 70%

Beyond Accuracy: A Geometric Stability Analysis of Large Language Models in Chess Evaluation

超越准确性:大型语言模型在国际象棋评估中的几何稳定性分析

Xidan Song, Weiqi Wang, Ruifeng Cao, Qingya Hu

专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.AI

AI总结 本文提出几何稳定性框架,用于评估大型语言模型在国际象棋评估中的几何推理能力,揭示了模型在几何变换下的稳定性差异及性能悖论。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14712 2025-12-18 cs.LG cs.AI cs.CL cs.CV cs.CY 70%

SepsisSuite: Beyond Risk Stratification -- A Comparative Analysis of Deep Fusion vs. Expert Stacking for Prescriptive Sepsis AI

SepsisSuite: 超越风险分层 -- 深度融合与专家堆叠的比较分析用于处方性脓毒症AI

Ryan Cartularo

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI、cs.CY

AI总结 SepsisSuite通过深度融合与专家堆叠对比,提出SepsisLateFusion架构,实现预测临床发作前4小时的AUC 0.915,并提升抗生素选择性能。

Comments 7 Pages, 4 Tables, 9 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01899 2025-12-18 cs.LG cs.AI cs.HC 62%

Multimodal Foundation Models for Early Disease Detection

多模态基础模型用于早期疾病检测

Md Talha Mohsin, Ismail Abdulrashid

机构 * The University of Tulsa(塔尔萨大学)

专题命中 安全评测 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 本文提出一种多模态基础模型,通过整合电子病历、医学影像、基因组学和可穿戴传感器数据,提升早期疾病检测的准确性和鲁棒性。

Comments 6 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15466 2025-12-18 cs.SE cs.AI 57%

On Assessing the Relevance of Code Reviews Authored by Generative Models

基于生成模型的代码审查相关性的评估

Robert Heumüller, Frank Ortmeier

机构 * Otto von Guericke University Magdeburg, Germany(奥托·冯·格里克大学马格德堡)

专题命中 安全评测 :safety(abstract);分类 cs.AI

AI总结 本文提出多主观排名方法,评估生成模型在代码审查中的表现,发现其生成评论质量优于人类,但需警惕潜在风险。

Comments Replication Package: https://github.com/robert-heumueller-ovgu/repl-generative-review-relevance

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15008 2025-12-18 cs.LG 57%

Stock Pattern Assistant (SPA): A Deterministic and Explainable Framework for Structural Price Run Extraction and Event Correlation in Equity Markets

股票模式助手(SPA):一种确定性和可解释性的框架,用于在权益市场中提取结构性价格运行和事件关联

Sandeep Neela

专题命中 安全评测 :alignment(abstract);分类 cs.LG

AI总结 SPA是一种用于提取结构性价格运行和事件关联的确定性框架,通过可解释的方法提供透明的历史价格结构分析。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13734 2025-12-18 cs.CL 57%

GAPS: A Clinically Grounded, Automated Benchmark for Evaluating AI Clinicians

GAPS: 一种基于临床的自动化评估基准,用于评估AI临床医生

Xiuyuan Chen, Tao Sun, Dexin Su, Ailing Yu, Junwei Liu, Zhe Chen, Gangzeng Jin, Xin Wang, Jingnan Liu, Hansong Xiao, Hualei Zhou, Dongjie Tao, Chunxiao Guo, Minghui Yang, Yuan Xia, Jing Zhao, Qianrui Fan, Yanyun Wang, Shuai Zhen, Kezhong Chen, Jun Wang, Zewen Sun, Heng Zhao, Tian Guan, Shaodong Wang, Geyun Chang, Jiaming Deng, Hongchengcheng Chen, Kexin Feng, Ruzhen Li, Jiayi Geng, Changtai Zhao, Jun Wang, Guihu Lin, Peihao Li, Liqi Liu, Peng Wei, Jian Wang, Jinjie Gu, Ping Wang, Fan Yang

机构 * Department of Thoracic Surgery(胸外科部门) Thoracic Oncology Institute(胸外科肿瘤研究所) Research Unit of Intelligence Diagnosis and Treatment in Early Non-small Cell Lung Cancer(早期非小细胞肺癌智能诊断与治疗研究单元) Institute of Advanced Clinical Medicine(先进临床医学研究所) Beijing Key Laboratory of Innovative Application of Big Data in Lung Cancer(肺癌大数据创新应用北京市重点实验室) Ant Group(蚂蚁集团) School of Software and Microelectronics(软件与微电子学院)

专题命中 安全评测 :safety(abstract);分类 cs.CL

AI总结 GAPS提出了一种基于临床的自动化评估基准,用于评估AI临床医生系统,通过多维评估框架解决现有基准的不足,揭示了AI在临床实践中的关键失败模式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05788 2025-12-18 eess.SY cs.SY 50%

Task-Specific Trust Evaluation for Multi-Hop Collaborator Selection via GNN-Aided Distributed Agentic AI

基于图神经网络的多跳协作者选择任务特定信任评估

Botao Zhu, Xianbin Wang, Dusit Niyato

专题命中 安全评测 :trustworthy(abstract)

AI总结 本文提出基于图神经网络的分布式代理人工智能框架,用于多跳协作者选择中的任务特定信任评估,通过整合设备可信度评估结果,实现隐私保护的任务路径规划。

Journal ref IEEE Journal on Selected Areas in Communications, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15148 2025-12-18 cs.SE 50%

Aligning Academia with Industry: An Empirical Study of Industrial Needs and Academic Capabilities in AI-Driven Software Engineering

将学术与产业对齐:一项关于工业需求和学术能力的AI驱动软件工程实证研究

Hang Yu, Yuzhou Lai, Li Zhang, Xiaoli Lian, Fang Liu, Yanrui Dong, Ting Zhang, Zhi Jin, David Lo

专题命中 安全评测 :alignment(abstract)

AI总结 本文通过分析学术研究与工业需求的差距,揭示AI驱动软件工程中的关键挑战,旨在引导未来研究更贴近实际应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14755 2025-12-18 cs.CV 50%

SkyCap: Bitemporal VHR Optical-SAR Quartets for Amplitude Change Detection and Foundation-Model Evaluation

SkyCap:双时间维高分辨率光学-合成孔径雷达四元组用于幅度变化检测和基础模型评估

Paul Weinmann, Ferdinand Schenck, Martin Šiklar

机构 * LiveEO GmbH(LiveEO公司)

专题命中 安全评测 :alignment(abstract)

AI总结 SkyCap通过光学-雷达数据集和标签转移,首次评估了高分辨率SAR幅度变化检测中的基础模型性能。

Comments 8 pages, 0 figures. Accepted at Advances in Representation Learning for Earth Observation (REO) at EurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏

9. AI治理与伦理 1 篇

2508.20764 2025-12-18 cs.CL 57%

Feel the Difference? A Comparative Analysis of Emotional Arcs in Real and LLM-Generated CBT Sessions

感知差异?真实与LLM生成CBT对话中情感弧的比较分析

Xiaoyi Wang, Jiwei Zhang, Guangtao Zhang, Honglei Guo

机构 * Department of Computer Science, Shantou University(汕头大学计算机科学系) Department of Automation, Tsinghua University(清华大学自动化系) BNRIST, Tsinghua University(清华大学脑科学与类脑智能研究院)

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.CL

AI总结 本研究通过比较真实与LLM生成的CBT对话,揭示了合成对话在情感动态上的不足,强调了情感真实性的关键作用。

Comments Accepted at 2025 EMNLP findings,19 page,2 figures

Journal ref In Findings of the Association for Computational Linguistics: EMNLP 2025, pages 19999-20017

详情

展开后加载摘要…

URL PDF HTML 收藏

10. 其他安全 7 篇

2512.15080 2025-12-18 cs.RO 78%

NAP3D: NeRF Assisted 3D-3D Pose Alignment for Autonomous Vehicles

NAP3D: 通过NeRF辅助的3D-3D姿态对齐用于自动驾驶车辆

Gaurav Bansal

机构 * MIT THINK Scholars Program(MIT THINK学者计划) Archbishop Mitty High School(阿奇博尔特·米蒂高中)

专题命中 其他安全 :alignment(title,abstract)

AI总结 NAP3D通过NeRF辅助的3D-3D对应关系,提升自动驾驶车辆在长视距下的姿态估计精度,实现优于传统2D-3D方法的鲁棒性。

Comments 10 pages, 5 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏