arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2025-11-24 至 2025-11-24 共收录 27 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全训练 4 篇

2511.16688 2025-11-24 cs.CL cs.AI 62%

Prompt-Based Value Steering of Large Language Models

基于提示的价值引导大型语言模型

Giulio Antonio Abbo, Tony Belpaeme

专题命中 安全训练 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 本文提出了一种基于提示的价值引导方法,通过评估提示候选者对生成文本的价值引导能力,展示在不修改模型的情况下实现价值对齐的可行性。

Comments 9 pages, 1 figure, 4 tables. Presented at the 3rd International Workshop on Value Engineering in AI (VALE 2025), 28th European Conference on AI. To appear in Springer LNCS

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17182 2025-11-24 cs.CY 57%

The Promotion Wall: Efficiency-Equity Trade-offs of Direct Promotion Regimes in Engineering Education

促进墙:工程教育中直接促进制度的效率-公平权衡

H. R. Paz

专题命中 安全训练 :safety(abstract);分类 cs.CY

AI总结 本文通过模拟研究发现,直接促进制度会导致退学率上升和公平差距扩大,而补充安全网的制度能部分缓解这一问题,同时降低学生压力。

Comments 42 pages, 4 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16916 2025-11-24 cs.AI 57%

Hybrid Differential Reward: Combining Temporal Difference and Action Gradients for Efficient Multi-Agent Reinforcement Learning in Cooperative Driving

混合差分奖励:结合时序差分和动作梯度用于高效合作驾驶多智能体强化学习

Ye Han, Lijun Zhang, Dejian Meng, Zhuang Zhang

机构 * School of Automotive Studies, Tongji University(交通学院)

专题命中 安全训练 :safety(abstract);分类 cs.AI

AI总结 本文提出混合差分奖励机制,结合时序差分和动作梯度,提升多智能体协同驾驶的收敛速度和策略稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16958 2025-11-24 econ.TH 50%

Real Option AI: Reversibility, Silence, and the Release Ladder

实时选项AI:可逆性、沉默与释放阶梯

I. Sebastian Buhai

专题命中 安全训练 :safety(abstract)

AI总结 本文研究了AI产品发布节奏作为战略实时选项的最优执行,揭示了可逆性、沉默与释放阶梯的内生机制,以及杠杆对不可逆性的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 越狱攻击 2 篇

2507.05248 2025-11-24 cs.CL 79%

Response Attack: Exploiting Contextual Priming to Jailbreak Large Language Models

响应攻击:利用上下文优先级来劫持大语言模型

Ziqi Miao, Lijun Li, Yuan Xiong, Zhenhua Liu, Pengyu Zhu, Jing Shao

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Xi’an Jiaotong University(西安交通大学) Beijing University of Posts and Telecommunications(北京邮电大学)

专题命中 越狱攻击 :jailbreak(title,abstract);分类 cs.CL

AI总结 响应攻击通过利用对话中中间响应作为上下文优先级,有效劫持大语言模型生成违反政策的内容。

Comments 20 pages, 10 figures. Code and data available at https://github.com/Dtc7w3PQ/Response-Attack

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.17987 2025-11-24 cs.CR cs.AI cs.CV 57%

Reason2Attack: Jailbreaking Text-to-Image Models via LLM Reasoning

通过LLM推理进行文本到图像模型的劫持:Reason2Attack

Chenyu Zhang, Lanjun Wang, Yiwen Ma, Wenhui Li, An-An Liu

专题命中 越狱攻击 :safety(abstract);分类 cs.AI

AI总结 Reason2Attack通过将劫持攻击融入LLM后训练过程,提升生成对抗性提示的推理能力,实现更高效的文本到图像模型攻击

Comments Noted that This paper includes model-generated content that may contain offensive or distressing material

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 幻觉与事实性 2 篇

2509.06938 2025-11-24 cs.LG cs.AI 73%

From Noise to Narrative: Tracing the Origins of Hallucinations in Transformers

从噪声到叙述:追踪变换器中幻觉的起源

Praneet Suresh, Jack Stanley, Sonia Joseph, Luca Scimeca, Danilo Bzdok

机构 * Mila - Quebec AI Institute(魁北克人工智能研究所)

专题命中 幻觉与事实性 :safety(abstract);AI safety(abstract);分类 cs.AI、cs.LG

AI总结 研究通过分析变换器模型在输入不确定性下的行为,揭示幻觉的起源及预测方法,为AI安全和风险评估提供依据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.12972 2025-11-24 cs.CV cs.AI 57%

Aligning Vision to Language: Annotation-Free Multimodal Knowledge Graph Construction for Enhanced LLMs Reasoning

对齐视觉与语言:无需注释的多模态知识图谱构建以增强大语言模型推理

Junming Liu, Siyuan Meng, Yanting Gao, Song Mao, Pinlong Cai, Guohang Yan, Yirong Chen, Zilin Bian, Ding Wang, Botian Shi

机构 * Tongji University(同济大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) East China Normal University(华东师范大学) Stanford University(斯坦福大学) New York University(纽约大学)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.AI

AI总结 本文提出 VaLiK 方法,通过跨模态信息补充构建无需注释的多模态知识图谱,提升大语言模型推理能力。

Comments 14 pages, 7 figures, 6 tables; Accepted by ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 隐私与版权 1 篇

2511.17201 2025-11-24 cs.CV 78%

Continual Alignment for SAM: Rethinking Foundation Models for Medical Image Segmentation in Continual Learning

持续对齐用于SAM:重新思考面向持续学习的医学图像分割的基础模型

Jiayi Wang, Wei Dai, Haoyu Wang, Sihan Yang, Haixia Bi, Jian Sun

机构 * Xi’an Jiaotong University(西安交通大学) School of Information and Communications Engineering, Xi’an Jiaotong University(信息与通信工程学院) School of Mathematics and Statistics, Xi’an Jiaotong University(数学与统计学学院)

专题命中 隐私与版权 :alignment(title,abstract)

AI总结 CA-SAM通过引入对齐层,实现了在持续学习中高效适应医学图像分割,提升性能并减少计算开销。

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 安全评测 12 篇

2510.22300 2025-11-24 cs.CR cs.AI cs.CV 79%

T2I-RiskyPrompt: A Benchmark for Safety Evaluation, Attack, and Defense on Text-to-Image Model

T2I-RiskyPrompt:用于评估、攻击和防御文本到图像模型安全性的基准

Chenyu Zhang, Tairen Zhang, Lanjun Wang, Ruidong Chen, Wenhui Li, Anan Liu

专题命中 安全评测 :safety(title,abstract);分类 cs.AI

AI总结 T2I-RiskyPrompt提出了一种用于评估文本到图像模型安全性的综合基准,通过层次化风险分类和原因驱动的检测方法,全面评估了多种模型和防御策略的安全性能。

Comments AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16823 2025-11-24 cs.LG cs.AI cs.HC 73%

Monte Carlo Expected Threat (MOCET) Scoring

蒙特卡洛预期威胁(MOCET)评分

Joseph Kim, Saahith Potluri

机构 * Johns Hopkins University School of Medicine(约翰霍普金斯大学医学院)

专题命中 安全评测 :safety(abstract);AI safety(abstract);分类 cs.AI、cs.LG

AI总结 MOCET是一种可解释且双重可扩展的指标,用于量化大语言模型在现实世界中的安全风险。

Comments Accepted to NeurIPS 2025 BioSafe GenAI

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16743 2025-11-24 cs.CV cs.AI cs.LG 73%

SafeR-CLIP: Mitigating NSFW Content in Vision-Language Models While Preserving Pre-Trained Knowledge

SafeR-CLIP: 通过保留预训练知识来缓解视觉-语言模型中的不适宜内容

Adeel Yousaf, Joseph Fioresi, James Beetham, Amrit Singh Bedi, Mubarak Shah

专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.AI、cs.LG

AI总结 SafeR-CLIP通过最小化干预策略,在保留预训练知识的同时提升视觉-语言模型的安全性,实现性能与安全性的平衡。

Comments AAAI 2026 (Main Technical Track)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16699 2025-11-24 cs.CL cs.AI 62%

Detecting and Steering LLMs' Empathy in Action

检测和引导大语言模型的同理心行为

Juan P. Cadile

机构 * Department of Philosophy University of Rochester(哲学系罗切斯特大学)

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI

AI总结 研究通过对比提示检测和引导大语言模型的同理心行为,发现不同模型在引导效果和鲁棒性上存在差异。

Comments 14 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.11393 2025-11-24 cs.SE cs.AI cs.CR cs.MA 61%

LLM-Agent-UMF: LLM-based Agent Unified Modeling Framework for Seamless Design of Multi Active/Passive Core-Agent Architectures

LLM-Agent-UMF: 基于大语言模型的代理统一建模框架,用于无缝设计多主动/被动核心代理架构

Amine Ben Hassouna, Hana Chaari, Ines Belhaj

机构 * Mediterranean Institute of Technology(地中海技术研究所) South Mediterranean University(南地中海大学) National School of Computer Science(国家计算机科学学校) University of Manouba(曼努巴大学)

专题命中 安全评测 :alignment(abstract);分类 cs.AI;trustworthy(comments)

AI总结 LLM-Agent-UMF提出了一种基于大语言模型的代理统一建模框架,用于设计多主动/被动核心代理架构,解决了现有架构的模块化和术语不一致问题。

Comments 39 pages, 19 figures, 3 tables. Published in Information Fusion, Volume 127, March 2026, 103865. Part of the special issue "Data Fusion Approaches in Data-Centric AI for Developing Trustworthy AI Systems"

Journal ref Information Fusion 127 (2026) 103865

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21651 2025-11-24 cs.AI 57%

Can AI Perceive Physical Danger and Intervene?

AI能否感知物理危险并干预?

Abhishek Jindal, Dmitry Kalashnikov, R. Alex Hofer, Oscar Chang, Divya Garikapati, Anirudha Majumdar, Pierre Sermanet, Vikas Sindhwani

机构 * Google DeepMind Robotics(谷歌深Mind机器人技术)

专题命中 安全评测 :safety(abstract);分类 cs.AI

AI总结 本文提出了一种用于评估具身体验AI系统物理安全性的基准测试方法,通过生成逼真图像和视频来测试模型对安全风险的理解和干预能力,并开发了训练后范式以提升模型的安全推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.01588 2025-11-24 cs.LG cs.CV 57%

Explore More, Learn Better: Parallel MLLM Embeddings under Mutual Information Minimization

探索更多,学习更好:基于互信息最小化的并行 MLLM 嵌入

Zhicheng Wang, Chen Ju, Xu Chen, Shuai Xiao, Jinsong Lan, Xiaoyong Zhu, Ying Chen, Zhiguo Cao

机构 * Zhejiang University(浙江大学) Alibaba Group(阿里巴巴集团) Huazhong University of Science and Technology(华中科技大学)

专题命中 安全评测 :alignment(abstract);分类 cs.LG

AI总结 本文提出基于互信息最小化的并行解耦框架,通过多条并行路径提升多模态嵌入质量,实现高效且鲁棒的嵌入空间。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.27629 2025-11-24 cs.CR cs.AI 57%

Best Practices for Biorisk Evaluations on Open-Weight Bio-Foundation Models

开放权重生物基础模型的生物风险评估最佳实践

Boyi Wei, Zora Che, Nathaniel Li, Udari Madhushani Sehwag, Jasper Götting, Samira Nedungadi, Julian Michael, Summer Yue, Dan Hendrycks, Peter Henderson, Zifan Wang, Seth Donoughe, Mantas Mazeika

机构 * Scale AI SecureBio Center for AI Safety(AI安全中心) Princeton University(普林斯顿大学)

专题命中 安全评测 :safety(abstract);分类 cs.AI

AI总结 本文提出BioRiskEval框架,用于评估开放权重生物基础模型的鲁棒性,揭示现有数据过滤方法的局限性,并强调需进一步研究安全策略。

Comments 17 Pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.13290 2025-11-24 cs.PL cs.AI 57%

Towards Formal Verification of LLM-Generated Code from Natural Language Prompts

向自然语言提示生成的LLM代码形式验证

Aaron Councilman, David Jiahao Fu, Aryan Gupta, Chengxiao Wang, David Grove, Yu-Xiong Wang, Vikram Adve

机构 * University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) IBM Research(IBM研究院)

专题命中 安全评测 :safety(abstract);分类 cs.AI

AI总结 Astrogator通过形式查询语言和知识库实现对LLM生成代码的正确性验证,验证准确率达83%。

Comments 28 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.08636 2025-11-24 cs.LG cs.CV 57%

Birds look like cars: Adversarial analysis of intrinsically interpretable deep learning

鸟类看起来像汽车:对内在可解释深度学习的对抗分析

Hubert Baniecki, Przemyslaw Biecek

机构 * University of Warsaw(华沙大学) Warsaw University of Technology(华沙技术大学)

专题命中 安全评测 :alignment(abstract);分类 cs.LG

AI总结 本文研究了内在可解释深度学习模型的对抗性风险,通过原型操纵和后门攻击揭示其不可解释性,并探讨了提升模型鲁棒性和对齐性的必要性。

Comments Accepted by Machine Learning

Journal ref Machine Learning (2025) 114:284

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17448 2025-11-24 cs.CV 50%

MMT-ARD: Multimodal Multi-Teacher Adversarial Distillation for Robust Vision-Language Models

MMT-ARD: 多模态多教师对抗蒸馏用于鲁棒视觉-语言模型

Yuqi Li, Junhao Dong, Chuanguang Yang, Shiping Wen, Piotr Koniusz, Tingwen Huang, Yingli Tian, Yew-Soon Ong

机构 * The City University of New York, CUNY(纽约城市大学) Nanyang Technological University(南洋理工大学) Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) University of Technology Sydney(悉尼技术大学) Data61, CSIRO(CSIRO数据61研究所) Shenzhen University of Advanced Technology(深圳先进技术大学)

专题命中 安全评测 :safety(abstract)

AI总结 MMT-ARD通过多教师对抗蒸馏提升视觉-语言模型的对抗鲁棒性,实验显示鲁棒精度提升4.32%,训练效率提高2.3倍。

Comments 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.18267 2025-11-24 cs.HC 50%

From Checking to Sensemaking: A Caregiver-in-the-Loop Framework for AI-Assisted Task Verification in Dementia Care

从验证到理解:一种护理人员在循环框架中的AI辅助任务验证方法用于痴呆症护理

Joy Lai, Kelly Beaton, David Black, Bing Ye, Alex Mihailidis

专题命中 安全评测 :trustworthy(abstract)

AI总结 本文提出了一种护理人员在循环框架中的AI辅助任务验证方法,通过生成式AI支持照护者主导的任务验证,提升痴呆症护理中的信任与协作。

详情

展开后加载摘要…

URL PDF HTML 收藏

6. AI治理与伦理 2 篇

2511.17256 2025-11-24 cs.CY cs.CL 81%

Cross-cultural value alignment frameworks for responsible AI governance: Evidence from China-West comparative analysis

跨文化价值观对齐框架用于负责任的AI治理:来自中西方比较分析的证据

Haijiang Liu, Jinguang Gu, Xun Wu, Daniel Hershcovich, Qiaoling Xiao

机构 * Wuhan University of Science and Technology(武汉理工大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) University of Copenhagen(哥本哈根大学) WUST-Madrid Complutense Institute(武汉理工大学-马德里康普顿斯研究所)

专题命中 AI治理与伦理 :alignment(title,abstract);分类 cs.CL、cs.CY

AI总结 本研究提出多层审计平台,评估中西方LLM跨文化价值观对齐,发现中国模型在多语言优化上更优,而西方模型存在美国偏见,Mistral系列在跨文化对齐上表现突出。

Comments Presented on Academic Conference "Technology for Good: Driving Social Impact" (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17036 2025-11-24 cs.CL cs.CV 57%

Do Vision-Language Models Understand Visual Persuasiveness?

视觉-语言模型理解视觉说服力吗?

Gyuwon Park

机构 * Department of Computer Science and Engineering, UNIST(计算机科学与工程系,UNIST)

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.CL

AI总结 本文研究视觉-语言模型对视觉说服力的理解,发现模型在链接说服对象与沟通意图方面存在局限。

Comments 8 pages (except for reference and appendix), 5 figures, 7 tables, to be published in NeurIPS 2025 Workshop: VLM4RWD

详情

展开后加载摘要…

URL PDF HTML 收藏

7. 其他安全 4 篇

2504.08016 2025-11-24 q-bio.NC cs.AI cs.CL 62%

Emergence of psychopathological computations in large language models

大语言模型中精神病理计算的出现

Soo Yong Lee, Hyunjin Hwang, Taekwan Kim, Yuyeong Kim, Kyuri Park, Jaemin Yoo, Denny Borsboom, Kijung Shin

机构 * KAIST, Kim Jaechul Graudate School of AI(KAIST人工智能研究生院) KAIST, School of Electrical Engineering(KAIST电子工程学院) UCL, Mental Health Neuroscience Department(伦敦大学学院心理健康神经科学系) UvA, Informatics Institute(乌得勒支大学信息学院) UvA, Department of Psychology(乌得勒支大学心理学系)

专题命中 其他安全 :safety(abstract);分类 cs.CL、cs.AI

AI总结 本研究通过建立计算理论框架,证明大语言模型中已出现精神病理学的网络计算结构,并揭示其可能带来的安全风险。

Comments pre-print

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.19588 2025-11-24 physics.chem-ph cs.LG 57%

Discovery of Sustainable Refrigerants through Physics-Informed RL Fine-Tuning of Sequence Models

通过结合物理信息的强化学习微调序列模型发现可持续制冷剂

Adrien Goldszal, Diego Calanzone, Vincent Taboga, Pierre-Luc Bacon

机构 * École Polytechnique(巴黎政治学院) Mila Quebec AI Institute(魁北克人工智能研究所) Université de Montréal(蒙特利尔大学)

专题命中 其他安全 :safety(abstract);分类 cs.LG

AI总结 Refgen通过结合物理信息的强化学习微调序列模型,有效发现新型可持续制冷剂。

Comments Accepted to 1st SIMBIOCHEM Workshop at EurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17304 2025-11-24 q-fin.CP 50%

Law-Strength Frontiers and a No-Free-Lunch Result for Law-Seeking Reinforcement Learning on Volatility Law Manifolds

法律强度前沿与在波动率法律流形上寻求法律的强化学习的无免费午餐结果

Jian'an Zhang

专题命中 其他安全 :alignment(abstract)

AI总结 本文研究了在波动率法律流形上强化学习的法律强度权衡及无免费午餐问题,通过实验揭示法律寻求RL在波动率建模中的局限性。

Comments 61 pages, 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16567 2025-11-24 cs.CV 50%

POMA-3D: The Point Map Way to 3D Scene Understanding

POMA-3D:点地图方式的3D场景理解

Ye Mao, Weixun Luo, Ranran Huang, Junpeng Jing, Krystian Mikolajczyk

机构 * Imperial College London(伦敦帝国学院)

专题命中 其他安全 :alignment(abstract)

AI总结 POMA-3D通过点地图实现3D场景理解,结合自监督学习和多视角对齐策略,提升3D任务表现。

Comments 11 pages, 6 tables, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏