arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2025-11-21 至 2025-11-21 共收录 45 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 偏好对齐 4 篇

2511.16324 2025-11-21 cs.CL cs.AI 84%

SDA: Steering-Driven Distribution Alignment for Open LLMs without Fine-Tuning

SDA:无微调的开放语言模型分布对齐框架

Wei Xia, Zhi-Hong Deng

专题命中 偏好对齐 :alignment(title,abstract);harmlessness(abstract);分类 cs.CL、cs.AI

AI总结 SDA 提出了一种无需微调的开源 LLMs 分布对齐框架,通过用户指令动态调整输出概率,提升模型与人类意图的一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.20059 2025-11-21 cs.CL 79%

Is Preference Alignment Always the Best Option to Enhance LLM-Based Translation? An Empirical Analysis

基于偏好对齐是否总是提升基于大语言模型的翻译质量的最佳选项?一项实证分析

Hippolyte Gisserot-Boukhlef, Ricardo Rei, Emmanuel Malherbe, Céline Hudelot, Pierre Colombo, Nuno M. Guerreiro

专题命中 偏好对齐 :alignment(title,abstract);分类 cs.CL

AI总结 本研究通过实证分析探讨了基于偏好的对齐在提升大语言模型翻译质量中的效果,发现CPO在高质量数据上表现优异,但可能在下游度量上存在不稳定性,同时基础模型生成翻译的表现与多个外部系统相当且更一致。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15767 2025-11-21 cs.LG cs.AI cs.PL 62%

TB or Not TB: Coverage-Driven Direct Preference Optimization for Verilog Stimulus Generation

TB 或 TB:基于覆盖率的直接偏好优化用于 Verilog 刺激生成

Bardia Nadimi, Khashayar Filom, Deming Chen, Hao Zheng

机构 * Core AI Department(核心人工智能部门) Cognichip Inc(认知芯片公司)

专题命中 偏好对齐 :DPO(abstract);分类 cs.AI、cs.LG

AI总结 TB or not TB通过覆盖率驱动的直接偏好优化,提升Verilog刺激生成的覆盖率和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.19753 2025-11-21 cs.CL 57%

CoTKR: Chain-of-Thought Enhanced Knowledge Rewriting for Complex Knowledge Graph Question Answering

CoTKR: 基于链式推理的增强型知识重写用于复杂知识图谱问答

Yike Wu, Yi Huang, Nan Hu, Yuncheng Hua, Guilin Qi, Jiaoyan Chen, Jeff Z. Pan

机构 * Southeast University(东南大学) Key Laboratory of New Generation Artificial Intelligence Technology and Its Interdisciplinary Applications (Southeast University) Ministry of Education(新一代人工智能技术及其交叉应用国家重点实验室) China Mobile Research Institute(中国移动研究院) Monash University(墨尔本大学) University of Manchester(曼彻斯特大学) University of Edinburgh(爱丁堡大学)

专题命中 偏好对齐 :alignment(abstract);分类 cs.CL

AI总结 CoTKR通过链式推理增强知识重写方法,提升复杂知识图谱问答性能。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 安全训练 2 篇

2511.16297 2025-11-21 cs.LG cs.SY eess.SY 57%

Optimizing Operation Recipes with Reinforcement Learning for Safe and Interpretable Control of Chemical Processes

利用强化学习优化操作配方以实现化学过程的安全可控

Dean Brandner, Sergio Lucia

机构 * TU Dortmund University(图卢兹大学)

专题命中 安全训练 :safety(abstract);分类 cs.LG

AI总结 本文提出利用强化学习优化操作配方,结合专家知识提升化学过程控制的安全性和可解释性,通过仿真验证其性能优势。

Comments 16 pages, 3 figures, Part of the workshop 'Machine Learning for Chemistry and Chemical Engineering (ML4CCE)' at the ECML24 conference: Link: https://ml4cce-ecml.com/

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15992 2025-11-21 cs.AI 57%

Detecting Sleeper Agents in Large Language Models via Semantic Drift Analysis

通过语义漂移分析检测大语言模型中的休眠代理

Shahin Zanbaghi, Ryan Rostampour, Farhan Abid, Salim Al Jarmakani

机构 * School of Computer Science, University of Windsor(计算机科学学院,温莎大学)

专题命中 安全训练 :safety(abstract);分类 cs.AI

AI总结 通过语义漂移分析与canary基线比较,实现大语言模型中休眠代理的实时检测,准确率达92.5%。

Comments 7 pages, 3 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 越狱攻击 4 篇

2511.16229 2025-11-21 cs.CR cs.AI 77%

Q-MLLM: Vector Quantization for Robust Multimodal Large Language Model Security

Q-MLLM:向量量化用于鲁棒多模态大语言模型安全

Wei Zhao, Zhe Li, Yige Li, Jun Sun

机构 * Singapore Management University(新加坡管理大学)

专题命中 越狱攻击 :alignment(abstract);safety(abstract);jailbreak(abstract);分类 cs.AI

AI总结 Q-MLLM通过两级向量量化提升多模态大语言模型的安全性,有效防御对抗性攻击并保持模型实用性。

Comments Accepted by NDSS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16347 2025-11-21 cs.CR cs.CY cs.RO 70%

The Shawshank Redemption of Embodied AI: Understanding and Benchmarking Indirect Environmental Jailbreaks

具身AI的肖申克救赎:理解与评估间接环境劫持

Chunyang Li, Zifeng Kang, Junwei Zhang, Zhuo Ma, Anda Cheng, Xinghua Li, Jianfeng Ma

机构 * Xidian University(西安电子科技大学) Beijing University of Posts and Telecommunications(北京邮电大学) Ant Group(蚂蚁集团)

专题命中 越狱攻击 :safety(abstract);jailbreak(abstract);分类 cs.CY

AI总结 本文提出了一种新型的间接环境劫持攻击,通过环境注入的恶意提示劫持具身AI,并设计了自动攻击生成和基准评估框架,评估结果显示其在多个任务场景中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16278 2025-11-21 cs.CR cs.AI 70%

"To Survive, I Must Defect": Jailbreaking LLMs via the Game-Theory Scenarios

为生存,我必须背叛:通过博弈论场景进行大语言模型的劫持攻击

Zhen Sun, Zongmin Zhang, Deqi Liang, Han Sun, Yule Liu, Yun Shen, Xiangshan Gao, Yilong Yang, Shuai Liu, Yutao Yue, Xinlei He

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) East China Normal University(华东师范大学) Flexera(Flexera公司) Zhejiang University(浙江大学) Xidian University(西安电子科技大学) Xi’an Jiaotong University(西安交通大学) Institute of Deep Perception Technology, JITRI(JITRI深度感知技术研究所)

专题命中 越狱攻击 :safety(abstract);jailbreak(abstract);分类 cs.AI

AI总结 本文提出一种基于博弈论的可扩展黑盒劫持框架GTA,通过重塑LLM目标以提高攻击成功率,实现在多种场景下的高ASR表现。

Comments 20 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16110 2025-11-21 cs.CR 67%

Multi-Faceted Attack: Exposing Cross-Model Vulnerabilities in Defense-Equipped Vision-Language Models

多面攻击:揭示配备防御机制的视觉语言模型中的跨模型漏洞

Yijun Yang, Lichao Wang, Jianping Zhang, Chi Harold Liu, Lanqing Hong, Qiang Xu

专题命中 越狱攻击 :alignment(abstract);safety(abstract)

AI总结 多面攻击揭示了配备防御机制的视觉语言模型中的跨模型安全漏洞,通过注意力转移攻击和轻量级转移增强算法,实现了58.5%的成功率。

Comments AAAI 2026 Oral

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 提示注入 1 篇

2511.15759 2025-11-21 cs.CR cs.AI 79%

Securing AI Agents Against Prompt Injection Attacks

保护AI代理免受提示注入攻击

Badrinath Ramakrishnan, Akshaya Balaji

专题命中 提示注入 :prompt injection(title,abstract);分类 cs.AI

AI总结 本文提出了一种多层防御框架,通过评估RAG系统中的提示注入风险,将攻击成功率降低至8.7%,同时保持高任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 幻觉与事实性 5 篇

2511.00588 2025-11-21 cs.LG cs.AI cs.CY 75%

Diagnosing Hallucination Risk in AI Surgical Decision-Support: A Sequential Framework for Sequential Validation

诊断人工智能手术决策支持中的幻觉风险:一种用于序列验证的连续框架

Dong Chen, Yanzhe Wei, Zonglin He, Guan-Ming Kuang, Canhua Ye, Meiru An, Huili Peng, Yong Hu, Huiren Tao, Kenneth MC Cheung

机构 * Orthopaedic Centre, The University of Hong Kong - Shenzhen Hospital(香港大学深圳医院骨科中心) Translational Medicine Centre, The University of Hong Kong - Shenzhen Hospital(香港大学深圳医院转化医学中心) Department of Orthopaedics & Traumatology, Li Ka Shing Faculty of Medicine, The University of Hong Kong(香港大学李嘉诚医学院骨科与创伤外科部)

专题命中 幻觉与事实性 :alignment(abstract);safety(abstract);分类 cs.AI、cs.CY、cs.LG

AI总结 本文提出了一种用于评估人工智能手术决策支持系统幻觉风险的连续框架,通过多维度测试揭示模型在复杂性下的脆弱性,并强调了增强推理能力的必要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.01533 2025-11-21 cs.CR cs.CY 70%

LightDefense: A Lightweight Uncertainty-Driven Defense against Jailbreaks via Shifted Token Distribution

LightDefense: 一种基于不确定性驱动的轻量级对抗劫持防御方法通过移位词分布

Zhuoran Yang, Yanyong Zhang

专题命中 幻觉与事实性 :safety(abstract);jailbreak(abstract);分类 cs.CY

AI总结 LightDefense通过调整词元分布和利用模型不确定性,提供了一种轻量级的对抗劫持防御方法,有效提升LLM的安全性同时保持对正常查询的有用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.13246 2025-11-21 cs.CL cs.AI 62%

Atomic Calibration of LLMs in Long-Form Generations

大语言模型在长文本生成中的原子校准

Caiqi Zhang, Ruihan Yang, Zhisong Zhang, Xinting Huang, Sen Yang, Dong Yu, Nigel Collier

机构 * University of Cambridge(剑桥大学) Fudan University(复旦大学) Tencent AI Lab(腾讯AI实验室) The Chinese University of Hong Kong(香港中文大学)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 本研究提出原子校准方法,用于改进大语言模型在长文本生成中的校准能力,揭示置信度方法与生成过程中置信度变化的关联。

Comments ACL 2025 KnowFM Oral / AACL-IJCNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16333 2025-11-21 cs.LG 57%

Beyond Generative AI: World Models for Clinical Prediction, Counterfactuals, and Planning

超越生成式AI:用于临床预测、反事实和规划的世界模型

Mohammad Areeb Qazi, Maryam Nadeem, Mohammad Yaqub

机构 * Mohamed bin Zayed University of Artificial Intelligence (MBZUAI)(莫莫德·本·扎伊德人工智能大学)

专题命中 幻觉与事实性 :safety(abstract);分类 cs.LG

AI总结 本文探讨了世界模型在医疗领域中的应用,旨在通过预测动态、反事实评估和规划提升临床决策的可靠性。

Comments 2 Figures, 1 Table

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15921 2025-11-21 cs.AI 57%

Thinking, Faithful and Stable: Mitigating Hallucinations in LLMs

思考、忠实与稳定:减轻大语言模型幻觉的方法

Chelsea Zou, Yiheng Yao, Basant Khalil

机构 * Stanford University(斯坦福大学)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.AI

AI总结 本研究提出一种通过强化学习策略减少大语言模型幻觉的方法,通过置信度对齐和熵激增信号提升推理的连贯性和准确性。

Comments Originally released June 5, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 隐私与版权 1 篇

2506.10825 2025-11-21 eess.IV cs.AI cs.CV 57%

Generalist Models in Medical Image Segmentation: A Survey and Performance Comparison with Task-Specific Approaches

通用模型在医学图像分割中的应用:一项调查与与任务特定方法的性能比较

Andrea Moglia, Matteo Leccardi, Matteo Cavicchioli, Alice Maccarini, Marco Marcon, Luca Mainardi, Pietro Cerveri

专题命中 隐私与版权 :trustworthy(abstract);分类 cs.AI

AI总结 本文调查了通用模型在医学图像分割中的应用,对比了通用模型与任务特定方法的性能,探讨了其在监管、隐私、预算及临床转化等方面面临的挑战。

Comments 132 pages, 26 figures, 23 tables. Andrea Moglia and Matteo Leccardi are equally contributing authors

Journal ref Moglia A, et al.Generalist models in medical image segmentation: A survey and performance comparison with task-specific approaches. Inf Fus 2026 https://www.sciencedirect.com/science/article/pii/S156625352500781X

详情

展开后加载摘要…

URL PDF HTML 收藏

7. 安全评测 16 篇

2511.16402 2025-11-21 cs.AI cs.DB 80%

Trustworthy AI in the Agentic Lakehouse: from Concurrency to Governance

可信AI在代理湖仓中的实现:从并发到治理

Jacopo Tagliabue, Federico Bianchi, Ciro Greco

专题命中 安全评测 :trustworthy(title,abstract);分类 cs.AI

AI总结 本文提出Bauplan设计,通过事务机制实现湖仓中的数据和计算隔离,解决代理工作流的可信性问题,并提供自修复管道的实现。

Comments AAAI26, pre-print of paper accepted at the Trustworthy Agentic AI Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.24143 2025-11-21 cs.DC 78%

Enhancing Traffic Safety with AI and 6G: Latency Requirements and Real-Time Threat Detection

用AI和6G提升交通安全性:延迟需求与实时威胁检测

Kurt Horvath, Dragi Kimovski, Stojan Kitanov, Radu Prodan

专题命中 安全评测 :safety(title,abstract)

AI总结 本文提出基于6G和AI的交通安全框架,通过实时威胁检测和低延迟通信提升交通安全性。

Comments Sumbitted/Accepted ICINT 2025 (PrePrint)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15716 2025-11-21 cs.AI 70%

MACIE: Multi-Agent Causal Intelligence Explainer for Collective Behavior Understanding

MACIE:多智能体因果智能解释器用于集体行为理解

Abraham Itzhak Weinberg

机构 * AI-WEINBERG, AI Experts, Tel Aviv, Israel(AI-WEINBERG,AI专家,特拉维夫,以色列)

专题命中 安全评测 :safety(abstract);trustworthy(abstract);分类 cs.AI

AI总结 MACIE通过结合因果模型和反事实分析,为多智能体强化学习提供全面的因果解释,解决集体行为归因、涌现智能量化和可操作解释问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16410 2025-11-21 cs.SE 67%

Data Annotation Quality Problems in AI-Enabled Perception System Development

人工智能感知系统开发中的数据标注质量问题

Hina Saeeda, Tommy Johansson, Mazen Mohamad, Eric Knauss

专题命中 安全评测 :safety(abstract);trustworthy(abstract)

AI总结 本研究通过多组织案例研究,提出了一种涵盖完整性、准确性和一致性的18种标注错误类型分类法,为人工智能感知系统开发中的数据标注质量提供了共享词汇、诊断工具和可操作指导。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16482 2025-11-21 cs.LG cs.AI stat.ML 62%

Correlation-Aware Feature Attribution Based Explainable AI

基于相关性的特征归因可解释人工智能

Poushali Sengupta, Yan Zhang, Frank Eliassen, Sabita Maharjan

机构 * Department of Informatics, University of Oslo, Norway(奥斯陆大学信息学院)

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI、cs.LG

AI总结 ExCIR通过相关性感知的归因方法,提供高效、一致且可扩展的可解释人工智能解决方案。

Comments Accepted, 2026 International Conference on Advances in Artificial Intelligence and Machine Learning (AAIML 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.00091 2025-11-21 cs.CY cs.AI 62%

A First-Principles Based Risk Assessment Framework and the IEEE P3396 Standard

基于第一性原理的风险评估框架及IEEE P3396标准

Richard J. Tong, Marina Cortês, Jeanine A. DeFalco, Mark Underwood, Janusz Zalewski

机构 * Chair, IEEE Artificial Intelligence Standards Committee (AISC) Institute of Astrophysics Space Sciences, University of Lisbon, Portugal Vice Chair, IEEE Artificial Intelligence Standards Committee University of New Haven Florida Gulf Coast University, United States State Academy of Applied Sciences, Ciechanow, Poland

专题命中 安全评测 :safety(abstract);分类 cs.AI、cs.CY

AI总结 本文提出基于第一性原理的生成式AI风险评估框架,通过信息分类系统识别不同风险类型并归责于相关方,旨在提升AI治理的严谨性与责任性。

Comments 8 pages with 3 tables. This manuscript is prepared for publication by the Institute of Electrical and Electronics Engineers, Standards Association (IEEE-SA), Sponsor Committee - Artificial Intelligence Standards Committee (C/AISC) as a White Paper of Working Group p3396 at https://standards.ieee.org/ieee/3396/11379/

Journal ref 2025 IEEE Conference on Artificial Intelligence (CAI), pp. 1588-1595, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16438 2025-11-21 cs.CL cs.IR 57%

ESGBench: A Benchmark for Explainable ESG Question Answering in Corporate Sustainability Reports

ESGBench:用于企业可持续发展报告中可解释ESG问答的基准

Sherine George, Nithish Saji

机构 * BNY FedEx

专题命中 安全评测 :alignment(abstract);分类 cs.CL

AI总结 ESGBench是一个用于评估企业可持续发展报告中可解释ESG问答系统性能的基准,通过领域相关问题和人工整理答案来评估模型推理能力,揭示了事实一致性、可追溯性和领域对齐等关键挑战。

Comments Workshop paper accepted at AI4DF 2025 (part of ACM ICAIF 2025). 3 pages including tables and figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.17936 2025-11-21 cs.HC cs.AI 57%

When concept-based XAI is imprecise: Do people distinguish between generalisations and misrepresentations?

基于概念的XAI有时不够精确:人们能否区分泛化与误表?

Romy Müller

专题命中 安全评测 :safety(abstract);分类 cs.AI

AI总结 研究探讨了人们在基于概念的XAI中区分泛化与误表的能力,发现人们更敏感于相关特征的不精确性,而非泛化不相关特征的不精确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16221 2025-11-21 cs.CV cs.CL 57%

Can MLLMs Read the Room? A Multimodal Benchmark for Assessing Deception in Multi-Party Social Interactions

大语言模型能读取环境吗?一个多模态基准用于评估多当事人社交互动中的欺骗

Caixin Kang, Yifei Huang, Liangyang Ouyang, Mingfang Zhang, Ruicong Liu, Yoichi Sato

机构 * The University of Tokyo(东京大学)

专题命中 安全评测 :trustworthy(abstract);分类 cs.CL

AI总结 本文提出多模态互动欺骗评估任务,通过新颖数据集评估多种MLLMs的欺骗检测能力,揭示其在多模态社交线索处理上的不足,并提出SoCoT和DSEM模块提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16132 2025-11-21 cs.LG 57%

An Interpretability-Guided Framework for Responsible Synthetic Data Generation in Emotional Text

可解释性引导的负责任情感文本合成数据生成框架

Paula Joy B. Martinez, Jose Marie Antonio Miñoza, Sebastian C. Ibañez

专题命中 安全评测 :trustworthy(abstract);分类 cs.LG

AI总结 本文提出一种基于SHAP的可解释性引导框架,用于生成情感文本的合成数据,提升少数情绪类别的分类性能,同时揭示合成文本在词汇丰富性和表达复杂性上的局限性。

Journal ref Association for the Advancement of Artificial Intelligence (2026). Shaping Responsible Synthetic Data in the Era of Foundation Models

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15870 2025-11-21 cs.CE cs.AI 57%

AquaSentinel: Next-Generation AI System Integrating Sensor Networks for Urban Underground Water Pipeline Anomaly Detection via Collaborative MoE-LLM Agent Architecture

AquaSentinel:下一代集成传感器网络的AI系统,通过协作MoE-LLM代理架构实现城市地下供水管道异常检测

Qiming Guo, Bishal Khatri, Wenbo Sun, Jinwen Tang, Hua Zhang, Wenlu Wang

专题命中 安全评测 :safety(abstract);分类 cs.AI

AI总结 AquaSentinel通过协作MoE-LLM代理架构实现城市地下供水管道异常检测,结合物理信息和稀疏传感技术,以低成本实现高精度的实时监测。

Comments 7 pages, 1 figure, 2 tables, Accepted to the 40th AAAI Conference on Artificial Intelligence (AAAI 2026), IAAI Deployed Applications Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15720 2025-11-21 cs.AI 57%

Automated Hazard Detection in Construction Sites Using Large Language and Vision-Language Models

利用大语言和视觉-语言模型进行施工工地自动危险检测

Islem Sahraoui

机构 * University of Houston Cullen College of Engineering Department of Civil and Environmental Engineering(德克萨斯大学休斯顿分校库伦工程学院土木与环境工程系)

专题命中 安全评测 :safety(abstract);分类 cs.AI

AI总结 本研究利用大语言和视觉-语言模型,通过分析文本和图像数据,提高施工工地的安全隐患检测效率。

Comments Master thesis, University of Houton

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.09109 2025-11-21 cs.CV cs.CL 57%

CAIRe: Cultural Attribution of Images by Retrieval-Augmented Evaluation

CAIRe:通过检索增强评估进行图像文化归因

Arnav Yayavaram, Siddharth Yayavaram, Simran Khanuja, Michael Saxon, Graham Neubig

机构 * BITS Pilani(比斯·皮兰大学) Carnegie Mellon University(卡内基梅隆大学) University of California, Santa Barbara(加州大学圣巴巴拉分校)

专题命中 安全评测 :alignment(abstract);分类 cs.CL

AI总结 CAIRe通过检索增强评估方法,评估图像在不同文化标签下的相关性,有效衡量文化偏见,提升跨文化公平性。

Comments Preprint, under review

详情

展开后加载摘要…

URL PDF HTML 收藏