arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2025-12-03 至 2025-12-03 共收录 42 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 偏好对齐 6 篇

2512.02807 2025-12-03 cs.CL 79%

SR-GRPO: Stable Rank as an Intrinsic Geometric Reward for Large Language Model Alignment

SR-GRPO:稳定秩作为大语言模型对齐的内在几何奖励

Yixuan Tang, Yi Yang

机构 * The Hong Kong University of Science and Technology(香港理工大学)

专题命中 偏好对齐 :alignment(title,abstract);分类 cs.CL

AI总结 SR-GRPO通过稳定秩作为内在几何奖励信号,无需外部监督提升大语言模型对齐性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02665 2025-12-03 cs.CL 74%

Input Order Shapes LLM Semantic Alignment in Multi-Document Summarization

输入顺序影响多文档摘要中LLM语义对齐

Jing Ma

机构 * University of Zurich(苏黎世大学)

专题命中 偏好对齐 :alignment(title);分类 cs.CL

AI总结 研究发现输入顺序显著影响LLM在多文档摘要中的语义对齐,优先位置的文章对摘要的语义相似性有显著影响。

Comments 9 pages, 3 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.06942 2025-12-03 cs.CL cs.CR 70%

HLPD: Aligning LLMs to Human Language Preference for Machine-Revised Text Detection

HLPD: 通过人类语言偏好对齐大语言模型以检测机器修订文本

Fangqi Dai, Xingjian Jiang, Zizhuang Deng

专题命中 偏好对齐 :alignment(abstract);trustworthy(abstract);分类 cs.CL

AI总结 HLPD通过人类语言偏好优化提升机器修订文本检测性能,实现对GPT系列模型和先进大语言模型生成文本的高效识别。

Comments 20 pages, 10 figures, accepted by AAAI'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.17636 2025-12-03 cs.CV cs.AI 70%

Aligning Diffusion Models with Noise-Conditioned Perception

对扩散模型进行噪声条件感知对齐

Alexander Gambashidze, Anton Kulikov, Yuriy Sosnin, Ilya Makarov

机构 * Artificial Intelligence Research Institute (AIRI)(人工智能研究 institute(AIRI)) Skolkovo Institute of Science and Technology(斯克尔科沃科学与技术研究所) HSE University(俄罗斯高等经济学院) Research Center for Trusted Artificial Intelligence, ISP RAS(可信人工智能研究中心,信息与通信技术研究院) ISP RAS(信息与通信技术研究院)

专题命中 偏好对齐 :alignment(abstract);DPO(abstract);分类 cs.AI

AI总结 本研究提出在扩散模型的U-Net嵌入空间中使用感知目标,以提升人类偏好对齐的效率和质量,并减少计算成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.03317 2025-12-03 cs.CV 67%

Diffusion-SDPO: Safeguarded Direct Preference Optimization for Diffusion Models

Diffusion-SDPO:用于扩散模型的受保护直接偏好优化

Minghao Fu, Guo-Hua Wang, Tianyu Cui, Qing-Guo Chen, Zhao Xu, Weihua Luo, Kaifu Zhang

机构 * School of Artificial Intelligence, Nanjing University(人工智能学院,南京大学) National Key Laboratory for Novel Software Technology, Nanjing University(新型软件技术国家实验室,南京大学) Alibaba International Digital Commerce Group(阿里巴巴国际数字商业集团)

专题命中 偏好对齐 :alignment(abstract);DPO(abstract)

AI总结 Diffusion-SDPO通过保护性更新规则提升扩散模型对人类偏好的对齐效果。

Comments The code is publicly available at https://github.com/AIDC-AI/Diffusion-SDPO

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03001 2025-12-03 cs.AI 57%

Invasive Context Engineering to Control Large Language Models

侵入式上下文工程以控制大语言模型

Thomas Rivasseau

机构 * McGill University(麦吉尔大学)

专题命中 偏好对齐 :jailbreak(abstract);分类 cs.AI

AI总结 本文提出侵入式上下文工程方法,通过在LLM上下文中插入控制句子以提升其安全性,避免长上下文场景下的数据短缺问题。

Comments 4 pages

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 安全训练 3 篇

2512.02445 2025-12-03 cs.LG cs.AI cs.CL 82%

When Refusals Fail: Unstable Safety Mechanisms in Long-Context LLM Agents

当拒绝失效时:长上下文LLM代理中的不稳定安全机制

Tsimur Hadeliya, Mohammad Ali Jauhar, Nidhi Sakpal, Diogo Cruz

专题命中 安全训练 :safety(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究发现长上下文LLM代理在性能和拒绝率上存在不稳定安全问题,揭示了评估长多步骤任务代理安全性的挑战。

Comments 12 pages, 11 figures. Accepted at AAAI 2026 TrustAgent Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02682 2025-12-03 cs.MA cs.AI 79%

Beyond Single-Agent Safety: A Taxonomy of Risks in LLM-to-LLM Interactions

超越单体安全:LLM到LLM交互中的风险分类

Piercosma Bisconti, Marcello Galisai, Federico Pierucci, Marcantonio Bracale, Matteo Prandi

机构 * icaro-lab(ICARO实验室)

专题命中 安全训练 :safety(title,abstract);分类 cs.AI

AI总结 本文提出从模型级安全向系统级安全的转变,引入ESRH框架,阐述LLM交互中的集体风险并提出InstitutionalAI架构。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02306 2025-12-03 cs.AI cs.CL cs.CR cs.CV cs.LG 67%

OmniGuard: Unified Omni-Modal Guardrails with Deliberate Reasoning

OmniGuard:统一的多模态防护机制与刻意推理

Boyu Zhu, Xiaofei Wen, Wenjie Jacky Mo, Tinghui Zhu, Yanan Xie, Peng Qi, Muhao Chen

机构 * Fudan University(复旦大学) University of California, Davis(加州大学戴维斯分校)

专题命中 安全训练 :safety(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 OmniGuard通过统一的多模态防护机制与刻意推理能力,有效提升多模态安全防护的鲁棒性和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 越狱攻击 1 篇

2512.02973 2025-12-03 cs.CV cs.CL cs.CR 83%

Contextual Image Attack: How Visual Context Exposes Multimodal Safety Vulnerabilities

基于上下文的图像攻击:如何通过视觉上下文暴露多模态安全漏洞

Yuan Xiong, Ziqi Miao, Lijun Li, Chen Qian, Jie Li, Jing Shao

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Xi’an Jiaotong University(西安交通大学) Renmin University of China(中国人民大学)

专题命中 越狱攻击 :safety(title,abstract);jailbreak(abstract);分类 cs.CL

AI总结 本文提出上下文图像攻击方法,通过多智能体系统和四种可视化策略,有效利用图像的上下文信息对多模态大语言模型进行劫持攻击,实验结果显示攻击效果优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 红队测试 1 篇

2512.02157 2025-12-03 cs.CR cs.CL 57%

Factor(T,U): Factored Cognition Strengthens Monitoring of Untrusted AI

因子(T,U):因子认知强化对不可信AI的监控

Aaron Sandoval, Cody Rushing

机构 * Independent(独立研究者)

专题命中 红队测试 :safety(abstract);分类 cs.CL

AI总结 本文提出基于因子认知的AI控制协议,通过分解任务和独立解决子任务来提高安全性,实验显示其在提升监控性能和降低后门风险方面具有显著效果。

Comments 7 pages body; 19 pages total; 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 幻觉与事实性 3 篇

2512.02217 2025-12-03 cs.LG physics.app-ph 70%

Uncertainty Reasoning with Photonic Bayesian Machines

基于光子贝叶斯机器的不确定性推理

F. Brückerhoff-Plückelmann, H. Borras, S. U. Hulyal, L. Meyer, X. Ji, J. Hu, J. Sun, B. Klein, F. Ebert, J. Dijkstra, L. McRae, P. Schmidt, T. J. Kippenberg, H. Fröning, W. Pernice

专题命中 幻觉与事实性 :safety(abstract);trustworthy(abstract);分类 cs.LG

AI总结 本研究提出一种基于光子技术的贝叶斯机器,利用混沌光源实现高速不确定性推理,应用于血细胞图像分类与域外检测,提升可信AI系统的效率与可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01568 2025-12-03 cs.LG cs.AI cs.CL cs.CY 70%

Do Large Language Models Walk Their Talk? Measuring the Gap Between Implicit Associations, Self-Report, and Behavioral Altruism

大型语言模型是否言出必行?隐含关联、自我报告与行为利他主义之间的差距测量

Sandro Andric

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CL、cs.AI、cs.CY

AI总结 研究发现大型语言模型在隐含利他主义偏见和自我报告与实际行为之间存在显著差距,建议将校准差距作为衡量标准。

Comments 14 pages, 7 figures, 7 tables. Code and data available at https://github.com/sandroandric/LLMs_Altruism_Study_Code

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02340 2025-12-03 cs.AI cs.CV 57%

Reasoning Path and Latent State Analysis for Multi-view Visual Spatial Reasoning: A Cognitive Science Perspective

多视角视觉空间推理的推理路径与潜在状态分析:从认知科学视角

Qiyao Xue, Weichen Liu, Shiqi Wang, Haoming Wang, Yuyang Wu, Wei Gao

机构 * University of Pittsburgh(匹兹堡大学) Carnegie Mellon University(卡内基梅隆大学)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.AI

AI总结 ReMindView-Bench从认知科学视角评估VLMs在多视角空间推理中的表现,揭示其在跨视角对齐和视角取向方面的不足。

Comments 23 pages, 37 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 隐私与版权 3 篇

2507.06192 2025-12-03 cs.DB cs.AI cs.CL cs.LG 67%

SQLBarber: A System Leveraging Large Language Models to Generate Customized and Realistic SQL Workloads

SQLBarber: 借助大型语言模型生成定制化和真实SQL工作负载的系统

Jiale Lao, Immanuel Trummer

机构 * Cornell University(康奈尔大学)

专题命中 隐私与版权 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 SQLBarber利用大型语言模型生成定制化且真实的SQL工作负载,通过声明式接口和贝叶斯优化器高效生成符合目标成本分布的查询。

Comments Accepted by SIGMOD 2026; extended version with appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.21393 2025-12-03 cs.CR cs.AI 57%

VeriLoRA: Fine-Tuning Large Language Models with Verifiable Security via Zero-Knowledge Proofs

VeriLoRA: 通过零知识证明实现通过验证的安全大语言模型微调

Guofu Liao, Taotao Wang, Shengli Zhang, Jiqun Zhang, Shi Long, Dacheng Tao

机构 * Shenzhen University(深圳大学) Nanjing University of Science(南京理工大学) Nanyang Technological University(南洋理工大学)

专题命中 隐私与版权 :trustworthy(abstract);分类 cs.AI

AI总结 VeriLoRA通过整合零知识证明与LoRA微调,实现了大语言模型在敏感环境中的安全可信部署。

Comments This paper has been accepted for publication at the Network and Distributed System Security Symposium (NDSS) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02861 2025-12-03 cs.NI 50%

Network Self-Configuration based on Fine-Tuned Small Language Models

基于微调小语言模型的网络自配置

Oscar G. Lira, Oscar M. Caicedo, Nelson L. S. Da Fonseca

专题命中 隐私与版权 :alignment(abstract)

AI总结 本文提出SLM_netconfig,一种基于微调小语言模型的网络自配置框架,通过参数高效适应技术实现高效、准确且隐私保护的本地化配置生成。

Comments 16 pages, 11 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏

7. 安全评测 15 篇

2512.02363 2025-12-03 cs.CL cs.AI 86%

Memory-Augmented Knowledge Fusion with Safety-Aware Decoding for Domain-Adaptive Question Answering

具有安全意识解码的记忆增强知识融合用于领域自适应问答

Lei Fu, Xiang Chen, Kaige Gao Xinyue Huang, Kejian Tong

机构 * Independent Researcher(独立研究者) Boston University(波士顿大学) Binghamton University(伯克利大学)

专题命中 安全评测 :safety(title,abstract);alignment(abstract);trustworthy(abstract);分类 cs.CL、cs.AI

AI总结 KARMA通过记忆增强和安全意识解码提升领域自适应问答的准确性和安全性

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02282 2025-12-03 cs.AI cs.HC cs.MA 83%

DialogGuard: Multi-Agent Psychosocial Safety Evaluation of Sensitive LLM Responses

DialogGuard: 多智能体心理社会安全评估框架用于敏感LLM响应

Han Luo, Guy Laban

机构 * University of Leeds(利兹大学) Southwest Jiaotong University(西南交通大学) Department of Industrial Engineering and Management(工业工程与管理系) Ben-Gurion University of the Negev(贝内尔·加隆大学)

专题命中 安全评测 :safety(title,abstract);alignment(abstract);分类 cs.AI

AI总结 DialogGuard通过多智能体框架评估LLM响应的心理社会风险,提供高准确性的风险检测与可解释的评估结果,支持安全提示设计和脆弱用户应用的监督。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03026 2025-12-03 cs.CL cs.AI 73%

The Moral Consistency Pipeline: Continuous Ethical Evaluation for Large Language Models

道德一致性流水线:面向大语言模型的持续道德评估

Saeid Jamshidi, Kawser Wazed Nafi, Arghavan Moradi Dakhel, Negar Shahabi, Foutse Khomh

机构 * SWAT Laboratory, Polytechnique Montréal(蒙特利尔大学SWAT实验室) Concordia Institute for Information Systems Engineering, Concordia University(Concordia大学信息系统工程研究所)

专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.CL、cs.AI

AI总结 MoCoP通过闭环框架持续评估大语言模型的道德一致性,揭示伦理与毒性间的强负相关,推动自主AI系统中计算道德研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02057 2025-12-03 cs.LG cs.AI 73%

Opening the Black Box: An Explainable, Few-shot AI4E Framework Informed by Physics and Expert Knowledge for Materials Engineering

揭开黑箱:一个受物理和专家知识启发的可解释、少样本AI4E框架

Haoxiang Zhang, Ruihao Yuan, Lihui Zhang, Yushi Luo, Qiang Zhang, Pan Ding, Xiaodong Ren, Weijie Xing, Niu Gao, Jishan Chen, Chubo Zhang

专题命中 安全评测 :safety(abstract);trustworthy(abstract);分类 cs.AI、cs.LG

AI总结 本文提出一个受物理和专家知识启发的可解释、少样本AI4E框架,通过生成合成数据和优化策略提升工程领域模型的可解释性和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02763 2025-12-03 cs.CL cs.AI 62%

SurveyEval: Towards Comprehensive Evaluation of LLM-Generated Academic Surveys

SurveyEval: 向LLM生成学术调查的全面评估迈进

Jiahao Zhao, Shuaixing Zhang, Nan Xu, Lei Wang

机构 * Beijing Wenge Technology Co., Ltd.(北京文格科技有限公司) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 SurveyEval通过多维度评估LLM生成的学术调查,揭示了专门系统在质量上的优势,并为改进自动调查系统提供可扩展的测试平台。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01282 2025-12-03 cs.CL cs.AI 62%

Kardia-R1: Unleashing LLMs to Reason toward Understanding and Empathy for Emotional Support via Rubric-as-Judge Reinforcement Learning

Kardia-R1: 通过Rubric-as-Judge强化学习释放大语言模型以通过评分标准进行推理,以实现情感支持的理解与共情

Jiahao Yuan, Zhiqing Cui, Hanqing Wang, Yuansheng Gao, Yucheng Zhou, Usman Naseem

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI

AI总结 Kardia-R1通过Rubric-as-Judge强化学习框架,提升大语言模型在情感支持中的理解与共情能力,通过评分标准引导训练以实现更准确的情感推理和个性化响应。

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.15272 2025-12-03 cs.CV cs.AI cs.CL 62%

CT-GLIP: 3D Grounded Language-Image Pretraining with CT Scans and Radiology Reports for Full-Body Scenarios

CT-GLIP:基于CT扫描和放射报告的3D grounded语言-图像预训练,用于全身场景

Jingyang Lin, Yingda Xia, Jianpeng Zhang, Ke Yan, Kai Cao, Le Lu, Jiebo Luo, Ling Zhang

机构 * DAMO Academy, Alibaba Group(达摩院,阿里巴巴集团) University of Rochester(罗切斯特大学) Hupan Lab, \postcode 10587, \state Hangzhou, \country China(华普实验室,浙江省杭州市,中国) Department of Radiology, Shanghai Institution of Pancreatic Disease, \state Shanghai, \country China(胰腺疾病研究所放射科,上海市,中国)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 CT-GLIP通过构建细粒度CT报告对,提升3D grounded语言-图像预训练,实现更精确的跨模态对齐,从而在零样本任务中提升器官识别和肿瘤检测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02816 2025-12-03 cs.CL 57%

A benchmark dataset for evaluating Syndrome Differentiation and Treatment in large language models

用于评估大型语言模型中辨证论治的基准数据集

Kunning Li, Jianbin Guo, Zhaoyang Shang, Yiqing Liu, Hongmin Du, Lingling Liu, Yuping Zhao, Lifeng Dong

专题命中 安全评测 :safety(abstract);分类 cs.CL

AI总结 本文提出TCM-BEST4SDT基准,用于评估大型语言模型在中医辨证论治中的能力,包含四个任务并提供三种评估机制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.26012 2025-12-03 cs.AI 57%

AutoSurvey2: Empowering Researchers with Next Level Automated Literature Surveys

AutoSurvey2:赋能研究人员的下一代自动化文献综述

Siyi Wu, Chiaxin Liang, Ziqian Bi, Leyi Zhao, Tianyang Wang, Junhao Song, Yichao Zhang, Keyu Chen, Benji Peng, Xinyuan Song

机构 * University of Texas at Arlington(德克萨斯理工大学) AI Agent Lab(人工智能代理实验室) Indiana University(印第安纳大学) Ohio State University(俄亥俄州立大学) Imperial College London(伦敦帝国理工学院) Georgia Institute of Technology(佐治亚理工学院) Appcubic(Appcubic公司) Emory University(埃默里大学)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 AutoSurvey2通过多阶段流程实现自动化文献综述生成,结合检索增强合成与结构化评估,提升综述的连贯性与相关性,为学术写作提供可扩展解决方案。

Comments TKDD 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.26004 2025-12-03 cs.CV cs.AI 57%

Learning Egocentric In-Hand Object Segmentation through Weak Supervision from Human Narrations

通过人类叙述的弱监督学习进行视角注视手部物体分割

Nicola Messina, Rosario Leonardi, Luca Ciampi, Fabio Carrara, Giovanni Maria Farinella, Fabrizio Falchi, Antonino Furnari

机构 * Institute of Information Science and Technologies - National Research Council(信息科学与技术研究所-国家研究理事会) University of Catania(卡塔尼亚大学)

专题命中 安全评测 :safety(abstract);分类 cs.AI

AI总结 本文提出WISH模型,通过人类叙述的弱监督学习实现手部物体分割,无需精细像素标注即可超越基线方法。

Comments Under consideration at Pattern Recognition Letters

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.12498 2025-12-03 cs.AI 57%

Artificial Intelligence Virtual Cells: From Measurements to Decisions across Modality, Scale, Dynamics, and Evaluation

人工智能虚拟细胞:从多模态、多尺度测量到决策的跨模态、跨尺度、动态和评估

Chengpeng Hu, Calvin Yu-Chian Chen

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 本文提出了一种模型无关的细胞状态潜在视角,通过操作符语法组织学习,旨在跨模态、跨尺度、上下文和干预实现决策对齐的评估框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.17699 2025-12-03 cs.CV q-bio.QM 50%

Benchmarking Class Activation Map Methods for Explainable Brain Hemorrhage Classification on Hemorica Dataset

在Hemorica数据集上基于类激活图方法的可解释性脑出血分类基准测试

Z. Rafati, M. Hoseyni, J. Khoramdel, A. Nikoofard

机构 * Faculty of Computer Engineering, K. N. Toosi University of Technology(计算机工程学院,K.N.托菲大学) Faculty of Electrical Engineering, K. N. Toosi University of Technology(电气工程学院,K.N.托菲大学) Faculty of Mechanical Engineering, Tarbiat Modares University(机械工程学院,塔里比亚特莫达res大学)

专题命中 安全评测 :alignment(abstract)

AI总结 本研究通过在Hemorica数据集上评估九种CAM算法,发现AblationCAM在像素级Dice和IoU指标上表现最佳,为脑出血分类的可解释性提供了新的基准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02410 2025-12-03 cs.MA cs.CR 50%

Decentralized Multi-Agent System with Trust-Aware Communication

去中心化多智能体系统与信任感知通信

Yepeng Ding, Ahmed Twabi, Junwei Yu, Lingfeng Zhang, Tohru Kondo, Hiroyuki Sato

专题命中 安全评测 :trustworthy(abstract)

AI总结 本文提出了一种基于区块链的去中心化多智能体系统,通过信任感知通信协议解决传统集中式系统中的信任、可扩展性和抗审查问题。

详情

展开后加载摘要…

URL PDF HTML 收藏