arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2025-12-19 至 2025-12-19 共收录 58 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全评测 16 篇

2509.05368 2025-12-19 cs.RO cs.AI cs.LG 62%

Long-Horizon Visual Imitation Learning via Plan and Code Reflection

通过计划与代码反思实现长 horizon 视觉模仿学习

Quan Chen, Chenrui Shi, Qi Chen, Yuwei Wu, Zhi Gao, Xintong Zhang, Rui Gao, Kun Wu, Yunde Jia

机构 * Beijing Key Laboratory of Intelligent Information Technology, School of Computer Science and Technology, Beijing Institute of Technology, China(北京智能信息科技重点实验室,计算机科学与技术学院,北京理工大学,中国) Guangdong Laboratory of Machine Perception and Intelligent Computing, Shenzhen MSU-BIT University, China(广东机器感知与智能计算实验室,深圳MSU-BIT大学,中国) Beijing Innovation Center of Humanoid Robotics, China(北京人形机器人创新中心,中国)

专题命中 安全评测 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 本文提出通过计划与代码反思模块提升长 horizon 视觉模仿学习性能,引入 LongVILBench 基准验证方法有效性。

Comments 9 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16750 2025-12-19 cs.HC cs.AI 57%

Plausibility as Failure: How LLMs and Humans Co-Construct Epistemic Error

可能性作为失败:大语言模型与人类如何共同构建知识错误

Claudia Vale Oliveira, Nelson Zagalo, Filipe Silva, Anabela Brandao, Syeda Faryal Hussain Khurrum, Joaquim Santos

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI

AI总结 本研究探讨了大语言模型与人类在知识错误中的共同构建过程,发现人类判断受模型生成可能性和解释快捷方式影响,导致错误被误判为可信。

Comments 19 pages, 2 tables, 77 references, 6 appendices

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.04133 2025-12-19 cs.AI 57%

TRiSM for Agentic AI: A Review of Trust, Risk, and Security Management in LLM-based Agentic Multi-Agent Systems

TRiSM 用于代理 AI:对基于 LLM 的代理多代理系统中信任、风险和安全管理的综述

Shaina Raza, Ranjan Sapkota, Manoj Karkee, Christos Emmanouilidis

机构 * Vector Institute, Toronto, Canada(向量研究所) Cornell University, USA(康奈尔大学) University of Groningen, Netherlands(格罗宁根大学)

专题命中 安全评测 :safety(abstract);分类 cs.AI

AI总结 本文综述了基于 LLM 的代理多代理系统中信任、风险和安全管理的框架与方法,提出新的评估指标并探讨了安全与隐私增强策略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14902 2025-12-19 cs.CY cs.SE 57%

How frontier AI companies could implement an internal audit function

前沿AI公司如何实施内部审计功能

Francesca Gomez, Adam Buick, Leah Ferentinos, Haelee Kim, Elley Lee

专题命中 安全评测 :safety(abstract);分类 cs.CY

AI总结 本文探讨了前沿AI公司如何通过专门设计的内部审计功能来加强安全治理,补充外部评估并提供更高信心的风险控制保证。

Comments Colors updated on table 2 for clarity

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21557 2025-12-19 cs.CL 57%

Generation-Time vs. Post-hoc Citation: A Holistic Evaluation of LLM Attribution

生成时间与事后引用:对大语言模型归属的全面评估

Yash Saxena, Raviteja Bommireddy, Ankur Padia, Manas Gaur

机构 * UMBC(美国马里兰大学伯克利分校) IIITDM(印度印度理工学院迪瓦德分校)

专题命中 安全评测 :trustworthy(abstract);分类 cs.CL

AI总结 本文评估了生成时间引用与事后引用在大语言模型归属中的性能差异,发现P-Cite在覆盖和正确性上表现更优,而G-Cite更适用于精度要求高的场景。

Comments NeurIPS 2025 LLM Evaluation Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01185 2025-12-19 cs.CR 50%

DefenSee: Dissecting Threat from Sight and Text -- A Multi-View Defensive Pipeline for Multi-modal Jailbreaks

DefenSee:从视觉和文本中解构威胁——一种多视图防御管道用于多模态对抗突破

Zihao Wang, Kar Wai Fok, Vrizlynn L. L. Thing

专题命中 安全评测 :jailbreak(abstract)

AI总结 DefenSee通过图像变体转录和跨模态一致性检查,提供一种多模态防御方法,有效降低多模态对抗攻击的成功率,提升模型鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15818 2025-12-19 cs.CR 50%

Unveiling the Attribute Misbinding Threat in Identity-Preserving Models

揭示身份保持模型中的属性绑定威胁

Junming Fu, Jishen Zeng, Yi Jiang, Peiyu Zhuang, Baoying Chen, Siyu Lu, Jianquan Yang

专题命中 安全评测 :safety(abstract)

AI总结 本文提出属性绑定攻击,揭示身份保持模型生成不安全内容的风险,并通过Misbinding Prompt评估集和ABSS指标评估模型的安全性与真实性。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. AI治理与伦理 5 篇

2512.00931 2025-12-19 cs.CL cs.AI 62%

Mitigating Hallucinations in Zero-Shot Scientific Summarisation: A Pilot Study

缓解零样本科学摘要中的幻觉:一项初步研究

Imane Jaaouine, Ross D. King

机构 * Department of Chemical Engineering and Biotechnology(化学工程与生物技术系) University of Cambridge(剑桥大学)

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 本研究探讨提示工程方法对缓解零样本科学摘要中的幻觉效果,发现上下文重复和随机添加能显著提升摘要与原文的对齐度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16873 2025-12-19 cs.AI 57%

The Social Responsibility Stack: A Control-Theoretic Architecture for Governing Socio-Technical AI

社会责任栈:一种基于控制理论的治理社会技术AI的架构

Otman A. Basir

机构 * Department of Electrical and Computer Engineering University of Waterloo(电气与计算机工程系滑铁卢大学)

专题命中 AI治理与伦理 :safety(abstract);分类 cs.AI

AI总结 本文提出社会责任栈架构,通过控制理论将社会价值观嵌入AI系统,实现责任闭环控制,提升AI系统的可问责性和可审计性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16532 2025-12-19 cs.AI cs.IR 57%

From Personalization to Prejudice: Bias and Discrimination in Memory-Enhanced AI Agents for Recruitment

从个性化到偏见:记忆增强型AI招聘代理中的偏见与歧视

Himanshu Gharat, Himanshi Agrawal, Gourab K. Patro

机构 * Phi Labs, Quantiphi Inc.(Phi实验室、Quantiphi公司)

专题命中 AI治理与伦理 :safety(abstract);分类 cs.AI

AI总结 研究揭示了记忆增强型AI招聘代理中偏见的系统性引入与强化,强调了对LLM基础AI代理的额外防护措施的必要性。

Comments In Proceedings of the Nineteenth ACM International Conference on Web Search and Data Mining (WSDM '26)

Journal ref In Proceedings of the Nineteenth ACM International Conference on Web Search and Data Mining (WSDM '26), 2026, Boise, ID, USA. ACM, New York, NY, USA

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16408 2025-12-19 cs.LG cs.MA 57%

NDRL: Cotton Irrigation and Nitrogen Application with Nested Dual-Agent Reinforcement Learning

NDRL:基于嵌套双智能体强化学习的棉花灌溉与氮肥施用

Ruifeng Xu, Liang He

机构 * School of Computer Science and Technology, Xinjiang University(新疆大学计算机科学与技术学院) Xinjiang Multimodal Information Technology Engineering Research Center(新疆多模态信息处理工程技术研究中心) Xinjiang Key Laboratory of Signal Detection and Processing(新疆信号检测与处理重点实验室) Department of Electronic Engineering, Tsinghua University(清华大学电子工程系)

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.LG

AI总结 NDRL通过嵌套双智能体强化学习优化棉花灌溉与氮肥施用,提升产量和资源利用效率。

Comments Accepted by ICONIP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.17361 2025-12-19 cs.LG cs.CR 57%

Trust Me, I Know This Function: Hijacking LLM Static Analysis using Bias

相信我,我知道这个函数:利用偏见进行LLM静态分析的劫持

Shir Bernstein, David Beste, Daniel Ayzenshteyn, Lea Schonherr, Yisroel Mirsky

专题命中 AI治理与伦理 :safety(abstract);分类 cs.LG

AI总结 本文提出利用LLM的抽象偏见进行代码分析的攻击方法,通过注入熟悉模式攻击来劫持LLM的控制流,揭示了LLM在静态分析中的安全漏洞。

Journal ref The Network and Distributed System Security Symposium (NDSS). 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 其他安全 16 篇

2512.16245 2025-12-19 cs.AI 83%

AlignMerge - Alignment-Preserving Large Language Model Merging via Fisher-Guided Geometric Constraints

AlignMerge - 通过Fisher引导的几何约束实现的保持对齐的大语言模型合并

Aniruddha Roy, Jyoti Patel, Aman Chadha, Vinija Jain, Amitava Das

机构 * AI Institute, University of South Carolina(AI研究院,南卡罗来纳大学) Indian Institute of Technology, Kharagpur(印度理工学院,Khargpur分校) Islamic University of Technology(伊斯兰科技大学) Stanford University, USA(斯坦福大学,美国) Amazon AI, USA(亚马逊AI,美国) HCL(HCL公司) Evalueserve(Evalueserve公司) Apple (USA)(苹果(美国)) Google (USA)(谷歌(美国)) Pragya Lab, BITS Pilani, Goa(Pragya实验室, BITS Pilani,Goa分校)

专题命中 其他安全 :alignment(title,abstract);safety(abstract);分类 cs.AI

AI总结 AlignMerge通过Fisher引导的几何约束实现大语言模型合并,提升对齐度量并保持性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16164 2025-12-19 cs.CV cs.AI 79%

C-DGPA: Class-Centric Dual-Alignment Generative Prompt Adaptation

面向类别的双对齐生成提示适应:C-DGPA

Chao Li, Dasha Hu, Chengyang Li, Yuming Jiang, Yuncheng Shen

专题命中 其他安全 :alignment(title,abstract);分类 cs.AI

AI总结 C-DGPA通过双分支架构协同优化边缘分布和条件分布对齐,提升无监督领域适应中提示学习的领域不变性和语义判别性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.12913 2025-12-19 cs.CL 79%

MAIN: Mutual Alignment Is Necessary for instruction tuning

MAIN:互斥对齐是指令微调的必要条件

Fanyi Yang, Jianfeng Liu, Xin Zhang, Haoyu Liu, Xixin Cao, Yuefeng Zhan, Hao Sun, Weiwei Deng, Feng Sun, Qi Zhang

机构 * Peking University(北京大学) Microsoft Corporation(微软公司)

专题命中 其他安全 :alignment(title,abstract);分类 cs.CL

AI总结 本文提出MAIN框架,通过互斥约束增强指令与响应的一致性,提升LLM在多种基准上的性能。

Comments Accepted by EMNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.12781 2025-12-19 cs.CL cs.AI 62%

A Token is Worth over 1,000 Tokens: Efficient Knowledge Distillation through Low-Rank Clone

一个标记值超过1000个标记:通过低秩克隆实现高效的知识蒸馏

Jitai Hao, Qiang Huang, Hao Liu, Xinyan Xiao, Zhaochun Ren, Jun Yu

机构 * School of Intelligence Science and Engineering, Harbin Institute of Technology, Shenzhen(哈尔滨工业大学智能科学与工程学院) Baidu Inc.(百度公司) Leiden University(莱顿大学) Pengcheng Laboratory(鹏城实验室)

专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 本文提出低秩克隆方法,通过高效预训练实现小语言模型在训练效率和性能上的突破。

Comments NeurIPS 2025 Spotlight

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15885 2025-12-19 cs.CV cs.AI cs.CL cs.MM 62%

Seeing Beyond Words: Self-Supervised Visual Learning for Multimodal Large Language Models

超越文字:面向多模态大语言模型的自监督视觉学习

Davide Caffagni, Sara Sarto, Marcella Cornia, Lorenzo Baraldi, Pier Luigi Dovesi, Shaghayegh Roohi, Mark Granroth-Wilding, Rita Cucchiara

机构 * University of Modena and Reggio Emilia(摩德纳和雷吉奥艾米利亚大学) AMD Silo AI

专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 JARVIS通过自监督视觉学习提升多模态大语言模型的视觉推理能力,无需依赖语言监督。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15736 2025-12-19 cs.AI cs.LG quant-ph 62%

Anubuddhi: A Multi-Agent AI System for Designing and Simulating Quantum Optics Experiments

Anubuddhi:一种用于设计和模拟量子光学实验的多智能体AI系统

S. K. Rithvik

机构 * Quantum Science and Technology Laboratory(量子科学与技术实验室) Physical Research Laboratory(物理研究所) Indian Institute of Technology Gandhinagar(印度理工学院冈格里分校)

专题命中 其他安全 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 Anubuddhi通过多智能体系统实现自然语言提示下的量子光学实验设计与模拟,支持灵活数学表示,提升实验设计民主化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16822 2025-12-19 cs.LG 57%

MEPIC: Memory Efficient Position Independent Caching for LLM Serving

MEPIC:内存高效的无位置依赖缓存用于大语言模型服务

Qian Wang, Zahra Yousefijamarani, Morgan Lindsay Heisler, Rongzhi Gu, Bai Xiaolong, Shan Yizhou, Wei Zhang, Wang Lan, Ying Xiong, Yong Zhang, Zhenan Fan

机构 * Huawei Technologies Canada Co., Ltd.(华为技术加拿大有限公司) Huawei Technologies Co., Ltd.(华为技术有限公司)

专题命中 其他安全 :alignment(abstract);分类 cs.LG

AI总结 MEPIC通过内存高效的无位置依赖缓存技术,实现跨请求和批次的片段KV重用,显著减少HBM使用量,提升大语言模型服务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24320 2025-12-19 cs.LG stat.ML 57%

AuON: A Linear-time Alternative to Orthogonal Momentum Updates

AuON: 一种线性时间的替代正交动量更新方法

Dipan Maity

专题命中 其他安全 :alignment(abstract);分类 cs.LG

AI总结 AuON是一种线性时间优化器,通过归一化非线性缩放实现替代单位范数动量更新,无需近似正交矩阵,有效处理爆炸性注意力logits并在语言建模任务中优于Muon

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16202 2025-12-19 cs.CV cs.AI 57%

Open Ad-hoc Categorization with Contextualized Feature Learning

开放性即需分类与上下文化特征学习

Zilin Wang, Sangwoo Mo, Stella X. Yu, Sima Behpour, Liu Ren

机构 * University of Michigan(密歇根大学) UC Berkeley(加州大学伯克利分校) Bosch Center for AI(博世人工智能中心)

专题命中 其他安全 :alignment(abstract);分类 cs.AI

AI总结 OAK通过引入上下文标记和结合CLIP与GCD目标,实现了开放性即需分类的高准确率和可解释性。

Comments 26 pages, 17 figures

Journal ref CVPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16071 2025-12-19 cs.ET cs.AI eess.SP 57%

Feasibility of Radio Frequency Based Wireless Sensing of Lead Contamination in Soil

基于无线电频率的土壤铅污染无线传感可行性研究

Yixuan Gao, Tanvir Ahmed, Mikhail Mohammed, Zhongqi Cheng, Rajalakshmi Nandakumar

机构 * Brooklyn College of the City University of New York(纽约市立大学布鲁克林学院)

专题命中 其他安全 :safety(abstract);分类 cs.AI

AI总结 本研究提出基于无线电频率的SoilScanner系统,用于检测土壤中的铅污染,通过实验验证其在不同盐类下的信号反射特性,实现72%的准确率分类。

Comments 12 pages, 12 Figures, International Conference on Embedded Wireless Systems and Networks, https://ewsn.org/file-repository/ewsn2024/ewsn24-final99.pdf, Best Paper Award of EWSN2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13089 2025-12-19 cs.CV cs.AI 57%

UniVCD: A New Method for Unsupervised Change Detection in the Open-Vocabulary Era

UniVCD:面向开放词汇时代的无监督变化检测新方法

Ziqiang Zhu, Bowei Yang

机构 * School of Aeronautics and Astronautics, Zhejiang University(航空宇航学院,浙江大学)

专题命中 其他安全 :alignment(abstract);分类 cs.AI

AI总结 UniVCD是一种基于冻结视觉基础模型的无监督开放词汇变化检测方法,通过轻量级多模态对齐实现高分辨率语义感知变化检测。

Comments 10 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16784 2025-12-19 cs.CV 50%

R3ST: A Synthetic 3D Dataset With Realistic Trajectories

R3ST:一个具有真实轨迹的合成3D数据集

Simone Teglia, Claudia Melis Tonti, Francesco Pro, Leonardo Russo, Andrea Alfarano, Leonardo Pentassuglia, Irene Amerini

机构 * Sapienza University of Rome(萨皮恩扎罗马大学) INSAIT EURECOM

专题命中 其他安全 :safety(abstract)

AI总结 R3ST数据集通过生成真实轨迹和3D环境,提供准确的多模态标注,提升道路车辆轨迹预测研究

Journal ref Computer Analysis of Images and Patterns. CAIP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15971 2025-12-19 cs.CV 50%

From Words to Wavelengths: VLMs for Few-Shot Multispectral Object Detection

从词语到波长:用于少样本多光谱目标检测的视觉语言模型

Manuel Nkegoum, Minh-Tan Pham, Élisa Fromont, Bruno Avignon, Sébastien Lefèvre

机构 * Univ Bretagne Sud, IRISA, UMR 6074(布列塔尼大学,IRISA,UMR 6074) Univ Rennes, IRISA, UMR 6074(里尔大学,IRISA,UMR 6074) ATERMES UiT The Arctic University of Norway(北欧大学)

专题命中 其他安全 :safety(abstract)

AI总结 本文提出利用视觉语言模型进行少样本多光谱目标检测,通过整合文本、视觉和热模态,在数据稀缺情况下实现高效检测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03508 2025-12-19 cs.CV 50%

Exploiting Domain Properties in Language-Driven Domain Generalization for Semantic Segmentation

利用领域特性进行语言驱动的领域泛化以实现语义分割

Seogkyu Jeon, Kibeom Hong, Hyeran Byun

机构 * Yonsei University(延世大学) Sookmyung Women’s University(淑明女子大学)

专题命中 其他安全 :alignment(abstract)

AI总结 本文提出DPMFormer框架,通过领域感知提示学习和对比学习提升语义分割的领域泛化能力。

Comments ICCV 2025 (poster)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.20322 2025-12-19 cs.CV 50%

HyperET: Efficient Training in Hyperbolic Space for Multi-modal Large Language Models

HyperET: 在超几何空间中为多模态大语言模型实现高效训练

Zelin Peng, Zhengqin Xu, Qingyang Liu, Xiaokang Yang, Wei Shen

机构 * MoE Key Lab of Artificial Intelligence, AI Institute, School of Computer Science, SJTU(摩埃人工智能重点实验室、人工智能学院、计算机科学学院、上海交通大学)

专题命中 其他安全 :alignment(abstract)

AI总结 HyperET通过在双曲空间中动态调整半径,实现多模态大语言模型的高效训练,提升跨模态对齐性能。

Comments Accepted by NeurIPS2025 (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.06189 2025-12-19 cs.RO cs.HC 50%

Accessible and Pedagogically-Grounded Explainability for Human-Robot Interaction: A Framework Based on UDL and Symbolic Interfaces

可及且以教学为导向的机器人可解释性:基于UDL和符号接口的框架

Francisco J. Rodríguez Lera, Raquel Fernández Hernández, Sonia Lopez González, Miguel Angel González-Santamarta, Francisco Jesús Rodríguez Sedano, Camino Fernandez Llamas

机构 * Grupo de Robótica , EIIIA Campus de Vegazana, Universidad de León(机器人组,EIIIA校区,莱昂大学) C.E.E. Ntra. Sra. Del Sagrado Corazón(圣心宗女会)

专题命中 其他安全 :alignment(abstract)

AI总结 本文提出基于UDL和符号接口的框架,旨在通过多模态解释板提升人机交互中不同需求用户的可解释性与教学导向性。

Comments 6 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏