arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-02-23 至 2026-02-23 共收录 31 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 偏好对齐 3 篇

2507.09650 2026-02-23 cs.LG 79%

Cultivating Pluralism In Algorithmic Monoculture: The Community Alignment Dataset

在算法单一性中培育多元主义:社区对齐数据集

Lily Hong Zhang, Smitha Milli, Karen Jusko, Jonathan Smith, Brandon Amos, Wassim Bouaziz, Manon Revel, Jack Kussman, Yasha Sheynin, Lisa Titus, Bhaktipriya Radharapu, Jane Yu, Vidya Sarma, Kris Rose, Maximilian Nickel

机构 * FAIR at Meta(Meta 的 FAIR 部门) Governance at Meta(Meta 的治理部门) AI at Meta(Meta 的人工智能部门) Social Issues Research at Meta(Meta 的社会问题研究部门) AI Policy Team at Meta(Meta 的人工智能政策团队) Center for Data Science, New York University(纽约大学数据科学中心)

专题命中 偏好对齐 :alignment(title,abstract);分类 cs.LG

AI总结 本文通过构建社区对齐数据集,探讨如何通过负相关采样提升LLM对不同偏好的适应能力,推动算法多元主义发展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17695 2026-02-23 cs.LG cs.AI cs.IR 62%

EXACT: Explicit Attribute-Guided Decoding-Time Personalization

EXACT: 显式属性引导的解码时个性化

Xin Yu, Hanwen Xing, Lingzhou Xue

机构 * Department of Statistics, the Pennsylvania State University, PA, USA(统计系,宾夕法尼亚州立大学) University of Southern California, CA, USA(南加州大学)

专题命中 偏好对齐 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 EXACT通过显式属性引导解码时个性化,利用预定义可解释属性提升生成质量,有效缓解上下文偏好变化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17814 2026-02-23 cs.CV cs.IR cs.LG 57%

VQPP: Video Query Performance Prediction Benchmark

VQPP:视频查询性能预测基准

Adrian Catalin Lutu, Eduard Poesina, Radu Tudor Ionescu

机构 * University of Bucharest / Bitdefender(布加勒斯大学/Bitdefender) University of Bucharest(布加勒斯大学)

专题命中 偏好对齐 :DPO(abstract);分类 cs.LG

AI总结 本文提出VQPP基准,用于视频查询性能预测,包含两个数据集和两个系统,探索预检索和后检索预测器,并展示其在训练大型语言模型上的应用。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 安全训练 3 篇

2510.26752 2026-02-23 cs.AI cs.LG 84%

The Oversight Game: Learning to Cooperatively Balance an AI Agent's Safety and Autonomy

视角游戏:学习协作平衡AI代理的安全性与自主性

William Overman, Mohsen Bayati

机构 * Graduate School of Business(商学院) Stanford University(斯坦福大学)

专题命中 安全训练 :safety(title,abstract);alignment(abstract);分类 cs.AI、cs.LG

AI总结 本文提出了一种视角游戏框架,通过马尔可夫游戏模型平衡AI代理的安全性与自主性,减少开放环境中的安全违规。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17676 2026-02-23 cs.AI cs.CL cs.LG 75%

Epistemic Traps: Rational Misalignment Driven by Model Misspecification

知识陷阱:由模型规格不准确驱动的理性偏差

Xingcheng Xu, Jingjing Qu, Qiaosheng Zhang, Chaochao Lu, Yanqing Yang, Na Zou, Xia Hu

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) ShanghaiTech University(上海科技大学)

专题命中 安全训练 :alignment(abstract);safety(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出主观模型工程,通过设计代理的内部信念结构来实现稳健对齐,揭示安全由认知先验决定而非奖励大小连续函数。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.10134 2026-02-23 cs.AI 57%

FRSICL: LLM-Enabled In-Context Learning Flight Resource Allocation for Fresh Data Collection in UAV-Assisted Wildfire Monitoring

FRSICL: 基于大语言模型的上下文学习飞行资源分配用于无人机辅助 wildfire 监测中的新鲜数据采集

Yousef Emami, Hao Zhou, Miguel Gutierrez Gaitan, Kai Li, Luis Almeida

机构 * Real-Time and Embedded Computing Systems Research Centre (CISTER)(实时嵌入式计算系统研究中心) Carnegie Mellon University(卡内基梅隆大学) Pontificia Universidad Católica de Chile(天主教智利大学) Instituto de Telecomunicações(电信研究院) Faculdade de Engenharia, Universidade do Porto(工程学院,葡萄牙里斯本大学)

专题命中 安全训练 :safety(abstract);分类 cs.AI

AI总结 本文提出基于大语言模型的上下文学习飞行资源分配方法,用于无人机辅助森林火灾监测中的实时数据采集优化。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 越狱攻击 3 篇

2602.11495 2026-02-23 cs.CR cs.CL 79%

Jailbreaking Leaves a Trace: Understanding and Detecting Jailbreak Attacks from Internal Representations of Large Language Models

对大型语言模型进行劫持留有痕迹:从内部表示理解并检测劫持攻击

Sri Durga Sai Sowmya Kadali, Evangelos E. Papalexakis

机构 * University of California, Riverside(加州大学河滨分校)

专题命中 越狱攻击 :jailbreak(title,abstract);分类 cs.CL

AI总结 本文提出了一种基于张量的潜在表示框架,通过分析LLM内部表示差异来检测劫持攻击,并在推理阶段主动干扰劫持执行。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17837 2026-02-23 cs.CR cs.CL cs.LG 62%

TFL: Targeted Bit-Flip Attack on Large Language Model

TFL:针对大语言模型的定向位翻转攻击

Jingkai Guo, Chaitali Chakrabarti, Deliang Fan

机构 * School of Electrical, Computer and Energy Engineering(电气、计算机与能源工程学院) Arizona State University(亚利桑那州立大学)

专题命中 越狱攻击 :safety(abstract);分类 cs.CL、cs.LG

AI总结 TFL是一种新型定向位翻转攻击框架,通过精确操控LLM输出并减少对无关输入的影响,提升攻击的隐蔽性和针对性。

Comments 13 pages, 11 figures. Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18079 2026-02-23 cs.CR cs.RO 50%

Dynamic Deception: When Pedestrians Team Up to Fool Autonomous Cars

动态欺骗:当行人联手欺骗自动驾驶汽车

Masoud Jamshidiyan Tehrani, Marco Gabriel, Jinhan Kim, Paolo Tonella

机构 * Università della Svizzera italiana(瑞士意大利大学)

专题命中 越狱攻击 :safety(abstract)

AI总结 本文提出通过多个动态元素协作放大对抗信号,以引发自动驾驶车辆的系统级故障,展示动态协作在对抗攻击中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 幻觉与事实性 1 篇

2507.10587 2026-02-23 cs.CL cs.AI 62%

Anthropomimetic Uncertainty: What Verbalized Uncertainty in Language Models is Missing

拟人化不确定性:语言模型中言语不确定性所缺失的内容

Dennis Ulmer, Alexandra Lorson, Ivan Titov, Christian Hardmeier

专题命中 幻觉与事实性 :trustworthy(abstract);分类 cs.CL、cs.AI

AI总结 本文探讨了语言模型中言语不确定性缺失的问题,提出拟人化不确定性的概念,旨在通过模仿人类语言行为提升模型的可信度和人机协作效果。

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 安全评测 10 篇

2602.17696 2026-02-23 cs.LG cs.AI 81%

Can LLM Safety Be Ensured by Constraining Parameter Regions?

通过约束参数区域能否确保大语言模型的安全性?

Zongmin Li, Jian Su, Farah Benamara, Aixin Sun

机构 * Nanyang Technological University(南洋理工大学) Institute for Infocomm Research (I 2 R)(信息通信研究所) IRIT, Université de Toulouse, CNRS, Toulouse INP(图卢兹大学IRIT研究所、法国国家科学研究中心) IPAL, CNRS-NUS-A*STAR(IPAL、法国国家科学研究中心-南洋理工大学-A*STAR)

专题命中 安全评测 :safety(title,abstract);分类 cs.AI、cs.LG

AI总结 本文评估了四种安全区域识别方法,发现其在不同粒度和数据集下重叠程度低,表明现有方法难以可靠地识别稳定的安全区域。

Comments 32 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17910 2026-02-23 cs.AI 79%

Alignment in Time: Peak-Aware Orchestration for Long-Horizon Agentic Systems

时间对齐:面向长时间 horizon 代理系统的峰值感知 orchestration

Hanjing Shi, Dominic DiFranzo

机构 * Lehigh University(莱维大学)

专题命中 安全评测 :alignment(title,abstract);分类 cs.AI

AI总结 APEMO通过时间-情感信号优化计算分配,提升长horizon代理系统轨迹质量和重用概率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17687 2026-02-23 cs.IR cs.AI cs.CL cs.LG 67%

IRPAPERS: A Visual Document Benchmark for Scientific Retrieval and Question Answering

IRPAPERS: 一个用于科学检索和问答的视觉文档基准

Connor Shorten, Augustas Skaburskas, Daniel M. Jones, Charles Pierse, Roberto Esposito, John Trengrove, Etienne Dilocker, Bob van Luijt

机构 * Weaviate

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 IRPAPERS基准通过比较图像和文本检索系统,揭示了多模态混合搜索在科学文档检索和问答中的优势。

Comments 23 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17672 2026-02-23 cs.HC cs.AI cs.CL cs.CR cs.CY 67%

Assessing LLM Response Quality in the Context of Technology-Facilitated Abuse

评估在技术辅助虐待情境下的LLM响应质量

Vijay Prakash, Majed Almansoori, Donghan Hu, Rahul Chatterjee, Danny Yuxing Huang

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI、cs.CY

AI总结 本文评估了四种LLM在技术辅助虐待情境下的响应质量,揭示其在支持幸存者方面的有效性和局限性,并提出改进建议。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18351 2026-02-23 cs.CL cs.AI 62%

Validating Political Position Predictions of Arguments

验证论证中政治立场预测的准确性

Jordan Robinson, Angus R. Williams, Katie Atkinson, Anthony G. Cohn

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 本文提出双尺度验证框架,通过点评和成对验证方法验证论证中政治立场预测的准确性,构建了大规模政治立场知识库,提升了政治领域知识表示能力。

Comments 13 pages, 6 figures, 6 tables. Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01865 2026-02-23 cs.CL cs.AI 62%

Cross-Lingual Interleaving for Speech Language Models

跨语言交织用于语音语言模型

Adel Moumen, Guangzhi Sun, Philip C. Woodland

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 本文提出跨语言交织方法,通过混合多语言语音标记提升SLMs的跨语言理解和生成能力,并发布相关数据集和基准以促进多语言语音模型的发展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17871 2026-02-23 cs.CV cs.AI cs.LG cs.MM 62%

Understanding the Fine-Grained Knowledge Capabilities of Vision-Language Models

理解视觉语言模型的细粒度知识能力

Dhruba Ghosh, Yuhui Zhang, Ludwig Schmidt

机构 * Stanford University(斯坦福大学)

专题命中 安全评测 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 本文研究了视觉语言模型在细粒度知识任务中的表现,发现更好的语言模型和视觉编码器对细粒度分类性能有显著影响,预训练阶段也至关重要。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17999 2026-02-23 cs.HC cs.AI 57%

Aurora: Neuro-Symbolic AI Driven Advising Agent

Aurora:神经符号AI驱动的建议代理

Lorena Amanda Quincoso Lugones, Christopher Kverne, Nityam Sharadkumar Bhimani, Ana Carolina Oliveira, Agoritsa Polyzou, Christine Lisetti, Janki Bhimani

机构 * Florida International University(佛罗里达国际大学) Northeastern University(东北大学)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 Aurora通过神经符号AI结合检索增强生成、符号推理和课程数据库,实现大规模、可验证的学术建议,提升推荐准确性和效率。

Comments Accepted to 41st ACM/SIGAPP Symposium On Applied Computing. 8 Pages, 3 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17770 2026-02-23 cs.CV cs.LG 57%

CLUTCH: Contextualized Language model for Unlocking Text-Conditioned Hand motion modelling in the wild

CLUTCH:解锁野外文本条件手部运动建模的上下文化语言模型

Balamurugan Thambiraja, Omid Taheri, Radek Danecek, Giorgio Becherini, Gerard Pons-Moll, Justus Thies

机构 * Technical University of Darmstadt(德累斯顿技术大学) Max-Planck Institute for Intelligent Systems(马克斯·普朗克智能系统研究所) University of Tuebingen(图宾根大学) Tubingen AI Center(图宾根人工智能中心) Max Planck Institute for Informatics(马克斯·普朗克信息研究所)

专题命中 安全评测 :alignment(abstract);分类 cs.LG

AI总结 CLUTCH通过引入3D-HIW数据集和SHIFT架构,提出基于LLM的手部动画系统,提升野外手部运动建模的保真度与泛化能力。

Comments ICLR2026; Project page: https://balamuruganthambiraja.github.io/CLUTCH/

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.15605 2026-02-23 cs.CV 50%

GIFT: A Framework Towards Global Interpretable Faithful Textual Explanations of Vision Classifiers

GIFT: 一种面向视觉分类器全局可解释忠实文本解释的框架

Éloi Zablocki, Valentin Gerard, Amaia Cardiel, Eric Gaussier, Matthieu Cord, Eduardo Valle

机构 * Université Grenoble Alpes(法国格勒诺布尔大学) Sorbonne Université(巴黎索邦大学)

专题命中 安全评测 :trustworthy(abstract)

AI总结 GIFT提出一种框架,通过生成局部反事实并转化为文本解释,实现视觉分类器的全局可解释和忠实性。

Comments TMLR 2026 (featured certification)

详情

展开后加载摘要…

URL PDF HTML 收藏

6. AI治理与伦理 2 篇

2602.18092 2026-02-23 cs.CL cs.AI cs.CY 67%

Perceived Political Bias in LLMs Reduces Persuasive Abilities

感知到的LLM政治偏见会降低说服能力

Matthew DiGiuseppe, Joshua Robison

机构 * Leiden University(莱顿大学)

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.CL、cs.AI、cs.CY

AI总结 研究发现,感知到的LLM政治偏见会降低其在对话中的说服效果,表明说服力受政治中立性感知的影响。

Comments 39 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17919 2026-02-23 cs.CY cs.HC 57%

Visual Anthropomorphism Shifts Evaluations of Gendered AI Managers

视觉人化影响对性别化AI管理者评价

Ruiqing Han, Hao Cui, Taha Yasseri

专题命中 AI治理与伦理 :trustworthy(abstract);分类 cs.CY

AI总结 研究发现,文本描述中能力信息可缓解对AI管理者的负面评价,而视觉人化会引发性别偏见,表明表示方式影响性别刻板印象的激活。

Comments Preprint, Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏

7. 其他安全 9 篇

2601.10160 2026-02-23 cs.CL cs.AI cs.LG 82%

Alignment Pretraining: AI Discourse Causes Self-Fulfilling (Mis)alignment

对齐预训练:人工智能 discourse 导致自我实现的(不)对齐

Cameron Tice, Puria Radmard, Samuel Ratnam, Andy Kim, David Africa, Kyle O'Brien

机构 * Geodesic Research(Geodesic研究机构) UK AI Security Institute(英国人工智能安全研究所) University of Cambridge(剑桥大学) University of Oxford(牛津大学)

专题命中 其他安全 :alignment(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文通过预训练不同量级的AI discourse,发现其对下游对齐有显著影响,表明预训练数据塑造对齐先验的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17951 2026-02-23 cs.CV cs.AI 79%

ROCKET: Residual-Oriented Multi-Layer Alignment for Spatially-Aware Vision-Language-Action Models

ROCKET:基于残差的多层对齐用于空间感知的视觉-语言-动作模型

Guoheng Sun, Tingting Du, Kaixi Feng, Chenxiang Luo, Xingguo Ding, Zheyu Shen, Ziyao Wang, Yexiao He, Ang Li

机构 * University of Maryland, College Park University of Wisconsin, Madison City University of Hong Kong St.\ Paul's School

专题命中 其他安全 :alignment(title,abstract);分类 cs.AI

AI总结 ROCKET通过共享投影器和稀疏激活方案实现多层对齐,提升3D空间理解能力,在LIBERO等任务中达到98.5%的高成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.07238 2026-02-23 cs.CL cs.AI cs.LG 67%

Beyond Mimicry to Contextual Guidance: Knowledge Distillation for Interactive AI

超越模仿到情境引导:面向交互AI的知识蒸馏

Tong Wang, K. Sudhir

专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出了一种基于情境引导的知识蒸馏方法,通过构建可重用的战略文本引导库,提升交互AI在客户服务中的服务质量与客户满意度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.02605 2026-02-23 cs.AI 57%

Adaptive GR(1) Specification Repair for Liveness-Preserving Shielding in Reinforcement Learning

自适应GR(1)规范修复用于强化学习中的存活保持防护

Tiberiu-Andrei Georgescu, Alexander W. Goodall, Dalal Alrajeh, Francesco Belardinelli, Sebastian Uchitel

机构 * Imperial College London(伦敦帝国理工学院) Universidad de Buenos Aires(布宜诺斯艾利斯大学)

专题命中 其他安全 :safety(abstract);分类 cs.AI

AI总结 本文提出基于GR(1)规范的自适应防护框架,通过在线修复规范实现环境假设违反时的安全与存活保持。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17815 2026-02-23 cs.CL 57%

Neural Synchrony Between Socially Interacting Language Models

社会交互语言模型间的神经同步

Zhining Zhang, Wentao Zhu, Chi Han, Yizhou Wang, Heng Ji

机构 * Peking University(北京大学) Eastern Institute of Technology(东部技术研究所) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 其他安全 :alignment(abstract);分类 cs.CL

AI总结 研究通过分析社会交互语言模型间的神经同步,探讨其社会行为表现与神经同步的关联性,揭示了人类与语言模型社会互动的内在相似性。

Comments Accepted at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17680 2026-02-23 cs.LG 57%

BioBridge: Bridging Proteins and Language for Enhanced Biological Reasoning with LLMs

BioBridge: 蛋白质与语言的桥梁:利用大语言模型增强生物推理

Yujia Wang, Jihong Guan, Wengen Li, Shuigeng Zhou, Xuhong Wang

机构 * School of Computer Science and Technology(计算机科学与技术学院) College of Computer Science and Artificial Intelligence(计算机科学与人工智能学院) Fudan University(复旦大学) Shanghai AI Laboratory(上海人工智能实验室)

专题命中 其他安全 :alignment(abstract);分类 cs.LG

AI总结 BioBridge结合蛋白质领域知识与通用语言能力,通过领域自适应持续预训练框架提升生物推理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18432 2026-02-23 cs.CV 50%

SARAH: Spatially Aware Real-time Agentic Humans

SARAH:具有空间意识的实时代理人类

Evonne Ng, Siwei Zhang, Zhang Chen, Michael Zollhoefer, Alexander Richard

机构 * Meta Reality Labs(Meta现实实验室)

专题命中 其他安全 :alignment(abstract)

AI总结 SARAH提出了一种实时、完全因果的方法,实现具有空间意识的对话运动,通过结合因果变换器VAE和流匹配模型,在VR中实现自然的人机交互。

Comments Project page: https://evonneng.github.io/sarah/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18260 2026-02-23 cs.RO 50%

Role-Adaptive Collaborative Formation Planning for Team of Quadruped Robots in Cluttered Environments

面向 cluttered 环境的四足机器人团队角色自适应协作形成规划

Magnus Norén, Marios-Nektarios Stamatopoulos, Avijit Banerjee, George Nikolakopoulos

机构 * Robotics and Artificial Intelligence Group, Department of Computer, Electrical and Space Engineering, Lulea University of Technology(机器人与人工智能小组,计算机、电气与航天工程系,卢莱亚理工大学)

专题命中 其他安全 :safety(abstract)

AI总结 本文提出了一种适用于 cluttered 环境的四足机器人团队角色自适应协作形成规划方法,通过动态角色分配和 FM2 算法实现灵活导航与稳定形成。

详情

展开后加载摘要…

URL PDF HTML 收藏