arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-02-23 至 2026-02-23 共收录 9 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 其他安全 9 篇

2601.10160 2026-02-23 cs.CL cs.AI cs.LG 82%

Alignment Pretraining: AI Discourse Causes Self-Fulfilling (Mis)alignment

对齐预训练:人工智能 discourse 导致自我实现的(不)对齐

Cameron Tice, Puria Radmard, Samuel Ratnam, Andy Kim, David Africa, Kyle O'Brien

机构 * Geodesic Research(Geodesic研究机构) UK AI Security Institute(英国人工智能安全研究所) University of Cambridge(剑桥大学) University of Oxford(牛津大学)

专题命中 其他安全 :alignment(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文通过预训练不同量级的AI discourse,发现其对下游对齐有显著影响,表明预训练数据塑造对齐先验的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17951 2026-02-23 cs.CV cs.AI 79%

ROCKET: Residual-Oriented Multi-Layer Alignment for Spatially-Aware Vision-Language-Action Models

ROCKET:基于残差的多层对齐用于空间感知的视觉-语言-动作模型

Guoheng Sun, Tingting Du, Kaixi Feng, Chenxiang Luo, Xingguo Ding, Zheyu Shen, Ziyao Wang, Yexiao He, Ang Li

机构 * University of Maryland, College Park University of Wisconsin, Madison City University of Hong Kong St.\ Paul's School

专题命中 其他安全 :alignment(title,abstract);分类 cs.AI

AI总结 ROCKET通过共享投影器和稀疏激活方案实现多层对齐,提升3D空间理解能力,在LIBERO等任务中达到98.5%的高成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.07238 2026-02-23 cs.CL cs.AI cs.LG 67%

Beyond Mimicry to Contextual Guidance: Knowledge Distillation for Interactive AI

超越模仿到情境引导:面向交互AI的知识蒸馏

Tong Wang, K. Sudhir

专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出了一种基于情境引导的知识蒸馏方法,通过构建可重用的战略文本引导库,提升交互AI在客户服务中的服务质量与客户满意度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.02605 2026-02-23 cs.AI 57%

Adaptive GR(1) Specification Repair for Liveness-Preserving Shielding in Reinforcement Learning

自适应GR(1)规范修复用于强化学习中的存活保持防护

Tiberiu-Andrei Georgescu, Alexander W. Goodall, Dalal Alrajeh, Francesco Belardinelli, Sebastian Uchitel

机构 * Imperial College London(伦敦帝国理工学院) Universidad de Buenos Aires(布宜诺斯艾利斯大学)

专题命中 其他安全 :safety(abstract);分类 cs.AI

AI总结 本文提出基于GR(1)规范的自适应防护框架,通过在线修复规范实现环境假设违反时的安全与存活保持。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17815 2026-02-23 cs.CL 57%

Neural Synchrony Between Socially Interacting Language Models

社会交互语言模型间的神经同步

Zhining Zhang, Wentao Zhu, Chi Han, Yizhou Wang, Heng Ji

机构 * Peking University(北京大学) Eastern Institute of Technology(东部技术研究所) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 其他安全 :alignment(abstract);分类 cs.CL

AI总结 研究通过分析社会交互语言模型间的神经同步,探讨其社会行为表现与神经同步的关联性,揭示了人类与语言模型社会互动的内在相似性。

Comments Accepted at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17680 2026-02-23 cs.LG 57%

BioBridge: Bridging Proteins and Language for Enhanced Biological Reasoning with LLMs

BioBridge: 蛋白质与语言的桥梁:利用大语言模型增强生物推理

Yujia Wang, Jihong Guan, Wengen Li, Shuigeng Zhou, Xuhong Wang

机构 * School of Computer Science and Technology(计算机科学与技术学院) College of Computer Science and Artificial Intelligence(计算机科学与人工智能学院) Fudan University(复旦大学) Shanghai AI Laboratory(上海人工智能实验室)

专题命中 其他安全 :alignment(abstract);分类 cs.LG

AI总结 BioBridge结合蛋白质领域知识与通用语言能力,通过领域自适应持续预训练框架提升生物推理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18432 2026-02-23 cs.CV 50%

SARAH: Spatially Aware Real-time Agentic Humans

SARAH:具有空间意识的实时代理人类

Evonne Ng, Siwei Zhang, Zhang Chen, Michael Zollhoefer, Alexander Richard

机构 * Meta Reality Labs(Meta现实实验室)

专题命中 其他安全 :alignment(abstract)

AI总结 SARAH提出了一种实时、完全因果的方法,实现具有空间意识的对话运动,通过结合因果变换器VAE和流匹配模型,在VR中实现自然的人机交互。

Comments Project page: https://evonneng.github.io/sarah/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18260 2026-02-23 cs.RO 50%

Role-Adaptive Collaborative Formation Planning for Team of Quadruped Robots in Cluttered Environments

面向 cluttered 环境的四足机器人团队角色自适应协作形成规划

Magnus Norén, Marios-Nektarios Stamatopoulos, Avijit Banerjee, George Nikolakopoulos

机构 * Robotics and Artificial Intelligence Group, Department of Computer, Electrical and Space Engineering, Lulea University of Technology(机器人与人工智能小组,计算机、电气与航天工程系,卢莱亚理工大学)

专题命中 其他安全 :safety(abstract)

AI总结 本文提出了一种适用于 cluttered 环境的四足机器人团队角色自适应协作形成规划方法,通过动态角色分配和 FM2 算法实现灵活导航与稳定形成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18016 2026-02-23 cs.CV 50%

Towards LLM-centric Affective Visual Customization via Efficient and Precise Emotion Manipulating

面向高效精准情感操控的基于大语言模型的有情感视觉定制

Jiamin Luo, Xuqian Gu, Jingjing Wang, Jiahong Lu

机构 * School of Computer Science and Technology, Soochow University(计算机科学与技术学院,苏州大学)

专题命中 其他安全 :alignment(abstract)

AI总结 本文提出基于大语言模型的有情感视觉定制任务,通过高效精准的情感操控方法实现图像主观情感的生成与修改。

详情

展开后加载摘要…

URL PDF HTML 收藏