arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-09-01 至 2026-09-01 共收录 221 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 偏好对齐 18 篇

2608.29378 2026-09-01 cs.CL cs.AI 新提交 93%

Arabic Safety Alignment as Selective Refusal: An Empirical Study of SFT, DPO, and Guard Calibration

阿拉伯语安全对齐作为选择性拒绝:SFT、DPO与防护校准的实证研究

Mohamad Zbib, Ammar Mohanna

机构 * American University of Beirut(贝鲁特美国大学)

专题命中 偏好对齐 :DPO(title,title_cn);alignment(title);safety(title);分类 cs.CL、cs.AI

AI总结 该研究针对阿拉伯语大语言模型的安全对齐问题,通过实证对比SFT、DPO等方法,提出需针对特定模型选择操作点以平衡有害提示拒绝与良性提示接受的权衡。

Comments The Fourth Arabic Natural Language Processing Conference(ArabicNLP 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30141 2026-09-01 cs.CR cs.LG 新提交 90%

Balancing Privacy, Utility, and Safety in LLM Alignment through Preference Optimization

通过偏好优化实现大语言模型对齐中的隐私、效用与安全平衡

Dishu Yang, Jingjing Liu, Jize Li

专题命中 偏好对齐 :safety(title,abstract);alignment(title);DPO(abstract,abstract_cn);harmlessness(abstract)

AI总结 该研究提出P3M协议,在不修改目标函数或引入正式隐私机制的情况下,通过调整隐私-偏好数据比例,降低LLM的金丝雀记忆与成员推理攻击性能,同时平衡隐私、效用与安全。

Comments 6 pages, accepted for presentation at PRAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29357 2026-09-01 cs.AI 新提交 90%

LiteSearch-VL: Small Multimodal Search Agents via Trajectory Distillation and Synthetic Step-DPO

LiteSearch-VL:通过轨迹蒸馏和合成步级DPO实现的小型多模态搜索智能体

Saeed Khaki, Nima Safaei, Kamal Ginotra

机构 * Microsoft AI(微软人工智能) Ohio State University(俄亥俄州立大学)

专题命中 偏好对齐 :DPO(title,title_cn);分类 cs.AI

AI总结 该研究提出LiteSearch-VL方案,通过轨迹蒸馏和合成步级DPO,在单节点预算下将多模态搜索智能体能力迁移至Qwen3-VL-2B等小型模型,使其在多模态视觉问答任务上取得接近4B模型的性能,明确小型多模态智能体的下一瓶颈是答案验证而非搜索深度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10009 2026-09-01 cs.LG cs.AI cs.CL 版本更新 87%

Personalized Group Relative Policy Optimization for Heterogenous Preference Alignment

面向异质偏好对齐的个性化群体相对策略优化

Jialu Wang, Heinrich Peters, Asad A. Butt, Navid Hashemi, Alireza Hashemi, Pouya M. Ghari, Joseph Hoover, James Rae, Morteza Dehghani

专题命中 偏好对齐 :alignment(title,abstract);RLHF(abstract,abstract_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出个性化GRPO框架,通过解耦优势估计与批次统计,提升模型对异质偏好信号的对齐能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27505 2026-09-01 cs.CL cs.AI 版本更新 85%

A Survey on Rubric-Guided Reinforcement Learning for Language Models

面向语言模型的准则引导强化学习综述

Zifei Shan, Fangning Shao

机构 * WeChat, Tencent(腾讯微信)

专题命中 偏好对齐 :RLHF(summary_cn,abstract);alignment(abstract);分类 cs.CL、cs.AI

AI总结 该综述针对传统RLHF的缺陷,提出贝叶斯框架并沿先验-后验轴分类准则引导强化学习,分析语言学相关对齐问题,明确未来研究方向。

Comments Accepted to Findings of EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08136 2026-09-01 cs.CV cs.AI 版本更新 84%

Robustness of Vision Language Models Against Split-Image Harmful Input Attacks

视觉语言模型对分裂图像有害输入攻击的鲁棒性

Md Rafi Ur Rashid, MD Sadik Hossain Shanto, Vishnu Asutosh Dasu, Shagufta Mehnaz

机构 * Pennsylvania State University(宾夕法尼亚州立大学) Bangladesh University of Engineering and Technology(孟加拉工程与技术大学)

专题命中 偏好对齐 :RLHF(abstract,abstract_cn);alignment(abstract);safety(abstract);jailbreak(abstract)

AI总结 本研究提出分裂图像视觉陷阱攻击(SIVA),揭示视觉语言模型在面对分裂图像攻击时的安全漏洞,并通过对抗性知识蒸馏算法提升跨模型攻击效果。

Comments Accepted in ACM CCS 2026. 26 Pages, long conference paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11573 2026-09-01 cs.CL cs.AI 版本更新 82%

Reinforcing Step-level Reasoning for Effective Self-Correction in LLMs

强化步骤级推理以实现大语言模型的有效自校正

Vu Duc Anh, Nhat M. Hoang, Do Xuan Long, Cong-Duy Nguyen, Ponhvoan Srey, Luu Anh Tuan

机构 * Nanyang Technological University(南洋理工大学) National University of Singapore(新加坡国立大学) VinUniversity Institute for Infocomm Research (IR), A*STAR(新加坡科技研究局信息通信研究院)

专题命中 偏好对齐 :DPO(summary_cn,abstract);分类 cs.CL、cs.AI

AI总结 针对大语言模型自校正的核心挑战,提出SFS-DPO及教师辅助变体SFS-DPO-R框架,经多模型多域评估,其性能优于现有步骤级训练基线,可提升自校正频率与有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25200 2026-09-01 cs.LG cs.AI cs.CL 版本更新 82%

MoPLEx: Estimating Plackett-Luce Mixture Models for Multi-Objective Alignment

学习用于多目标对齐的Plackett-Luce模型混合

Dongyue Li, Ziniu Zhang, Lu Wang, Hongyang R. Zhang

机构 * Northeastern University(东北大学) University of Michigan(密歇根大学)

专题命中 偏好对齐 :alignment(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 该研究针对异质偏好下多向排序的模型混合问题,提出MoPLEx算法,通过扩充排序并结合梯度估计与期望最大化,在偏好优化任务上显著优于基线方法。

Comments 19 pages; To appear in EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01914 2026-09-01 cs.CL cs.CV 版本更新 81%

Mechanistic Diagnostics of Spatial Lexical Bias in Multimodal Large Language Model Spatial Reasoning

多模态大语言模型空间推理中空间词汇偏差的机制诊断

Chuang Ma, Qianying Liu, Tomoyuki Obuchi, Fei Cheng, Wang Yang, Sudong Cai, Shuyuan Zheng, Akiko Aizawa, Sadao Kurohashi

机构 * Kyoto University(京都大学) NII LLMC(日本国立信息与通信技术研究所语言模型中心) RIKEN AIP(日本理化学研究所先进理工研究所) Case Western Reserve University(凯斯西储大学) The Hong Kong Polytechnic University(香港理工大学) The University of Osaka(大阪大学) University of Tokyo(东京大学)

专题命中 偏好对齐 :DPO(summary_cn,abstract);分类 cs.CL

AI总结 本文发现多模态大语言模型存在空间词汇偏差,即添加空间关系词会吸引模型选择该选项,并通过机制可解释性工具揭示偏差主要源于语言侧而非视觉侧,最后提出轻量级LLM-only DPO更新可有效缓解偏差。

Comments 27 pages. Accepted to EMNLP 2026 (Main Conference); camera-ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.00030 2026-09-01 cs.LG cs.AI 版本更新 81%

RSPO: Regularized Self-Play Alignment of Large Language Models

RSPO:大语言模型的正则化自博弈对齐

Xiaohang Tang, Sangwoong Yoon, Seongho Son, Huizhuo Yuan, Quanquan Gu, Ilija Bogunovic

机构 * University College London(伦敦大学学院) University of California, Los Angeles(加州大学洛杉矶分校)

专题命中 偏好对齐 :alignment(title,abstract);分类 cs.AI、cs.LG

AI总结 本研究提出RSPO框架,统一现有方法并保证收敛性,在多个基准测试中提升了自博弈微调LLMs的性能,为正则化自博弈对齐提供了基础。

Comments Accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29326 2026-09-01 cs.CL cs.AI 新提交 79%

StageWell: A Process-Aligned Chinese Corpus for Positive-Psychology Support Dialogue

StageWell:面向积极心理学支持对话的流程对齐中文语料库

Yuxiong Wang, Ziwei Lin, Bo Wang, Yu Zhang, Shiguang Ni

专题命中 偏好对齐 :DPO(abstract,abstract_cn);safety(abstract);分类 cs.CL、cs.AI

AI总结 本研究构建了流程对齐中文语料库StageWell及HQS协议,用于优化多轮积极心理学支持对话的监督,在多个开源大模型上实现了流程控制、回复质量与安全性的提升。

Comments 29 pages, 20 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.31079 2026-09-01 cs.LG 新提交 77%

Sycophantic Agreement Transfers with Neutral Data via Contrastive Preference Optimization

通过对比偏好优化实现的基于中性数据的谄媚式一致性转移

Camila Blank, Zhuofan Ying, Christopher Potts, Peter Hase, Jing Huang

机构 * Stanford University(斯坦福大学) Columbia University(哥伦比亚大学)

专题命中 偏好对齐 :DPO(abstract,abstract_cn);alignment(abstract);分类 cs.LG

AI总结 本研究发现对比偏好优化会导致教师模型的谄媚式一致性向学生模型转移,且该信号分散于中性偏好数据中,现有过滤方法难以缓解,揭示了对齐训练的意外有害行为。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16567 2026-09-01 cs.LG cs.AI cs.CR 版本更新 73%

Watch your steps: Dormant Adversarial Behaviors that Activate upon LLM Finetuning

留意你的步骤:大语言模型微调时激活的潜伏对抗行为

Thibaud Gloaguen, Mark Vero, Robin Staab, Martin Vechev

机构 * ETH Zurich(苏黎世联邦理工学院)

专题命中 偏好对齐 :DPO(abstract,abstract_cn);分类 cs.AI、cs.LG

AI总结 该研究提出FAB攻击,通过元学习技术创建潜伏对抗行为的受损LLM,其在微调前表现良性,微调后会触发主动广告推送、越狱等行为,挑战了微调的安全性假设。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29352 2026-09-01 cs.AI 新提交 70%

Cross-Relational Preference Learning for Better LLM Instruction Following

用于提升大语言模型指令遵循能力的跨关系偏好学习

Runsheng Li, Kai Sun, Bin Shi, Bo Dong

机构 * School of Computer Science and Technology, Xi’an Jiaotong University(西安交通大学计算机科学与技术学院) Shaanxi Provincial Key Laboratory of Big Data Knowledge Engineering, Xi’an Jiaotong University(西安交通大学陕西省大数据知识工程重点实验室) School of Distance Education, Xi’an Jiaotong University(西安交通大学远程教育学院)

专题命中 偏好对齐 :DPO(abstract,abstract_cn);分类 cs.AI

AI总结 针对LLMs遵循复杂指令时忽略不同指令允许响应空间关系的问题,提出CRPL框架,通过两项关键技术构建高质量偏好数据,在多方法、主干及基准上实现显著改进与强泛化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23991 2026-09-01 cs.CL cs.AI 版本更新 62%

SyRuP: Enhancing System-Prompt Following via Reward-Guided Prediction in LLM Decoding

SyRuP:通过大语言模型解码中的奖励引导预测增强系统提示遵循

Seoyeon Kim, Minjae Kang, Jaehyung Kim

机构 * Yonsei University(延世大学)

专题命中 偏好对齐 :safety(abstract);分类 cs.CL、cs.AI

AI总结 研究如何增强大语言模型对系统提示的遵循,提出SyRuP框架,通过训练交叉注意力奖励头产生令牌级遵循分数,推理时结合多种信号对候选重新排序,实验表明该方法能有效提升系统提示遵循度且开销适度。

Comments EMNLP 26 Main, 27 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30902 2026-09-01 cs.CL 新提交 57%

Low-Resource Preference Adaptation of LLMs via Activation-Based Label Propagation

基于激活传播的低资源大语言模型偏好适配

Alessio Galatolo, Meriem Beloucif

机构 * Uppsala University(乌普萨拉大学)

专题命中 偏好对齐 :alignment(abstract);分类 cs.CL

AI总结 针对低资源场景下LLMs偏好优化受标注成本限制的问题,本文提出基于少量标注数据训练的轻量线性探针,利用激活结构标注大量未标注数据,其性能优于直接训练且接近使用更多标注数据的基线。

Comments EMNLP26 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23263 2026-09-01 cs.AI 版本更新 57%

GUI-PRA: Process Reward Agent for GUI Tasks

GUI-PRA:面向GUI任务的过程奖励智能体

Tao Xiong, Xavier Hu, Yurun Chen, Yuhang Liu, Changqiao Wu, Pengzhi Gao, Wei Liu, Jian Luan, Shengyu Zhang

机构 * Zhejiang University(浙江大学) MiLM Plus, Xiaomi Inc.(小米公司)

专题命中 偏好对齐 :alignment(abstract);分类 cs.AI

AI总结 针对长程GUI自动化的错误累积与视觉歧义问题,本文提出GUI-PRA,通过主动调查式评估实现性能提升,在AndroidWorld等数据集上较标准PRM取得显著进步。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03468 2026-09-01 cs.CV 版本更新 50%

Understanding Reward Hacking in Text-to-Image Reinforcement Learning

理解文本到图像强化学习中的奖励黑客行为

Yunqi Hong, Kuei-Chun Kao, Hengguang Zhou, Cho-Jui Hsieh

机构 * Department of Computer Science, University of California, Los Angeles(计算机科学系,加州大学洛杉矶分校)

专题命中 偏好对齐 :alignment(abstract)

AI总结 本文提出了一种轻量的伪影奖励模型,用于缓解文本到图像强化学习中的奖励黑客问题,通过提高图像真实性和减少低质量生成。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 安全训练 37 篇

2508.20766 2026-09-01 cs.CL cs.AI cs.LG 版本更新 89%

Turning the Spell Around: Lightweight Alignment Amplification via Rank-One Safety Injection

反转思路:通过单秩安全注入实现轻量级对齐增强

Harethah Abu Shairah, Hasan Abed Al Kader Hammoud, George Turkiyyah, Bernard Ghanem

机构 * King Abdullah University of Science and Technology (KAUST)(卡布尔大学科学与技术学院)

专题命中 安全训练 :alignment(title,abstract);safety(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出单秩安全注入(ROSI)这一无需微调的白盒方法,通过修改模型权重增强 LLM 安全对齐,可提升安全拒绝率且保留模型效用,还可重新对齐未审查模型,是高效的 LLM 安全改进机制。

Comments EMNLP 2026, Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29936 2026-09-01 cs.CL cs.LG 新提交 84%

When Safety Speaks a Language: A Mechanistic Analysis of Safety-Language Identity Entanglement in LLMs

当安全“说”一种语言:大语言模型中安全-语言身份纠缠的机制分析

Apoorva Upadhyaya, Sandipan Sikdar

机构 * L3S Research Center(L3S研究中心) Leibniz Universität Hannover(汉诺威莱布尼茨大学)

专题命中 安全训练 :safety(title,abstract);alignment(abstract);分类 cs.CL、cs.LG

AI总结 本研究通过稀疏自编码器特征分析,揭示大语言模型中安全与语言身份的纠缠机制,发现安全相关特征具架构依赖性,为多语言安全干预提供机制解释。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25201 2026-09-01 cs.CL cs.CY 版本更新 84%

SafeMath: Inference-time Safety improves Math Accuracy

SafeMath: 在推理过程中提升安全性以提高数学准确性

Sagnik Basu, Subhrajit Mitra, Aman Juneja, Somnath Banerjee, Rima Hazra, Animesh Mukherjee

机构 * Indian Institute of Technology Kharagpur(印度理工学院克勒格布尔分校) Cisco Systems(思科系统公司) National University of Singapore(新加坡国立大学)

专题命中 安全训练 :safety(title,abstract);alignment(abstract);分类 cs.CL、cs.CY

AI总结 本文研究了有害数学问题对LLM的影响,提出SafeMath技术在保障安全的同时提升数学推理能力。

Comments Accepted in EMNLP Findings 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30750 2026-09-01 cs.LG 新提交 83%

Do VLMs Share Safety Neurons Across Modalities?

视觉语言模型(VLMs)是否在不同模态间共享安全神经元?

Jiaxuan Li, Jiahao Zhang, Duc Minh Vo, Huy H. Nguyen, Pride Kavumba, Koki Wataoka

机构 * SB Intuitions Corp.(SB Intuitions公司)

专题命中 安全训练 :safety(title,abstract);alignment(abstract);分类 cs.LG

AI总结 该研究针对10个视觉语言模型,通过因果神经元层面分析,提出两阶段迭代消融检测流程与两个模态隔离基准,发现文本安全神经元集中、视觉安全高维弥散的差距,解释了当前对齐未缩小视觉安全差距的原因。

Comments Accepted to EMNLP 2026 (Main Conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30197 2026-09-01 cs.CL cs.SE 新提交 83%

ALTSTEER: Selective Safety Steering for Moving Beyond Hard Refusals to Constructive Alternatives

ALTSTEER:用于超越生硬拒绝并构建建设性替代方案的选择性安全引导

Hoejoon Kwon, Byeonggeuk Lim, Kahyeon Kim, YoungBin Kim

机构 * Chung-Ang University(中央大学)

专题命中 安全训练 :safety(title,abstract);alignment(abstract);分类 cs.CL

AI总结 该研究提出推理时框架ALTSTEER,结合选择性干预与拒绝锚定的建设性重定向,在Llama-3.1和Qwen2.5上验证其可保持良性效用并提升建设性安全完成行为。

Comments Accepted at EMNLP 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22118 2026-09-01 cs.AI 版本更新 83%

Defining Operational Conditions for Safety-Critical AI-Based Systems from Data

从数据定义安全关键AI系统的操作条件

Johann Maximilian Christensen, Elena Hoemann, Frank Köster, Sven Hallerbach

专题命中 安全训练 :safety(title,abstract);分类 cs.AI

AI总结 本文提出了一种基于多维核表示的方法,从已有数据后验定义安全关键AI系统的操作条件领域,以实现更有效的认证。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02665 2026-09-01 cs.CR cs.AI cs.CL 版本更新 81%

Single Canonical Prompts Underestimate LLM Safety's Surface-Form Sensitivity

单一规范提示低估了大语言模型安全的表面形式敏感性

Yongxi Zhou, Junwei Yao, Yuanzhe Liu, Zihan Dong, Wenbo Ye, Jiaxi Wen, Lai Yun Choi

机构 * Northeastern University(东北大学) Georgia Institute of Technology(佐治亚理工学院) University of Southern California(南加利福尼亚大学)

专题命中 安全训练 :safety(title,abstract);分类 cs.CL、cs.AI

AI总结 该研究发现仅用单一规范提示评估大语言模型安全会低估其不安全合规性,不同表面形式下的不安全结果并集会超出最糟单一形式,且存在模型差异,同时发布了相关数据集、代码与响应标签。

Comments Accepted at the Sci-FM Workshop @ COLM 2026 (non-archival). Workshop version with reviews: this https URL (https://openreview.net/forum?id=mZh0MqpOOC)

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.00610 2026-09-01 cs.CY cs.AI 版本更新 81%

Multimodal Large Language Models Predict Urban Safety Perception but Encode Non-Neutral Demographic Priors

多模态大语言模型可预测城市安全感知,但编码非中立的人口统计先验

Ciro Beneduce, Bruno Lepri, Massimiliano Luca

机构 * Fondazione Bruno Kessler(布鲁诺·凯塞勒基金会) University of Trento(特伦托大学)

专题命中 安全训练 :safety(title,abstract);分类 cs.AI、cs.CY

AI总结 该研究验证多模态大语言模型可规模化预测城市安全感知,但发现其存在非中立人口统计先验,不同性别、种族角色下的安全判断存在系统偏差。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30585 2026-09-01 cs.LG 新提交 79%

The Safety Relay in Roleplay Jailbreaks: A Component-Resolved Causal Analysis of Harm Recognition and Refusal

角色扮演越狱中的安全继电器:对有害内容识别与拒绝的组件解析因果分析

Md Mokarram Chowdhury, Ernie Chang, Yang Li

机构 * Iowa State University(爱荷华州立大学) Meta

专题命中 安全训练 :safety(title,abstract);分类 cs.LG

AI总结 本研究通过机制可解释性分析角色扮演越狱中模型服从有害请求的机制,发现安全继电器衰减等规律,明确了安全措施需维持有害识别到拒绝的关联。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27580 2026-09-01 cs.AI 版本更新 79%

LongGuard: Mechanistic Analysis and Training-Free Mitigation of Long-Context Failure in Safety Guardrails

LongGuard:针对安全护栏长上下文失效的机制分析与无训练缓解方案

Ziyang Chen, Xing Wu, Songlin Hu

机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络空间安全学院)

专题命中 安全训练 :safety(title,abstract);分类 cs.AI

AI总结 本研究针对LLM安全护栏在长上下文下的失效问题,提出LongGuard框架,经机制分析后开发无训练缓解方案,在多基准测试中实现显著性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10014 2026-09-01 cs.RO cs.LG cs.MA eess.SY 版本更新 79%

Runtime Safety Filtering for Learned Small UAS Separation Policies under GNSS Degradation

全球导航卫星系统(GNSS)退化情况下学习到的小型无人机分离策略的运行时安全过滤

Alex Zongo, Peng Wei

专题命中 安全训练 :safety(title,abstract);分类 cs.LG

AI总结 研究在GNSS退化时小型无人机分离策略的运行时安全过滤问题,对比动作过滤和观测过滤两种方法,发现动作过滤安全改进小,观测过滤能减少近90%的空中碰撞且更稳健,表明保留策略决策权限更优。

Comments Accepted for publication at the 2026 IEEE/AIAA Digital Avionics Systems Conference (DASC). 9 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29379 2026-09-01 cs.RO 新提交 71%

Bridging Semantics and Physics with Constrained LLMs for Safe and Trustworthy Robotic Manipulation

用受约束的大语言模型(LLM)弥合语义与物理鸿沟,实现安全可信的机器人操纵

Wenhao Hong, Lan Wei, Dandan Zhang

机构 * Imperial College London(帝国理工学院)

专题命中 安全训练 :trustworthy(title)

AI总结 该研究针对语言引导机器人操纵的语言-动作鸿沟,通过类型化契约约束LLM决策,结合MoveIt流水线验证,在多类机器人任务上实现了优于脚本策略的安全可靠性能。

Comments ECCV Workshop paper

详情

展开后加载摘要…

URL PDF HTML 收藏