arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 3302 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全训练 3302 篇

2510.08592 2026-05-12 cs.CL cs.AI cs.LG 67%

Less Diverse, Less Safe: The Indirect But Pervasive Risk of Test-Time Scaling in Large Language Models

多样性越低,安全性越差:大规模语言模型测试时缩放的间接但广泛的风险

Shahriar Kabir Nahin, Hadi Askari, Muhao Chen, Anshuman Chhabra

机构 * Bellini College of AI, Cybersecurity, and Computing(人工智能、网络安全与计算学院) University of South Florida, Tampa, Florida, USA(佛罗里达州塔帕斯大学) University of California, Davis, California, USA(加州大学戴维斯分校)

专题命中 安全训练 :safety(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文揭示了测试时缩放(TTS)中多样性降低导致安全风险增加的问题,提出RefDiv协议用于检测TTS管道中的漏洞,并发现现有安全防护措施对此类风险效果有限。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27045 2026-05-01 cs.LG cs.AI cs.CL 67%

Detecting Clinical Discrepancies in Health Coaching Agents: A Dual-Stream Memory and Reconciliation Architecture

在健康教练代理中检测临床差异:一种双流记忆与协调架构

Samuel L Pugh, Eric Yang, Alexander Muir Sutherland, Alessandra Breschi

机构 * Verily Health Inc(Verily健康公司)

专题命中 安全训练 :safety(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出双流记忆与协调架构,用于检测健康教练代理中的临床差异,通过验证患者报告与临床记录以确保安全部署。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18731 2026-05-01 cs.CL cs.AI cs.LG 67%

Mitigating Lost in Multi-turn Conversation via Curriculum RL with Verifiable Accuracy and Abstention Rewards

通过可验证准确性和回避奖励的课程强化学习缓解多轮对话中的迷失问题

Ming Li, Pei Chen, Zhenhao Zhang, Tao Yang, Xinyang Zhang, Han Li, Tianyu Cao, Ming Zeng, Zhuofeng Wu, Meng Jiang, Huasheng Li, Lihong Li, Bing Yin

机构 * University of Maryland(马里兰大学) Amazon(亚马逊)

专题命中 安全训练 :trustworthy(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出RLAAR框架,通过可验证准确性和回避奖励的课程强化学习,减少多轮对话中因提前回答导致的性能下降,提升模型可靠性。

Comments ACL2026, camera-ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08377 2026-04-28 cs.LG cs.AI cs.CL 67%

Reinforcement Learning with Backtracking Feedback

具有回溯反馈的强化学习

Bilgehan Sel, Vaishakh Keshava, Phillip Wallis, Lukas Rutishauser, Ming Jin, Dingcheng Li

机构 * Google(谷歌) Google DeepMind(谷歌DeepMind) Virginia Tech(弗吉尼亚理工大学)

专题命中 安全训练 :safety(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出RLBF框架,通过强化学习阶段使模型动态纠正生成错误,结合改进的SFT数据生成策略,提升LLM在对抗攻击和内在错误中的安全性。

Comments NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16042 2026-04-21 cs.CL cs.AI cs.LG 67%

Towards Intrinsic Interpretability of Large Language Models:A Survey of Design Principles and Architectures

面向大语言模型内在可解释性的探索:设计原则与架构的综述

Yutong Gao, Qinglin Meng, Yuan Zhou, Liangming Pan

机构 * MOE Key Lab of Computational Linguistics, Peking University(计算语言学MOE实验室,北京大学) Beijing Academy of Artificial Intelligence, Beijing, China(北京人工智能研究院,北京,中国) Nanjing University of Science and Technology(南京理工大学) Purdue University(普渡大学)

专题命中 安全训练 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文综述了大语言模型内在可解释性的发展,分类现有方法为五种设计范式,并讨论开放挑战与未来研究方向。

Comments Accepted to the Main Conference of ACL 2026. 14 pages, 4 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14142 2026-04-16 cs.LG cs.AI cs.CL 67%

From $P(y|x)$ to $P(y)$: Investigating Reinforcement Learning in Pre-train Space

从P(y|x)到P(y):在预训练空间中研究强化学习

Yuqiao Tan, Minzheng Wang, Bo Liu, Zichen Liu, Tian Liang, Shizhu He, Jun Zhao, Kang Liu

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) University of Chinese Academy of Sciences(中国科学院大学) National University of Singapore(新加坡国立大学) Tencent AI Lab(腾讯AI实验室)

专题命中 安全训练 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出PreRL和DSRL方法,通过优化预训练空间中的边际分布P(y),提升LLM推理能力,并通过NSR机制增强推理效果,实验表明DSRL在推理任务中表现优异。

Comments Preprint. Our code is available at https://github.com/Trae1ounG/Pretrain_Space_RLVR

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13016 2026-04-16 cs.LG cs.AI cs.CL 67%

Rethinking On-Policy Distillation of Large Language Models: Phenomenology, Mechanism, and Recipe

重新思考大型语言模型的在线策略蒸馏:现象、机制和配方

Yaxuan Li, Yuxin Zuo, Bingxiang He, Jinqian Zhang, Chaojun Xiao, Cheng Qian, Tianyu Yu, Huan-ang Gao, Wenkai Yang, Zhiyuan Liu, Ning Ding

机构 * Tsinghua University(清华大学) ShanghaiTech University(上海交通大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Renmin University of China(中国人民大学)

专题命中 安全训练 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文系统研究了在线策略蒸馏的动态和机制,发现成功关键在于师生思维模式兼容及教师提供新能力,提出两种恢复失败蒸馏的策略,并指出密集奖励的表面优势背后存在代价。

Comments 30 pages, 23 figures. Code: https://github.com/thunlp/OPD

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08524 2026-04-10 cs.LG cs.AI cs.CL 67%

What Drives Representation Steering? A Mechanistic Case Study on Steering Refusal

是什么驱动了表示引导?对引导拒绝的机制性案例研究

Stephen Cheng, Sarah Wiegreffe, Dinesh Manocha

机构 * University of Maryland, College Park(马里兰大学帕克分校)

专题命中 安全训练 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究通过机制性案例分析,探讨引导向量如何通过注意力机制影响模型输出,揭示引导向量主要作用于OV电路而非QK电路,并发现引导向量可被稀疏化而不影响性能。

Comments 9 pages + appendix, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05125 2026-04-08 cs.IR cs.AI cs.CL cs.LG 67%

Offline RL for Adaptive Policy Retrieval in Prior Authorization

离线强化学习在先决授权政策适应性检索中的应用

Ruslan Sharifullin, Maxim Gorshkov, Hannah Clay

机构 * Stanford University(斯坦福大学)

专题命中 安全训练 :DPO(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出了一种基于离线强化学习的适应性政策检索方法,通过将检索过程建模为马尔可夫决策过程,提升了检索效率和准确性。

Comments 9 pages, 7 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21343 2026-04-07 cs.CL cs.AI cs.LG 67%

Self-Improving Pretraining: using post-trained models to pretrain better models

自我改进预训练:利用后训练模型来预训练更好的模型

Ellen Xiaoqing Tan, Jack Lanchantin, Shehzaad Dhuliawala, Danwei Li, Thao Nguyen, Jing Xu, Ping Yu, Ilia Kulikov, Sainbayar Sukhbaatar, Jason Weston, Xian Li, Olga Golovneva

机构 * FAIR at Meta(Meta FAIR)

专题命中 安全训练 :safety(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出一种新的预训练和中训练方法,通过利用已有的强后训练模型来重写预训练数据并判断策略模型的 rollout,从而在早期训练中引入安全、事实性、生成质量和推理能力等关键行为,提升模型整体性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22367 2026-04-06 cs.CL cs.AI cs.CY 67%

What Is The Political Content in LLMs' Pre- and Post-Training Data?

大语言模型预训练和后训练数据中的政治内容是什么?

Tanise Ceron, Dmitry Nikolaev, Dominik Stammbach, Debora Nozza

机构 * Bocconi University(博科尼大学) University of Manchester(曼彻斯特大学) Princeton University(普林斯顿大学)

专题命中 安全训练 :alignment(abstract);分类 cs.CL、cs.AI、cs.CY

AI总结 研究探讨了大语言模型训练数据中的政治倾向,发现预训练数据偏向左翼内容,且政治立场与模型行为相关,强调数据组成对模型行为的关键作用。

Comments 10 pages, under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00627 2026-04-02 cs.CR 67%

When Safe Models Merge into Danger: Exploiting Latent Vulnerabilities in LLM Fusion

当安全模型融合进入危险:在LLM融合中利用潜在漏洞

Jiaqing Li, Zhibo Zhang, Shide Zhou, Yuxi Li, Tianlong Yu, Kailong Wang

专题命中 安全训练 :alignment(abstract);safety(abstract)

AI总结 研究揭示模型融合引入的新攻击面,提出TrojanMerge框架通过约束优化问题攻击安全对齐,实验显示融合模型产生高危害响应,源模型保持安全。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29982 2026-04-01 cs.GT 67%

Performative Scenario Optimization

表现性场景优化

Quanyan Zhu, Zhengye Han

专题命中 安全训练 :safety(abstract);AI safety(abstract)

AI总结 本文提出了一种表现性场景优化框架,用于决策依赖的约束问题,通过反馈循环考虑决策对数据生成过程的影响,证明了其存在性并展示了在AI安全应用中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29232 2026-04-01 cs.CL cs.AI cs.LG 67%

Long-Document QA with Chain-of-Structured-Thought and Fine-Tuned SLMs

长文档问答与结构化思维链及微调大语言模型

Zhuowen Liang, Xiaotian Lin, Zhengxuan Zhang, Yuyu Luo, Haixun Wang, Nan Tang

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) EvenUp, USA(美国EvenUp公司)

专题命中 安全训练 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出LiteCoST框架,通过结构化思维链和微调小语言模型,实现高精度低延迟的长文档问答,采用双支柱方法提升准确性和效率。

Comments 26 pages, 17 figures, 10 tables. Accepted at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28807 2026-04-01 cs.CR 67%

SafeClaw-R: Towards Safe and Secure Multi-Agent Personal Assistants

SafeClaw-R:迈向安全且安全的多智能体个人助理

Haoyu Wang, Zibo Xiao, Yedi Zhang, Christopher M. Poskitt, Jun Sun

专题命中 安全训练 :safety(abstract);prompt injection(abstract)

AI总结 本文提出SafeClaw-R框架,通过在执行图层面强制安全不变量,提升多智能体系统在安全性和隐私保护方面的性能,实验表明其在多个领域均表现出色。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27412 2026-03-31 cs.LG cs.AI cs.CL 67%

The Geometry of Harmful Intent: Training-Free Anomaly Detection via Angular Deviation in LLM Residual Streams

有害意图的几何学:通过残差流中的角度偏差实现无训练异常检测

Isaac Llorente-Saguer

机构 * Independent Researcher(独立研究者)

专题命中 安全训练 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出LatentBiopsy方法,通过分析大语言模型残差流激活的几何特性,无需训练即可检测有害提示。该方法基于残差流激活的主成分分析和角度偏差,实现高精度的异常检测,具有低延迟和强鲁棒性。

Comments 20 pages, 10 figures, 3 tables. Training-free harmful-prompt detector via angular deviation in LLM residual streams. Evaluated on six Qwen variants (base / instruct / abliterated). Achieves AUROC over 0.937 (harmful-vs-normative) and 1.000 (harmful-vs-benign-aggressive) with no harmful training data

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.13734 2026-03-27 cs.CL cs.AI cs.LG 67%

Instruction Following by Principled Boosting Attention of Large Language Models

通过原理性提升大语言模型的注意力来实现指令遵循

Vitoria Guardieiro, Avishree Khare, Adam Stein, Eric Wong

机构 * University of Pennsylvania(宾夕法尼亚大学)

专题命中 安全训练 :safety(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出InstABoost方法,通过提升指令相关注意力来增强指令遵循,避免了其他方法的缺陷,提升了指令引导与任务相关上下文的平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25022 2026-03-27 cs.AI cs.CR cs.CY cs.LG 67%

A Public Theory of Distillation Resistance via Constraint-Coupled Reasoning Architectures

通过约束耦合推理架构的公开蒸馏阻力理论

Peng Wei, Wesley Shu

机构 * The Institute of Energetic Paradigm(能量范式研究所)

专题命中 安全训练 :alignment(abstract);分类 cs.AI、cs.CY、cs.LG

AI总结 本文提出一种理论框架,通过约束耦合推理架构减少蒸馏 asymmetry,核心观点是高阶能力与内部稳定性约束耦合时蒸馏价值降低,提供可验证的理论主张和实验假设。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12273 2026-03-16 cs.CL cs.AI cs.LG 67%

Aligning Language Models from User Interactions

从用户交互对齐语言模型

Thomas Kleine Buening, Jonas Hübotter, Barna Pásztor, Idan Shenfeld, Giorgia Ramponi, Andreas Krause

机构 * ETH Zurich(苏黎世联邦理工学院) MIT(麻省理工学院) University of Zurich(苏黎世大学)

专题命中 安全训练 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出通过自蒸馏直接从用户交互学习的方法,利用用户反馈调整模型行为,提升对齐和指令遵循能力,同时实现个性化和持续适应。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11219 2026-03-13 cs.CV 67%

Senna-2: Aligning VLM and End-to-End Driving Policy for Consistent Decision Making and Planning

Senna-2:对齐视觉语言模型与端到端驾驶策略以实现一致的决策与规划

Yuehao Song, Shaoyu Chen, Hao Gao, Yifan Zhu, Weixiang Yue, Jialv Zou, Bo Jiang, Zihao Lu, Yu Wang, Qian Zhang, Xinggang Wang

机构 * Huazhong University of Science & Technology(华中科技大学) Horizon Robotics

专题命中 安全训练 :alignment(abstract);safety(abstract)

AI总结 Senna-2通过三阶段训练范式对齐视觉语言模型与端到端驾驶策略,提升决策与规划的一致性,增强驾驶安全性和效率。

Comments 15 pages, 8 figures. Project page: https://ambitious-idiot.github.io/senna2-project

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01928 2026-03-13 cs.CV 67%

LaST-VLA: Thinking in Latent Spatio-Temporal Space for Vision-Language-Action in Autonomous Driving

LaST-VLA: 在自动驾驶的视觉-语言-动作中思考于潜在的空间-时间空间

Yuechen Luo, Fang Li, Shaoqing Xu, Yang Ji, Zehan Zhang, Bing Wang, Yuannan Shen, Jianwei Cui, Long Chen, Guang Chen, Hangjun Ye, Zhi-Xin Yang, Fuxi Wen

专题命中 安全训练 :alignment(abstract);safety(abstract)

AI总结 LaST-VLA通过潜在空间-时间推理框架,结合双特征对齐机制和渐进式SFT训练策略,提升自动驾驶中的视觉-语言-动作处理能力,实现更安全的物理基础推理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25896 2026-03-11 cs.CV 67%

LLaVAShield: Safeguarding Multimodal Multi-Turn Dialogues in Vision-Language Models

LLaVAShield: 保障视觉语言模型中的多模态多轮对话安全

Guolei Huang, Qinzhi Peng, Gan Xu, Yao Huang, Yuxuan Lu, Yongjun Shen

机构 * Southeast University(东南大学) University of California, Santa Cruz(加州大学圣克鲁兹分校) Zhejiang University of Technology(浙江工业大学) Tsinghua University(清华大学) RealAI

专题命中 安全训练 :safety(abstract);red teaming(abstract)

AI总结 LLaVAShield通过构建MMDS数据集和MMRT框架,有效提升多模态多轮对话的安全性,优于现有VLMs和内容审查工具,揭示了主流模型的安全漏洞。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03957 2026-03-05 cs.RO 67%

ArthroCut: Autonomous Policy Learning for Robotic Bone Resection in Knee Arthroplasty

ArthroCut:膝关节置换术中机器人骨切除的自主策略学习

Xu Lu, Yiling Zhang, Wenquan Cheng, Longfei Ma, Fang Chen, Hongen Liao

机构 * School of Biomedical Engineering, Tsinghua University(清华大学生物医学工程学院) School of Biomedical Engineering, Shanghai Jiao Tong University(上海交通大学生物医学工程学院) Longwood Valley MedTech

专题命中 安全训练 :alignment(abstract);safety(abstract)

AI总结 ArthroCut通过结合术前和术中数据,实现膝关节置换术中骨切除的自主策略学习,提升机器人手术的自主性和可解释性。

Comments Accepted for publication at the 2026 IEEE International Conference on Robotics and Automation (ICRA)

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.01870 2026-03-05 cs.MA cs.GT 67%

$\aleph$-IPOMDP: Mitigating Deception in a Cognitive Hierarchy with Off-Policy Counterfactual Anomaly Detection

$\aleph$-IPOMDP:通过非策略反事实异常检测缓解认知层级中的欺骗

Nitay Alon, Joseph M. Barnby, Stefan Sarkadi, Lion Schulz, Jeffrey S. Rosenschein, Peter Dayan

专题命中 安全训练 :safety(abstract);AI safety(abstract)

AI总结 $\aleph$-IPOMDP通过非策略反事实异常检测机制,缓解认知层级中的欺骗问题,提升博弈中的公平性和安全性。

Comments 28 pages, 12 figures

Journal ref Journal of Artificial Intelligence Research (JAIR), Volume 85, Article 14, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.07462 2026-03-02 cs.AI cs.CY cs.LG cs.MA econ.TH 67%

A Hormetic Approach to the Value-Loading Problem: Preventing the Paperclip Apocalypse?

一种针对价值加载问题的激素方法:防止纸夹 apocalypse?

Nathan I. N. Henry, Mangor Pedersen, Matt Williams, Jamin L. B. Martin, Liesje Donkin

专题命中 安全训练 :alignment(abstract);分类 cs.AI、cs.CY、cs.LG

AI总结 HALO通过激素分析方法解决价值加载问题,通过调节AI行为模式防止潜在的AI失控风险。

Comments 24 pages, 7 figures

Journal ref SN COMPUT. SCI. 6, 872 (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21857 2026-02-26 cs.AI cs.CL cs.LG 67%

Distill and Align Decomposition for Enhanced Claim Verification

分解与对齐:提升声明验证的Distill和Align分解

Jabez Magomere, Elena Kochkina, Samuel Mensah, Simerjot Kaur, Fernando Acero, Arturo Oncevay, Charese H. Smiley, Xiaomo Liu, Manuela Veloso

专题命中 安全训练 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出一种基于强化学习的分解与对齐方法,通过优化分解质量和验证器对齐,提升声明验证性能,达到71.75%的宏F1,优于现有方法。

Comments EACL Findings 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.06966 2026-02-26 cs.LG cs.AI cs.CY 67%

Machine Unlearning Doesn't Do What You Think: Lessons for Generative AI Policy and Research

机器去学习并不如你所想:生成式AI政策与研究的启示

A. Feder Cooper, Christopher A. Choquette-Choo, Miranda Bogen, Kevin Klyman, Matthew Jagielski, Katja Filippova, Ken Liu, Alexandra Chouldechova, Jamie Hayes, Yangsibo Huang, Eleni Triantafillou, Peter Kairouz, Nicole Elyse Mitchell, Niloofar Mireshghallah, Abigail Z. Jacobs, James Grimmelmann, Vitaly Shmatikov, Christopher De Sa, Ilia Shumailov, Andreas Terzis, Solon Barocas, Jennifer Wortman Vaughan, danah boyd, Yejin Choi, Sanmi Koyejo, Fernando Delgado, Percy Liang, Daniel E. Ho, Pamela Samuelson, Miles Brundage, David Bau, Seth Neel, Hanna Wallach, Amy B. Cyphert, Mark A. Lemley, Nicolas Papernot, Katherine Lee

机构 * The GenLaw Center(GenLaw中心) Microsoft Research(微软研究院) Stanford University(斯坦福大学) Google DeepMind(谷歌DeepMind) Center for Democracy & Technology(民主与科技中心) Princeton(普林斯顿) Google(谷歌) University of Washington(华盛顿大学) University of Michigan(密歇根大学) Cornell Tech(康奈尔科技) Cornell Law School(康奈尔法学院) Cornell University(康奈尔大学) Lighthouse Stanford Law School(斯坦福法学院) UC Berkeley(伯克利大学) Independent(独立研究者) Northeastern University(东北大学) Harvard Business School(哈佛商学院) W. Virginia University College of Law(维珍尼亚大学法学院)

专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.CY、cs.LG

AI总结 本文指出机器去学习并非通用解决方案,揭示其在生成式AI政策与研究中的局限性。

Comments NeurIPS 2025 (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20500 2026-02-25 cs.RO cs.CV 67%

Strategy-Supervised Autonomous Laparoscopic Camera Control via Event-Driven Graph Mining

基于事件驱动图挖掘的策略监督自主腹腔镜摄像机控制

Keyu Zhou, Peisen Xu, Yahao Wu, Jiming Chen, Gaofeng Li, Shunlei Li

机构 * Hangzhou Dianzi University(杭州电子科技大学) Zhejiang University(浙江大学)

专题命中 安全训练 :alignment(abstract);safety(abstract)

AI总结 本研究提出基于事件驱动图挖掘的策略监督自主腹腔镜摄像机控制方法,通过结合视觉-语言推理与闭环控制,提升手术视野稳定性与可解释性,实验表明其在减少视野偏移和图像抖动方面表现优异。

Comments Submitted to IEEE Transactions on Robotics (T-RO). 19 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04801 2026-02-05 eess.SY cs.SY 67%

SQP-Based Cable-Tension Allocation for Multi-Drone Load Transport

基于SQP的多无人机负载运输电缆张力分配

Lamberto Vazquez-Soqui, Fatima Oliva-Palomo, Diego Mercado-Ravell, Pedro Castillo

专题命中 安全训练 :alignment(abstract);safety(abstract)

AI总结 本文提出基于SQP算法的多无人机负载运输电缆张力分配方法,通过实时优化提升负载运输的安全性和能耗平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04581 2026-02-05 cs.CL cs.AI cs.DC cs.LG 67%

Trust The Typical

信任典型

Debargha Ganguly, Sreehari Sankar, Biyao Zhang, Vikash Singh, Kanan Gupta, Harshini Kavuru, Alan Luo, Weicong Chen, Warren Morningstar, Raghu Machiraju, Vipin Chaudhary

机构 * Case Western Reserve University(凯斯西储大学) University of Pittsburgh(匹兹堡大学) The Ohio State University(俄亥俄州立大学) Google Research(谷歌研究)

专题命中 安全训练 :safety(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 Trust The Typical通过将安全性视为分布外检测问题,在无需有害示例训练的情况下,实现了在多个安全基准测试中的高性能表现,显著降低误报率。

详情

展开后加载摘要…

URL PDF HTML 收藏