arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-02-27 至 2026-02-27 共收录 3 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 幻觉与事实性 3 篇

2602.22814 2026-02-27 cs.AI cs.HC 57%

When Should an AI Act? A Human-Centered Model of Scene, Context, and Behavior for Agentic AI Design

AI何时行动?面向智能体AI设计的场景、情境与行为的人本模型

Soyoung Jung, Daehoo Yoon, Sung Gyu Koh, Young Hwan Kim, Yehan Ahn, Sung Park

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.AI

AI总结 本文提出了一种人本模型,用于设计具有情境敏感性和判断力的智能体AI系统,通过整合场景、情境和人类行为因素,指导智能体的干预行为。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23005 2026-02-27 cs.SE 50%

Managing Uncertainty in LLM-based Multi-Agent System Operation

在基于大语言模型的多智能体系统操作中管理不确定性

Man Zhang, Tao Yue, Yihua He

专题命中 幻觉与事实性 :safety(abstract)

AI总结 本文提出了一种基于生命周期的不确定性管理框架,用于提升基于大语言模型的多智能体系统在安全关键领域的可靠性和可诊断性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22727 2026-02-27 cs.CV 50%

HulluEdit: Single-Pass Evidence-Consistent Subspace Editing for Mitigating Hallucinations in Large Vision-Language Models

HulluEdit: 单次通过证据一致子空间编辑用于缓解大视觉-语言模型中的幻觉

Yangguang Lin, Quan Fang, Yufei Li, Jiachen Sun, Junyu Gao, Jitao Sang

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Beijing Jiaotong University(北京交通大学)

专题命中 幻觉与事实性 :trustworthy(abstract)

AI总结 HulluEdit通过单次通过的正交子空间编辑方法,有效缓解大视觉-语言模型中的幻觉问题,实现了最先进的幻觉减少效果。

Comments accepted at CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏