arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-08-24 至 2026-08-24 共收录 64 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 其他安全 12 篇

2608.21325 2026-08-24 cs.CL 新提交 57%

Move by Move: Measuring and Steering How LLMs Conduct Psychotherapy

逐步推进:测量与引导大语言模型开展心理治疗的方式

Afonso Baldo, Hugo Pitorro, Areti Vassilopoulos, Anabela C. Areias, Maya D'Eon, Fabíola Costa, Ricardo Rei, Nuno M. Guerreiro

机构 * Sword Health Yale University(耶鲁大学) Instituto Superior Técnico(高等技术学院)

专题命中 其他安全 :alignment(abstract);分类 cs.CL

AI总结 本研究提出基于MULTI-60清单的10种治疗动作本体,对比大语言模型与人类临床医生的心理治疗动作分布,发现模型过度使用询问、忽视心理教育,通过公开该本体可提升模型与人类治疗师的动作对齐度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19621 2026-08-24 cs.CL 版本更新 57%

Mitigating Identity Essentialism in LLM Agents with Longitudinal Life Trajectories

通过纵向生活轨迹缓解大语言模型智能体中的本质主义身份偏差

Hexi Wang, Yujia Zhou, Bangde Du, Weihang Su, Xinyuan Cao, Qingyi Pan, Qingyao Ai, Yueyue Wu, Min Zhang, Yiqun Liu

专题命中 其他安全 :alignment(abstract);分类 cs.CL

AI总结 针对现有LLM智能体存在的身份本质主义偏差导致组内反应同质化的问题,提出LifeMem纵向记忆框架,在Add Health等数据集上验证其可提升与人类数据的一致性。

Comments 23 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20929 2026-08-24 cs.CV 新提交 50%

GAP-SAM: A Global Artifact Prior for Generalizable AI-Generated Image Manipulation Localization

GAP-SAM:用于通用AI生成图像篡改定位的全局伪影先验

Haozhen Yan, Siyuan Shan, Zijian Yu, Youqi Wang, Yan Hong, Jun Lan, Jianfu Zhang

专题命中 其他安全 :alignment(abstract)

AI总结 本研究针对AI生成图像篡改定位的分布外性能问题,提出GAP-SAM方法,通过构建COCO-ControlNet对齐语义与几何,利用全局伪影标记抑制语义边界捷径,在六个数据集上平均像素F1达79.8,优于现有方法且在各类图像退化下表现最佳。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20916 2026-08-24 cs.CV 新提交 50%

Semantically Compatible Knowledge Distillation for Cross-Domain Object Detection with Vision Foundation Models

基于视觉基础模型的跨域目标检测的语义兼容知识蒸馏

Qifeng Zhang, Ting Xiang, Zeyuan Bai, Changjian Chen

机构 * National Supercomputing Center in Changsha, Hunan University(湖南大学长沙国家超级计算中心)

专题命中 其他安全 :alignment(abstract)

AI总结 该研究针对跨域目标检测中VFM的语义不兼容问题,提出SLE-T框架,通过适配DINOv2实现高效知识迁移,在DAOD基准上达到SOTA性能,且训练成本更低。

详情

展开后加载摘要…

URL PDF HTML 收藏