arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-01-06 至 2026-01-06 共收录 5 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 偏好对齐 5 篇

2512.23260 2026-01-06 cs.CL cs.AI cs.LG 90%

Interpretable Safety Alignment via SAE-Constructed Low-Rank Subspace Adaptation

通过SAE构造的低秩子空间适应实现可解释的安全对齐

Dianyun Wang, Qingsen Ma, Yuhu Shang, Zhifeng Lu, Zhenbo Xu, Lechen Ning, Huijia Wu, Zhaofeng He

机构 * Beijing University of Posts and Telecommunications(北京邮电大学)

专题命中 偏好对齐 :alignment(title,abstract);safety(title,abstract);RLHF(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 SAILS通过SAE构造低秩子空间实现安全对齐,提升安全性能并保持参数效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16202 2026-01-06 cs.AI 70%

Multi-Agent Collaborative Reward Design for Enhancing Reasoning in Reinforcement Learning

多智能体协作奖励设计以增强强化学习中的推理

Pei Yang, Ke Zhang, Ji Wang, Xiao Chen, Yuxin Tang, Eric Yang, Lynn Ai, Bill Shi

机构 * Gradient Waseda University(早稻田大学) Columbia University(哥伦比亚大学) Hong Kong Polytechnic University(香港理工大学) Rice University(莱斯大学)

专题命中 偏好对齐 :RLHF(abstract);safety(abstract);分类 cs.AI

AI总结 多智能体协作奖励模型通过分解偏好评估和引入集中化聚合器,提升强化学习中的鲁棒性和可解释性,同时提供透明的奖励建模方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.21656 2026-01-06 cs.CV cs.CL 70%

Fine-Grained Preference Optimization Improves Spatial Reasoning in VLMs

细粒度偏好优化提升视觉语言模型的空间推理能力

Yifan Shen, Yuanzhe Liu, Jingyuan Zhu, Xu Cao, Xiaofeng Zhang, Yixiao He, Wenming Ye, James Matthew Rehg, Ismini Lourentzou

专题命中 偏好对齐 :alignment(abstract);DPO(abstract);分类 cs.CL

AI总结 细粒度偏好优化方法SpatialReasoner-R1通过改进空间推理能力,在空间推理任务中取得显著性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24052 2026-01-06 cs.SD cs.AI cs.CL cs.MM 62%

AHA: Aligning Large Audio-Language Models for Reasoning Hallucinations via Counterfactual Hard Negatives

AHA: 通过反事实硬负样本对齐大音频-语言模型以缓解推理幻觉

Yanxi Chen, Wenhui Zhu, Xiwen Chen, Zhipeng Wang, Xin Li, Peijie Qiu, Hao Wang, Xuanzhao Dong, Yujian Xiong, Anderson Schneider, Yuriy Nevmyvaka, Yalin Wang

机构 * Arizona State University(亚利桑那州立大学) Clemson University(克莱姆斯大学) Washington University in St.Louis(圣路易斯华盛顿大学) Rice University(Rice 大学) Morgan Stanley(摩根大通)

专题命中 偏好对齐 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 AHA通过反事实硬负样本对齐大音频-语言模型,有效减少推理幻觉,提升时间推理能力,并在多个基准测试中取得显著成效。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12869 2026-01-06 cs.CE cs.CL 57%

ERA-IT: Aligning Semantic Models with Revealed Economic Preference for Real-Time and Explainable Patent Valuation

ERA-IT:通过揭示的经济偏好对齐语义模型以实现实时和可解释的专利估值

Yongmin Yoo, Seungwoo Kim, Jingjiang Liu

机构 * School of Computing(计算学院) Macquarie University(麦考瑞大学) School of Computer Science(计算机科学学院) University of Technology Sydney(悉尼技术大学) School of Management(管理学院) Zhejiang University(浙江大学)

专题命中 偏好对齐 :alignment(abstract);分类 cs.CL

AI总结 ERA-IT通过揭示的经济偏好对齐语义模型,实现实时且可解释的专利估值,提升预测准确性并增强决策透明度。

详情

展开后加载摘要…

URL PDF HTML 收藏