arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2025-12-15 至 2025-12-15 共收录 3 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 偏好对齐 3 篇

2512.04752 2025-12-15 cs.LG 79%

RLHFSpec: Breaking the Efficiency Bottleneck in RLHF Training via Adaptive Drafting

RLHFSpec: 通过自适应草稿打破RLHF训练的效率瓶颈

Siqi Wang, Hailong Yang, Junjie Zhu, Xuezhu Wang, Yufan Xu, Depei Qian

专题命中 偏好对齐 :RLHF(title,abstract);分类 cs.LG

AI总结 RLHFSpec通过自适应草稿策略和高效样本再分配,提升RLHF训练效率,缓解生成瓶颈,提高整体性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.06682 2025-12-15 cs.CL cs.AI 62%

Textual Self-attention Network: Test-Time Preference Optimization through Textual Gradient-based Attention

文本自注意力网络:通过基于文本的梯度注意力进行测试时偏好优化

Shibing Mo, Haoyang Ruan, Kai Wu, Jing Liu

专题命中 偏好对齐 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 本文提出TSAN,一种无需参数更新的测试时偏好优化方法,通过文本梯度空间实现多候选响应的系统分析与综合,提升输出质量。

Comments AAAI2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11755 2025-12-15 cs.CL 57%

SUMFORU: An LLM-Based Review Summarization Framework for Personalized Purchase Decision Support

SUMFORU: 一种基于LLM的个性化购买决策支持的评论摘要框架

Yuming Feng, Xinrui Jiang

专题命中 偏好对齐 :alignment(abstract);分类 cs.CL

AI总结 SUMFORU通过可调节的多元对齐方法,实现个性化购买决策支持,结合高质量数据管道和两阶段对齐流程,提升摘要的一致性、基础性和偏好对齐性能。

Comments Code available at https://github.com/Harry20030331/SumForU

详情

展开后加载摘要…

URL PDF HTML 收藏