arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 3278 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 偏好对齐 3278 篇

2603.14916 2026-03-17 cs.CV cs.MM 50%

EditHF-1M: A Million-Scale Rich Human Preference Feedback for Image Editing

EditHF-1M: 一个百万级的丰富人类偏好反馈用于图像编辑

Zitong Xu, Huiyu Duan, Zhongpeng Ji, Xinyun Zhang, Yutao Liu, Xiongkuo Min, Ke Gu, Jian Zhang, Shusong Xu, Jinwei Chen, Bo Li, Guangtao Zhai

机构 * Shanghai Jiao Tong University(上海交通大学) Vivo Mobile Communication Co., Ltd(vivo移动通信有限公司) University of Electronic and Science Technology of China(电子科技大学) Ocean University of China(海洋大学) Beijing University of Technology(北京理工大学)

专题命中 偏好对齐 :alignment(abstract)

AI总结 本文提出EditHF-1M百万级图像编辑数据集及基于其的EditHF评估模型和EditHF-Reward奖励模型,通过强化学习优化文本引导图像编辑模型,实验表明其在对齐人类偏好和泛化能力方面表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15668 2026-03-17 cs.SD 50%

EmotionThinker: Prosody-Aware Reinforcement Learning for Explainable Speech Emotion Reasoning

EmotionThinker: 基于语调感知的强化学习用于可解释的语音情绪推理

Dingdong Wang, Shujie Liu, Tianhua Zhang, Youjun Chen, Jinyu Li, Helen Meng

专题命中 偏好对齐 :alignment(abstract)

AI总结 本文提出EmotionThinker,通过强化学习将语音情绪识别转化为深度推理问题,利用细粒度声学线索生成可解释的情绪预测,改进了语音大语言模型的语调感知能力。

Comments ICLR 2026 (Oral). Project page: https://github.com/dingdongwang/EmotionThinker

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12247 2026-03-13 cs.CV 50%

Trust Your Critic: Robust Reward Modeling and Reinforcement Learning for Faithful Image Editing and Generation

相信你的批评者:用于忠实图像编辑和生成的鲁棒奖励建模与强化学习

Xiangyu Zhao, Peiyuan Zhang, Junming Lin, Tianhao Liang, Yuchen Duan, Shengyuan Ding, Changyao Tian, Yuhang Zang, Junchi Yan, Xue Yang

机构 * Shanghai Jiao Tong University(上海交通大学) Wuhan University(武汉大学) BUPT(北京邮电大学) CUHK(香港中文大学) Fudan University(复旦大学) Shanghai AI Laboratory(上海人工智能实验室)

专题命中 偏好对齐 :alignment(abstract)

AI总结 本文提出FIRM框架,通过定制数据集和鲁棒奖励模型,提升图像编辑和生成的忠实性与指令遵循,采用'基础与奖励'策略平衡一致性与质量,实现性能突破。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11494 2026-03-13 cs.DB 50%

PRMB: Benchmarking Reward Models in Long-Horizon CBT-based Counseling Dialogue

PRMB:基于长期horizon认知行为疗法对话的奖励模型基准测试

Yougen Zhou, Qin Chen, Ningning Zhou, Jie Zhou, Liang He

专题命中 偏好对齐 :alignment(abstract)

AI总结 PRMB提出了一种用于评估奖励模型在多会话CBT咨询中长期效果的基准,揭示了现有方法的不足并展示了生成奖励模型的潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08853 2026-03-11 econ.GN q-fin.EC 50%

LLM-Agent Interactions on Markets with Information Asymmetries

在信息不对称市场中的人工智能代理互动

Alexander Erlei, Lukas Meub

专题命中 偏好对齐 :alignment(abstract)

AI总结 本文研究了在信息不对称市场中,人工智能代理的行为,发现社会偏好协调对市场效率至关重要。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06243 2026-03-09 cs.IR 50%

MLLMRec-R1: Incentivizing Reasoning Capability in Large Language Models for Multimodal Sequential Recommendation

MLLMRec-R1: 通过大型语言模型增强多模态序列推荐的推理能力

Yu Wang, Yonghui Yang, Le Wu, Jiancan Wu, Hefei Xu, Hui Lin

专题命中 偏好对齐 :alignment(abstract)

AI总结 MLLMRec-R1通过离线文本化视觉信号和混合粒度数据增强策略,提升多模态序列推荐中基于GRPO的推理效率与稳定性。

Comments 14 pages, 10figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.02464 2026-03-06 cs.CV 50%

SAMPO-Path: Segmentation Intent-Aligned Preference Optimization for Pathology Foundation Model Segmentation

SAMPO-Path: 分段意图对齐的偏好优化用于病理基础模型分段

Yonghuang Wu, Wenwen Zeng, Xuan Xie, Chengqian Zhao, Guoqing Wu, Jinhua Yu

机构 * School of Biomedical Engineering and Technological Innovation, Fudan university, Shanghai, China.(生物医学工程与技术创新学院,复旦大学,上海,中国)

专题命中 偏好对齐 :DPO(abstract)

AI总结 SAMPO-Path通过偏好优化框架提升病理图像分割的准确性和临床意图一致性。

Comments 15 pages, 9 tables, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16434 2026-02-27 cs.RO 50%

From Prompts to Printable Models: Support-Effective 3D Generation via Offset Direct Preference Optimization

从提示到可打印模型:通过偏移直接偏好优化实现支持有效的3D生成

Chenming Wu, Xiaofan Li, Chengkai Dai

机构 * Axiswise Ltd.(Axiswise有限公司) Centre for Perceptual and Interactive Intelligence(感知与交互智能中心)

专题命中 偏好对齐 :DPO(abstract)

AI总结 SEG通过偏移直接偏好优化实现支持有效的3D生成,显著减少支撑材料使用并提升打印可制造性。

Comments Accepted by IEEE Robotics and Automation Letters 2026, preprint version by authors

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20800 2026-02-26 cs.IR 50%

Mitigating Preference Leakage via Strict Estimator Separation for Normative Generative Ranking

通过严格估计分离缓解偏好泄漏以规范生成排序

Dalia Nahhas, Xiaohao Cai, Imran Razzak, Shoaib Jameel

专题命中 偏好对齐 :alignment(abstract)

AI总结 本文提出通过严格分离监督与评估模型,缓解偏好泄漏问题,提升生成排序的可信度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.23479 2026-02-24 cs.CV 50%

MergeMix: A Unified Augmentation Paradigm for Visual and Multi-Modal Understanding

MergeMix:一种用于视觉和多模态理解的统一增强范式

Xin Jin, Siyuan Li, Siyong Jian, Kai Yu, Huan Wang

机构 * Westlake University(西拉克大学) Zhejiang University(浙江大学) College of Computer Science and Technology(计算机科学与技术学院)

专题命中 偏好对齐 :alignment(abstract)

AI总结 MergeMix通过高效的令牌合并Mixup增强方法,平衡了SFT和RL的优劣,提升多模态大语言模型的分类准确率和对齐能力。

Comments ICLR 2026, Web link: https://jinxins.github.io/MergeMix_Web/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11124 2026-02-12 cs.CV 50%

PhyCritic: Multimodal Critic Models for Physical AI

PhyCritic:面向物理AI的多模态批评模型

Tianyi Xiong, Shihao Wang, Guilin Liu, Yi Dong, Ming Li, Heng Huang, Jan Kautz, Zhiding Yu

专题命中 偏好对齐 :alignment(abstract)

AI总结 PhyCritic通过双阶段RLVR流程优化,提升物理AI任务中的感知和推理能力,实现对物理任务的高效评估和改进。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10869 2026-02-12 cs.CR 50%

Agentic Knowledge Distillation: Autonomous Training of Small Language Models for SMS Threat Detection

代理知识蒸馏:自主训练小型语言模型用于短信威胁检测

Adel ElZemity, Joshua Sylvester, Budi Arief, Rogério De Lemos

专题命中 偏好对齐 :DPO(abstract)

AI总结 本研究提出代理知识蒸馏方法,通过自主训练小型语言模型实现高效的短信威胁检测,实验显示教师LLM的选择对性能影响显著。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10418 2026-02-12 cs.CR cs.SE 50%

SecCodePRM: A Process Reward Model for Code Security

SecCodePRM: 一种用于代码安全的过程奖励模型

Weichen Yu, Ravi Mangal, Yinyi Luo, Kai Hu, Jingxuan He, Corina S. Pasareanu, Matt Fredrikson

专题命中 偏好对齐 :safety(abstract)

AI总结 SecCodePRM通过一种面向安全的过程奖励模型,提升代码安全性和检测效率,适用于完整代码漏洞检测、部分代码漏洞检测和安全代码生成。

Comments 20 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09662 2026-02-11 cs.CV 50%

TreeCUA: Efficiently Scaling GUI Automation with Tree-Structured Verifiable Evolution

TreeCUA: 通过树结构可验证进化高效扩展GUI自动化

Deyang Jiang, Jing Huang, Xuanle Zhao, Lei Chen, Liming Zheng, Fanfan Liu, Haibo Qiu, Peng Shi, Zhixiong Zeng

专题命中 偏好对齐 :DPO(abstract)

AI总结 TreeCUA通过树结构可验证进化高效扩展GUI自动化,提升GUI规划能力。

Comments 14 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09411 2026-02-11 cs.CV 50%

K-Sort Eval: Efficient Preference Evaluation for Visual Generation via Corrected VLM-as-a-Judge

K-Sort Eval: 通过校正VLM作为评判者实现视觉生成的高效偏好评估

Zhikai Li, Jiatong Li, Xuewen Liu, Wangbo Zhao, Pan Du, Kaicheng Zhou, Qingyi Gu, Yang You, Zhen Dong, Kurt Keutzer

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) University of California, Berkeley(加州大学伯克利分校) University of California, Santa Barbara(加州大学圣巴巴拉分校) National University of Singapore(新加坡国立大学) Nanyang Technological University(南洋理工大学)

专题命中 偏好对齐 :alignment(abstract)

AI总结 K-Sort Eval通过后验校正和动态匹配策略,实现高效可靠的视觉生成模型偏好评估。

Comments ICLR 2026. Code is available at: https://github.com/zkkli/K-Sort-Eval

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.13885 2026-02-10 cs.IR 50%

Retrieval-GRPO: A Multi-Objective Reinforcement Learning Framework for Dense Retrieval in Taobao Search

检索-GRPO:面向淘宝搜索密集检索的多目标强化学习框架

Xingxian Liu, Dongshuai Li, Jiahui Wan, Tao Wen, Gui Ling, Yuliang Yan, Fuyu Lv, Dan Ou, Haihong Tang, Bo Zheng

专题命中 偏好对齐 :alignment(abstract)

AI总结 Retrieval-GRPO通过多目标强化学习框架解决密集检索中的硬负样本依赖和跷跷板效应问题,提升复杂长尾查询的语义泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.08127 2026-02-10 cs.CV 50%

TIPO: Text to Image with Text Presampling for Prompt Optimization

TIPO: 文本到图像的文本预采样用于提示优化

Shih-Ying Yeh, Yi Li, Sang-Hyun Park, Giyeong Oh, Xuehai Wang, Min Song, Youngjae Yu, Shang-Hong Lai

专题命中 偏好对齐 :alignment(abstract)

AI总结 TIPO通过文本预采样优化提示,提升文本到图像生成的视觉质量和人类偏好度。

Comments 50 pages, 28 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06714 2026-02-09 cs.HC 50%

PrefIx: Understand and Adapt to User Preference in Human-Agent Interaction

PrefIx: 在人机交互中理解并适应用户偏好

Jialin Li, Zhenhao Chen, Hanjun Luo, Hanan Salam

专题命中 偏好对齐 :alignment(abstract)

AI总结 PrefIx通过交互作为工具范式,评估智能体在人机交互中的偏好适应能力,提升用户体验和偏好对齐度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00744 2026-02-09 cs.SD 50%

ACE-Step 1.5: Pushing the Boundaries of Open-Source Music Generation

ACE-Step 1.5:推动开源音乐生成的边界

Junmin Gong, Yulin Song, Wenxiao Zhao, Sen Wang, Shengyuan Xu, Jing Guo, Xuerui Yang

机构 * ACE Studio(ACE工作室) Step Fun

专题命中 偏好对齐 :alignment(abstract)

AI总结 ACE-Step 1.5通过高效开源模型实现商业级音乐生成,结合内在强化学习与混合架构,支持多语言创作与风格控制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04526 2026-02-05 econ.TH 50%

Choice via AI

通过代理人工智能的选择

Christopher Kops, Elias Tsakas

专题命中 偏好对齐 :alignment(abstract)

AI总结 本文通过代理人工智能模型研究选择行为,提出双重单调性与幂等性属性以确保推荐的合理性和一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21740 2026-01-30 cs.MM cs.SD 50%

MIDI-LLaMA: An Instruction-Following Multimodal LLM for Symbolic Music Understanding

MIDI-LLaMA:一种用于符号音乐理解的指令遵循多模态大语言模型

Meng Yang, Jon McCormack, Maria Teresa Llano, Wanchao Su, Chao Lei

机构 * SensiLab, Monash University, Australia(Monash大学) University of Sussex, Brighton, United Kingdom(Sussex大学) School of Computing and Information Systems, The University of Melbourne, Australia(墨尔本大学计算机与信息系统学院)

专题命中 偏好对齐 :alignment(abstract)

AI总结 MIDI-LLaMA通过结合MusicBERT和Llama-3-8B,实现了对符号音乐的指令遵循理解,显著提升了音乐描述和语义对齐能力。

Comments Accepted for publication at International Conference on Acoustics, Speech, and Signal Processing (ICASSP) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19856 2026-01-28 cs.RO 50%

Estimating Trust in Human-Robot Collaboration through Behavioral Indicators and Explainability

通过行为指标和可解释性估计人机协作中的信任

Giulio Campagna, Marta Lagomarsino, Marta Lorenzini, Dimitrios Chrysostomou, Matthias Rehm, Arash Ajoudani

机构 * Human-Robot Interaction Lab., Technical Faculty of IT and Design, Aalborg University, Denmark(人机交互实验室,信息技术与设计技术学院,阿alborg大学,丹麦) Human-Robot Interfaces and Interaction Lab., Istituto Italiano di Tecnologia (IIT), Italy(人机界面与交互实验室,意大利理工学院(IIT)) Smart Production Lab., Faculty of Engineering and Natural Sciences, Aalborg University, Denmark(智能生产实验室,工程与自然科学学院,阿alborg大学,丹麦)

专题命中 偏好对齐 :safety(abstract)

AI总结 本研究提出了一种数据驱动框架,通过行为指标和可解释性评估人机协作中的信任,实验表明机器学习模型在预测信任水平方面具有高准确率。

Journal ref IEEE Robotics and Automation Letters (Volume: 10, Issue: 10, October 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14727 2026-01-23 stat.ME 50%

Recent advances in the Bradley--Terry Model: theory, algorithms, and applications

布莱德利-蒂尔模型近期进展:理论、算法与应用

Shuxing Fang, Ruijian Han, Yuanhang Luo, Yiming Xu

专题命中 偏好对齐 :alignment(abstract)

AI总结 本文综述了布莱德利-蒂尔模型的最新理论、算法及应用,探讨了大规模场景下的统计推断和计算方法,并指出了未来研究的方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17915 2026-01-23 cs.MA 50%

DISPATCH -- Decentralized Informed Spatial Planning and Assignment of Tasks for Cooperative Heterogeneous Agents

DISPATCH -- 分布式知情空间规划与任务分配以实现协作异构代理

Yao Liu, Sampad Mohanty, Elizabeth Ondula, Bhaskar Krishnamachari

专题命中 偏好对齐 :alignment(abstract)

AI总结 DISPATCH提出两种算法,通过整合公平性和效率,在分布式环境下实现异构代理任务分配的公平与效率平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13629 2026-01-21 eess.AS eess.SP 50%

S$^2$Voice: Style-Aware Autoregressive Modeling with Enhanced Conditioning for Singing Style Conversion

S$^2$Voice: 基于增强条件的风格感知自回归建模用于歌唱风格转换

Ziqian Wang, Xianjun Xia, Chuanzeng Huang, Lei Xie

专题命中 偏好对齐 :DPO(abstract)

AI总结 S$^2$Voice通过增强条件和自回归建模提升歌唱风格转换的风格控制和鲁棒性,实现更自然的音色相似性和更高的转换性能。

Comments accepted to ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13505 2026-01-21 cs.IR 50%

Integrating Vision-Centric Text Understanding for Conversational Recommender Systems

集成视觉导向的文本理解用于对话推荐系统

Wei Yuan, Shutong Qiao, Tong Chen, Quoc Viet Hung Nguyen, Zi Huang, Hongzhi Yin

专题命中 偏好对齐 :alignment(abstract)

AI总结 STARCRS通过集成视觉导向的文本理解和大语言模型文本路径,提升对话推荐系统的偏好建模和响应生成能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.15012 2026-01-14 cs.RO 50%

Learning Contextually-Adaptive Rewards via Calibrated Features

通过校准特征学习上下文自适应奖励

Alexandra Forsey-Smerek, Julie Shah, Andreea Bobu

机构 * Massachusetts Institute of Technology(麻省理工学院)

专题命中 偏好对齐 :safety(abstract)

AI总结 本文提出通过校准特征显式建模上下文相关的特征显著性,以提高奖励学习的样本效率和适应性。

Comments Proceedings of the 21st ACM/IEEE International Conference on Human-Robot Interaction (HRI '26), March 16 - 19, 2026, Edinburgh, Scotland, UK

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21541 2026-01-12 cs.CV 50%

Video Generation Models Are Good Latent Reward Models

视频生成模型是良好的潜在奖励模型

Xiaoyue Mi, Wenqing Yu, Jiesong Lian, Shibo Jie, Ruizhe Zhong, Zijun Liu, Guozhen Zhang, Zixiang Zhou, Zhiyong Xu, Yuan Zhou, Qinglin Lu, Fan Tang

机构 * University of Chinese Academy of Sciences(中国科学院大学) Tencent Hunyuan(腾讯文元) Huazhong University of Science and Technology(华中科技大学) Peking University(北京大学) Shanghai Jiao Tong University(上海交通大学) Tsinghua University(清华大学) Nanjing University(南京大学)

专题命中 偏好对齐 :alignment(abstract)

AI总结 本文提出PRFL框架,利用预训练视频生成模型在噪声潜在空间中进行奖励建模,实现高效去噪和降低训练成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04656 2026-01-09 cs.SD 50%

FlexiVoice: Enabling Flexible Style Control in Zero-Shot TTS with Natural Language Instructions

FlexiVoice: 通过自然语言指令实现零样本语音合成的灵活风格控制

Dekun Chen, Xueyao Zhang, Yuancheng Wang, Kenan Dai, Li Ma, Zhizheng Wu

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Huawei Technologies Co., Ltd(华为技术有限公司)

专题命中 偏好对齐 :DPO(abstract)

AI总结 FlexiVoice通过自然语言指令实现零样本语音合成的灵活风格控制,结合LLM核心和PPT方案,实现风格与音色的精准解耦与可控。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03468 2026-01-08 cs.CV 50%

Understanding Reward Hacking in Text-to-Image Reinforcement Learning

理解文本到图像强化学习中的奖励黑客行为

Yunqi Hong, Kuei-Chun Kao, Hengguang Zhou, Cho-Jui Hsieh

机构 * Department of Computer Science, University of California, Los Angeles(计算机科学系,加州大学洛杉矶分校)

专题命中 偏好对齐 :alignment(abstract)

AI总结 本文提出了一种轻量的伪影奖励模型,用于缓解文本到图像强化学习中的奖励黑客问题,通过提高图像真实性和减少低质量生成。

详情

展开后加载摘要…

URL PDF HTML 收藏