arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 3278 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 偏好对齐 3278 篇

1705.03597 2017-05-11 cs.AI 57%

Solving Multi-Objective MDP with Lexicographic Preference: An application to stochastic planning with multiple quantile objective

Yan Li, Zhaohan Sun

专题命中 偏好对齐 :safety(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.07207 2024-12-23 cs.LG cs.AI cs.CL 56%

MAPLE: A Framework for Active Preference Learning Guided by Large Language Models

Saaduddin Mahmud, Mason Nakamura, Shlomo Zilberstein

专题命中 偏好对齐 :分类 cs.CL、cs.AI、cs.LG;alignment(comments)

Comments AAAI 2025 AI Alignment Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.05393 2026-08-27 cs.CV 版本更新 50%

PreResQ-R1: Response-Preference Disentangled Ranking-and-Scoring Reinforcement Optimization for Robust Visual Quality Assessment

PreResQ-R1:用于鲁棒视觉质量评估的响应偏好解耦排序与评分强化优化

Zehui Feng, Weichuan Wang, Xiaohan Chen, Ting Han

机构 * Shanghai Jiao Tong University(上海交通大学) Zhejiang University(浙江大学)

专题命中 偏好对齐 :alignment(abstract)

AI总结 本文提出PreResQ-R1框架,通过解耦响应偏好的强化学习统一评分与排序目标,结合GRPO优化,在IQA和VQA基准上取得最优结果,推理轨迹更贴合人类感知。

Comments 27 pages, 16 figures, Accepted as EMNLP 2026 conference paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22780 2026-08-25 cs.CV 新提交 50%

Can We Perform Online RL for Image Editing without Editing Rewards?

我们能否在无编辑奖励的情况下进行图像编辑的在线强化学习?

Qichao Ma, Jikang Cheng, Ling Liang, Zhaofei Yu, Tiejun Huang, Renye Yan

专题命中 偏好对齐 :alignment(abstract)

AI总结 本文提出Lever-Edit框架,将文本到图像(T2I)奖励生态系统迁移至图像编辑,在无编辑奖励的情况下优化编辑策略,实验效果优于直观迁移基线且接近基于编辑奖励的微调。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19271 2026-08-21 math.GM 新提交 50%

Information Geometry (IG) Lives at Edge or Boundary of SMG (statistically meaningful geometry): - the First Edge Theorem and Applications

信息几何(IG)存在于SMG(统计意义几何)的边缘或边界:第一边缘定理及其应用

Bing Cheng, Yi-Shuai Niu, Howell Tong, Shing-Tung Yau

专题命中 偏好对齐 :alignment(abstract)

AI总结 该研究提出第一边缘定理,证明信息几何与传统统计学是统计意义几何空间的退化边界层,利用纤维丛机制解决深度学习泛化悖论等多领域问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14260 2026-08-17 eess.IV cs.MM 新提交 50%

Personalized Digital Semantic Communication for Image Transmission with Vision-Language Models

基于视觉语言模型的图像传输个性化数字语义通信

Nan Li, Li Zhou, Haijun Wang, Jun Xiong, Haitao Zhao, Jibo Wei

专题命中 偏好对齐 :alignment(abstract)

AI总结 针对现有语义通信方案忽略接收端依赖语义的问题,提出整合VLM与LDM的PDSC框架,构建容量受限的个性化语义率失真问题,实验证实其在带宽受限场景下的源语义一致性与个性化表现优于CDDM、MoS等基线。

Comments Accepted by IEEE GLOBECOM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11973 2026-08-14 cs.IR 版本更新 50%

Sci-Surf: Navigating Scientific Literature Discovery through Human Feedback and Intelligent Summarization

Sci-Surf:通过人类反馈与智能摘要实现科学文献发现

Fang Guo, Qi Zhu, Rongcan Pei, Shuqi He, Hui Chen, Yue Zhang

专题命中 偏好对齐 :alignment(abstract)

AI总结 针对现有学术发现平台支持不足的问题,提出以意图为中心的Sci-Surf系统,结合反馈驱动推荐与多模态论文消化,经评估推荐质量和消化质量有可测量提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26073 2026-07-30 cs.IR 新提交 50%

Guess Where You Go: Generative Next Point-of-Interest Recommendation in Amap

猜猜你要去哪里:高德地图中的生成式下一个兴趣点推荐

Penglong Zhai, Bowen Zheng, Jie Li, Yifang Yuan, Yue Liu, Sicong Wang, Mingyang Yin, Tingting Hu, Shuaijun Guo, Fanyi Di, Xin Li

专题命中 偏好对齐 :alignment(abstract)

AI总结 该研究提出Gwhere框架,结合SID生成与LLM生成式下一个POI推荐,经实验验证其在高德地图中可提升P-CTR和U-CTR,已部署应用且效果显著。

Comments 10 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24353 2026-07-28 cs.CV 新提交 50%

PRISM: Prompt Refinement via Image-grounded Self-rewarding Mechanism for Text-to-Image Generation

PRISM:通过基于图像的自我奖励机制进行文本到图像生成的提示优化

Guo Tang, HongJie Luo, Tianxu Wang, Ying Zhang, Hao Wang

机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) Sun Yat-sen University(中山大学) South China University of Technology(华南理工大学) Guangdong University of Technology(广东工业大学)

专题命中 偏好对齐 :alignment(abstract)

AI总结 针对文本到图像生成模型对提示制定敏感的问题,提出PRISM框架,通过基于图像的自我奖励机制,利用结构化视觉诊断和多任务监督微调等方法,提高图像质量和语义对齐,并提供可解释反馈。

Comments 18 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08274 2026-07-28 cs.MA 版本更新 50%

Toward Human-Centered Multi-Agent Systems: Integrating Cognition, Culture, Values, and Cooperation in AI Agents

迈向以人为中心的多智能体系统:在AI智能体中整合认知、文化、价值观与合作

Safia Baloch, Rahemeen Khan

专题命中 偏好对齐 :alignment(abstract)

AI总结 本文综述了从认知科学、文化对齐、价值学习到多智能体协调的研究,指出现有系统缺乏整合认知、文化、价值观和社会行为的统一框架,并提出了构建文化感知、价值对齐、认知基础与合作的多智能体系统的方向。

Comments 14 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11886 2026-07-14 cs.CV 新提交 50%

Read It Back: Pretrained MLLMs Are Zero-Shot Reward Models for Text-to-Image Generation

读回:预训练的多模态语言模型是文本到图像生成的零样本奖励模型

Runhui Huang, Qihui Zhang, Zhe Liu, Yu Gao, Jie Wu, Hengshuang Zhao

机构 * The University of Hong Kong(香港大学) ByteDance Seed(字节跳动Seed) Peking University(北京大学)

专题命中 偏好对齐 :alignment(abstract)

AI总结 研究提出SpectraReward将预训练多模态语言模型转为图像生成强化学习奖励模型,用图像条件提示对数似然作奖励,还引入Self-SpectraReward形成闭环框架。经广泛实验验证,二者能提升生成性能,表明奖励-策略对齐是关键。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09091 2026-07-13 cs.CV 新提交 50%

Beyond Time Shifts: Adapting Omni-LLM as a Reference-Free Evaluator for Generative Audio-Visual Models

超越时间偏移:将全能语言模型(Omni-LLM)适配为生成式视听模型的无参考评估器

Yijie Qian, Juncheng Wang, Chao Xu, Huihan Wang, Yuxiang Feng, Yang Liu, Baigui Sun, Yong Liu, Shujun Wang

机构 * Zhejiang University(浙江大学) The Hong Kong Polytechnic University(香港理工大学) IROOTECH TECHNOLOGY(易路泰克科技)

专题命中 偏好对齐 :alignment(abstract)

AI总结 研究针对视听生成模型跨模态同步评估难题,提出框架解决人类与自动化评估指标的矛盾。通过引入数据集、适配模型及提出优化方法,实现先进的人类偏好对齐,建立标准化基准推动评估从信号相关性到因果关系发展。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05971 2026-07-08 cs.MM cs.SD 新提交 50%

Multimodal Video-to-Music Recommendation via Semantic Retrieval and Temporal Reranking

通过语义检索和时间重排实现多模态视频到音乐推荐

Seungheon Doh, Minhee Lee, Sangmoon Lee, Ben Sangbae Chon, Juhan Nam

机构 * Graduate School of Culture Technology, KAIST(韩国釜山科学技术大学文化科技研究生院) Gaudio Lab, Inc(Gaudio实验室)

专题命中 偏好对齐 :alignment(abstract)

AI总结 提出用于视频到音乐推荐的两阶段框架VTMR,第一阶段通过全局嵌入检索语义兼容候选,第二阶段关注时间序列重排。实验显示该框架能提升推荐效果,人类偏好研究表明其在总体偏好上与商业基线相当,音乐质量优于生成基线。

Comments Accepted for publication at The Machine Learning for Audio workshop at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01721 2026-07-03 cs.RO 新提交 50%

CoRe: Combined Rewards with Vision-Language Model Feedback for Preference-Aligned Reinforcement Learning

CoRe: 结合视觉语言模型反馈的复合奖励用于偏好对齐强化学习

Hexian Ni, Tao Lu, Yinghao Cai

专题命中 偏好对齐 :alignment(abstract)

AI总结 提出CoRe框架,将奖励分解为基于任务知识的正式奖励和从观察中学习的残差奖励,利用视觉语言模型迭代优化奖励,实现无需人工的偏好对齐,在机器人操作任务中优于现有方法。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19100 2026-07-02 cs.CV 新提交 50%

AMALIA-VL: A Native European Portuguese Open-Source Vision and Language Model

AMALIA-VL: 一个原生欧洲葡萄牙语开源视觉与语言模型

Diogo Glória-Silva, João Cardeira, Manuel Letras da Luz, Afonso Simplício, Gonçalo Vinagre, Diogo Tavares, Rafael Ferreira, Inês Calvo, Inês Vieira, David Semedo, João Magalhães

机构 * NOVA School of Science and Technology(NOVA科学与技术学校) NOVA LINCS

专题命中 偏好对齐 :alignment(abstract)

AI总结 针对欧洲葡萄牙语缺乏开源多模态模型的问题,提出AMALIA-VL,通过三阶段训练和葡萄牙语中心数据混合,建立强基线并开源所有资源。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29805 2026-07-01 cs.CV 版本更新 50%

Clearer Sight, Fewer Lies: Oriented Pickup Preference Optimization for Multimodal Hallucination Mitigation

更清晰的视野,更少的谎言:面向多模态幻觉缓解的定向拾取偏好优化

Xin Zou, Haolin Deng, Yibo Yan, Shuliang Liu, Zhiwei Jin, Chen Chen, Haonan Lu, Xuming Hu

机构 * HKUST (GZ)(香港科技大学(广州)) HKUST(香港科技大学) OPPO AI Center(OPPO AI中心)

专题命中 偏好对齐 :alignment(abstract)

AI总结 提出一种证据感知的对齐目标OPPO,通过对比不同视觉证据强度下的相同忠实响应,将视觉偏好转化为有序视觉证据对齐,以缓解多模态大模型的幻觉问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29212 2026-06-30 cs.CV cs.HC 50%

MetaRanker: Human-in-the-loop Active Ranking for Metalens Image Quality

MetaRanker:用于超透镜图像质量的人机协同主动排序

Yujin Park, Haejun Chung, Ikbeom Jang

机构 * Hanyang University(翰阳大学) Hankuk University of Foreign Studies(韩国民法大学)

专题命中 偏好对齐 :alignment(abstract)

AI总结 提出MetaRanker框架,通过人机协同主动排序,以语义可解释性为指标评估超透镜图像质量,减少80%人工标注量,并实现与人类评估高度一致的排序。

Comments 12 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.02459 2026-06-30 cs.CV 50%

ReSpace: Text-Driven Autoregressive 3D Indoor Scene Synthesis and Editing

ReSpace:基于文本的自回归3D室内场景合成与编辑

Martin JJ. Bucher, Iro Armeni

机构 * Stanford University(斯坦福大学)

专题命中 偏好对齐 :alignment(abstract)

AI总结 ReSpace通过自回归方法实现文本驱动的3D室内场景合成与编辑,具备明确房间边界和资产无关部署能力,支持通过自然语言添加、移除和交换物体,实验在物体添加和完整场景合成质量上超越现有方法。

Comments 23 pages, 17 figures, 11 tables (incl. appendix)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25661 2026-06-25 cs.CV 版本更新 50%

DRM: Diffusion-based Reward Model With Step-wise Guidance

DRM: 基于扩散的奖励模型与逐步引导

Jaxon Zhang, Binxin Yang, Hubery Yin, Chen Li, Jing Lyu

机构 * Peking University(北京大学) WeChat Vision, Tencent Inc.(腾讯微信视觉实验室)

专题命中 偏好对齐 :alignment(abstract)

AI总结 提出基于扩散的奖励模型(DRM),利用预训练扩散模型作为评估骨干,通过逐步评估能力改进强化学习对齐和推理采样,提升图像生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09054 2026-06-24 cs.SD cs.MM 版本更新 50%

HAFM: Hierarchical Autoregressive Foundation Model for Music Accompaniment Generation

HAFM:用于音乐伴奏生成的分层自回归基础模型

Jian Zhu, Jianwei Cui, Yunlong Xue, Shihao Chen, Yubang Zhang, Cheng Luo, Jun Sun

机构 * Zhejiang Lab(浙江实验室) University of Science and Technology of China(中国科学技术大学) Zhejiang International Studies University(浙江国际 Studies 大学)

专题命中 偏好对齐 :alignment(abstract)

AI总结 提出HAFM分层自回归基础模型,通过双速率分词和三阶段级联生成框架,在MUSDB18上FAD达1.71,主观偏好率51.5%,优于基线。

Comments This paper is submitted to the to National Conference on Man-Machine Speech Communication (NCMMSC, 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21993 2026-06-23 cs.SE cs.CV 新提交 50%

From Driving Videos to Simulatable Scenarios

从驾驶视频到可模拟场景

Alexandre Levy, Ernest Valveny Llobet, Antonio Manuel López

机构 * Dept. Computer Science, Universitat Autònoma de Barcelona (UAB)(巴塞罗那自治大学计算机科学系) Computer Vision Center (CVC), UAB(UAB计算机视觉中心)

专题命中 偏好对齐 :safety(abstract)

AI总结 提出D-V2S框架,通过视觉语言模型和大语言模型从驾驶视频自动生成可模拟场景,实现90%语义元素保留和75%偏好率。

Comments 8 pages, 11 figures and Accepted for publication at the IEEE International Conference on Intelligent Transportation Systems (ITSC), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01624 2026-06-23 cs.CV 版本更新 50%

PISCES: Annotation-free Text-to-Video Post-Training via Optimal Transport-Aligned Rewards

PISCES: 基于最优传输对齐奖励的无标注文本到视频后训练

Minh-Quan Le, Gaurav Mittal, Cheng Zhao, David Gu, Dimitris Samaras, Mei Chen

机构 * Microsoft(微软) Stony Brook University(石溪大学)

专题命中 偏好对齐 :alignment(abstract)

AI总结 提出PISCES算法,通过双重最优传输对齐奖励模块,无需人工标注即可提升文本生成视频的质量和语义对齐,在VBench上超越现有方法。

Comments Accepted to ICML 2026. Project page and code: https://roar-ai.github.io/pisces/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14252 2026-06-15 cs.RO 新提交 50%

Optimality-Preserving Decomposition for Scalable QAOA in Natural-Language-Guided Multi-Drone Assignment

面向自然语言引导的多无人机分配中可扩展QAOA的最优性保持分解

Junyeop Bang, Byongho Lee, Dohyun An, Hwangnam Kim

机构 * Korea University(高丽大学)

专题命中 偏好对齐 :DPO(abstract)

AI总结 提出端到端框架,集成微调大语言模型与量子-经典后端,通过约束保持图分割和动态规划合并,实现自然语言引导下多无人机任务分配的可扩展量子优化。

Comments 10 pages, 2 figures, 3 tables, preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26760 2026-06-15 cs.IR 版本更新 50%

Factorized Latent Reasoning for LLM-based Recommendation

基于分解潜在推理的LLM推荐方法

Tianqi Gao, Chengkai Huang, Zihan Wang, Cao Liu, Ke Zeng, Lina Yao

专题命中 偏好对齐 :alignment(abstract)

AI总结 针对现有潜在推理方法用单向量表示用户意图难以捕捉多面偏好的问题,提出分解潜在推理框架,通过多因子注意力模块解耦偏好因子,结合正则化与强化学习提升推荐性能与可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06826 2026-06-08 cs.SE 新提交 50%

SkelDPO: A Skeleton-Guided Direct Preference Optimization Framework for Efficient Code Generation

SkelDPO: 一种骨架引导的直接偏好优化框架用于高效代码生成

Yu Yu, Chen Lyu

专题命中 偏好对齐 :alignment(abstract)

AI总结 提出SkelDPO框架,通过骨架引导的偏好优化,在代码生成中同时优化语义正确性和执行效率,相比现有方法在Pass@1、Beyond@1和Effi@1上提升3-7%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19995 2026-06-03 cs.CV 50%

CREward: A Type-Specific Creativity Reward Model

CREward:一种类型特定的创造力奖励模型

Jiyeon Han, Ali Mahdavi-Amiri, Hao Zhang, Haedong Jeong

机构 * Simon Fraser University(西蒙弗雷泽大学) Sogang University(首尔大学)

专题命中 偏好对齐 :alignment(abstract)

AI总结 提出首个类型特定的创造力奖励模型CREward,通过几何、材质和纹理三个轴评估创造力,并应用于创造力评估、可解释创造力及创意样本获取。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01036 2026-06-02 cs.RO 50%

Position: Good Embodied Reward Models Need Bad Behavior Data

立场:好的具身奖励模型需要不良行为数据

Ran Tian, Yilin Wu, Andrea Bajcsy

机构 * Ran Tian, Yilin Wu, Andrea Bajcsy

专题命中 偏好对齐 :alignment(abstract)

AI总结 本文主张为获得可靠的具身奖励模型,社区必须投资于“不良”机器人数据(失败、次优、易错甚至危险行为),并通过实验证明即使少量真实不良数据也能改善与人类偏好的一致性。

Comments This position paper has been accepted by the ICML 2026 position track as a spotlight paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25719 2026-06-02 eess.AS 50%

Step-Audio-R1.5 Technical Report

Step-Audio-R1.5 技术报告

Yuxin Zhang, Xiangyu Tony Zhang, Daijiao Liu, Fei Tian, Yayue Deng, Jun Chen, Qingjian Lin, Haoyang Zhang, Yuxin Li, Jinglan Gong, Yechang Huang, Liang Zhao, Chengyuan Yao, Hexin Liu, Eng Siong Chng, Xuerui Yang, Gang Yu, Xiangyu Zhang, Daxin Jiang

专题命中 偏好对齐 :RLHF(abstract)

AI总结 本文提出 Step-Audio-R1.5,通过从强化学习验证奖励转向基于人类反馈的强化学习,解决了音频大语言模型在客观基准上表现优异但牺牲真实对话自然度的问题,实现了分析推理与沉浸式交互体验的平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28175 2026-06-01 cs.IR 50%

Mixture-of-Experts Knowledge Graph Retrieval-Augmented Generation for Multi-Agent LLM-based Recommendation

基于混合专家知识图谱检索增强生成的多智能体LLM推荐系统

Shijie Wang, Chengyi Liu, Yujuan Ding, Shanru Lin, See-Kiong Ng, Xu Xin, Wenqi Fan

专题命中 偏好对齐 :alignment(abstract)

AI总结 提出MixRAGRec框架,通过混合专家检索、知识偏好对齐和对比学习增强推荐,解决KG-RAG中检索粒度单一、结构信息丢失和端到端学习困难问题。

Comments Accepted by KDD 2026 Research Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.21151 2026-05-29 cs.IR 50%

VOGUE: A Multimodal Dataset for Conversational Recommendation in Fashion

VOGUE:面向时尚领域对话式推荐的多模态数据集

David Guo, Minqi Sun, Yilun Jiang, Jiazhou Liang, Scott Sanner

专题命中 偏好对齐 :alignment(abstract)

AI总结 为弥补多模态对话推荐数据集的不足,构建了包含60个人类对话、2100个细粒度标注话语的VOGUE数据集,支持视觉和上下文推理评估,并揭示了多模态大语言模型在偏好推断上的系统性分布误差。

详情

展开后加载摘要…

URL PDF HTML 收藏