arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 3278 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 偏好对齐 3278 篇

2503.15191 2025-03-20 cs.IR 50%

Optimizing Retrieval Strategies for Financial Question Answering Documents in Retrieval-Augmented Generation Systems

Sejong Kim, Hyunseo Song, Hyunwoo Seo, Hyunjun Kim

专题命中 偏好对齐 :DPO(abstract)

Comments 15 pages, 3 figures, 11 tables. Accepted at ICLR 2025 Workshop on Advances in Financial AI. Code available at https://github.com/seohyunwoo-0407/GAR

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.08619 2025-03-12 cs.CV 50%

LightGen: Efficient Image Generation through Knowledge Distillation and Direct Preference Optimization

Xianfeng Wu, Yajing Bai, Haoze Zheng, Harold Haodong Chen, Yexin Liu, Zihao Wang, Xuran Ma, Wen-Jie Shu, Xianzu Wu, Harry Yang, Ser-Nam Lim

机构 * The Hong Kong University of Science and Technology(香港科技大学) Everlyn AI University of Central Florida(中佛罗里达大学)

专题命中 偏好对齐 :DPO(abstract)

Comments Code: https://github.com/XianfengWu01/LightGen

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.07703 2025-03-12 cs.CV 50%

Seedream 2.0: A Native Chinese-English Bilingual Image Generation Foundation Model

Lixue Gong, Xiaoxia Hou, Fanshi Li, Liang Li, Xiaochen Lian, Fei Liu, Liyang Liu, Wei Liu, Wei Lu, Yichun Shi, Shiqi Sun, Yu Tian, Zhi Tian, Peng Wang, Xun Wang, Ye Wang, Guofeng Wu, Jie Wu, Xin Xia, Xuefeng Xiao, Linjie Yang, Zhonghua Zhai, Xinyu Zhang, Qi Zhang, Yuwei Zhang, Shijia Zhao, Jianchao Yang, Weilin Huang

机构 * ByteDance(字节跳动)

专题命中 偏好对齐 :RLHF(abstract)

Comments Official Page: https://team.doubao.com/tech/seedream

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.09243 2025-02-07 cs.IR 50%

SPRec: Self-Play to Debias LLM-based Recommendation

Chongming Gao, Ruijun Chen, Shuai Yuan, Kexin Huang, Yuanqing Yu, Xiangnan He

专题命中 偏好对齐 :DPO(abstract)

Comments Accepted by WWW 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.18506 2025-01-31 cs.HC cs.ET cs.SE 50%

Design and Validation of Learning Aware HMI For Learning-Enabled Increasingly Autonomous Systems

Parth Ganeriwala, Michael Matessa, Siddhartha Bhattacharyya, Randolph M. Jones, Jennifer Davis, Parneet Kaur, Simone Fulvio Rollini, Natasha Neogi

专题命中 偏好对齐 :safety(abstract)

Comments Accepted for presentation at SysCon 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.05411 2025-01-24 cs.IR cs.HC 50%

Filtering Discomforting Recommendations with Large Language Models

Jiahao Liu, Yiyang Shao, Peng Zhang, Dongsheng Li, Hansu Gu, Chao Chen, Longzhi Du, Tun Lu, Ning Gu

专题命中 偏好对齐 :alignment(abstract)

Comments Accepted by WWW 2025, 16 pages, full version

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.06761 2025-01-14 cs.CV 50%

VidChain: Chain-of-Tasks with Metric-based Direct Preference Optimization for Dense Video Captioning

Ji Soo Lee, Jongha Kim, Jeehye Na, Jinyoung Park, Hyunwoo J. Kim

专题命中 偏好对齐 :DPO(abstract)

Comments AAAI 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.05543 2024-12-10 cs.IR 50%

ULMRec: User-centric Large Language Model for Sequential Recommendation

Minglai Shao, Hua Huang, Qiyao Peng, Hongtao Liu

专题命中 偏好对齐 :alignment(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.17535 2024-11-27 cs.CV 50%

IMPROVE: Improving Medical Plausibility without Reliance on HumanValidation -- An Enhanced Prototype-Guided Diffusion Framework

Anurag Shandilya, Swapnil Bhat, Akshat Gautam, Subhash Yadav, Siddharth Bhatt, Deval Mehta, Kshitij Jadhav

专题命中 偏好对齐 :RLHF(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.11909 2024-11-26 cs.CV 50%

SymDPO: Boosting In-Context Learning of Large Multimodal Models with Symbol Demonstration Direct Preference Optimization

Hongrui Jia, Chaoya Jiang, Haiyang Xu, Wei Ye, Mengfan Dong, Ming Yan, Ji Zhang, Fei Huang, Shikun Zhang

专题命中 偏好对齐 :alignment(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.21966 2024-11-05 cs.CV 50%

PrefPaint: Aligning Image Inpainting Diffusion Model with Human Preference

Kendong Liu, Zhiyu Zhu, Chuanhao Li, Hui Liu, Huanqiang Zeng, Junhui Hou

专题命中 偏好对齐 :alignment(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.20266 2024-10-29 cs.HC 50%

Limitations of the LLM-as-a-Judge Approach for Evaluating LLM Outputs in Expert Knowledge Tasks

Annalisa Szymanski, Noah Ziems, Heather A. Eicher-Miller, Toby Jia-Jun Li, Meng Jiang, Ronald A. Metoyer

专题命中 偏好对齐 :alignment(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.15881 2024-10-24 cs.CV 50%

LLaVA-MoD: Making LLaVA Tiny via MoE Knowledge Distillation

Fangxun Shu, Yue Liao, Le Zhuo, Chenning Xu, Lei Zhang, Guanghao Zhang, Haonan Shi, Long Chen, Tao Zhong, Wanggui He, Siming Fu, Haoyuan Li, Bolin Li, Zhelun Yu, Si Liu, Hongsheng Li, Hao Jiang

专题命中 偏好对齐 :DPO(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.12519 2024-10-17 cs.IR 50%

RosePO: Aligning LLM-based Recommenders with Human Values

Jiayi Liao, Xiangnan He, Ruobing Xie, Jiancan Wu, Yancheng Yuan, Xingwu Sun, Zhanhui Kang, Xiang Wang

专题命中 偏好对齐 :harmlessness(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.14713 2024-09-24 cs.CV 50%

Phantom of Latent for Large Language and Vision Models

Byung-Kwan Lee, Sangyun Chung, Chae Won Kim, Beomchan Park, Yong Man Ro

专题命中 偏好对齐 :DPO(abstract)

Comments Code is available in https://github.com/ByungKwanLee/Phantom

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.06726 2024-09-05 cs.CV 50%

Filter & Align: Leveraging Human Knowledge to Curate Image-Text Data

Lei Zhang, Fangxun Shu, Tianyang Liu, Sucheng Ren, Hao Jiang, Cihang Xie

专题命中 偏好对齐 :alignment(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.04225 2024-08-27 cs.RO 50%

Feeling Optimistic? Ambiguity Attitudes for Online Decision Making

Jared J. Beard, R. Michael Butts, Yu Gu

专题命中 偏好对齐 :safety(abstract)

Comments 6 pages, 5 figures, 2 algorithms. Accepted to the 2024 IEEE/RSJ International Conference on Intelligent Robots and Systems in Abu Dhabi, UAE (Oct 14-18, 2024) \c{opyright} 2024 IEEE

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.16127 2024-06-21 cs.IR 50%

Finetuning Large Language Model for Personalized Ranking

Zhuoxi Bai, Ning Wu, Fengyu Cai, Xinyi Zhu, Yun Xiong

专题命中 偏好对齐 :alignment(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.03746 2024-06-18 cs.CV 50%

Tuning Large Multimodal Models for Videos using Reinforcement Learning from AI Feedback

Daechul Ahn, Yura Choi, Youngjae Yu, Dongyeop Kang, Jonghyun Choi

专题命中 偏好对齐 :alignment(abstract)

Comments ACL 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.11165 2024-05-30 cs.CV 50%

Automated Multi-level Preference for MLLMs

Mengxi Zhang, Wenhao Wu, Yu Lu, Yuxin Song, Kang Rong, Huanjin Yao, Jianbo Zhao, Fanglong Liu, Yifan Sun, Haocheng Feng, Jingdong Wang

专题命中 偏好对齐 :RLHF(abstract)

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.13942 2024-05-13 cs.CV 50%

StyleInject: Parameter Efficient Tuning of Text-to-Image Diffusion Models

Mohan Zhou, Yalong Bai, Qing Yang, Tiejun Zhao

专题命中 偏好对齐 :alignment(abstract)

Comments 11 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.04069 2024-05-07 cs.RO 50%

Bidirectional Human Interactive AI Framework for Social Robot Navigation

Tuba Girgin, Emre Girgin, Yigit Yildirim, Emre Ugur, Mehmet Haklidir

专题命中 偏好对齐 :trustworthy(abstract)

Comments Accepted by Robot Trust for Symbiotic Societies (RTSS) Workshop at ICRA 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.07491 2024-04-12 cs.SE 50%

Neural Fault Injection: Generating Software Faults from Natural Language

Domenico Cotroneo, Pietro Liguori

专题命中 偏好对齐 :RLHF(abstract)

Comments 2024 54th Annual IEEE/IFIP International Conference on Dependable Systems and Networks - Disrupt

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.06311 2024-04-10 cs.IR 50%

DRE: Generating Recommendation Explanations by Aligning Large Language Models at Data-level

Shen Gao, Yifan Wang, Jiabao Fang, Lisi Chen, Peng Han, Shuo Shang

专题命中 偏好对齐 :alignment(abstract)

Comments 5 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.10240 2024-04-10 cs.CV 50%

Rich Human Feedback for Text-to-Image Generation

Youwei Liang, Junfeng He, Gang Li, Peizhao Li, Arseniy Klimovskiy, Nicholas Carolan, Jiao Sun, Jordi Pont-Tuset, Sarah Young, Feng Yang, Junjie Ke, Krishnamurthy Dj Dvijotham, Katie Collins, Yiwen Luo, Yang Li, Kai J Kohlhoff, Deepak Ramachandran, Vidhya Navalpakkam

专题命中 偏好对齐 :RLHF(abstract)

Comments CVPR'24

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.05666 2024-04-09 cs.CV 50%

YaART: Yet Another ART Rendering Technology

Sergey Kastryulin, Artem Konev, Alexander Shishenya, Eugene Lyapustin, Artem Khurshudov, Alexander Tselousov, Nikita Vinokurov, Denis Kuznedelev, Alexander Markovich, Grigoriy Livshits, Alexey Kirillov, Anastasiia Tabisheva, Liubov Chubarova, Marina Kaminskaia, Alexander Ustyuzhanin, Artemii Shvetsov, Daniil Shlenskii, Valerii Startsev, Dmitrii Kornilov, Mikhail Romanov, Artem Babenko, Sergei Ovcharenko, Valentin Khrulkov

专题命中 偏好对齐 :RLHF(abstract)

Comments Prompts and additional information are available on the project page, see https://ya.ru/ai/art/paper-yaart-v1

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.10762 2024-03-19 cs.RO 50%

NARRATE: Versatile Language Architecture for Optimal Control in Robotics

Seif Ismail, Antonio Arbues, Ryan Cotterell, René Zurbrügg, Carmen Amo Alonso

专题命中 偏好对齐 :safety(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.11882 2024-02-20 cs.CV 50%

NOTE: Notable generation Of patient Text summaries through Efficient approach based on direct preference optimization

Imjin Ahn, Hansle Gwon, Young-Hak Kim, Tae Joon Jun, Sanghyun Park

专题命中 偏好对齐 :DPO(abstract)

Comments 13 pages, 3 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.09872 2024-02-16 cs.CV 50%

Social Reward: Evaluating and Enhancing Generative AI through Million-User Feedback from an Online Creative Community

Arman Isajanyan, Artur Shatveryan, David Kocharyan, Zhangyang Wang, Humphrey Shi

专题命中 偏好对齐 :alignment(abstract)

Comments 16 pages with 10 figures, accepted at ICLR 2024 as a spotlight, codes can be accessed at https://github.com/Picsart-AI-Research/Social-Reward

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.00647 2024-01-23 cs.CV cs.MM 50%

Beyond Task Performance: Evaluating and Reducing the Flaws of Large Multimodal Models with In-Context Learning

Mustafa Shukor, Alexandre Rame, Corentin Dancette, Matthieu Cord

专题命中 偏好对齐 :RLHF(abstract)

Comments ICLR 2024. Project Page: https://evalign-icl.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏