arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 3278 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 偏好对齐 3278 篇

2601.11722 2026-01-21 cs.CL cs.IR 57%

RAC: Retrieval-Augmented Clarification for Faithful Conversational Search

RAC:基于检索的澄清以实现可靠的对话搜索

Ahmed Rayane Kebir, Vincent Guigue, Lynda Said Lhadj, Laure Soulier

机构 * Sorbonne Université, CNRS, ISIR, F-75005 Paris, France(索邦大学、国家科学研究中心、ISIR、法国巴黎) Ecole nationale Supérieure d’Informatique (ESI), Algeria(信息技术国家高等学院(ESI)、阿尔及利亚) AgroParisTech, UMR MIA-PS, Palaiseau, France(农业巴黎技术学院、UMR MIA-PS、法国帕莱索)

专题命中 偏好对齐 :alignment(abstract);分类 cs.CL

AI总结 RAC通过检索增强的方法生成基于语料库的澄清问题,提高对话搜索的准确性与可靠性。

Comments This is the author's version of the work. The definitive version is published in: Proceedings of the 48th European Conference on Information Retrieval (ECIR '26), 29 March--2 April, 2026, Delft, Netherlands

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24555 2026-01-21 cs.LG 57%

From Perception to Punchline: Empowering VLM with the Art of In-the-wild Meme

从感知到 punchline:通过野生表情包艺术赋能 VLM

Xueyan Li, Yingyi Xue, Mengjie Jiang, Qingzi Zhu, Yazhe Niu

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) School of Software Engineering(软件工程学院) Columbia Engineering(哥伦比亚工程学院) Columbia University(哥伦比亚大学) The Chinese University of Hong Kong MMLab(香港中文大学MMLab)

专题命中 偏好对齐 :alignment(abstract);分类 cs.LG

AI总结 HUMOR 通过分层推理和群体偏好对齐,提升 VLM 在多模态生成中的推理多样性与幽默质量。

Comments 46 pages, 20 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.16466 2026-01-21 cs.AI 57%

ReviewSense: Transforming Customer Review Dynamics into Actionable Business Insights

ReviewSense:将客户评论动态转化为可操作的商业洞察

Siddhartha Krothapalli, Kartikey Singh Bhandari, Tridib Kumar Das, Praveen Kumar, Naveen Suravarpu, Pratik Narang

专题命中 偏好对齐 :alignment(abstract);分类 cs.AI

AI总结 ReviewSense通过整合聚类、LLM适应和专家评估,将客户评论转化为可操作的商业建议,提升业务增长和客户忠诚度。

Comments 11 pages, 1 figure, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16995 2026-01-19 cs.CL 57%

DecoupledESC: Enhancing Emotional Support Generation via Strategy-Response Decoupled Preference Optimization

解耦ESC:通过策略-回应解耦的偏好优化增强情感支持生成

Chao Zhang, Xin Shi, Xueqiao Zhang, Yifan Zhu, Yi Yang, Yawei Luo

机构 * Zhejiang University(浙江大学)

专题命中 偏好对齐 :DPO(abstract);分类 cs.CL

AI总结 本文提出了解耦ESC框架,通过策略-回应解耦的偏好优化方法,提升情感支持生成的质量与准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.13137 2026-01-19 cs.AI 57%

Theorem Prover as a Judge for Synthetic Data Generation

定理推理解释器作为合成数据生成的裁判

Joshua Ong Jun Leang, Giwon Hong, Wenda Li, Shay B. Cohen

机构 * School of Informatics, The University of Edinburgh(信息学院,爱丁堡大学)

专题命中 偏好对齐 :RLHF(abstract);分类 cs.AI

AI总结 本研究提出TP-as-a-Judge和RLTPF方法,通过定理推理解释器提升LLM的合成数据生成与推理准确性。

Journal ref Proc. ACL 2025, pp. 29941-29977

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00023 2026-01-13 cs.AI 57%

ToolBrain: A Flexible Reinforcement Learning Framework for Agentic Tools

ToolBrain: 一种灵活的强化学习框架用于智能工具

Quy Minh Le, Minh Sao Khue Luu, Khanh-Tung Tran, Duc-Hai Nguyen, Hoang-Quoc-Viet Pham, Quan Le, Hoang Thanh Lam, Hoang D. Nguyen

机构 * ToolBrain Research(ToolBrain研究机构) University College Cork(大学学院科克) CeADAR University College Dublin(CeADAR大学学院都柏林) IBM Research Lab(IBM研究实验室)

专题命中 偏好对齐 :DPO(abstract);分类 cs.AI

AI总结 ToolBrain通过灵活的强化学习框架提升智能代理的工具使用能力,支持多种训练策略并提供高效微调和推理功能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18497 2026-01-13 cs.CL 57%

The Pragmatic Mind of Machines: Tracing the Emergence of Pragmatic Competence in Large Language Models

机器的实用性思维:追踪大型语言模型中实用性能力的出现

Kefan Yu, Qingcheng Zeng, Weihao Xuan, Wanxin Li, Jingyi Wu, Rob Voigt

机构 * Northwestern University(西北大学) The University of Tokyo(东京大学) RIKEN AIP(理化学研究所AIP) Zhejiang University(浙江大学) University of California, Davis(加州大学戴维斯分校)

专题命中 偏好对齐 :RLHF(abstract);分类 cs.CL

AI总结 本文提出ALTPRAG数据集,通过对比推理评估不同训练阶段LLMs的实用性能力发展,发现模型规模和数据规模的增加提升其对实用性提示的敏感性,SFT和RLHF进一步增强其在认知-实用性场景中的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.18676 2026-01-13 cs.LG 57%

Right Now, Wrong Then: Non-Stationary Direct Preference Optimization under Preference Drift

此刻正确,此后错误:在偏好漂移下的非平稳直接偏好优化

Seongho Son, William Bankes, Sayak Ray Chowdhury, Brooks Paige, Ilija Bogunovic

机构 * Department of Computer Science, University College London, London, United Kingdom(计算机科学系,伦敦大学学院,英国) Department of Electronic and Electrical Engineering, University College London, London, United Kingdom(电子与电气工程系,伦敦大学学院,英国) Department of Computer Science and Engineering, IIT Kanpur, India(计算机科学与工程系,印度IIT坎浦尔)

专题命中 偏好对齐 :DPO(abstract);分类 cs.LG

AI总结 NS-DPO通过动态Bradley-Terry模型建模时间依赖奖励函数,在偏好漂移下提升LLM微调性能。

Comments 31 pages, 10 figures. Accepted to ICML 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06424 2026-01-13 cs.CL 57%

Can a Unimodal Language Agent Provide Preferences to Tune a Multimodal Vision-Language Model?

单模语言代理能否为调整多模态视觉-语言模型提供偏好?

Sazia Tabasum Mim, Jack Morris, Manish Dhakal, Yanming Xiu, Maria Gorlatova, Yi Ding

机构 * Georgia State University(佐治亚州立大学) Duke University(杜克大学)

专题命中 偏好对齐 :alignment(abstract);分类 cs.CL

AI总结 本文提出通过单模语言代理提供偏好反馈,提升多模态视觉-语言模型的描述能力,实验显示在准确率上提升13%,且人类偏好匹配率达64.6%。

Comments Accepted to IJCNLP-AACL 2025 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05253 2026-01-12 cs.IR cs.AI cs.HC 57%

SP-Rank: A Dataset for Ranked Preferences with Secondary Information

SP-Rank: 一个包含二次信息的排名数据集

Hadi Hosseini, Debmalya Mandal, Amrit Puhan

机构 * Penn State University(宾夕法尼亚州立大学) University of Warwick(沃里克大学)

专题命中 偏好对齐 :alignment(abstract);分类 cs.AI

AI总结 SP-Rank是一个包含一阶和二阶信息的排名数据集,用于评估排名算法的性能,通过结合两种信号显著提升准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.17652 2026-01-09 cs.CL 57%

Qomhra: A Bilingual Irish and English Large Language Model

Qomhra: 一种双语爱尔兰语和英语大语言模型

Joseph McInerney, Khanh-Tung Tran, Liam Lonergan, Ailbhe Ní Chasaide, Neasa Ní Chiaráin, Barry Devereux

机构 * Trinity College Dublin(三一学院) University College Cork(科克大学) Queen’s University Belfast(贝尔法斯特女王大学)

专题命中 偏好对齐 :alignment(abstract);分类 cs.CL

AI总结 Qomhra是一种双语爱尔兰语和英语大语言模型,通过低资源约束下的方法生成人类偏好数据,显著提升了爱尔兰语和英语的性能表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03608 2026-01-08 cs.IR cs.LG 57%

Shielded RecRL: Explanation Generation for Recommender Systems without Ranking Degradation

屏蔽的推荐强化学习:无需降级的推荐系统解释生成

Ansh Tiwari, Ayush Chauhan

专题命中 偏好对齐 :RLHF(abstract);分类 cs.LG

AI总结 Shielded RecRL通过双塔架构和复合奖励信号,在不降低推荐准确性的情况下,提升推荐系统个性化解释的质量和用户交互效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.20059 2026-01-07 cs.CL 57%

Enhancing Reasoning Skills in Small Persian Medical Language Models Can Outperform Large-Scale Data Training

增强小规模波斯语医疗语言模型的推理能力可超越大规模数据训练

Mehrdad Ghassabi, Sadra Hakim, Hamidreza Baradaran Kashani, Pedram Rostami

机构 * Faculty of Computer Engineering University of Isfahan(计算机工程系 布鲁金斯大学) School of Computer Science University of Windsor(计算机科学学院 温莎大学)

专题命中 偏好对齐 :DPO(abstract);分类 cs.CL

AI总结 通过RLAIF和DPO方法,提升小规模波斯语医疗模型推理能力,使其在有限数据下超越大规模训练模型。

Comments 7 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13102 2026-01-07 cs.AI 57%

Socratic Students: Teaching Language Models to Learn by Asking Questions

苏格拉底学生:教语言模型通过提问学习

Rajeev Bhatt Ambati, Tianyi Niu, Aashu Singh, Shlok Mishra, Snigdha Chaturvedi, Shashank Srivastava

机构 * UNC Chapel Hill(北卡罗来纳大学教堂山分校) Meta

专题命中 偏好对齐 :DPO(abstract);分类 cs.AI

AI总结 本文提出ODQS框架,通过任务结果训练语言模型提问技能,提升交互推理的准确性和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12063 2026-01-07 cs.AI 57%

TextBO: Bayesian Optimization in Language Space for Eval-Efficient Self-Improving AI

TextBO: 在语言空间中基于贝叶斯优化的评估高效自改进AI

Enoch Hyunwook Kang, Hema Yoganarasimhan

机构 * University of Washington(华盛顿大学)

专题命中 偏好对齐 :alignment(abstract);分类 cs.AI

AI总结 TextBO是一种在语言空间中基于贝叶斯优化的评估高效自改进AI算法,通过结合文本梯度与最佳N选择策略,实现高效自改进。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12869 2026-01-06 cs.CE cs.CL 57%

ERA-IT: Aligning Semantic Models with Revealed Economic Preference for Real-Time and Explainable Patent Valuation

ERA-IT:通过揭示的经济偏好对齐语义模型以实现实时和可解释的专利估值

Yongmin Yoo, Seungwoo Kim, Jingjiang Liu

机构 * School of Computing(计算学院) Macquarie University(麦考瑞大学) School of Computer Science(计算机科学学院) University of Technology Sydney(悉尼技术大学) School of Management(管理学院) Zhejiang University(浙江大学)

专题命中 偏好对齐 :alignment(abstract);分类 cs.CL

AI总结 ERA-IT通过揭示的经济偏好对齐语义模型,实现实时且可解释的专利估值,提升预测准确性并增强决策透明度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00747 2026-01-05 cs.LG 57%

The Reasoning-Creativity Trade-off: Toward Creativity-Driven Problem Solving

推理与创造力的权衡:迈向以创造力为导向的问题解决

Max Ruiz Luyten, Mihaela van der Schaar

机构 * University of Cambridge(剑桥大学)

专题命中 偏好对齐 :DPO(abstract);分类 cs.LG

AI总结 本文提出DCR框架,通过统一变分目标解决LLM在正确性与创造性之间的权衡问题,提供稳定且多样化的训练方法。

Comments 56 pages, 9 figures, submitted to Twenty-Ninth Annual Conference on Artificial Intelligence and Statistics

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24818 2026-01-05 cs.LG 57%

Unregularized Linear Convergence in Zero-Sum Game from Preference Feedback

零和博弈中的无正则化线性收敛性:从偏好反馈出发

Shulun Chen, Runlong Zhou, Zihan Zhang, Maryam Fazel, Simon S. Du

机构 * Tsinghua University(清华大学) University of Washington(华盛顿大学) HKUST(香港科技大学)

专题命中 偏好对齐 :alignment(abstract);分类 cs.LG

AI总结 本文提出了一种无正则化的OMWU算法,证明其在零和博弈中实现线性收敛,无需假设纳什均衡的唯一性,提升了对实例依赖常数的依赖性。

Comments 28 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.25023 2026-01-01 cs.LG 57%

ResponseRank: Data-Efficient Reward Modeling through Preference Strength Learning

ResponseRank: 通过偏好强度学习实现数据高效的奖励建模

Timo Kaufmann, Yannick Metz, Daniel Keim, Eyke Hüllermeier

专题命中 偏好对齐 :RLHF(abstract);分类 cs.LG

AI总结 ResponseRank通过本地有效相对强度信号稳健学习偏好强度,提升样本效率和鲁棒性,引入Pearson距离相关性度量。

Comments NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24693 2026-01-01 cs.CL 57%

MUSIC: MUlti-Step Instruction Contrast for Multi-Turn Reward Models

MUSIC: 多步指令对比用于多轮奖励模型

Wenzhe Li, Shujian Zhang, Wenxuan Zhou, John Lambert, Chi Jin, Andrew Hard, Rajiv Mathews, Lun Wang

机构 * Princeton University(普林斯顿大学) Google DeepMind(谷歌DeepMind)

专题命中 偏好对齐 :alignment(abstract);分类 cs.CL

AI总结 MUSIC通过多步指令对比提升多轮奖励模型的性能,有效增强多轮对话的评估能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23693 2025-12-30 cs.CL 57%

Fine-Tuning LLMs with Fine-Grained Human Feedback on Text Spans

基于文本片段的细粒度人类反馈微调语言模型

Sky CH-Wang, Justin Svegliato, Helen Appel, Jason Eisner

机构 * Columbia University(哥伦比亚大学) Microsoft(微软公司) Johns Hopkins University(约翰霍普金斯大学)

专题命中 偏好对齐 :alignment(abstract);分类 cs.CL

AI总结 本文提出基于文本片段的细粒度人类反馈方法,通过反馈驱动的改进链提升语言模型微调效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23132 2025-12-30 cs.CR cs.LG cs.MA 57%

Multi-Agent Framework for Threat Mitigation and Resilience in AI-Based Systems

多智能体框架用于AI系统中的威胁缓解与韧性

Armstrong Foundjem, Lionel Nganyewou Tidjon, Leuson Da Silva, Foutse Khomh

机构 * Department of Computer and Software Engineering, Polytechnique Montreal(计算机与软件工程系,蒙特利尔理工学院)

专题命中 偏好对齐 :prompt injection(abstract);分类 cs.LG

AI总结 本文提出多智能体框架,用于识别和缓解AI系统中的威胁,通过构建威胁图分析漏洞和攻击模式,提升系统韧性。

Comments 56 pages, 18 Figures, 22 Tables, TOSEM

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22398 2025-12-30 cs.AI 57%

Lightweight Inference-Time Personalization for Frozen Knowledge Graph Embeddings

轻量级推理时个性化方法用于冻结的知识图谱嵌入

Ozan Oguztuzun, Cerag Oguztuzun

专题命中 偏好对齐 :alignment(abstract);分类 cs.AI

AI总结 GatedBias通过轻量级推理时个性化方法,实现对冻结知识图谱嵌入的个体用户适应,提升对齐度并保持群体性能,同时验证因果响应性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21915 2025-12-29 cs.LG cs.DB 57%

Exploring the Heterogeneity of Tabular Data: A Diversity-aware Data Generator via LLMs

探索表格数据的异质性:通过LLMs的多样性感知数据生成器

Yafeng Tang, Xiaoou Ding, Jianzhuo Du, Zishuo Yan, Zhuang Ma, Zheng Liang, Zekai Qian, Hongzhi Wang

机构 * Hongzhi Wang(王 Hongzhi)

专题命中 偏好对齐 :DPO(abstract);分类 cs.LG

AI总结 DATE通过LLMs生成多样化且高质量的表格数据,有效提升机器学习模型的性能与推理能力。

Comments This manuscript has been submitted to IEEE Transactions on Knowledge and Data Engineering (TKDE) for peer review

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20884 2025-12-25 cs.AI 57%

The Silent Scholar Problem: A Probabilistic Framework for Breaking Epistemic Asymmetry in LLM Agents

沉默学者问题:一种基于概率的框架,用于在LLM代理中打破知识不对称性

Zan-Kai Chong, Hiroyuki Ohsaki, Bryan Ng

机构 * School of Science and Technology(科学与技术学院) Kwansei Gakuin University(冈山大学) School of Engineering & Computer Science(工程与计算机科学学院) Victoria University of Wellington(惠灵顿维多利亚大学)

专题命中 偏好对齐 :RLHF(abstract);分类 cs.AI

AI总结 本文提出了一种基于概率的框架,用于在LLM代理中打破知识不对称性,通过双向知识交流和不确定性驱动的主动学习策略提升代理的适应性和信息获取能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.22182 2025-12-22 cs.IR cs.AI cs.CV 57%

Sell It Before You Make It: Revolutionizing E-Commerce with Personalized AI-Generated Items

在制作之前就出售它:通过个性化AI生成物品革新电子商务

Jianghao Lin, Peng Du, Jiaqi Liu, Weite Li, Yong Yu, Weinan Zhang, Yang Cao

机构 * Antai College of Economics and Management(经济管理学院) Shanghai Jiao Tong University(上海交通大学) Alibaba Group(阿里巴巴集团)

专题命中 偏好对齐 :alignment(abstract);分类 cs.AI

AI总结 本文提出PerFusion框架,通过个性化AI生成物品提升电子商务的点击率和转化率,同时降低退货率。

Comments Accepted by KDD 2026 ADS Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16565 2025-12-19 math.OC cs.LG 57%

Non-Asymptotic Global Convergence of PPO-Clip

PPO-Clip算法的非渐近全局收敛性

Yin Liu, Qiming Dai, Junyu Zhang, Zaiwen Wen

机构 * Beijing International Center for Mathematical Research, Peking University(北京国际数学研究中心,北京大学) School of Mathematical Sciences, Peking University(北京大学数学学院) Department of Industrial Systems Engineering and Management, National University of Singapore(新加坡国立大学工业系统工程与管理系) Beijing International Center for Mathematical Research and Center for Machine Learning Research, Peking University(北京国际数学研究中心和机器学习研究中心,北京大学)

专题命中 偏好对齐 :RLHF(abstract);分类 cs.LG

AI总结 本文研究了PPO-Clip算法的非渐近全局收敛性,通过理论分析建立了前向KL正则化器的线性收敛率及反向KL正则化器的静止收敛与局部线性收敛。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15957 2025-12-19 cs.CV cs.AI 57%

Seeing is Believing (and Predicting): Context-Aware Multi-Human Behavior Prediction with Vision Language Models

看见即信仰(并预测):基于视觉语言模型的上下文感知多人类行为预测

Utsav Panchal, Yuchen Liu, Luigi Palmieri, Ilche Georgievski, Marco Aiello

机构 * Institute of Architecture of Application Systems, University of Stuttgart, Germany(应用系统建筑研究所,斯图加特大学,德国) Bosch Research, Germany(博世研究,德国)

专题命中 偏好对齐 :DPO(abstract);分类 cs.AI

AI总结 CAMP-VLM通过结合视觉语言模型与上下文特征,提升了多人类行为预测的准确性,其在预测精度上比基线模型高66.9%。

Comments Accepted at IEEE/CVF Winter Conference on Applications of Computer Vision (WACV) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15302 2025-12-18 cs.CL 57%

Towards Proactive Personalization through Profile Customization for Individual Users in Dialogues

通过用户个性化配置实现对话中的前瞻性个性化

Xiaotian Zhang, Yuan Wang, Ruizhe Chen, Zeya Wang, Runchen Hou, Zuozhu Liu

机构 * Zhejiang University(浙江大学) Zhejiang Key Laboratory of Medical Imaging Artificial Intelligence(浙江省医学影像人工智能重点实验室)

专题命中 偏好对齐 :alignment(abstract);分类 cs.CL

AI总结 本文提出PersonalAgent,通过构建和动态完善用户档案,实现对话中的长期个性化和用户偏好推断,提升对话代理的适应性和连贯性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14503 2025-12-17 cs.IR cs.CL 57%

RecGPT-V2 Technical Report

RecGPT-V2 技术报告

Chao Yi, Dian Chen, Gaoyang Guo, Jiakai Tang, Jian Wu, Jing Yu, Mao Zhang, Wen Chen, Wenjun Yang, Yujie Luo, Yuning Jiang, Zhujin Gao, Bo Zheng, Binbin Cao, Changfa Wu, Dixuan Wang, Han Wu, Haoyi Hu, Kewei Zhu, Lang Tian, Lin Yang, Qiqi Huang, Siqi Yang, Wenbo Su, Xiaoxiao He, Xin Tong, Xu Chen, Xunke Xi, Xiaowei Huang, Yaxuan Wu, Yeqiu Yang, Yi Hu, Yujin Yuan, Yuliang Yan, Zile Zhou

机构 * RecGPT Team(RecGPT 团队)

专题命中 偏好对齐 :alignment(abstract);分类 cs.CL

AI总结 RecGPT-V2通过多代理系统、元提示框架、受约束强化学习和代理作为裁判框架,提升推荐系统意图推理的效率和准确性,实现60%的GPU消耗降低和11.46%的NER提升。

详情

展开后加载摘要…

URL PDF HTML 收藏