arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 143 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 偏好对齐 143 篇

2605.03799 2026-08-14 cs.CL 版本更新 83%

Natural Language Processing: A Comprehensive Practical Guide from Tokenisation to RLHF

自然语言处理:从分词到RLHF的全面实用指南

Mullosharaf K. Arabov

机构 * KAZAN (VOLGA REGION) FEDERAL UNIVERSITY INSTITUTE OF COMPUTATIONAL MATHEMATICS AND INFORMATION TECHNOLOGIES(卡赞(伏尔加地区)联邦大学计算数学与信息科技学院)

专题命中 偏好对齐 :RLHF(title,title_cn);分类 cs.CL

AI总结 本文系统指导现代NLP全流程,涵盖分词、向量化、大语言模型微调、检索增强生成及人类反馈强化学习,强调低资源语言处理与开源模型应用。

Comments 136 pages, 12 practical works, preprint. Textbook for senior undergraduates and graduate students. Original contributions on low-resource languages (Tajik, Tatar and other). Companion repository available

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18295 2026-08-04 cs.LG 版本更新 83%

On the Limits of Support-Preserving Alignment and Bounded Filtering

关于支持保持对齐和有界过滤的局限性

Aryan Dutt, Rui Mao, Anupam Chattopadhyay

专题命中 偏好对齐 :alignment(title,abstract);safety(abstract);分类 cs.LG

AI总结 研究在大语言模型中,重塑基础模型输出分布的对齐方案与有界安全过滤器结合能否消除有害行为。通过形式化设置并分析,发现有界过滤可能无法消除所有有害输出,实证评估显示有害输出率始终高于零。

Comments Withdrawn to allow a complete rewrite and substantial revision of the theoretical analysis and experiments

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10494 2026-07-07 cs.CL cs.LG 版本更新 82%

Coverage-Controlled Preference Mining from Noisy Claim Verification for Evidence-Grounded Generation

基于噪声声明验证的覆盖控制偏好挖掘用于基于证据的生成

Weixin Liu, Congning Ni, Qingyuan Song, Susannah L. Rose, Murat Kantarcioglu, Bradley A. Malin, Zhijun Yin

机构 * Vanderbilt University(范德比大学) Vanderbilt University Medical Center(范德比大学医学中心) Lirio Virginia Tech(弗吉尼亚理工大学)

专题命中 偏好对齐 :DPO(summary_cn,abstract);分类 cs.CL、cs.LG

AI总结 研究临床简要医院病程总结中基于证据生成的问题,引入VERI-DPO框架,将噪声声明验证转化为覆盖控制的摘要级偏好,经实验验证该框架能降低不支持率,提升模型表现。

Comments 15 pages, 1 figure, 8 tables. Major revision with locked MIMIC-IV transfer evaluation, blinded pairwise human assessment, matched multi-seed ablations, revised title, and revised author list

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12288 2026-06-11 cs.CL cs.AI 版本更新 82%

TokenRatio: Principled Token-Level Preference Optimization via Ratio Matching

TokenRatio: 通过比率匹配实现原理化的token级偏好优化

Truong Nguyen, Tien-Phat Nguyen, Linh Ngo Van, Duy Minh Ho Nguyen, Khoa Doan, Trung Le

机构 * National University of Singapore(新加坡国立大学) Institute of Cybernetics and Robotics, Czech Technical University in Prague(捷克布拉格技术大学控制论与机器人研究所)

专题命中 偏好对齐 :DPO(abstract,abstract_cn);alignment(abstract);harmlessness(abstract);分类 cs.CL、cs.AI

AI总结 本文提出TBPO方法,通过比率匹配恢复token级偏好最优性,改进对齐质量和训练稳定性,并增加输出多样性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.06659 2026-08-18 cs.LG cs.AI cs.CL 版本更新 82%

Leveraging Machine Unlearning for Cost-Efficient Preference Alignment

利用机器遗忘实现高性价比的偏好对齐

Xiaohua Feng, Yuyuan Li, Huwei Ji, Jiaming Zhang, Li Zhang, Tianyu Du, Chaochao Chen

专题命中 偏好对齐 :alignment(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 该研究针对现有偏好对齐方法成本高的问题,提出结合LLM遗忘的U2A框架,通过双层优化实现负示例的最优选择与遗忘,经实验验证有效。

Comments Accepted by ICML 2026. 12 pages, 6 figures, and 4 tables. Code available at https://github.com/muyiahhh/U2A

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.26707 2026-07-16 cs.CL cs.CY cs.LG 版本更新 82%

Value Drifts: Tracing Value Alignment During LLM Post-Training

价值漂移:在大语言模型训练后追踪价值对齐

Mehar Bhatia, Shravan Nayak, Gaurav Kamath, Marius Mosbach, Karolina Stańczak, Vered Shwartz, Siva Reddy

机构 * Mila - Quebec AI Institute(魁北克人工智能研究所) McGill University(麦吉尔大学) Université de Montréal(蒙特利尔大学) ETH Zurich(苏黎世联邦理工学院) University of British Columbia(不列颠哥伦比亚大学) Vector Institute(向量研究所) Canada CIFAR AI Chair(加拿大CIFAR人工智能主席)

专题命中 偏好对齐 :alignment(title,abstract);分类 cs.CL、cs.CY、cs.LG

AI总结 研究大语言模型训练后价值对齐问题,通过实验区分训练后算法和数据集影响,测量价值漂移,发现SFT阶段确立模型价值,后续偏好优化难重对齐,不同算法在偏好数据不变时也有不同结果,为相关选择提供见解。

Comments TACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02813 2026-07-03 cs.AI cs.CL cs.LG 版本更新 82%

HAL: Inducing Human-likeness in LLMs with Alignment

HAL: 通过对齐引导LLM的人类相似性

Masum Hasan, Junjie Zhao, Ehsan Hoque

机构 * University of Rochester(罗切斯特大学)

专题命中 偏好对齐 :alignment(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出HAL框架,利用可解释的数据驱动奖励信号,通过对比对话数据提取显式会话特征并优化偏好,使模型在对话中更常被视为类人,同时保持整体性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.10544 2026-06-08 cs.HC 版本更新 82%

Effects of Personality- and Opinion-Alignment in Human-AI Interaction

人格与观点一致性在人机交互中的影响

Maximilian Eder, Clemens Lechner, Maurice Jakesch

专题命中 偏好对齐 :alignment(title,abstract);trustworthy(abstract)

AI总结 研究探讨了AI助手的人格和观点一致性如何影响用户交互结果和感知,发现观点一致性的AI更受信任和受欢迎,但人格一致性影响不显著。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.05385 2026-07-24 cs.IR cs.AI 版本更新 81%

TeaRAG: A Token-Efficient Agentic Retrieval-Augmented Generation Framework

TeaRAG:一种令牌高效的智能检索增强生成框架

Chao Zhang, Yuhao Wang, Derong Xu, Haoxin Zhang, Yuanjie Lyu, Yuhao Chen, Shuochen Liu, Tong Xu, Xiangyu Zhao, Yan Gao, Yao Hu, Enhong Chen

机构 * University of Science and Technology of China(中国科学技术大学) City University of Hong Kong(香港城市大学) Xiaohongshu Inc.(小红书公司)

专题命中 偏好对齐 :DPO(summary_cn,abstract);分类 cs.AI

AI总结 研究提出TeaRAG框架解决智能RAG令牌开销大问题,通过基于简洁三元组的图检索压缩检索内容,用IP-DPO减少推理步骤,在多个数据集上实验,提高了平均精确匹配,减少了输出令牌。

Comments 34 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.04136 2026-07-07 cs.AI 版本更新 81%

A Technical Survey of Reinforcement Learning Techniques for Large Language Models

大语言模型强化学习技术的技术综述

Saksham Sahai Srivastava, Vaneet Aggarwal

机构 * University of Georgia(佐治亚大学) Purdue University(普渡大学)

专题命中 偏好对齐 :alignment(abstract);RLHF(abstract);DPO(abstract);safety(abstract)

AI总结 综述强化学习与语言模型整合,介绍如近端策略优化等算法,分析其在各领域应用,对失败模式算法分析,给出分类法,评估趋势并探讨挑战与新兴方向,为研究提供路线图。

Comments Accepted to ACM Transactions on Intelligent Systems and Technology, June 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06625 2026-07-01 cs.CL 版本更新 81%

FairJudge: An Adaptive, Debiased, and Consistent LLM-as-a-Judge

FairJudge: 一种自适应、去偏且一致的LLM作为评判者

Bo Yang, Lanfei Feng, Yunkui Chen, Yu Zhang, Xiao Xu, Shijian Li

机构 * School of Software Technology, Zhejiang University(浙江大学软件学院)

专题命中 偏好对齐 :DPO(summary_cn,abstract);分类 cs.CL

AI总结 针对LLM评判系统在适应性、偏见和一致性上的局限,提出FairJudge,通过可学习正则化策略和课程式SFT-DPO-GRPO训练范式,实现自适应、去偏和一致评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09533 2026-06-11 cs.AI 版本更新 81%

Autoregressive Direct Preference Optimization

自回归直接偏好优化

Masanari Oi, Mahiro Ukai, Masahiro Kaneko, Naoaki Okazaki, Nakamasa Inoue

机构 * University of Tokyo(东京大学)

专题命中 偏好对齐 :DPO(summary_cn,abstract);分类 cs.AI

AI总结 提出自回归直接偏好优化(ADPO),在应用Bradley-Terry模型前显式引入自回归假设,通过将DPO目标中的求和操作移至log-sigmoid函数外部,实现更优的偏好对齐,并首次区分token长度μ和反馈长度μ'两种度量。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23982 2026-06-11 cs.CL cs.AI cs.CY cs.LG cs.NE 版本更新 81%

Toward Preference-aligned Large Language Models via Residual-based Model Steering

基于残差模型引导的偏好对齐大型语言模型

Lucio La Cava, Andrea Tagarelli

机构 * DIMES Dept., University of Calabria, Italy(卡利博大学DIMES系)

专题命中 偏好对齐 :DPO(abstract,abstract_cn);alignment(abstract);分类 cs.CL、cs.AI、cs.CY

AI总结 提出PaLRS方法,利用残差流中的偏好信号提取轻量级引导向量,无需训练即可在推理时对齐模型偏好,在数学推理和代码生成任务上取得一致提升,同时节省大量时间。

Comments Accepted at IJCAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23816 2026-06-26 cs.LG cs.AI 版本更新 81%

Improved Bounds for Private and Robust Alignment

私有和鲁棒对齐的改进界

Wenqian Weng, Yi He, Xingyu Zhou

专题命中 偏好对齐 :alignment(title,abstract);分类 cs.AI、cs.LG

AI总结 本文从理论角度研究语言模型的私有和鲁棒对齐,通过建立离线与在线设置下的次优性差距上界,分析隐私与对抗性腐败的两种交互模式,并给出改进的界。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02572 2026-06-09 cs.LG cs.AI 版本更新 81%

Reward Shaping for (Inference-Time) Alignment: A Stackelberg Game Perspective

奖励塑形用于(推理时)对齐:一个Stackelberg博弈视角

Haichuan Wang, Tao Lin, Lingkai Kong, Ce Li, Hezi Jiang, Milind Tambe

机构 * University of Southern California(南加州大学)

专题命中 偏好对齐 :alignment(title,abstract);分类 cs.AI、cs.LG

AI总结 针对KL正则化导致LLM继承基策略偏见的问题,提出将奖励模型优化形式化为Stackelberg博弈,并通过简单奖励塑形方案近似最优奖励模型,在推理时对齐中持续提升平均奖励并达到超过66%的胜率。

Comments Accepted to ICML 2026. Camera-ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03160 2026-06-08 cs.AI cs.CL 版本更新 81%

VALUEFLOW: Toward Pluralistic and Steerable Value-based Alignment in Large Language Models

VALUEFLOW:迈向大语言模型中多元化和可引导的基于价值的对齐

Woojin Kim, Sieun Hyeon, Jusang Oh, Jaeyoung Do

机构 * Department of Electrical and Computer Engineering, Seoul National University(首尔国立大学电气与计算机工程系) Interdisciplinary Program in Artificial Intelligence, Seoul National University(首尔国立大学人工智能交叉学科项目)

专题命中 偏好对齐 :alignment(title,abstract);分类 cs.CL、cs.AI

AI总结 提出VALUEFLOW框架,通过分层价值嵌入、强度标注数据库和锚定评估器,实现大语言模型在价值强度上的可控对齐,解决现有方法在提取、评估和引导方面的不足。

Comments Accepted in ICML 2026 (Oral). Code available at https://github.com/AIDASLab/VALUEFLOW

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06343 2026-06-10 cs.LG cs.AI cs.CL 版本更新 80%

When Distance Distracts: Representation Distance Bias in BT-Loss for Reward Models

当距离干扰:BT损失中表示距离偏差对奖励模型的影响

Tong Xie, Andrew Bai, Yuanhao Ban, Yunqi Hong, Haoyu Li, Cho-Jui Hsieh

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 偏好对齐 :RLHF(abstract,abstract_cn);alignment(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 分析BT损失中表示距离导致的梯度偏差,提出NormBT自适应归一化方案,提升奖励模型在细粒度区分上的性能。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27366 2026-08-18 cs.CL 版本更新 79%

BridgeAlign: Bridging Preference Alignment for Humanities and Social Sciences

BridgeAlign:面向人文社科的偏好对齐框架

Ru Peng, Haokai Xu, Xijun Gu, Tianyu Zhao, Zhiting Fan, Yawen Zeng, Yihong Zhuang, Jinyang Zhang, Kexin Yang, Jian Wu, Hao Chen, Junyang Lin, Dayiheng Liu, Junbo Zhao

机构 * Alibaba Group(阿里巴巴集团) Ant Group(蚂蚁集团)

专题命中 偏好对齐 :alignment(title,abstract);分类 cs.CL

AI总结 该研究针对人文社科领域的偏好对齐需求,提出BridgeAlign框架,经21万+合成偏好样本对齐后,使Qwen3-8B在17个基准测试中优于11个强基线,且人工偏好与知识能力无权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09164 2026-08-14 cs.AI 版本更新 79%

CIDER: A Dataset of Contextual Disclosure Boundaries for Privacy Preference Alignment

CIDER:用于隐私偏好对齐的上下文披露边界数据集

Bingcan Guo, Eryue Xu, Jijie Zhou, Zhiping Zhang, Tianshi Li

机构 * University of Washington(华盛顿大学) UIUC(伊利诺伊大学厄巴纳-香槟分校) Northeastern University(东北大学)

专题命中 偏好对齐 :alignment(title,abstract);分类 cs.AI

AI总结 本文推出包含169名用户标注的CIDER数据集,用于评估LLM隐私偏好对齐,发现上下文个性化可提升预测准确率,GPT-5.4和Claude Sonnet 4.6表现更优。

Comments Accepted to COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13227 2026-08-07 cs.CL 版本更新 79%

PolyAlign: Conditional Human-Distribution Alignment

PolyAlign: 条件性人类分布对齐

L. D. M. S. Sai Teja, Ufaq Khan, Sathira Silva, Xiao Wu, Muhammad Haris Khan

机构 * NIT Silchar(印度国立理工学院锡尔恰尔分校) MBZUAI(穆罕默德·本·扎耶德人工智能大学)

专题命中 偏好对齐 :alignment(title,abstract);分类 cs.CL

AI总结 提出PolyAlign框架,通过桶感知SFT和人类分布偏好优化,实现语言模型在不同交互上下文中的条件性人类分布对齐,提升自然性和分布忠实度。

Comments 23 pages, 5 Figures, 13 Tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14990 2026-07-29 cs.AI 版本更新 79%

The Possibility of Artificial Intelligence Becoming a Subject and the Alignment Problem

人工智能成为主体的可能性及对齐问题

Till Mossakowski, Helena Esther Grass

机构 * Institute of computer science, Osnabrück University(奥斯纳布吕克大学计算机科学学院) Institute of philosophy, Oldenburg University(奥尔登堡大学哲学学院)

专题命中 偏好对齐 :alignment(title,abstract);分类 cs.AI

AI总结 本文探讨AGI可能成为独立主体的可能性,提出通过支持自主性的养育方式替代传统控制策略,强调人类与AGI的协作共存与共进化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13315 2026-07-23 cs.CL 版本更新 79%

Meta-Learning Preferences for Multilingual LLM Alignment

多语言语言模型对齐的元学习偏好

Jiaying Lin, Seongho Son, Nam Phuong Tran, Long Tran-thanh, Ilija Bogunovic, Debmalya Mandal

机构 * University of Warwick(华威大学) University College London(伦敦大学学院) University of Basel(巴塞尔大学)

专题命中 偏好对齐 :alignment(title,abstract);分类 cs.CL

AI总结 针对多语言环境下低资源语言对齐数据不足问题,提出元学习框架,利用其他语言偏好数据学习可转移初始化,经理论和实验验证,该方法在极低资源设置下比基线方法胜率最多提高28%,且在多场景表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13312 2026-06-23 cs.MM cs.LG 版本更新 79%

Design-MLLM: A Reinforcement Alignment Framework for Verifiable and Aesthetic Interior Design

Design-MLLM:一种用于可验证且美观的室内设计的强化对齐框架

Yuxuan Yang, Xiaotong Mao, Jingyao Wang

机构 * National Jiangsu University of Finance(江苏财经大学) University of Lorraine(洛林大学) Institute of Electronics and Information Technology, Chinese Academy of Sciences(中国科学院电子信息技术研究所) Tsinghua University(清华大学)

专题命中 偏好对齐 :alignment(title,abstract);分类 cs.LG

AI总结 提出Design-MLLM框架,通过双分支美学导向奖励的强化对齐,解决室内设计中空间可行性硬约束与美学偏好软约束的矛盾,生成既可行又美观的设计。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25148 2026-06-19 cs.AI 版本更新 79%

AAPA: Adversarially Anchored Preference Alignment for Post-Training of Large Language Models

AAPA:用于大型语言模型后训练的对抗锚定偏好对齐

Faqiang Qian, Kang An, Weikun Zhang, Ziliang Wang, Xuhui Zheng, Liangjian Wen, Yong Dai, Mengya Gao, Yichao Wu

机构 * Southwest University of Finance and Economics(西南财经大学)

专题命中 偏好对齐 :alignment(title,abstract);分类 cs.AI

AI总结 提出AAPA框架,通过固定轻量判别器对策略输出与专家响应进行句子级对抗锚定,增强SFT、GRPO等后训练目标,在指令遵循基准上持续提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01642 2026-06-08 cs.LG 版本更新 79%

Adaptive Pluralistic Alignment: A pipeline for dynamic artificial democracy

自适应多元对齐:动态人工民主的流水线

Rachel Freedman

专题命中 偏好对齐 :alignment(title,abstract);分类 cs.LG

AI总结 提出自适应多元对齐(APA)流水线,通过低秩奖励基分解和陪审团投票机制,动态追踪社会价值观演变,避免价值锁定,无需重复预训练或大规模数据收集。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23102 2026-08-12 cs.AI cs.CL 版本更新 79%

Multiplayer Nash Preference Optimization

多玩家纳什偏好优化

Fang Wu, Xu Huang, Weihao Xuan, Zhiwei Zhang, Yijia Xiao, Guancheng Wan, Xiaomin Li, Bing Hu, Peng Xia, Jure Leskovec, Yejin Choi

机构 * Stanford University(斯坦福大学) Georgia Institute of Technology(佐治亚理工学院) The University of Tokyo(东京大学) RIKEN AIP(日本理化学研究所智能系统研究中心) Pennsylvania State University(宾夕法尼亚州立大学) University of California, Los Angeles(加州大学洛杉矶分校) Harvard University(哈佛大学) UNC–Chapel Hill(北卡罗来纳大学教堂山分校)

专题命中 偏好对齐 :RLHF(abstract,abstract_cn);alignment(abstract);分类 cs.CL、cs.AI

AI总结 本文提出多玩家纳什偏好优化框架,扩展了传统的两玩家纳什对齐方法,通过引入多玩家博弈机制,提升对复杂非传递性人类偏好的对齐能力,并在多个基准测试中表现更优。

Journal ref ICLR 2026 Oral

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17658 2026-08-07 cs.LG cs.AI cs.IT math.IT 版本更新 79%

MARS: Margin and Semantic-Aware Data Augmentation for Reward Modeling

MARS:面向奖励建模的边界与语义感知数据增强

Payel Bhattacharjee, Osvaldo Simeone, Ravi Tandon

机构 * University of Arizona(亚利桑那大学) Northeastern University London(伦敦东北大学)

专题命中 偏好对齐 :RLHF(abstract,abstract_cn);alignment(abstract);分类 cs.AI、cs.LG

AI总结 提出MARS框架,通过优先增强低边界偏好对并利用语义距离细化,提升奖励模型质量和对齐性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06133 2026-08-04 cs.SE cs.AI cs.LG cs.LO 版本更新 79%

TLA-Prover: Verifiable TLA+ Specification Synthesis via Preference-Optimized Low-Rank Adaptation

TLA-Prover: 通过偏好优化低秩适配实现可验证的 TLA+ 规范合成

Eric Spencer, Arslan Bisharat, Brian Ortiz, Khushboo Bhadauria, Mujtaba Nazari, TaiNing Wang, George K. Thiruvathukal, Konstantin Laufer, Mohammed Abuhamad

机构 * Department of Computer Science, Loyola University Chicago(洛约拉芝加哥大学计算机科学系)

专题命中 偏好对齐 :DPO(abstract,abstract_cn);safety(abstract);分类 cs.AI、cs.LG

AI总结 提出 TLA-Prover 模型,结合监督微调和基于修复的组相对策略优化,在 TLC 模型检查器上实现 TLA+ 规范合成,Gold/Diamond 级别通过率达 30%,约为未调优基线的 3.5 倍。

Comments 12 pages, 5 tables, 3 figures. In Proceedings at the 21st International Conference on Software Technologies (ICSOFT 2026)

Journal ref ICSOFT 2026, pp. 627-636, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15095 2026-07-20 cs.CL cs.AI cs.MA 版本更新 79%

Digital Pantheon: Simulating and Auditing Coalition Formation with LLM Agents

数字万神殿:使用大语言模型智能体模拟和审计联盟形成

Dylan Van Mulders, Matthias Bogaert, Dirk Van den Poel

机构 * Ghent University(根特大学)

专题命中 偏好对齐 :alignment(abstract);RLHF(abstract);DPO(abstract);分类 cs.CL、cs.AI

AI总结 该研究针对政治联盟形成谈判,提出结合多种技术的多智能体框架,在弗拉芒选举中实施,通过引入相关拓扑、分数和检验使其可解释,模拟产生稳定结果,能可靠预测现实,提供了探索政党兼容性等的测试平台。

Comments 11 pages, 2 figures, 5 tables, To be published in the AIDEM Workshop proceedings of the ECML PKDD 2026 Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19139 2026-07-07 cs.CL cs.AI 版本更新 79%

The Rise of Verbal Tics in Large Language Models: A Systematic Analysis Across Frontier Models

大语言模型中言语 tic 的兴起:前沿模型的系统分析

Shuai Wu, Xue Li, Yanna Feng, Yufang Li, Zhijun Wang, Ran Wang

机构 * Lead Researcher(研究员) Research Assistant(研究助理) Academic Advisor(学术顾问) Research Consultant(研究顾问)

专题命中 偏好对齐 :RLHF(abstract,abstract_cn);alignment(abstract);分类 cs.CL、cs.AI

AI总结 本文系统分析了八个前沿大语言模型中言语 tic 的现象,通过定制评估框架评估10,000个提示,发现 Gemini 3.1 Pro tic 值最高,DeepSeek V3.2 最低,并揭示了 tic 在多轮对话中的累积效应及跨语言差异。

Comments 17 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏