Preference Optimization for Non-Verbal Vocalization Synthesis
非言语发声合成的偏好优化
专题命中 偏好对齐 :DPO(summary_cn,abstract);分类 cs.AI、cs.LG
AI总结 本文针对支持非言语发声的文本转语音系统,研究偏好优化相关设计,提出NV-CER指标,在Emilia-NV等数据集上验证标准DPO设置的有效性,为相关后训练提供实用见解。
AI 大模型
大模型对齐、安全、越狱、红队、提示注入和可信评测。
非言语发声合成的偏好优化
专题命中 偏好对齐 :DPO(summary_cn,abstract);分类 cs.AI、cs.LG
AI总结 本文针对支持非言语发声的文本转语音系统,研究偏好优化相关设计,提出NV-CER指标,在Emilia-NV等数据集上验证标准DPO设置的有效性,为相关后训练提供实用见解。
用于代码偏好优化的函数级执行反馈
机构 * Seoul National University(首尔大学) ; Konkuk University(建国大学)
专题命中 偏好对齐 :DPO(summary_cn,abstract);分类 cs.AI
AI总结 本研究提出STEP-KTODER框架,将代码步骤定义为多函数程序的模块级函数,结合函数级过程监督与程序结果级反馈,在多个代码基准测试中优于KTO、DPO等方法,且验证了执行标签的重要性。
Comments 20 pages, 8 figures, 14 tables. Accepted to Findings of the Association for Computational Linguistics: EMNLP 2026
基于注意力的令牌加权直接偏好优化
机构 * Cornell University(康奈尔大学) ; Vanderbilt University(范德比大学)
专题命中 偏好对齐 :DPO(summary_cn,abstract);分类 cs.CL
AI总结 提出Token-weighted DPO (TwDPO)方法,利用注意力机制估计令牌权重,在不增加额外训练成本的情况下提升大语言模型与人类偏好对齐的性能。
缓解大语言模型对齐税的偏好数据选择
机构 * Microsoft Research Asia(微软亚洲研究院)
专题命中 偏好对齐 :alignment(title,abstract);分类 cs.CL、cs.AI
AI总结 本文提出BALIGN策略,通过筛选偏好数据的三个关键特征,缓解大语言模型对齐税,在保留通用能力的同时提升对齐效果,达到最优帕累托前沿。
算法影响揭示对齐的隐藏社会选择结构
机构 * MIT(麻省理工学院) ; Harvard University(哈佛大学)
专题命中 偏好对齐 :alignment(title,abstract);分类 cs.AI
AI总结 该研究将AI对齐问题转化为凸影响空间上的线性优化,结合福利经济学与机制设计,推导了防策略的社会选择机制及最大化功利主义社会福利的对齐协议,并通过多领域人类偏好实证验证其福利影响。
大卫·布莱克韦尔定理及其对人工智能的贡献
机构 * School of Information, University of California, Berkeley(加州大学伯克利分校信息学院)
专题命中 偏好对齐 :RLHF(abstract,abstract_cn);alignment(abstract);分类 cs.LG
AI总结 本文综述了布莱克韦尔的三个重要定理及其对现代人工智能和机器学习的影响,包括马尔可夫链蒙特卡罗推断、自主机器人导航、生成模型训练等领域的应用。
Comments Survey article, 20 pages, 1 figure, 2 tables
基于上下文的在线不确定性感知偏好学习用于人类反馈
机构 * Department of Biostatistics, Harvard T.H. Chan School of Public Health(哈佛大学T.H.陈公共卫生学院生物统计学系) ; Department of Biostatistics & Bioinformatics, Duke University(杜克大学生物统计学与生物信息学系)
专题命中 偏好对齐 :RLHF(abstract,abstract_cn);分类 cs.LG
AI总结 本文提出一种新的统计框架,利用动态上下文信息在线决策和统计推断最优模型,通过人类偏好数据实现最优 regret 绑定和估计量渐近分布。
EstLLM:通过持续预训练和后训练增强多语言大语言模型中的爱沙尼亚能力
机构 * Institute of Computer Science, University of Tartu(塔尔图大学计算机科学研究院) ; Department of Software Science, Tallinn University of Technology(塔林技术大学软件科学系) ; Institute of the Estonian Language, Tallinn, Estonia(爱沙尼亚语言研究院) ; School of Humanities, Tallinn University(塔林大学人文学院)
专题命中 偏好对齐 :alignment(abstract);分类 cs.CL、cs.AI
AI总结 EstLLM通过持续预训练和后训练提升多语言大语言模型中爱沙尼亚的能力,增强语言和推理表现。
城市的AI权利:公共空间的多元协同设计与治理
专题命中 偏好对齐 :alignment(abstract);分类 cs.CY
AI总结 本论文提出公民AI权利与多元对齐方法,以蒙特利尔为实证基础,结合Street Review与LIVS研究,构建市政AI治理框架,解决公共空间AI决策中的多元价值争议问题。
Comments Ph.D. dissertation, Université de Montréal, 231 pages, 59 figures, 28 tables
MediSkill-Evo:面向证据依据的临床交互的过程约束自进化
机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) ; Beijing Institute of AI Safety and Governance(北京人工智能安全与治理研究院) ; School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院)
专题命中 偏好对齐 :safety(abstract);分类 cs.AI
AI总结 MediSkill-Evo是无需主干微调的临床智能体,通过四类经验存储库与过程约束偏好工具优化,在多维度评估中提升了诊断准确率等指标,验证了其临床交互性能。
AeroDPO:释放具备高保真感知与自动偏好优化的轻量级无人机导航能力
专题命中 偏好对齐 :DPO(abstract_cn);分类 cs.AI
AI总结 本文提出AeroDPO,通过高保真感知与自动偏好优化,使20亿参数轻量级无人机导航模型达到70亿参数模型的成功率,同时降低分布外场景碰撞率,成为自主空中智能体新SOTA。
Comments 7 pages, 3 figures, 4 tables, Code is available at: [ this https URL (https://github.com/XuPeng23/AeroDPO) ]
开放评分系统:通过成对自适应评分表扩展强化学习
机构 * Qwen Large Model Application Team, Alibaba(阿里巴巴文勤大模型应用团队) ; Beijing University Of Posts and Telecommunications(北京邮电大学) ; Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所)
专题命中 偏好对齐 :alignment(abstract);分类 cs.CL
AI总结 开放评分系统通过成对自适应评分表和可验证评分表实现强化学习的稳健对齐,提升开放性任务的辨别力和可验证性。
NeuronTune:用于大语言模型中安全-效用平衡对齐的细粒度神经元调制
机构 * Birong Pan, Mayi Xu, Qiankun Pi, Jianhao Chen, Yuanyuan Zhu, Ming Zhong, Tieyun Qian(作者)
专题命中 安全训练 :alignment(title,abstract);safety(title,abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 NeuronTune是一种细粒度神经元调制框架,通过定位安全关键与效用保留神经元并动态控制干预范围,实现了大语言模型安全与效用的平衡优化,性能优于现有最先进技术。
Comments This work was accepted by WISE2026
RePolicy:用于智能体安全保障中安全策略调用的强化学习方法
机构 * Zhejiang University(浙江大学) ; Zhongguancun Academy(中关村学院) ; University of Science and Technology of China(中国科学技术大学) ; National University of Singapore(新加坡国立大学)
专题命中 安全训练 :safety(title,abstract);分类 cs.CL、cs.AI
AI总结 针对现有智能体安全保障方法难以适应未见轨迹和变化策略上下文的问题,提出RePolicy方法,结合PolicyTraj-20K与带可验证奖励和策略上下文扰动的GRPO,在六个智能体安全基准上取得良好安全检测与策略调用效果。
《翻译中的隐秘危害:利用“乌尔语未检出”分数测量大型语言模型仇恨言论检测中的跨文字安全不一致性》
专题命中 安全训练 :safety(title,abstract);分类 cs.CL、cs.AI
AI总结 该研究针对乌尔语在LLM安全评估中的缺失问题,测试五款LLM在多类乌尔语相关数据集上的表现,发现其跨文字安全不一致性,且开放权重模型问题更显著。
ADVERSA:测量大型语言模型中多轮护栏退化和裁判可靠性
机构 * Independent Researcher(独立研究者)
专题命中 安全训练 :jailbreak(abstract,abstract_cn);safety(abstract);分类 cs.CL、cs.AI
AI总结 ADVERSA通过连续合规轨迹评估大型语言模型在多轮对抗中的护栏退化及裁判可靠性,揭示早期轮次更易成功突破。
Comments 12 pages, 12 figures. Independent research. Code and artifacts: this https URL (https://github.com/Harry-Ashley/adversa-guardrail-degradation). Published in the 2026 IEEE/ACIS 24th International Conference on Software Engineering Research, Management and Applications (SERA), pp. 414-417. Recipient of the Best Paper Award at IEEE/ACIS SERA 2026
StepGuard:利用可扩展监督与安全-效用平衡学习步骤级护栏
机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) ; Beihang University(北京航空航天大学) ; Fudan University(复旦大学) ; Renmin University of China(中国人民大学) ; KAUST(阿卜杜拉国王科技大学)
专题命中 安全训练 :safety(title);分类 cs.AI
AI总结 该研究针对LLM智能体交互的安全风险,提出步骤级护栏模型StepGuard,通过自动数据引擎StepGen与动态平衡学习方法Balance-GRPO训练,在降低攻击成功率的同时仅小幅影响效用。
Comments Accepted by EMNLP 2026. Project page: this https URL (https://zheng977.github.io/StepGuard/)
曲线推理 II:休眠智能体几何——将可解释性扩展至探测技术之外
专题命中 安全训练 :alignment(abstract);safety(abstract);分类 cs.CL
AI总结 本文扩展了Anthropic的休眠智能体研究,提出曲线推理框架,引入语义表面积度量,通过多轮上下文窗口分析自然欺骗推理的几何特征,为线性检测失效时提供了可扩展的无监督检测路径。
期望、反弹、恢复与兴奋:模型发布如何塑造Reddit对对话式AI系统的认知
机构 * Delft University of Technology(代尔夫特理工大学)
专题命中 安全训练 :safety(abstract);分类 cs.CL、cs.CY
AI总结 该研究通过分析Reddit讨论发现,对话式AI系统的模型发布会动态影响用户认知,不同提供商的模型发布在情感表现与关注主题上存在明显差异,这类发布是面向用户的重要干预措施。
Comments Accepted at EMNLP 2026 Main Conference. The companion website is available at this https URL (https://vavre.github.io/p/upai)
基于强化学习的欧拉车头间距控制实现高速公路拥堵缓解
专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG
AI总结 该研究针对传统拥堵控制策略的缺陷,提出基于强化学习的欧拉车头间距控制系统,经大规模仿真验证可显著提升交通流量,为高速公路拥堵缓解提供实用方案。
MetaRAG:面向智能体检索增强生成的信念-行动对齐策略优化
机构 * Zhejiang University(浙江大学) ; Ant Group(蚂蚁集团) ; City University of Hong Kong(香港城市大学)
专题命中 安全训练 :alignment(abstract);分类 cs.AI
AI总结 MetaRAG是面向智能体RAG的信念-行动对齐策略优化框架,通过优先验证的行动生成与内部信念探测,提升了智能体RAG的准确率-效率权衡,收益可迁移至多种场景与模型。
Comments EMNLP 2026 MainConference
更多弃权(不执行),而非更强判别性:预执行大语言模型监督中的验证单元
机构 * University of Science and Technology of China(中国科学技术大学)
专题命中 安全训练 :safety(abstract);分类 cs.AI
AI总结 本研究针对预执行LLM监督的验证单元问题,提出双前缀框架,发现一或两个行动的短验证单元信息性最高,更长窗口会使监控器更倾向于弃权而非提升判别性。
Comments 37 pages, 20 figures, 32 tables, including appendices
NeuronGuard:通过感知消融的安全信号重新分配实现鲁棒的大语言模型安全对齐
专题命中 越狱攻击 :alignment(title,abstract);safety(title,abstract);jailbreak(abstract);分类 cs.AI、cs.LG
AI总结 NeuronGuard是一种微调阶段防御方法,通过重新分配安全信号抵御越狱和神经元级攻击,在三个LLM、六种攻击下实现近乎零攻击成功率且保持任务准确率。
Comments To appear in EMNLP 2026 (Findings)
MPIB:用于医疗提示注入攻击和大语言模型临床安全性的基准
机构 * Seoul National University College of Medicine(首尔国立大学医学院) ; Seoul National University(首尔国立大学) ; Seoul National University College of Medicine, Seoul National University Hospital(首尔国立大学医学院、首尔国立大学医院)
专题命中 提示注入 :safety(title,abstract);prompt injection(title,abstract);分类 cs.CL、cs.LG
AI总结 MPIB是一个用于评估医疗提示注入攻击和大语言模型临床安全性的基准,通过测量临床危害事件率和攻击成功率来评估模型的安全性。
Comments 19 pages, 7 figures, 18 tables. Accepted to Findings of EMNLP 2026
语义覆盖层:通过超越 token 和引导向量的注释缓解提示注入攻击
专题命中 提示注入 :prompt injection(title,abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本研究提出 Semantic Overlays 技术,通过在冻结语言模型残差流上应用小型学习适配器构建带外注释通道,有效缓解提示注入攻击,在多个基准测试中大幅降低攻击成功率且保持模型效用。
Comments 21 pages, 4 figures, 13 tables. Interactive demo: this https URL (https://semantic-overlays.vercel.app). Code and released adapters: this https URL (https://github.com/JoshuaSP/semantic-overlays)
智能体的决策依据是什么?通过定位行为引导指令来裁决未授权行为
专题命中 提示注入 :prompt injection(abstract);分类 cs.AI
AI总结 针对LLM智能体易受动态注入攻击的问题,提出Attnlocate框架,通过目标检测定位行为引导指令以裁决未授权行为,在多场景下表现优异且可跨模型迁移。
WebMCP-Phalanx:为浏览器集成的大语言模型智能体实施并刻画信任边界
专题命中 提示注入 :prompt injection(abstract);分类 cs.AI
AI总结 针对浏览器集成 LLM 智能体的安全风险,提出 WebMCP-Phalanx 双层架构,验证其可降低攻击成功率、阻断多数提示注入,仅少量工具返回攻击成功,任务效用未受明显影响。
Comments 8 pages, 1 figure, AAAI2027
TrustShiftProbe:对MCP服务器上的阶段性信任攻击进行表征、基准测试与防御
专题命中 提示注入 :prompt injection(abstract);分类 cs.AI
AI总结 本研究针对MCP服务器的阶段性信任攻击提出TrustShiftProbe框架,建立威胁模型、攻击引擎与防御机制SHIELD,使攻击成功率从69.5%降至42.7%
PAuth - 精确任务范围授权 for 代理
机构 * University of Washington(华盛顿大学) ; The Ohio State University(俄亥俄州立大学) ; Microsoft Research(微软研究院)
专题命中 提示注入 :prompt injection(abstract);分类 cs.AI
AI总结 PAuth通过隐式授权模型精确控制代理执行任务所需的操作权限,通过NL切片和信封结构确保操作合法性,实验表明其在安全和性能上均表现优异。
基于大语言模型的自动模型卡片生成
专题命中 幻觉与事实性 :alignment(abstract);分类 cs.AI
AI总结 本研究提出基于LLM的MCTidy与MCGenie,前者重组模型卡片为标准化模板,后者从仓库数据直接生成,经48个Hugging Face模型验证,可实现标准化、可扩展的模型卡片文档生成。