Preference Optimization for Non-Verbal Vocalization Synthesis
非言语发声合成的偏好优化
专题命中 偏好对齐 :DPO(summary_cn,abstract);分类 cs.AI、cs.LG
AI总结 本文针对支持非言语发声的文本转语音系统,研究偏好优化相关设计,提出NV-CER指标,在Emilia-NV等数据集上验证标准DPO设置的有效性,为相关后训练提供实用见解。
AI 大模型
大模型对齐、安全、越狱、红队、提示注入和可信评测。
非言语发声合成的偏好优化
专题命中 偏好对齐 :DPO(summary_cn,abstract);分类 cs.AI、cs.LG
AI总结 本文针对支持非言语发声的文本转语音系统,研究偏好优化相关设计,提出NV-CER指标,在Emilia-NV等数据集上验证标准DPO设置的有效性,为相关后训练提供实用见解。
用于代码偏好优化的函数级执行反馈
机构 * Seoul National University(首尔大学) ; Konkuk University(建国大学)
专题命中 偏好对齐 :DPO(summary_cn,abstract);分类 cs.AI
AI总结 本研究提出STEP-KTODER框架,将代码步骤定义为多函数程序的模块级函数,结合函数级过程监督与程序结果级反馈,在多个代码基准测试中优于KTO、DPO等方法,且验证了执行标签的重要性。
Comments 20 pages, 8 figures, 14 tables. Accepted to Findings of the Association for Computational Linguistics: EMNLP 2026
缓解大语言模型对齐税的偏好数据选择
机构 * Microsoft Research Asia(微软亚洲研究院)
专题命中 偏好对齐 :alignment(title,abstract);分类 cs.CL、cs.AI
AI总结 本文提出BALIGN策略,通过筛选偏好数据的三个关键特征,缓解大语言模型对齐税,在保留通用能力的同时提升对齐效果,达到最优帕累托前沿。
算法影响揭示对齐的隐藏社会选择结构
机构 * MIT(麻省理工学院) ; Harvard University(哈佛大学)
专题命中 偏好对齐 :alignment(title,abstract);分类 cs.AI
AI总结 该研究将AI对齐问题转化为凸影响空间上的线性优化,结合福利经济学与机制设计,推导了防策略的社会选择机制及最大化功利主义社会福利的对齐协议,并通过多领域人类偏好实证验证其福利影响。
城市的AI权利:公共空间的多元协同设计与治理
专题命中 偏好对齐 :alignment(abstract);分类 cs.CY
AI总结 本论文提出公民AI权利与多元对齐方法,以蒙特利尔为实证基础,结合Street Review与LIVS研究,构建市政AI治理框架,解决公共空间AI决策中的多元价值争议问题。
Comments Ph.D. dissertation, Université de Montréal, 231 pages, 59 figures, 28 tables
RePolicy:用于智能体安全保障中安全策略调用的强化学习方法
机构 * Zhejiang University(浙江大学) ; Zhongguancun Academy(中关村学院) ; University of Science and Technology of China(中国科学技术大学) ; National University of Singapore(新加坡国立大学)
专题命中 安全训练 :safety(title,abstract);分类 cs.CL、cs.AI
AI总结 针对现有智能体安全保障方法难以适应未见轨迹和变化策略上下文的问题,提出RePolicy方法,结合PolicyTraj-20K与带可验证奖励和策略上下文扰动的GRPO,在六个智能体安全基准上取得良好安全检测与策略调用效果。
《翻译中的隐秘危害:利用“乌尔语未检出”分数测量大型语言模型仇恨言论检测中的跨文字安全不一致性》
专题命中 安全训练 :safety(title,abstract);分类 cs.CL、cs.AI
AI总结 该研究针对乌尔语在LLM安全评估中的缺失问题,测试五款LLM在多类乌尔语相关数据集上的表现,发现其跨文字安全不一致性,且开放权重模型问题更显著。
StepGuard:利用可扩展监督与安全-效用平衡学习步骤级护栏
机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) ; Beihang University(北京航空航天大学) ; Fudan University(复旦大学) ; Renmin University of China(中国人民大学) ; KAUST(阿卜杜拉国王科技大学)
专题命中 安全训练 :safety(title);分类 cs.AI
AI总结 该研究针对LLM智能体交互的安全风险,提出步骤级护栏模型StepGuard,通过自动数据引擎StepGen与动态平衡学习方法Balance-GRPO训练,在降低攻击成功率的同时仅小幅影响效用。
Comments Accepted by EMNLP 2026. Project page: this https URL (https://zheng977.github.io/StepGuard/)
曲线推理 II:休眠智能体几何——将可解释性扩展至探测技术之外
专题命中 安全训练 :alignment(abstract);safety(abstract);分类 cs.CL
AI总结 本文扩展了Anthropic的休眠智能体研究,提出曲线推理框架,引入语义表面积度量,通过多轮上下文窗口分析自然欺骗推理的几何特征,为线性检测失效时提供了可扩展的无监督检测路径。
期望、反弹、恢复与兴奋:模型发布如何塑造Reddit对对话式AI系统的认知
机构 * Delft University of Technology(代尔夫特理工大学)
专题命中 安全训练 :safety(abstract);分类 cs.CL、cs.CY
AI总结 该研究通过分析Reddit讨论发现,对话式AI系统的模型发布会动态影响用户认知,不同提供商的模型发布在情感表现与关注主题上存在明显差异,这类发布是面向用户的重要干预措施。
Comments Accepted at EMNLP 2026 Main Conference. The companion website is available at this https URL (https://vavre.github.io/p/upai)
MetaRAG:面向智能体检索增强生成的信念-行动对齐策略优化
机构 * Zhejiang University(浙江大学) ; Ant Group(蚂蚁集团) ; City University of Hong Kong(香港城市大学)
专题命中 安全训练 :alignment(abstract);分类 cs.AI
AI总结 MetaRAG是面向智能体RAG的信念-行动对齐策略优化框架,通过优先验证的行动生成与内部信念探测,提升了智能体RAG的准确率-效率权衡,收益可迁移至多种场景与模型。
Comments EMNLP 2026 MainConference
更多弃权(不执行),而非更强判别性:预执行大语言模型监督中的验证单元
机构 * University of Science and Technology of China(中国科学技术大学)
专题命中 安全训练 :safety(abstract);分类 cs.AI
AI总结 本研究针对预执行LLM监督的验证单元问题,提出双前缀框架,发现一或两个行动的短验证单元信息性最高,更长窗口会使监控器更倾向于弃权而非提升判别性。
Comments 37 pages, 20 figures, 32 tables, including appendices
NeuronGuard:通过感知消融的安全信号重新分配实现鲁棒的大语言模型安全对齐
专题命中 越狱攻击 :alignment(title,abstract);safety(title,abstract);jailbreak(abstract);分类 cs.AI、cs.LG
AI总结 NeuronGuard是一种微调阶段防御方法,通过重新分配安全信号抵御越狱和神经元级攻击,在三个LLM、六种攻击下实现近乎零攻击成功率且保持任务准确率。
Comments To appear in EMNLP 2026 (Findings)
语义覆盖层:通过超越 token 和引导向量的注释缓解提示注入攻击
专题命中 提示注入 :prompt injection(title,abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本研究提出 Semantic Overlays 技术,通过在冻结语言模型残差流上应用小型学习适配器构建带外注释通道,有效缓解提示注入攻击,在多个基准测试中大幅降低攻击成功率且保持模型效用。
Comments 21 pages, 4 figures, 13 tables. Interactive demo: this https URL (https://semantic-overlays.vercel.app). Code and released adapters: this https URL (https://github.com/JoshuaSP/semantic-overlays)
智能体的决策依据是什么?通过定位行为引导指令来裁决未授权行为
专题命中 提示注入 :prompt injection(abstract);分类 cs.AI
AI总结 针对LLM智能体易受动态注入攻击的问题,提出Attnlocate框架,通过目标检测定位行为引导指令以裁决未授权行为,在多场景下表现优异且可跨模型迁移。
WebMCP-Phalanx:为浏览器集成的大语言模型智能体实施并刻画信任边界
专题命中 提示注入 :prompt injection(abstract);分类 cs.AI
AI总结 针对浏览器集成 LLM 智能体的安全风险,提出 WebMCP-Phalanx 双层架构,验证其可降低攻击成功率、阻断多数提示注入,仅少量工具返回攻击成功,任务效用未受明显影响。
Comments 8 pages, 1 figure, AAAI2027
TrustShiftProbe:对MCP服务器上的阶段性信任攻击进行表征、基准测试与防御
专题命中 提示注入 :prompt injection(abstract);分类 cs.AI
AI总结 本研究针对MCP服务器的阶段性信任攻击提出TrustShiftProbe框架,建立威胁模型、攻击引擎与防御机制SHIELD,使攻击成功率从69.5%降至42.7%
基于大语言模型的自动模型卡片生成
专题命中 幻觉与事实性 :alignment(abstract);分类 cs.AI
AI总结 本研究提出基于LLM的MCTidy与MCGenie,前者重组模型卡片为标准化模板,后者从仓库数据直接生成,经48个Hugging Face模型验证,可实现标准化、可扩展的模型卡片文档生成。
面向生理安全临床语言模型的神经符号对齐
机构 * University of Kurdistan Hewlêr(库尔德斯坦大学) ; Nanyang Technological University(南洋理工大学) ; Massachusetts Institute of Technology(麻省理工学院) ; University of Kragujevac(克拉古耶瓦茨大学)
专题命中 安全评测 :alignment(title,abstract);safety(abstract,abstract_cn);分类 cs.AI
AI总结 提出神经符号对齐框架,耦合临床LLM与HGNN生理世界模型,在CSB基准上显著提升临床LLM的生理安全性能,优于ORPO、GPT-4等方法,为临床LLM安全对齐提供新路径。
超越语义准确率:面向安全关键型语言理解的后果感知评估
机构 * ATMRI, Nanyang Technological University (NTU)(南洋理工大学ATMRI) ; Centre of AI Research, VinUniversity(文大学人工智能研究中心) ; School of Management, Indian Institute of Technology Mandi(印度理工大学曼迪分校管理学院)
专题命中 安全评测 :safety(title,abstract);分类 cs.CL
AI总结 针对空管场景,研究发现传统NLP指标会误判语言模型的操作可靠性,提出后果感知评估可弥补语义-安全差距,为安全关键型部署提供必要补充。
SteerCheck:激活引导审计中的归因特异性与对齐泄漏
机构 * University of Technology Sydney(悉尼科技大学)
专题命中 安全评测 :alignment(title,abstract);分类 cs.CL
AI总结 SteerCheck是一项预先注册的归因审计方法,用于检测激活引导的对齐泄漏,揭示了Qwen3-14B等模型在激活引导中的特异性局限,为审计相关结论提供了可操作的框架。
SA-Bench:评估基于大语言模型的论文复现中的语义对齐
机构 * Beihang University(北京航空航天大学) ; Shanghai Jiao Tong University(上海交通大学) ; Minzu University of China(中央民族大学) ; Peking University(北京大学) ; Zhongguancun Academy(中关村科学院)
专题命中 安全评测 :alignment(title,abstract);分类 cs.AI
AI总结 本研究推出SA-Bench基准,评估LLM复现论文时的语义对齐,发现现有模型复现准确率低,需优化脚手架以提升语义规范验证能力。
Comments Accepted to Findings of EMNLP 2026
重新思考大语言模型增强型协同过滤中的语义对齐:一种谱解耦方法
专题命中 安全评测 :alignment(title,abstract)
AI总结 本研究针对LLM增强型推荐中语义对齐无法有效利用互补非主语义信息的问题,提出UniSpecRec模型,通过信号特异性谱滤波实现谱解耦,提升推荐性能。
大型语言模型创造力自动评估的局限性
专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI、cs.CY
AI总结 本研究发现,当前自动评估方法及LLM作为评判者的评估方式,与人类对LLM生成文本创造力的判断存在显著不一致,无法有效捕捉创造力的关键维度。
基于大语言模型的约束引导式企业数据映射
机构 * Bosch Center for Artificial Intelligence(博世人工智能中心) ; Robert Bosch GmbH(罗伯特·博世有限公司)
专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI
AI总结 针对企业数据映射的问题,提出约束引导式映射(CGM)神经符号方法,通过三阶段流程提升匹配性能,该方法成本低、可迁移且能降低专家工作量,在基准测试中表现优异。
Comments 20th International Conference on Neurosymbolic Learning and Reasoning. NeSy 2026
用于语音智能体评估的LLM评判基准:可靠性、校准与人工监督
机构 * Sprinklr AI
专题命中 安全评测 :safety(abstract,comments);分类 cs.AI
AI总结 本研究对比人工与GPT-4.1、GPT-5对电信和零售语音智能体对话的评估,发现LLM评估可靠性依赖指标与配置,可作为规模化评估组成部分,支持混合评估 pipeline。
Comments Extends LLM-as-a-Judge to voice agents across telecom and retail, testing GPT-4.1 and GPT-5 against human raters across 10 safety and efficiency metrics. A correlation-based calibration analysis reveals domain-dependent reliability and identifies Recovery Turn Count and safety-recall metrics as unreliable for fully automated judging
超越准确率:面向法律依据任务的视觉语言模型双裁判评估协议
机构 * National Institute of Informatics (NII)(国立信息学研究所) ; VinUniversity(文大学) ; ROIS-DS Center for Juris-Informatics(ROIS-DS法学信息学中心)
专题命中 安全评测 :trustworthy(abstract);分类 cs.AI
AI总结 针对法律依据任务,提出双裁判评估协议,结合质量与语义等价裁判,在英国交通标志解读任务中发现不对称II型模式,发布相关资源以评估视觉语言模型的法律相关性能。
Comments Accepted and presented at the AI for Law Workshop at ICML 2026
RecurSE:面向LLM规则评判器的有界递归自评估
机构 * College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院) ; Meituan LongCat Team(美团龙猫团队)
专题命中 安全评测 :alignment(abstract);分类 cs.CL
AI总结 本研究提出RecurSE,一种无需外部监督的LLM规则评判器优化方法,通过同步评判器与检查器的协同演化、接口解耦及PAV监控,在多基准上实现泛化提升,可增强下游策略对齐。
TrustDABench:面向结构化数据分析的大语言模型可靠性与鲁棒性基准
机构 * Jiutian(九天)
专题命中 安全评测 :trustworthy(abstract);分类 cs.CL
AI总结 本研究提出TrustDABench基准,评估8种LLM在结构化数据分析中的可靠性与鲁棒性,发现现有模型在检测冲突证据、应对扰动等方面存在不足,需提升证据边界识别与不变性推理能力。
Comments Code&Data: this https URL (https://github.com/Skyorca/TrustDABench)
WeMM-Embedding:微信多模态嵌入技术报告
机构 * WeChat Vision, Tencent Inc.(腾讯微信视觉部)
专题命中 安全评测 :alignment(abstract);分类 cs.CL
AI总结 本报告提出WeMM-Embedding多模态嵌入模型家族,含2B、4B、9B变体,经两阶段训练后在公开基准及微信应用中表现优异,已部署并开源。