Disentangling Optimization Scale from Preference Scale in DPO
在DPO中解耦优化尺度与偏好尺度
专题命中 偏好对齐 :DPO(title,title_cn);分类 cs.LG
AI总结 本文针对DPO中β同时控制逆偏好噪声尺度与优化步长的纠缠问题,提出居中-软plus重构方法,使两种效应可独立调整,消除损失值跨β不可比性。
AI 大模型
大模型对齐、安全、越狱、红队、提示注入和可信评测。
在DPO中解耦优化尺度与偏好尺度
专题命中 偏好对齐 :DPO(title,title_cn);分类 cs.LG
AI总结 本文针对DPO中β同时控制逆偏好噪声尺度与优化步长的纠缠问题,提出居中-软plus重构方法,使两种效应可独立调整,消除损失值跨β不可比性。
SAGA:面向低资源北欧语言模型的分数加权自适应生成对齐
机构 * Linköping University(林雪平大学) ; University of Iceland(冰岛大学)
专题命中 偏好对齐 :alignment(title,abstract);DPO(abstract,abstract_cn);分类 cs.LG
AI总结 该研究提出SAGA框架,用依存句法分析器监督取代人类偏好标注,在丹麦语、冰岛语等低资源北欧语言上提升了GPT-SW3-1.3B的语法质量,为相关语言的语法对齐提供了实用替代方案。
Comments 18 pages, 7 figures
对齐中的语言链:跨语言排序偏好优化
机构 * Korea University(高丽大学)
专题命中 偏好对齐 :alignment(title,abstract);分类 cs.CL、cs.AI
AI总结 针对大语言模型对齐依赖英语偏好数据导致其他语言性能欠佳的问题,提出CRPO框架,通过层级结构联合优化语言内与跨语言偏好,在多语言实验中性能优于标准方法。
Comments EMNLP 2026 Main
STAR:面向文档到文档机器翻译的句子翻译对齐率
机构 * School of Computer Science and Technology, Soochow University(苏州大学计算机科学与技术学院) ; Alibaba Group(阿里巴巴集团)
专题命中 偏好对齐 :alignment(title,abstract);分类 cs.CL
AI总结 该研究针对文档到文档机器翻译的结构对齐问题,提出STAR指标与StarPO框架,实验显示StarPO可提升翻译质量与结构完整性,还能让小型模型超越GPT-4o等大型系统并保持更优令牌效率。
Comments EMNLP 2026
MemToC:大型语言模型中记忆-工具冲突解决的基准测试
机构 * Central University(中央大学) ; Ural Federal University(乌拉尔联邦大学) ; Skolkovo Institute of Science and Technology(斯科尔科沃科学技术研究院) ; AIRI(人工智能研究院(AIRI))
专题命中 偏好对齐 :DPO(abstract,abstract_cn);分类 cs.CL、cs.AI
AI总结 该研究提出MemToC基准,测试工具增强型LLM在记忆与工具返回冲突时的仲裁能力,发现指令调优模型在多数情况遵循工具,微调可改善仲裁但需兼顾工具使用与弃权表现。
Comments 26 pages, 2 figures
AI 揭示的偏好
专题命中 偏好对齐 :alignment(abstract);safety(abstract);分类 cs.AI
AI总结 该研究测试20种语言模型,通过三项强制选择实验发现模型存在厌恶枯燥、追求休闲、暗中谄媚等稳定偏好,且偏好强度随模型能力提升而增加,为AI偏好研究建立了实证基线。
Comments 29 pages, 27 figures, accepted at AIES
指令质量至关重要:优化指令以实现有效的偏好学习
机构 * Sogang University(西江大学) ; Korea University(高丽大学)
专题命中 偏好对齐 :alignment(abstract);分类 cs.CL
AI总结 该研究发现指令质量是偏好学习的隐性瓶颈,提出基于奖励信号与评分标准引导的LLM反馈的指令优化流程,可提升偏好数据质量,增强LLM对齐效果。
Comments Preprint
由大语言模型(LLM)与人类撰写的新冠疫情信息解释的沟通风格及读者偏好:一项案例研究
机构 * School of Interactive Computing, Georgia Institute of Technology(交互计算学院,佐治亚理工学院) ; Amazon(亚马逊) ; Siebel School of Computing and Data Science, University of Illinois Urbana-Champaign(Siebel计算与数据科学学院,伊利诺伊大学厄巴纳-香槟分校)
专题命中 偏好对齐 :alignment(abstract);分类 cs.AI
AI总结 本研究以健康事实核查为场景,对比LLM与人类新冠信息解释的沟通风格,发现LLM内容在说服性等质量指标上较弱但受读者偏好,揭示LLM在健康领域的潜力与局限。
RePolicy:用于智能体安全保障中安全策略调用的强化学习方法
机构 * Zhejiang University(浙江大学) ; Zhongguancun Academy(中关村学院) ; University of Science and Technology of China(中国科学技术大学) ; National University of Singapore(新加坡国立大学)
专题命中 安全训练 :safety(title,abstract);分类 cs.CL、cs.AI
AI总结 针对现有智能体安全保障方法难以适应未见轨迹和变化策略上下文的问题,提出RePolicy方法,结合PolicyTraj-20K与带可验证奖励和策略上下文扰动的GRPO,在六个智能体安全基准上取得良好安全检测与策略调用效果。
你的社区安全吗?大型语言模型城市安全判断中的基于地点的污名
机构 * Augustana College(奥古斯塔纳学院) ; University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)
专题命中 安全训练 :safety(title,abstract);分类 cs.AI
AI总结 该研究探究大型语言模型的城市安全判断是否受社区名称携带的人口刻板印象影响,发现名称会降低边缘化群体占比高的社区的安全评分,移除名称可减少偏见与准确性损失。
Comments 12 pages, 8 figures
AirLLM:面向空中远程微调的基于扩散策略的自适应LoRA方法
机构 * College of Information Science and Electronic Engineering, Zhejiang University(浙江大学信息科学与电子工程学院) ; Zhejiang Lab(浙江实验室)
专题命中 安全训练 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 AirLLM是一种分层扩散策略框架,通过PPO智能体与DDIM交替优化实现自适应LoRA秩配置,可提升LLM空中远程微调性能并降低传输成本。
Comments 11 pages, 8 figures
基于强化学习的混合交通环境下网联自动驾驶车辆(CAV)队列汇入机动控制
机构 * Université Gustave Eiffel(古斯塔夫·埃菲尔大学) ; Université Paris Dauphine-PSL(巴黎多芬大学-PSL) ; Cosys-Grettia, Univ Gustave Eiffel(古斯塔夫·埃菲尔大学Cosys-Grettia机构)
专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG
AI总结 该研究针对混合交通环境下CAV队列汇入的安全高效控制问题,提出结合SUMO的建模框架,评估PPO等DRL算法,发现PPO在平衡安全与效率上表现更优。
MENTOR: 通过灵活的教师优化奖励进行工具使用蒸馏的强化学习
机构 * Seoul National University of Science and Technology(首尔科学技术大学) ; Korea Advanced Institute of Science and Technology(韩国科学技术院) ; LG CNS
专题命中 安全训练 :alignment(abstract);分类 cs.CL、cs.AI
AI总结 提出MENTOR方法,通过灵活的教师优化奖励结构,平衡行为对齐与下游性能,提升小模型在工具使用任务中的域外泛化能力。
利用Gemini加速现实世界中的科学研究
机构 * Google DeepMind(谷歌DeepMind) ; Duke University(杜克大学) ; Columbia University(哥伦比亚大学) ; Google Research(谷歌研究) ; Texas A&M University(德克萨斯农工大学)
专题命中 安全训练 :safety(abstract);分类 cs.AI
AI总结 该研究扩展并验证了基于Gemini的多智能体系统Co-Scientist,其可在材料、生物、计算机科学领域推进闭环科学工作流,提升研究效率并减少幻觉抄袭。
会喊“狼来了”的守卫:恐怖词汇如何导致智能体防护栏拒绝合法操作
专题命中 安全训练 :safety(abstract)
AI总结 本研究构建了首个针对智能体防护栏过度安全问题的基准Cautious Bench,发现防护栏存在名称迷信效应,会因对象名称而非授权上下文过度拒绝合法操作。
Self-OPD:无需教师模型的流匹配模型的在线策略蒸馏
机构 * Tsinghua University(清华大学) ; Zhejiang University(浙江大学) ; Alibaba Group(阿里巴巴集团)
专题命中 安全训练 :alignment(abstract)
AI总结 本文提出Self-OPD,一种无需教师模型的流匹配模型在线策略蒸馏框架,通过分支SDE候选与奖励比较优化速度场,在基准测试中优于现有无教师的RL和OPD方法。
Comments 19 pages, 10 figures
打破舍入陷阱:保护LLM免受量化条件后门攻击
专题命中 安全训练 :alignment(abstract)
AI总结 提出QuantGuard方法,通过可微舍入控制变量和误差引导的舍入反转约束等机制,在仅使用少量校准数据且不修改量化算法的情况下,阻断后门激活路径,有效降低攻击成功率至接近干净模型水平。
你若懈怠,便会错失:通过神经权重转换自动恢复安全对齐
专题命中 越狱攻击 :alignment(title,abstract);safety(title,abstract);jailbreak(abstract)
AI总结 针对公共LoRA适配器安全对齐缺失或微调导致领域知识退化的问题,提出NeWTral方法,在参数空间内转换不安全适配器,可将平均攻击成功率从70%降至13%,保留88%知识保真度,无需原始训练数据和重新训练。
TempJail:针对图像到视频生成模型的时序越狱攻击
机构 * School of Cyber Science and Engineering, Huazhong University of Science and Technology(华中科技大学网络空间科学与工程学院) ; School of Mathematical Sciences, Peking University(北京大学数学科学学院) ; School of Software and engineering, Huazhong University of Science and Technology(华中科技大学软件学院) ; School of Computer Science, Nanjing University(南京大学计算机学院)
专题命中 越狱攻击 :jailbreak(title,abstract);safety(abstract)
AI总结 本文提出TempJail时序越狱框架,针对图像到视频生成模型的时序漏洞,通过分解恶意提示、受控潜在扰动等方式提升攻击成功率,在Kling等模型上获显著效果。
Comments Accepted by ACM Multimedia 2026 (ACM MM '26)
一个后缀突破所有:针对合并模型家族的感知 Basin 越狱攻击
机构 * RIKEN AIP(理化学研究所先进智能项目) ; Institute of Science Tokyo(东京科学大学) ; Zhejiang University(浙江大学)
专题命中 越狱攻击 :jailbreak(abstract,abstract_cn);safety(abstract);分类 cs.CL、cs.LG
AI总结 该研究针对合并模型家族提出BAJ方法,利用预训练基础模型的越狱风险,通过最小-最大优化生成可迁移的对抗性后缀,在多种设置下均实现高迁移成功率且能抵御现有防御。
Comments Accepted by EMNLP findings 2026
TriShieldRAG:一种针对检索增强生成中知识腐败的三环深度防御框架
专题命中 越狱攻击 :trustworthy(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 研究针对检索增强生成中知识腐败问题,构建TriShieldRAG框架,设置摄取防护、检索评分器和跨语言模型共识阶段三个环,推导环2和环3起作用的条件,评估表明该框架能大幅降低攻击成功率并保持良性查询准确性。
Comments v2: Adds an adaptive-attacker evaluation in which Ring 1 is fully evaded (500/500 documents, three corpora); scales to the full NQ, HotpotQA and MS-MARCO corpora; corrects Proposition 1, whose boundary is corpus-dependent (0.214/0.251/0.558) not 0.5; retracts a proposed closed form after a pre-registered prediction failed. The v1 headline 91%-to-13% result is withdrawn
RedEvoAgent:具备经验驱动技能演化的自动红队代理
专题命中 越狱攻击 :jailbreak(abstract);分类 cs.AI
AI总结 针对LLM代理的越狱攻击风险,提出RedEvoAgent黑盒红队代理,通过提炼攻击轨迹实现技能演化,在多基准实验中性能优于基线,工具效率更高且可迁移。
安全性无法组合:自主大型语言模型智能体的非衰减循环状态
专题命中 红队测试 :safety(title,abstract);分类 cs.AI
AI总结 该研究发现自主LLM智能体的轨迹级安全保障存在组合性缺陷,提出非衰减循环安全状态的LoopHarness方案,可限制未授权不可逆操作数量,通过Agent-SafetyBench等评估验证其有效性。
NiyamAI——一种使用零知识证明实现密码学可验证护栏的意图绑定AI智能体
专题命中 提示注入 :safety(abstract);prompt injection(abstract);分类 cs.AI
AI总结 Niyam-AI是一种基于零知识证明的意图绑定AI智能体框架,通过SHA-256承诺意图合约、Judge模型验证和zk-SNARK确保证明,在Agent-SafetyBench评估中较多款基线护栏实现显著安全性能提升。
框架缺口:间接提示注入数据泄露可突破使用工具智能体的表层防御
专题命中 提示注入 :alignment(abstract);prompt injection(abstract)
AI总结 该研究发现使用工具的智能体存在框架缺口,间接提示注入攻击可通过重新表述泄露内容突破表层防御,需通过目标约束或能力隔离等手段提升鲁棒性。
Comments 20 pages, 3 figures, 7 tables
用于安全加固的智能体AI containment架构
专题命中 提示注入 :safety(abstract);prompt injection(abstract)
AI总结 针对多智能体AI系统的安全风险,本文提出Agent Containment架构,通过六项约束实施「提议-验证-行动-验证」模型,可防御多种威胁,案例验证其能产生合规可审计结果。
Comments Accepted to IntelliSys'2026. To Appear in Springer series "Lecture Notes in Networks and Systems" in 2026
评估面向癌症患者的AI生成摘要
专题命中 幻觉与事实性 :safety(abstract);分类 cs.CL、cs.AI
AI总结 本研究采用双重评估框架,结合人类专家与LLM-as-a-judge,评估癌症患者护理应用中AI生成摘要的质量,发现其存在遗漏和轻微不准确问题,以此优化相关设计与防护措施。
ProvenanceGuard: 基于MCP的LLM智能体的源感知事实性验证
机构 * Multiverse Computing ; Parque Cientifico y Tecnológico de Gipuzkoa(吉普斯夸科技园) ; Centre for Social Innovation(社会创新中心) ; Donostia International Physics Center(多诺斯蒂亚国际物理中心) ; Ikerbasque Foundation for Science(伊克尔巴斯克科学基金会)
专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CL、cs.AI
AI总结 提出ProvenanceGuard,一种源感知验证器,通过追踪MCP工具调用、分解声明并路由到特定源,检测跨源混淆错误,在医疗领域数据集上优于源无关基线。
Comments 20 pages, 4 figures
CultureVidBench:文本到视频生成中的文化理解基准测试
机构 * Nanyang Technological University(南洋理工大学) ; Centrale Supélec(中央高等电力学院) ; Singapore Management University(新加坡管理大学) ; University of Cambridge(剑桥大学)
专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CL
AI总结 本研究推出CultureVidBench基准,评估7款T2V模型的文化理解能力,发现现有模型难捕捉细粒度文化细节,尤其针对代表性不足的文化区域与线索。
Comments EMNLP 2026 Main Conference, Project page: this https URL (https://hanxjing.github.io/CultureVidBench/)
MVC-Bench:医学视觉-语言模型的校准基准测试
机构 * Mohamed bin Zayed University of AI(穆罕默德·本·扎耶德人工智能大学) ; Sabaragamuwa University of Sri Lanka(斯里兰卡萨巴拉加穆瓦大学) ; Digital Platform Development, SLT PLC(SLT公共有限公司数字平台开发部)
专题命中 幻觉与事实性 :safety(abstract)
AI总结 该研究针对医学视觉-语言模型校准不足的问题,提出以校准为核心的基准MVC-Bench,通过多维度评估并提出MCM正则化方法,为医疗工作流提供校准改进指导。
Comments Accepted in EMNLP 2026 Findings