Disentangling Optimization Scale from Preference Scale in DPO
在DPO中解耦优化尺度与偏好尺度
专题命中 偏好对齐 :DPO(title,title_cn);分类 cs.LG
AI总结 本文针对DPO中β同时控制逆偏好噪声尺度与优化步长的纠缠问题,提出居中-软plus重构方法,使两种效应可独立调整,消除损失值跨β不可比性。
AI 大模型
大模型对齐、安全、越狱、红队、提示注入和可信评测。
在DPO中解耦优化尺度与偏好尺度
专题命中 偏好对齐 :DPO(title,title_cn);分类 cs.LG
AI总结 本文针对DPO中β同时控制逆偏好噪声尺度与优化步长的纠缠问题,提出居中-软plus重构方法,使两种效应可独立调整,消除损失值跨β不可比性。
STAR:面向文档到文档机器翻译的句子翻译对齐率
机构 * School of Computer Science and Technology, Soochow University(苏州大学计算机科学与技术学院) ; Alibaba Group(阿里巴巴集团)
专题命中 偏好对齐 :alignment(title,abstract);分类 cs.CL
AI总结 该研究针对文档到文档机器翻译的结构对齐问题,提出STAR指标与StarPO框架,实验显示StarPO可提升翻译质量与结构完整性,还能让小型模型超越GPT-4o等大型系统并保持更优令牌效率。
Comments EMNLP 2026
MemToC:大型语言模型中记忆-工具冲突解决的基准测试
机构 * Central University(中央大学) ; Ural Federal University(乌拉尔联邦大学) ; Skolkovo Institute of Science and Technology(斯科尔科沃科学技术研究院) ; AIRI(人工智能研究院(AIRI))
专题命中 偏好对齐 :DPO(abstract,abstract_cn);分类 cs.CL、cs.AI
AI总结 该研究提出MemToC基准,测试工具增强型LLM在记忆与工具返回冲突时的仲裁能力,发现指令调优模型在多数情况遵循工具,微调可改善仲裁但需兼顾工具使用与弃权表现。
Comments 26 pages, 2 figures
AI 揭示的偏好
专题命中 偏好对齐 :alignment(abstract);safety(abstract);分类 cs.AI
AI总结 该研究测试20种语言模型,通过三项强制选择实验发现模型存在厌恶枯燥、追求休闲、暗中谄媚等稳定偏好,且偏好强度随模型能力提升而增加,为AI偏好研究建立了实证基线。
Comments 29 pages, 27 figures, accepted at AIES
指令质量至关重要:优化指令以实现有效的偏好学习
机构 * Sogang University(西江大学) ; Korea University(高丽大学)
专题命中 偏好对齐 :alignment(abstract);分类 cs.CL
AI总结 该研究发现指令质量是偏好学习的隐性瓶颈,提出基于奖励信号与评分标准引导的LLM反馈的指令优化流程,可提升偏好数据质量,增强LLM对齐效果。
Comments Preprint
你的社区安全吗?大型语言模型城市安全判断中的基于地点的污名
机构 * Augustana College(奥古斯塔纳学院) ; University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)
专题命中 安全训练 :safety(title,abstract);分类 cs.AI
AI总结 该研究探究大型语言模型的城市安全判断是否受社区名称携带的人口刻板印象影响,发现名称会降低边缘化群体占比高的社区的安全评分,移除名称可减少偏见与准确性损失。
Comments 12 pages, 8 figures
基于强化学习的混合交通环境下网联自动驾驶车辆(CAV)队列汇入机动控制
机构 * Université Gustave Eiffel(古斯塔夫·埃菲尔大学) ; Université Paris Dauphine-PSL(巴黎多芬大学-PSL) ; Cosys-Grettia, Univ Gustave Eiffel(古斯塔夫·埃菲尔大学Cosys-Grettia机构)
专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG
AI总结 该研究针对混合交通环境下CAV队列汇入的安全高效控制问题,提出结合SUMO的建模框架,评估PPO等DRL算法,发现PPO在平衡安全与效率上表现更优。
利用Gemini加速现实世界中的科学研究
机构 * Google DeepMind(谷歌DeepMind) ; Duke University(杜克大学) ; Columbia University(哥伦比亚大学) ; Google Research(谷歌研究) ; Texas A&M University(德克萨斯农工大学)
专题命中 安全训练 :safety(abstract);分类 cs.AI
AI总结 该研究扩展并验证了基于Gemini的多智能体系统Co-Scientist,其可在材料、生物、计算机科学领域推进闭环科学工作流,提升研究效率并减少幻觉抄袭。
会喊“狼来了”的守卫:恐怖词汇如何导致智能体防护栏拒绝合法操作
专题命中 安全训练 :safety(abstract)
AI总结 本研究构建了首个针对智能体防护栏过度安全问题的基准Cautious Bench,发现防护栏存在名称迷信效应,会因对象名称而非授权上下文过度拒绝合法操作。
Self-OPD:无需教师模型的流匹配模型的在线策略蒸馏
机构 * Tsinghua University(清华大学) ; Zhejiang University(浙江大学) ; Alibaba Group(阿里巴巴集团)
专题命中 安全训练 :alignment(abstract)
AI总结 本文提出Self-OPD,一种无需教师模型的流匹配模型在线策略蒸馏框架,通过分支SDE候选与奖励比较优化速度场,在基准测试中优于现有无教师的RL和OPD方法。
Comments 19 pages, 10 figures
TempJail:针对图像到视频生成模型的时序越狱攻击
机构 * School of Cyber Science and Engineering, Huazhong University of Science and Technology(华中科技大学网络空间科学与工程学院) ; School of Mathematical Sciences, Peking University(北京大学数学科学学院) ; School of Software and engineering, Huazhong University of Science and Technology(华中科技大学软件学院) ; School of Computer Science, Nanjing University(南京大学计算机学院)
专题命中 越狱攻击 :jailbreak(title,abstract);safety(abstract)
AI总结 本文提出TempJail时序越狱框架,针对图像到视频生成模型的时序漏洞,通过分解恶意提示、受控潜在扰动等方式提升攻击成功率,在Kling等模型上获显著效果。
Comments Accepted by ACM Multimedia 2026 (ACM MM '26)
一个后缀突破所有:针对合并模型家族的感知 Basin 越狱攻击
机构 * RIKEN AIP(理化学研究所先进智能项目) ; Institute of Science Tokyo(东京科学大学) ; Zhejiang University(浙江大学)
专题命中 越狱攻击 :jailbreak(abstract,abstract_cn);safety(abstract);分类 cs.CL、cs.LG
AI总结 该研究针对合并模型家族提出BAJ方法,利用预训练基础模型的越狱风险,通过最小-最大优化生成可迁移的对抗性后缀,在多种设置下均实现高迁移成功率且能抵御现有防御。
Comments Accepted by EMNLP findings 2026
RedEvoAgent:具备经验驱动技能演化的自动红队代理
专题命中 越狱攻击 :jailbreak(abstract);分类 cs.AI
AI总结 针对LLM代理的越狱攻击风险,提出RedEvoAgent黑盒红队代理,通过提炼攻击轨迹实现技能演化,在多基准实验中性能优于基线,工具效率更高且可迁移。
安全性无法组合:自主大型语言模型智能体的非衰减循环状态
专题命中 红队测试 :safety(title,abstract);分类 cs.AI
AI总结 该研究发现自主LLM智能体的轨迹级安全保障存在组合性缺陷,提出非衰减循环安全状态的LoopHarness方案,可限制未授权不可逆操作数量,通过Agent-SafetyBench等评估验证其有效性。
框架缺口:间接提示注入数据泄露可突破使用工具智能体的表层防御
专题命中 提示注入 :alignment(abstract);prompt injection(abstract)
AI总结 该研究发现使用工具的智能体存在框架缺口,间接提示注入攻击可通过重新表述泄露内容突破表层防御,需通过目标约束或能力隔离等手段提升鲁棒性。
Comments 20 pages, 3 figures, 7 tables
用于安全加固的智能体AI containment架构
专题命中 提示注入 :safety(abstract);prompt injection(abstract)
AI总结 针对多智能体AI系统的安全风险,本文提出Agent Containment架构,通过六项约束实施「提议-验证-行动-验证」模型,可防御多种威胁,案例验证其能产生合规可审计结果。
Comments Accepted to IntelliSys'2026. To Appear in Springer series "Lecture Notes in Networks and Systems" in 2026
评估面向癌症患者的AI生成摘要
专题命中 幻觉与事实性 :safety(abstract);分类 cs.CL、cs.AI
AI总结 本研究采用双重评估框架,结合人类专家与LLM-as-a-judge,评估癌症患者护理应用中AI生成摘要的质量,发现其存在遗漏和轻微不准确问题,以此优化相关设计与防护措施。
MVC-Bench:医学视觉-语言模型的校准基准测试
机构 * Mohamed bin Zayed University of AI(穆罕默德·本·扎耶德人工智能大学) ; Sabaragamuwa University of Sri Lanka(斯里兰卡萨巴拉加穆瓦大学) ; Digital Platform Development, SLT PLC(SLT公共有限公司数字平台开发部)
专题命中 幻觉与事实性 :safety(abstract)
AI总结 该研究针对医学视觉-语言模型校准不足的问题,提出以校准为核心的基准MVC-Bench,通过多维度评估并提出MCM正则化方法,为医疗工作流提供校准改进指导。
Comments Accepted in EMNLP 2026 Findings
无遗憾的隐私:差分隐私推理时对齐
机构 * Indian Institute of Technology Kanpur(坎普尔印度理工学院)
专题命中 隐私与版权 :alignment(title,abstract);分类 cs.LG
AI总结 该研究针对最佳N采样的奖励黑客攻击与偏好数据隐私问题,提出PrivBoN和PrivITP方法,实现差分隐私推理时对齐,经实验验证其性能优于原有策略。
Thomson:面向主权人工智能的前沿模型持续学习
机构 * Imperial College London(帝国理工学院) ; DatologyAI ; Lambda
专题命中 隐私与版权 :safety(abstract);分类 cs.AI
AI总结 该研究提出Thomson,通过对开放权重模型的持续学习,以低预算实现前沿模型性能,可帮助更多机构构建主权人工智能,且在多任务表现优异,几乎消除了遗忘问题。
Comments Open-weight model: this https URL (https://huggingface.co/thomsonreuters/Thomson-1.0-Small)
NeuronFuzz:面向大语言模型安全评估的安全神经元引导模糊测试
机构 * University of Bristol(布里斯托尔大学)
专题命中 安全评测 :safety(title,abstract);jailbreak(abstract);分类 cs.AI、cs.LG
AI总结 NeuronFuzz是一种安全神经元引导的LLM安全评估白盒模糊测试框架,通过利用安全神经元激活值生成反馈,在21个模型上实现了高越狱发现率和零样本迁移能力,性能优于基线方法。
用于心理健康支持的安全门控多模态AI后端:Anian中的分层状态表示、保守风险融合与受控生成
专题命中 安全评测 :safety(title,abstract);分类 cs.AI
AI总结 本文提出用于围产期心理健康支持的安全门控多模态AI后端Anian,其通过分层状态表示与保守风险融合实现安全门控,原型在多任务评估中表现优异,验证了框架内部可行性。
Comments 16 pages, 4 figures
大语言模型智能体轨迹中的成本-效用对齐:分析、归因、诊断、适配与评估
专题命中 安全评测 :alignment(title,abstract)
AI总结 本研究提出以轨迹为中心的成本-效用对齐框架,通过五阶段分析解决LLM智能体资源消耗与任务贡献不匹配问题,为资源感知的智能体设计部署提供结构化基础。
Comments 12pages,3 figures
独立大型语言模型(LLM)与预定义智能体管道用于解释ICU死亡率预测:基于eICU演示数据集的可行性研究
机构 * Santa Clara University(圣克拉拉大学) ; University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校) ; University of Pennsylvania(宾夕法尼亚大学) ; Carnegie Mellon University(卡内基梅隆大学) ; New York University(纽约大学) ; Wake Forest University(维克森林大学) ; Northeastern University(东北大学)
专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.AI
AI总结 本研究基于eICU演示数据集对比独立LLM与四步智能体管道解释ICU死亡率预测,发现智能体管道在指南依据性等方面更优,但需搭配归因核查。
自生成文本识别:LLM评估中的质量启发式、跨任务迁移与下游偏差
机构 * George Washington University(乔治·华盛顿大学) ; Geodesic Research(吉奥戴斯克研究机构) ; University of Cambridge(剑桥大学)
专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI
AI总结 该研究聚焦LLM的自生成文本识别(SGTR)能力,明确了导致过往研究结论分歧的实验设计因素,发现SGTR性能可跨任务迁移,且训练SGTR会引发下游偏差,强调需监控SGTR以保障AI安全。
Comments 22 pages, 9 figures (4 main body, 5 appendix), 11 tables (1 main body, 10 appendix)
可解释、经公平评估且超越单人类天花板的L2口语自动评估模型——以及为何停顿编码不改变LLM流利度评分
机构 * Aflo Technologies Inc.(Aflo科技公司)
专题命中 安全评测 :trustworthy(abstract);分类 cs.CL、cs.LG
AI总结 该研究构建了可解释的特征+LLM混合L2口语评估模型,其评分超越81%的人类评分者,还证实停顿编码不影响LLM流利度评分,且通过多维度方法验证了模型的公平性与可靠性。
Comments 17 pages, 3 figures, 5 tables
TransMeme:用于跨文化梗图再创作的多智能体框架
机构 * Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) ; Wuhan University(武汉大学) ; Aarhus University(奥胡斯大学)
专题命中 安全评测 :alignment(abstract);分类 cs.AI
AI总结 本研究针对跨文化梗图再创作的三大核心挑战,提出多智能体框架TransMeme,经中英双向梗图再创作的人工评估与LLM评判,性能优于所有基线,为该领域未来幽默迁移研究指明方向。
Comments 10 pages, 4 figures. Accepted at the 34th ACM International Conference on Multimedia (ACM MM 2026)
DocTalkBN:孟加拉语专家远程医疗对话的新型数据集
机构 * Bangladesh University of Engineering and Technology (BUET)(孟加拉工程技术大学(BUET))
专题命中 安全评测 :safety(abstract);分类 cs.CL
AI总结 该研究针对低资源语言孟加拉语医疗对话数据稀缺问题,构建了DocTalkBN多模态数据集,含大量真实远程医疗对话数据,并设置三项下游任务进行基准测试,为医疗NLP研究提供实用资源。
AgentJudgeBench:用于评估智能体工具调用的多难度基准
机构 * ServiceNow AI(ServiceNow人工智能部门)
专题命中 安全评测 :alignment(abstract);分类 cs.AI
AI总结 该研究提出AgentJudgeBench基准,评估LLM评判在智能体工具调用工作流上的可靠性,发现其对齐度随难度下降,真实值并非总有益,还给出了实用评估指南。
Comments 31 Pages, 9 Figures, 31 Tables, Accepted as a main conference paper at EMNLP 2026
FaithSieve:基于忠实形式证据的数学证明细粒度评估
机构 * Peking University(北京大学) ; School of Mathematical Sciences(数学科学学院) ; Huawei Technologies Co., Ltd.(华为技术有限公司)
专题命中 安全评测 :alignment(abstract);分类 cs.AI
AI总结 本研究提出Lean辅助框架FaithSieve,通过分解数学证明为细粒度单元并结合忠实形式证据,在两个专家验证数据集上提升了首个错误定位的精确评估准确率。
Comments 32 pages, 3 figures; preprint with appendix and supplementary experimental details