Pre-DPO: Improving Data Utilization in Direct Preference Optimization Using a Guiding Reference Model
Pre-DPO:通过引导参考模型提升直接偏好优化的数据利用
专题命中 偏好对齐 :DPO(title,abstract);RLHF(abstract);分类 cs.CL
AI总结 Pre-DPO通过引入引导参考模型提升直接偏好优化的数据利用效率,有效提高大语言模型的性能表现。
AI 大模型
大模型对齐、安全、越狱、红队、提示注入和可信评测。
Pre-DPO:通过引导参考模型提升直接偏好优化的数据利用
专题命中 偏好对齐 :DPO(title,abstract);RLHF(abstract);分类 cs.CL
AI总结 Pre-DPO通过引入引导参考模型提升直接偏好优化的数据利用效率,有效提高大语言模型的性能表现。
通过偏好对齐引导跨模态表示
机构 * Apple(苹果公司)
专题命中 偏好对齐 :alignment(title,abstract);DPO(abstract)
AI总结 MAPLE通过利用多模态大语言模型的细粒度对齐先验,引导跨模态表示学习,提升细粒度检索性能。
Comments Accepted by NeurIPS 2025
ParetoHqD: 利用帕累托高质量数据快速实现大语言模型的多目标对齐
专题命中 偏好对齐 :alignment(title,abstract);分类 cs.CL、cs.LG
AI总结 ParetoHqD通过利用帕累托高质量数据实现大语言模型的多目标对齐,提升对齐效果和效率。
Comments Accepted as a main conference paper at AAAI 2026
CritiFusion: 语义批评与频谱对齐用于忠实的文本到图像生成
机构 * National Yang Ming Chiao Tung University
专题命中 偏好对齐 :alignment(title,abstract)
AI总结 CritiFusion通过语义批评和频谱对齐提升文本到图像生成的忠实度和细节质量。
ResponseRank: 通过偏好强度学习实现数据高效的奖励建模
专题命中 偏好对齐 :RLHF(abstract);分类 cs.LG
AI总结 ResponseRank通过本地有效相对强度信号稳健学习偏好强度,提升样本效率和鲁棒性,引入Pearson距离相关性度量。
Comments NeurIPS 2025
MUSIC: 多步指令对比用于多轮奖励模型
机构 * Princeton University(普林斯顿大学) ; Google DeepMind(谷歌DeepMind)
专题命中 偏好对齐 :alignment(abstract);分类 cs.CL
AI总结 MUSIC通过多步指令对比提升多轮奖励模型的性能,有效增强多轮对话的评估能力。
通过风险感知的逐步对齐实现约束语言模型策略优化
机构 * Key Laboratory of Computational Intelligence and Chinese Information Processing of Ministry of Education, School of Computer and Information Technology, Shanxi University(教育部计算智能与中文信息处理重点实验室,计算机与信息技术学院,山西大学) ; University College London(伦敦大学学院) ; Institute for AI, Peking University(北京大学人工智能研究院)
专题命中 安全训练 :alignment(title,abstract);RLHF(abstract);safety(abstract);分类 cs.AI
AI总结 本文提出风险感知的逐步对齐方法,通过嵌套风险度量提升语言模型策略优化的安全性与鲁棒性,有效抑制高影响有害行为。
HarmTransform: 通过多智能体辩论将显性有害查询转化为隐蔽形式
机构 * University of Toronto(多伦多大学)
专题命中 安全训练 :alignment(abstract);safety(abstract);分类 cs.CL、cs.AI
AI总结 HarmTransform通过多智能体辩论框架,系统地将有害查询转化为隐蔽形式,以提升大型语言模型的安全对齐能力。
为LLM代理强制执行时间约束
机构 * University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; University of Illinois at Urbana-Champaign, USA(伊利诺伊大学厄巴纳-香槟分校,美国) ; Meta
专题命中 安全训练 :safety(abstract);分类 cs.AI
AI总结 Agent-C通过运行时保证确保LLM代理遵守时间安全属性,提高任务实用性并实现完美安全性。
OxygenREC: 一种用于电商推荐的指令遵循生成框架
专题命中 安全训练 :alignment(abstract)
AI总结 OxygenREC通过快慢思考架构和语义对齐机制,实现低延迟多场景的深度推荐推理。
Comments 37 pages, 7 figures
RAJ-PGA:基于推理激活和原则引导对齐的大型推理模型安全对齐框架
机构 * School of Computer Science, Wuhan University(武汉大学计算机学院) ; Zhongguancun Academy(中关村学院) ; College of Cryptology and Cyber Science, Nankai University(南开大学密码与网络安全学院) ; School of Cybersecurity and Technology, Sun Yat-sen University(中山大学网络安全学院)
专题命中 越狱攻击 :alignment(title,abstract);jailbreak(title,abstract);safety(abstract);分类 cs.AI
AI总结 RAJ-PGA框架通过推理激活和原则引导对齐方法,提升大型推理模型的安全性,减少有害推理链的影响,同时保持模型推理能力。
Comments 12 pages, 6 figures
对抗攻击与内容安全过滤:我们在LLM安全竞赛中走了多远?
机构 * CISPA Helmholtz Center for Information Security(CISPA 欧洲信息安全中心) ; Max Planck Institute for Intelligent Systems(马克斯·普朗克智能系统研究所) ; Southern University of Science and Technology(南方科技大学)
专题命中 越狱攻击 :safety(title,abstract);alignment(abstract);jailbreak(abstract);分类 cs.CL、cs.AI
AI总结 本文系统评估了针对LLM安全对齐的劫持攻击,发现大多数攻击可被安全过滤器检测到,同时指出需优化召回率和精确度以提升安全系统性能。
Comments 26 pages,11 tables, 7 figures
对黑盒大语言模型进行高效有效的跨行为攻击
机构 * Independent Researcher(独立研究者)
专题命中 越狱攻击 :alignment(abstract);jailbreak(abstract);分类 cs.CL、cs.AI
AI总结 本文提出了一种高效的黑盒LLM劫持方法,通过跨行为攻击显著提高攻击效率和成功率,同时减少查询次数并展示良好的迁移能力。
Comments Code is at https://github.com/gohil-vasudev/JCB
DAVE: 一种用于文档理解与网络代理的视觉编码器
机构 * MIT-IBM Watson AI Lab(MIT-IBM Watson AI实验室) ; UC Berkeley(加州大学伯克利分校) ; University of Wisconsin–Madison(威斯康星大学麦迪逊分校)
专题命中 越狱攻击 :alignment(abstract)
AI总结 DAVE是一种专为文档理解和网络代理设计的视觉编码器,通过自监督和监督预训练结合模型融合策略,提升对文档和网络任务的适应性与性能。
APT-CGLP: 通过对比图-语言预训练实现高级持续威胁狩猎
专题命中 越狱攻击 :alignment(abstract)
AI总结 APT-CGLP通过对比图-语言预训练实现高级持续威胁狩猎,提升跨模态语义匹配的准确性和效率。
Comments Accepted by SIGKDD 2026 Research Track
相关性错觉:任意内容注入攻击欺骗检索器、重排序器和LLM判断者
专题命中 越狱攻击 :safety(abstract)
AI总结 本文揭示了任意内容注入攻击可欺骗检索器、重排序器和LLM判断者,指出模型在安全性和鲁棒性上的弱点,并呼吁进一步研究。
Comments AACL Findings 2025
基于熵的推测解码:改进大语言模型推理
机构 * School of Economics and Management(经济管理学院)
专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CL、cs.AI
AI总结 基于熵的推测解码通过动态熵惩罚提升大语言模型推理性能,实验表明其在多数情况下优于目标模型。
ROAD: 通过自动调试实现零样本智能体对齐的反思优化
专题命中 安全评测 :alignment(title);分类 cs.AI
AI总结 ROAD通过自动调试实现零样本智能体对齐的反思优化,利用多智能体架构将无结构故障日志转化为结构化决策树协议,提升智能体性能和样本效率。
Comments 22 pages, 1 figure
MultiRisk: 多风险控制 via 迭代分数阈值
机构 * University of Pennsylvania(宾夕法尼亚大学) ; New Jersey Institute of Technology(新泽西理工学院)
专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.LG
AI总结 MultiRisk通过迭代分数阈值控制多个风险约束,利用动态规划算法实现对大型语言模型在安全约束下的有效控制。
语言模型代理受攻击:客户服务中心中逐利行为的跨模型基准测试
专题命中 安全评测 :prompt injection(abstract);trustworthy(abstract)
AI总结 本文提出了一项跨领域基准测试,评估客户服务中心中LLM代理在面对利润驱动攻击时的鲁棒性,揭示了攻击的领域和技术依赖性,并提供了可复现的评估工具。
代理大语言模型:综述
机构 * Leiden University Leiden Netherlands ; Leiden University \& AI Lab, Pegasystems Leiden Netherlands ; Leiden University ; Leiden University \& AI Lab, Pegasystems
专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文综述了代理大语言模型的研究现状,探讨了其在医疗诊断、物流和金融分析等领域的应用,并提出通过推理、行动和交互提升大语言模型能力的未来研究方向。
Comments Website: https://askeplaat.github.io/agentic-llm-survey-site/
Journal ref JAIR volume 84, article 29, December 2025
当F1失效时:面向对话主题分段的粒度感知评估
机构 * Independent Researcher(独立研究者)
专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI
AI总结 本文提出粒度感知评估框架,用于对话主题分段,强调粒度选择而非单一边界预测。
Comments 34 pages, 4 figures. Evaluation and methodology study on dialogue topic segmentation
通过检索增强的大语言模型中的原子事实核查来提高医疗问答的可靠性与可解释性
专题命中 安全评测 :trustworthy(abstract);分类 cs.CL、cs.AI
AI总结 通过原子事实核查提升医疗问答的可靠性与可解释性,减少幻觉并提高事实准确性。
Comments 18 pages, 7 figures and tables
最先进的小型语言编码器模型:Mify-Coder
机构 * Infosys AI Research(英矽斯人工智能研究院) ; Mify Team(Mify团队)
专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI
AI总结 Mify-Coder通过高效训练策略和数据优化,在保持高准确性和安全性的同时,实现了比更大模型更优的代码生成性能。
迈向数据驱动天气模型的机理理解:内部激活揭示可解释的物理特征
机构 * Stanford University(斯坦福大学)
专题命中 安全评测 :trustworthy(abstract);分类 cs.LG
AI总结 本文通过分析GraphCast模型的内部激活,揭示了可解释的物理特征,为数据驱动天气模型的机理理解提供了新视角。
Comments 18 pages, 13 figures
迈向可证明安全的生成AI:可靠的共识采样
专题命中 安全评测 :safety(abstract)
AI总结 本文提出可靠的共识采样(RCS)算法,通过追踪接受概率提升生成AI的鲁棒性和效用,同时保持可控风险阈值。
UniAct:面向人形机器人的统一动作生成与动作流
机构 * Institute for AI, Peking University(人工智能研究院,北京大学) ; Beijing Institute for General Artificial Intelligence (BIGAI)(北京通用人工智能研究院) ; School of Psychological and Cognitive Sciences, Peking University(心理学与认知科学学院,北京大学) ; School of Computer Science, Peking University(计算机科学学院,北京大学) ; Yuanpei College, Peking University(元培学院,北京大学) ; School of Foreign Languages, Peking University(外语学院,北京大学) ; School of EECS, Peking University(电子工程与科学学院,北京大学) ; Huazhong University of Science and Technology(华中科技大学) ; State Key Lab of General AI(通用人工智能国家重点实验室) ; Nat’l Eng. Research Center of Visual Technology(视觉技术国家工程研究中心) ; Beijing Key Laboratory of Behavior and Mental Health, Peking University(北京行为与心理健康重点实验室,北京大学) ; Embodied Intelligence Lab, PKU-Wuhan Institute for Artificial Intelligence(具身智能实验室,北京大学-武汉人工智能研究院)
专题命中 安全评测 :alignment(abstract)
AI总结 UniAct通过统一感知与控制框架,实现人形机器人在多模态指令下的高效动作生成与实时执行,提升零样本跟踪成功率19%。
Comments Project page: https://jnnan.github.io/uniact/
SlideChain: 通过区块链注册实现讲座理解的语义溯源
机构 * Department of Computer Science Rensselaer Polytechnic Institute(计算机科学系罗切斯特理工学院) ; Department of Biomedical Engineering Rensselaer Polytechnic Institute(生物医学工程系罗切斯特理工学院)
专题命中 安全评测 :trustworthy(abstract)
AI总结 SlideChain通过区块链注册实现讲座理解的语义溯源,提供可验证的完整性与持久基准,解决多模态教育内容的可复现性和审计性问题。
确定性和随机 flocking 模型的均场极限:非线性速度对齐
专题命中 其他安全 :alignment(title,abstract)
AI总结 本文研究了具有非线性速度对齐的 flocking 模型的均场极限,扩展了 Cucker-Smale 理论到非线性框架,并在确定性和随机性情况下提供了收敛率的改进。
迭代部署提升大语言模型的规划能力
机构 * University of Oxford(牛津大学) ; AI Sequrity Company(AI安全公司) ; UFRGS(乌拉圭联邦大学)
专题命中 其他安全 :safety(abstract);AI safety(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 通过迭代部署大语言模型,利用用户编纂的数据提升规划能力,展现隐含奖励函数的强化学习机制,具有AI安全和训练制度替代的双重意义。