arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-08-25 至 2026-08-25 共收录 151 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 偏好对齐 17 篇

2502.14643 2026-08-25 cs.CL 版本更新 86%

Length-Controlled Margin-Based Preference Optimization without Reference Model

无参考模型的长度可控基于间隔的偏好优化

Gengxu Li, Tingyu Xia, Yi Chang, Yuan Wu

机构 * School of Artificial Intelligence, Jilin University(吉林大学人工智能学院) Engineering Research Center of Knowledge-Driven Human-Machine Intelligence, MOE, China(知识驱动人机智能工程研究中心,教育部,中国) International Center of Future Science, Jilin University(未来科学国际中心,吉林大学)

专题命中 偏好对齐 :DPO(summary_cn,abstract);RLHF(abstract,abstract_cn);分类 cs.CL

AI总结 本研究针对DPO的局限提出LMPO,引入统一参考模型与平均对数概率优化策略,通过长度可控间隔损失调控响应长度并缓解概率退化,在Mistral和LLaMA3上的6个基准中性能优于现有方法。

Comments 17 pages, 3 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22806 2026-08-25 cs.CL 新提交 83%

DIAG: Diagnostic Iterative Alignment and Generation for Data-Efficient Mathematical Preference Distillation

DIAG:面向数据高效数学偏好蒸馏的诊断式迭代对齐与生成

Guhan Chen, Songtao Tian, Bohan Li, Hejin Wang, YeXin Xie, Zixiong Yu

机构 * Tsinghua University(清华大学) Kyoto University(京都大学) Nanjing University(南京大学)

专题命中 偏好对齐 :alignment(title,abstract);分类 cs.CL

AI总结 DIAG是一种自适应调整训练分布的框架,通过诊断偏好对产出与生成针对性训练数据,提升数学推理任务中偏好监督的信息价值,在同等训练预算下增强模型性能。

Comments Accepted by EMNLP 2026 findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02824 2026-08-25 cs.CL 版本更新 83%

CALIBURN: Self-Calibrated LLM Unlearning Alignment

CATNIP:通过校准和令牌化的负偏好对齐实现LLM去学习

Zhengbang Yang, Yisheng Zhong, Junyuan Hong, Zhuangdi Zhu

机构 * George Mason University(乔治·马歇尔大学) University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 偏好对齐 :alignment(title,abstract);safety(abstract);分类 cs.CL

AI总结 CATNIP通过校准和令牌化的负偏好对齐方法,实现有效LLM去学习,无需保留数据或对比对,提升知识遗忘与保留的平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21860 2026-08-25 cs.LG cs.AI 新提交 82%

ChainPrune: Evaluating and Reducing Redundancy in Long Chain-of-Thought Reasoning

ChainPrune:评估与减少长思维链推理中的冗余

Weihang Pan, Zhengxu Yu, Yuxiang Zhang, Wenzhi Li, Zhongming Jin, Binbin Lin, Xiaofei He, Jieping Ye

机构 * Alibaba Group(阿里巴巴集团)

专题命中 偏好对齐 :DPO(summary_cn,abstract);分类 cs.AI、cs.LG

AI总结 ChainPrune 是一种推理路径语义结构优化方法,通过整合推理路径为树结构、选择主导路径及结合 DPO 与监督损失,减少长思维链冗余,在保精度的同时降低了步骤长度与计算开销。

Comments 15 pages, 12 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04588 2026-08-25 cs.CL 版本更新 81%

VCIFBench: Evaluating Complex Instruction Following for Video Understanding

VCIFBench:评估视频理解中的复杂指令遵循能力

Huangchen Xu, Yuan Wu, Yi Chang

机构 * School of Artificial Intelligence, Jilin University(吉林大学人工智能学院) Engineering Research Center of Knowledge-Driven Human-Machine Intelligence, Jilin University(知识驱动人机智能工程研究中心,吉林大学) International Center of Future Science, Jilin University(未来科学国际中心,吉林大学)

专题命中 偏好对齐 :DPO(summary_cn,abstract);分类 cs.CL

AI总结 提出VCIFBench基准,通过混合验证流水线评估多模态大模型在视频理解中遵循内容、格式、风格和结构约束的复杂指令能力,实验表明联合约束满足仍具挑战,DPO训练可提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23149 2026-08-25 cs.CL cs.AI 新提交 81%

Language Chain in Alignment: Cross-Lingual Ranking Preference Optimization

对齐中的语言链:跨语言排序偏好优化

Seungyoon Lee, Minhyuk Kim, Jungseob Lee, Heuiseok Lim

机构 * Korea University(高丽大学)

专题命中 偏好对齐 :alignment(title,abstract);分类 cs.CL、cs.AI

AI总结 针对大语言模型对齐依赖英语偏好数据导致其他语言性能欠佳的问题,提出CRPO框架,通过层级结构联合优化语言内与跨语言偏好,在多语言实验中性能优于标准方法。

Comments EMNLP 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01160 2026-08-25 cs.AI 版本更新 79%

Expected Value Alignment for Generative Reward Modeling in Formal Mathematics Verification

形式数学验证中生成式奖励建模的期望值对齐

Shihao Ji, Haotao Tan, Zihui Song, Mingyu Li

专题命中 偏好对齐 :alignment(title,abstract);分类 cs.AI

AI总结 提出期望值对齐(EVA)方法,通过从模型词元分布中提取连续分数,在保持生成式奖励模型离散输出的同时实现连续评分,用于Lean 4形式验证。

Comments Withdrawn due to serious concerns regarding the authenticity and accuracy of the listed authorship. The identity of one or more listed authors cannot presently be verified, and the author list may not represent distinct contributors. The manuscript is withdrawn pending institutional review

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21993 2026-08-25 cs.LG 新提交 77%

Gated Decoupled Compositional Bandits: A Unified Theory of Contextual Bandits with Supervised-Calibrated Action Scaling and Pre-Execution Gating

门控解耦组合多臂老虎机:带监督校准动作缩放与预执行门控的上下文多臂老虎机统一理论

Oleg Miroshnichenko

专题命中 偏好对齐 :RLHF(abstract,abstract_cn);safety(abstract);分类 cs.LG

AI总结 该研究提出门控解耦组合多臂老虎机(GDCB),证明其可统一多个工业系统,核心定理可将非平稳问题转化为近似平稳问题,还推广了相关结果,配套论文已验证短期租赁动态定价实例。

Comments 30 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05882 2026-08-25 cs.CL cs.AI cs.LG 版本更新 75%

An Empirical Study on Preference Tuning Generalization and Diversity Under Domain Shift

关于领域转移下偏好微调泛化性和多样性的实证研究

Constantinos Karouzos, Xingwei Tan, Nikolaos Aletras

机构 * School of Computer Science University of Sheffield, UK(计算机科学学院 谢菲尔德大学)

专题命中 偏好对齐 :alignment(abstract);safety(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本研究通过比较不同对齐目标和适应策略,探讨领域转移下偏好微调的泛化性和多样性,发现伪标签法能有效缓解领域转移带来的性能下降。

Comments Accepted to EMNLP 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21864 2026-08-25 cs.LG cs.AI cs.CV 新提交 73%

BioMed-Agent-RL: A Meta Learning, All You Need for Biomedical Applications

BioMed-Agent-RL:元学习,生物医学应用的一切所需

Md Asaduzzaman Jabin, Zihao Wu, Tianming Liu

专题命中 偏好对齐 :DPO(abstract,abstract_cn);分类 cs.AI、cs.LG

AI总结 该研究针对临床视觉大语言模型的缺陷,提出BioMed-Agent-RL医学智能体,整合多模态元学习与强化学习等技术,在多基准实验中准确率达约73%,较现有模型提升约5%,为临床智能体系统建立新标准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09746 2026-08-25 cs.MA cs.AI cs.CL 版本更新 73%

CONSCIENTIA: Can LLM Agents Learn to Strategize? Emergent Deception and Trust in a Multi-Agent NYC Simulation

CONSCIENTIA:LLM代理能否学会策略性行为?多智能体纽约市模拟中的涌现欺骗与信任

Aarush Sinha, Arion Das, Soumyadeep Nag, Charan Karnati, Shravani Nag, Chandra Vadhan Raj, Aman Chadha, Vinija Jain, Suranjana Trivedy, Amitava Das

机构 * University of Copenhagen(哥本哈根大学) IIIT Ranchi(印度信息技术学院兰契分校) ISI Kolkata(印度统计学院加尔各答分校) NIT Andhra Pradesh(印度国家理工学院安得拉邦分校) IGDTUW(英迪拉·甘地德里技术女子大学) IIT Kharagpur(印度理工学院卡哈拉格普尔分校) Google DeepMind(谷歌DeepMind) Google(谷歌) AI Institute, University of South Carolina(南卡罗来纳大学人工智能研究所)

专题命中 偏好对齐 :alignment(abstract);safety(abstract);分类 cs.CL、cs.AI

AI总结 研究通过多智能体模拟探讨LLM在对抗性环境中的策略行为,发现智能体在导航中表现出有限的策略性,包括选择性信任与欺骗,但易受对抗性说服影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.08846 2026-08-25 cs.CY cs.AI cs.CL cs.LG 版本更新 70%

AI University: An LLM-Powered Learning Assistant for Engineering---A Finite Element Method Case Study

AI University:一款面向工程领域的大语言模型驱动学习助手——以有限元法案例研究为例

Mostafa Faghih Shojaei, Rahul Gulati, Benjamin A. Jasperson, Shangshang Wang, Simone Cimolato, Manas Vardhan, Dangli Cao, Willie Neiswanger, Krishna Garikipati

专题命中 偏好对齐 :alignment(abstract);分类 cs.CL、cs.AI、cs.CY

AI总结 本研究提出AI-U框架,结合微调LLM、RAG与推理合成模型,以FEM课程为案例开发学习助手,经多维度评估其对齐度优于基础模型,可推广至STEM领域。

Comments 14 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23397 2026-08-25 cs.AI 新提交 57%

MediSkill-Evo: Process-Constrained Self-Evolution for Evidence-Grounded Clinical Interaction

MediSkill-Evo:面向证据依据的临床交互的过程约束自进化

Ruoyu Wu, Shenfu Xie, Yinqian Sun, Haibo Tong, Feifei Zhao

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Beijing Institute of AI Safety and Governance(北京人工智能安全与治理研究院) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院)

专题命中 偏好对齐 :safety(abstract);分类 cs.AI

AI总结 MediSkill-Evo是无需主干微调的临床智能体,通过四类经验存储库与过程约束偏好工具优化,在多维度评估中提升了诊断准确率等指标,验证了其临床交互性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21425 2026-08-25 cs.CV cs.AI 新提交 57%

Aligning Human Sense: Calibrated Distributional Reward Learning for Video Generation

对齐人类感知:用于视频生成的校准分布奖励学习

Nai-Xin Zhai, Weihua Cheng, Dexu Yu, Yikai Gu, Hanwen Du, Junchen Fu, Chenxi Huang, Yingwei Song, Liyuan Lillian Ma, Yang Ran, Youhua Li, Yongxin Ni

专题命中 偏好对齐 :alignment(abstract);分类 cs.AI

AI总结 本文针对视频生成中奖励信号不可靠、偏好维度权衡丢失、KL散度难捕捉偏好全局结构的问题,提出统一偏好感知学习框架,通过精英过滤、分布建模与Wasserstein对齐改进,提升了奖励可靠性与视频感知一致性。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21374 2026-08-25 cs.AI 新提交 57%

LitReview Arena: Evaluating Literature Review Agents with Battle-Style Peer Review Platform

LitReview Arena:基于对战式同行评审平台的文献综述智能体评估

Ruotong Zhao, Zhiyu Chen, Xurui Liu, Haidong Xue, Dong Liang, Jigao Fu, Wu YanBiao, Yuanyi Zhen, Fengli Xu, Yong Li

专题命中 偏好对齐 :alignment(abstract);分类 cs.AI

AI总结 该研究推出对战式文献综述评估平台LitReview Arena,收集约3000条专家判断发现现有最强LLM综述系统仅23.0%胜率,校准后的评估器LitJudge将一致性提升至0.78。

Comments 20 pages, ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17795 2026-08-25 cs.CL 版本更新 57%

TraceSQL: Traceable Answerability Estimation for Reference-Free Text-to-SQL Verification

TraceSQL:无参考文本到SQL验证的可追踪答案性估计

Neelesh Kumar Shukla, Debasmita Panda, Srutanik Bhaduri, Aditya Banerjee, Vasu Rangarajan, Viji Krishnamurthy

机构 * Oracle Corporation(甲骨文公司)

专题命中 偏好对齐 :alignment(abstract);分类 cs.CL

AI总结 针对无参考文本到SQL验证的可追踪性不足问题,提出基于67种诊断特征的轻量模型TraceSQL,在BIRD数据集上优于基线模型,可提供可追溯的预测证据。

Comments 9 pages main paper with 6 pages supplementary material

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22780 2026-08-25 cs.CV 新提交 50%

Can We Perform Online RL for Image Editing without Editing Rewards?

我们能否在无编辑奖励的情况下进行图像编辑的在线强化学习?

Qichao Ma, Jikang Cheng, Ling Liang, Zhaofei Yu, Tiejun Huang, Renye Yan

专题命中 偏好对齐 :alignment(abstract)

AI总结 本文提出Lever-Edit框架,将文本到图像(T2I)奖励生态系统迁移至图像编辑,在无编辑奖励的情况下优化编辑策略,实验效果优于直观迁移基线且接近基于编辑奖励的微调。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 安全训练 22 篇

2603.02229 2026-08-25 cs.LG cs.CL 版本更新 84%

Safety Training May Persist Through Helpfulness Optimization in LLM Agents

在LLM代理中通过帮助性优化保持安全性训练

Benjamin Plaut

机构 * Department of Computer Science, University of California, Berkeley, USA(计算机科学系,加州大学伯克利分校)

专题命中 安全训练 :safety(title,abstract);DPO(abstract);分类 cs.CL、cs.LG

AI总结 研究通过帮助性优化在LLM代理中保持安全性训练,发现单独训练或依次训练无法找到最佳策略,但所有配置接近帕累托前沿。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21570 2026-08-25 cs.AI cs.LG 新提交 81%

A Reproducible, License-Aware Distillation Recipe for CPUDeployable Safety Classification

适用于CPU可部署安全分类的可复现、许可感知蒸馏方案

Edson Rodrigues da Cruz Filho, Paulo Ricardo Ferreira Neves, Paulo Henrique Eleuterio Falsetti, João Vitor Pavan, Ian Degaspari, Henrique Vieira Laturrague, Patrick Vieira Laturrague, Guilherme Nielsen Dias, Marccello Wilson Perez Berto, Gustavo Voltani Von Atzingen

专题命中 安全训练 :safety(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出一种可复现、许可感知的知识蒸馏方案,训练小型学生模型实现CPU可部署的安全分类,其性能接近大参数教师模型,误报率更低且推理速度更快。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21775 2026-08-25 cs.CL 新提交 79%

No One Model Catches Every Harm: Benchmarking Content Moderation Across Safety Scenarios

没有一种模型能应对所有危害:跨安全场景的内容审核基准测试

Afshin Orojlooyjadid, Hitesh Patel

机构 * Oracle AI(甲骨文人工智能)

专题命中 安全训练 :safety(title,abstract);分类 cs.CL

AI总结 该研究测试53个模型在11个数据集的四类安全场景下的表现,发现前沿模型在部分场景落后于专用模型,实际对话安全未解决,挑战规模即安全的假设并提供模型选择框架。

Comments EMNLP 2026 Main Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.07356 2026-08-25 cs.CL 版本更新 79%

Safety-Aligned Weights Are Not Enough: Refusal-Teacher-Guided Finetuning Enhances Safety and Downstream Performance under Harmful Finetuning Attacks

仅安全对齐权重不够:拒绝教师引导微调可在有害微调攻击下提升安全性与下游性能

Seokil Ham, Yubin Choi, Yujin Yang, Seungju Cho, Younghun Kim, Changick Kim

机构 * Korea Advanced Institute of Science and Technology (KAIST)(韩国科学技术院)

专题命中 安全训练 :safety(title,abstract);分类 cs.CL

AI总结 针对有害微调攻击威胁,该研究提出拒绝教师引导微调框架,将安全FaaS微调范式从安全对齐权重微调转为基础权重在安全教师指导下的微调,可减少有害输出并提升下游任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21796 2026-08-25 cs.CV cs.AI 新提交 70%

SAFE-G: Structure-aware Faithful Evidence-guided Generation for Knowledge-based Visual Question Answering

SAFE-G:面向基于知识的视觉问答的结构感知忠实证据引导生成

Long Shu, Shuochen Liu, Wei Chen, Junda Lin, Zhi Zheng, Huijun Hou, Tong Xu

机构 * State Key Laboratory of Cognitive Intelligence(认知智能国家重点实验室) University of Science and Technology of China(中国科学技术大学) NIO(蔚来)

专题命中 安全训练 :alignment(abstract);trustworthy(abstract);分类 cs.AI

AI总结 针对KB-VQA现有方法难以捕捉结构关联、推理不忠实的问题,提出SAFE-G框架,通过混合搜索、图检索与证据对齐RL策略,在两个基准上准确率优于现有方法8.9%、3.5%。

Comments 12 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23034 2026-08-25 cs.LG cs.CL 新提交 62%

ST$^2$U: Stateful Test-Time Unlearning via Restricted Knowledge Boundary Control

ST$^2$U:通过受限知识边界控制实现的有状态测试时遗忘

Xunlei Chen, Qinghui Gong, Ruini Xue, Yaodong Hu, Tian Lan, Wenhong Tian

专题命中 安全训练 :alignment(abstract);分类 cs.CL、cs.LG

AI总结 本研究提出ST$^2$U方法,将测试时遗忘转化为全轨迹范围的受限知识边界控制,在三个基准和三个模型系列上,该方法比测试时基线大幅减少受限知识重新进入,实现了保留与遗忘的良好平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22894 2026-08-25 cs.CL cs.AI 新提交 62%

AraDetox: A Multi-Dialect Arabic Detoxification Dataset

AraDetox:多方言阿拉伯语解毒数据集

Mo El-Haj

专题命中 安全训练 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 本文提出多方言阿拉伯语解毒数据集AraDetox,基于GPT-5和Gemini 2.5 Flash生成海量解毒文本,经评估验证其可有效去除有害语言并保留原意,为相关研究提供公开资源。

Comments 15 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22284 2026-08-25 cs.SE cs.AI cs.LG 新提交 62%

Learning from the Test: Self-Referential Differential Testing for Deep RL Agents

从测试中学习:深度强化学习智能体的自引用差异测试

Junda He, Jieke Shi, Zhou Yang, Mingfei Cheng, David Lo

专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG

AI总结 该研究针对深度强化学习智能体的最优性评估缺口,提出Delta框架,通过两阶段差异测试,结合离线RL算法,在5个环境中平均发现2518个最优性缺陷,效果优于基线方法50.2%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10279 2026-08-25 cs.CR cs.AI cs.CL 版本更新 62%

Withholding the Completing Chunk: Exact Release-Boundary Equivalence for Production Streaming Guardrails

withhold the Completing Chunk: 面向流式大语言模型输出的确定性配对完成护栏

Christopher M. Frost

专题命中 安全训练 :safety(abstract);分类 cs.CL、cs.AI

AI总结 本研究提出流式LLM输出的确定性配对完成护栏,通过扫描前缀扣留配对完成块,实验验证其效果,表明它是小型固定策略的精确发布边界后盾。

Comments 9 pages, 2 figures, 4 tables. Substantially revised version

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28900 2026-08-25 cs.RO cs.AI cs.LG eess.SY 版本更新 62%

Robust Multi-Agent Reinforcement Learning for Small UAS Separation Assurance under GPS Degradation and Spoofing

针对GPS退化和欺骗的鲁棒多智能体强化学习用于小型无人机分离保障

Alex Zongo, Filippos Fotiadis, Ufuk Topcu, Peng Wei

机构 * George Washington University(乔治华盛顿大学) University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG

AI总结 本文通过多智能体强化学习解决小型无人机在GPS退化和欺骗下的鲁棒分离保障问题,提出闭式表达式对抗扰动,实现线性时间评估,并在高密度无人机模拟中取得近零碰撞率。

Comments This work has been submitted to the IEEE for possible publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18492 2026-08-25 cs.DB cs.AI cs.CL cs.SE 版本更新 62%

Vibe Coding on Trial: Operating Characteristics of Unanimous LLM Juries

Vibe Coding on Trial: Unanimous LLM Juries的运行特性

Muhammad Aziz Ullah, Abdul Serwadda

机构 * Texas Tech University(德克萨斯农工大学)

专题命中 安全训练 :safety(abstract);分类 cs.CL、cs.AI

AI总结 本文研究了使用多数LLM陪审团在代码审查中减少假接受的同时保持高准确率的方法,通过基准测试和实验验证了委员会大小和组成对安全性的影响。

Comments Submitted to IEEE International Conference on Semantic Computing 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22797 2026-08-25 cs.AI 新提交 57%

Performance of a domain-specific large language model in answering patient questions in psychiatry

面向精神病学领域的专用大语言模型在回答患者问题时的性能表现

Alexander J. Hish, Arjun Nagendran, Scott N. Compton

专题命中 安全训练 :safety(abstract);分类 cs.AI

AI总结 本研究开发了专用LLM MIND,对比ChatGPT、OpenEvidence回答患者关于艾司西酞普兰的问题,发现MIND评分更高但医生更偏好ChatGPT,为构建精神病学安全LLM提供了进展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22752 2026-08-25 cs.AI cs.IR 新提交 57%

The Compaction Cliff in Long-Running AI Agent Memory

长期运行AI智能体记忆中的压缩 cliff

Saber Zerhoudi, Jelena Mitrovic, Michael Granitzer

机构 * University of Passau(帕绍大学) IT:U

专题命中 安全训练 :safety(abstract);分类 cs.AI

AI总结 针对AI智能体记忆压缩时安全规则保留率骤降的压缩cliff问题,提出Knowledge Triage框架,通过三类算子优化上下文管理,在多基准测试中优于现有方法,并发布了相关数据集与工具。

详情

展开后加载摘要…

URL PDF HTML 收藏