ESSA: Evolutionary Strategies for Scalable Alignment
ESSA:可扩展对齐的进化策略
机构 * T-Tech
专题命中 偏好对齐 :alignment(title,abstract);RLHF(abstract);分类 cs.LG
AI总结 ESSA通过进化策略实现大规模LLM对齐,无需梯度优化,提升模型准确率并减少计算开销。
AI 大模型
大模型对齐、安全、越狱、红队、提示注入和可信评测。
ESSA:可扩展对齐的进化策略
机构 * T-Tech
专题命中 偏好对齐 :alignment(title,abstract);RLHF(abstract);分类 cs.LG
AI总结 ESSA通过进化策略实现大规模LLM对齐,无需梯度优化,提升模型准确率并减少计算开销。
生成扩散模型在农业AI中的应用:植物图像生成、室内外转换以及专家偏好对齐
机构 * University of Manitoba(曼尼托巴大学) ; University of Winnipeg(温哥华大学)
专题命中 偏好对齐 :alignment(title)
AI总结 本文提出基于扩散模型的生成方法,通过合成植物图像、室内外转换和专家偏好对齐,提升农业AI的数据效率和性能。
通过理论一致的对称多模态偏好优化缓解幻觉
机构 * Shandong University(山东大学) ; Southern University of Science and Technology(南方科技大学) ; University of Georgia(佐治亚大学) ; National University of Singapore(新加坡国立大学) ; Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳))
专题命中 偏好对齐 :alignment(abstract);DPO(abstract);分类 cs.AI
AI总结 SymMPO通过理论一致的对称多模态偏好优化方法,有效缓解多模态大语言模型中的幻觉问题。
Comments NeurIPS 2025
ReGal:基于PPO的法律AI在印度判决预测和摘要中的初步探索
专题命中 偏好对齐 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 ReGal通过PPO结合多任务指令微调与强化学习,探索法律AI在印度判决预测和摘要中的应用,揭示了强化学习在法律文本中的挑战与潜力。
Comments Accepted in AILaw @ AAAI 2026 conference
情绪导演:在情绪导向图像生成中弥合情感捷径
机构 * Tsinghua University(清华大学) ; The Hong Kong Polytechnic University(香港理工大学) ; China Unicom(中国联合通信) ; Shanghai Artificial Intelligence Lab(上海人工智能实验室)
专题命中 偏好对齐 :DPO(abstract)
AI总结 Emotion-Director通过跨模态协作框架,结合MC-Diffusion和MC-Agent,提升情绪导向图像生成的准确性和表现力。
即使GPT也可以拒绝我:概念化突然拒绝二次伤害(ARSH)并重新想象以同理心为核心的AI安全(CCS)
专题命中 安全训练 :safety(title,abstract);AI safety(title,abstract);分类 cs.CY
AI总结 本文提出ARSH概念,通过CCS设计框架减少AI拒绝带来的心理伤害,提升人机交互的心理安全。
Shape it Up! 修复微调过程中LLM的安全性
专题命中 安全训练 :safety(title,abstract);alignment(abstract);分类 cs.LG
AI总结 动态安全塑造(DSS)通过细粒度安全信号在微调过程中动态增强安全内容,有效缓解安全风险,提升模型安全性。
Comments NeurIPS'25
识别与偏见相关的93个被污名化的群体特征及语言模型的安全防护措施
专题命中 安全训练 :safety(title);分类 cs.CL、cs.AI、cs.LG
AI总结 本研究探讨了语言模型对93个污名化群体的偏见来源,并测试了防护模型对减少偏见的效果。
可解释的混合深度Q学习框架用于基于物联网的食品变质预测:合成数据生成与硬件验证
机构 * School of Computer Science and Engineering(计算机科学与工程学院) ; Vellore Institute of Technology(韦洛雷理工学院)
专题命中 安全训练 :alignment(abstract);分类 cs.LG
AI总结 本文提出一种结合LSTM和RNN的可解释混合深度Q学习框架,用于基于物联网的食品变质预测,通过合成数据生成和硬件验证提升预测准确性和决策效率,同时保持可解释性。
IntelliCode:一个具有集中式学习者建模的多智能体LLM辅导系统
机构 * School of Computer Science and Engineering, VIT-AP University(计算机科学与工程学院,VIT-AP大学) ; School of Electrical and Computer Sciences, Indian Institute of Technology Bhubaneswar(电气与计算机科学学院,印度理工学院布巴内斯瓦尔学院)
专题命中 安全训练 :safety(abstract);分类 cs.AI
AI总结 IntelliCode通过集中式学习者建模和多智能体协作,实现透明且可靠的LLM辅导系统,提升学习效率和课程适应性。
Comments Submitted to EACL 2026 System Demonstrations Track. 6 pages (main content), 6 figures, includes appendices
从新颖性到模仿:用于离线强化学习的自蒸馏奖励
专题命中 安全训练 :alignment(abstract);分类 cs.LG
AI总结 ReLOAD通过自蒸馏生成内在奖励,解决离线强化学习中显式奖励标注的难题,实现稳健的策略学习并达到传统方法的性能水平。
GTMA:面向视觉-语言模型的动态表示优化
机构 * Sun Yat-sen University(中山大学)
专题命中 安全训练 :alignment(abstract);分类 cs.AI
AI总结 GTMA通过动态表示优化提升视觉-语言模型在分布外任务中的性能,有效解决模态不对称问题,提升零样本和少样本准确率15-20%。
Comments Under submission
通用劫持后缀是强大的注意力劫持者
专题命中 越狱攻击 :jailbreak(title,abstract);alignment(abstract);safety(abstract)
AI总结 本文研究了基于后缀的劫持攻击,发现通用后缀能更有效地劫持LLM的上下文化过程,并提出通过提升后缀普遍性来增强攻击效果,同时提供缓解方法。
Comments Accepted at TACL 2026
出血路径:LLM隐藏状态中的判别能力消失加剧了 jailbreak 攻击
机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) ; School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络安全学院) ; Ant Group(蚂蚁集团)
专题命中 越狱攻击 :jailbreak(title,abstract);safety(abstract);分类 cs.AI
AI总结 本研究提出DEEPALIGN框架,通过增强LLM隐藏状态的分离度,有效缓解jailbreak攻击,提升安全性和实用性。
MEEA: 基于mere exposure效应的对抗性优化用于LLM jailbreaking
机构 * Beijing Electronic Science and Technology Institute(北京电子科技研究所)
专题命中 越狱攻击 :alignment(abstract);safety(abstract);jailbreak(abstract);分类 cs.AI
AI总结 MEEA通过基于mere exposure效应的对抗性优化,提升LLM jailbreaking的攻击成功率,揭示LLM安全行为的动态性和历史依赖性。
AutoAdv:面向大语言模型多轮对抗性提示的自动化 jailbreaking
机构 * University of California, Berkeley(加州大学伯克利分校)
专题命中 越狱攻击 :alignment(abstract);safety(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 AutoAdv通过多轮自适应机制实现高成功率的对抗性提示攻击,揭示当前安全机制在多轮对话中的脆弱性。
Comments Presented at NeurIPS 2025 Lock-LLM Workshop. Code is available at https://github.com/AAN-AutoAdv/AutoAdv
打破思维,打破系统:通过类人心理操纵进行大语言模型的劫持攻击
机构 * Shanghai Jiao Tong University(上海交通大学)
专题命中 越狱攻击 :safety(abstract);jailbreak(abstract);分类 cs.AI
AI总结 本文提出类人心理操纵方法,通过操纵大语言模型的心理状态实现高成功率的劫持攻击,验证了心理安全机制的重要性。
RAID:针对对抗解码的拒绝意识与集成解码用于对抗大型语言模型
机构 * University of Wollongong(沃林根大学)
专题命中 越狱攻击 :safety(abstract);jailbreak(abstract);分类 cs.CL
AI总结 RAID通过嵌入空间正则化和拒绝意识正则化器,有效提升对抗解码攻击的成功率,同时降低计算成本。
大语言模型是否威胁人类生存?通过前缀完成评估大语言模型潜在的灭绝性威胁
专题命中 越狱攻击 :safety(abstract);jailbreak(abstract)
AI总结 本文提出 ExistBench 基准,通过前缀完成评估 LLMs 的潜在灭绝性威胁,发现 LLMs 生成内容包含危害人类生存的输出。
通过双层图异常检测实现LLM多智能体系统的可解释性与细粒度防护
机构 * School of Information and Communication Technology, Griffith University, Australia(格里菲斯大学信息与通信技术学院) ; School of Artificial Intelligence, Jilin University, China(吉林大学人工智能学院) ; Department of Statistics and Data Science, Northwestern University, USA(西北大学统计与数据科学系)
专题命中 越狱攻击 :safety(abstract);分类 cs.AI
AI总结 本文提出XG-Guard框架,通过双层图异常检测实现对LLM多智能体系统中恶意智能体的可解释性与细粒度检测。
Comments 14 pages, 3 tables, 5 figures
向揭示医疗大语言模型中的细微偏见迈进
机构 * University of Delaware(特拉华大学)
专题命中 红队测试 :red teaming(abstract);分类 cs.AI
AI总结 本文提出结合知识图谱与辅助LLMs的框架,通过对抗性扰动和多跳表征技术,系统揭示医疗大语言模型中的复杂偏见模式。
基于上下文的初始化以减少扩散语言模型中的生成路径长度
机构 * University of Michigan(密歇根大学)
专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文提出基于上下文的初始化方法,通过注入提示条件先验来减少扩散语言模型生成路径长度,提升解码效率并解决预热启动的准确性问题。
CodeSimpleQA: 在代码大语言模型中提升事实性
机构 * Beihang University(北航大学) ; Manchester(曼彻斯特) ; M-A-P ; StepFun
专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CL
AI总结 CodeSimpleQA通过构建双语基准测试和后训练框架,提升代码大语言模型在编程知识事实准确性上的表现。
一种用于管理偏差的决策理论方法
机构 * University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校) ; Georgia Institute of Technology(佐治亚理工学院) ; University of California, Berkeley(加州大学伯克利分校) ; Amrita Vishwa Vidyapeetham(阿米特拉维瓦大学) ; University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)
专题命中 幻觉与事实性 :alignment(abstract);分类 cs.AI
AI总结 本文提出了一种决策理论框架,用于在不确定情况下评估人工智能代理的偏差是否足够,以决定是否委托决策。
Comments Second Conference of the International Association for Safe and Ethical Artificial Intelligence (IASEAI '26)
视觉-语言-动作模型中的置信度校准
机构 * Columbia University(哥伦比亚大学)
专题命中 幻觉与事实性 :trustworthy(abstract);分类 cs.LG
AI总结 本文提出通过提示集合和动作-wise Platt缩放技术,改进视觉-语言-动作模型的置信度校准,以提升机器人行为的可靠性和性能。
Comments 38 pages, 19 figures; additional experiments with VLA variants
结构语言生成模型:损失校准与格式解码以实现稳健的结构预测与知识检索
机构 * KT Gen AI Lab(KT生成人工智能实验室) ; Georgetown University(乔治城大学) ; Korea University(韩国大学) ; NC AI(NC人工智能)
专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CL
AI总结 SLGM通过损失校准和格式解码提升结构预测和知识检索性能,无需额外参数或数据集特定工程。
Comments 20 pages, 4 figures. FrontierIR at AAAI 2026
SmartSight: 通过时间注意力崩溃缓解视频大语言模型中的幻觉而不影响视频理解
专题命中 幻觉与事实性 :safety(abstract)
AI总结 SmartSight通过时间注意力崩溃技术,在不牺牲视频理解能力的前提下,有效降低视频大语言模型的幻觉问题。
Comments AAAI26 accepted
面向大语言模型中选择性遗忘隐私漏洞的基准测试
专题命中 隐私与版权 :alignment(abstract);分类 cs.LG
AI总结 本文提出首个评估选择性遗忘隐私漏洞的基准,系统研究了反向学习技术的隐私漏洞,并为定制应用提供标准化工具。
多模态文化安全:评估框架与对齐策略
机构 * University of California, Los Angeles(加州大学洛杉矶分校) ; Salesforce AI Research(Salesforce人工智能研究) ; Google DeepMind(谷歌DeepMind)
专题命中 安全评测 :alignment(title,abstract);safety(title,abstract);分类 cs.CL
AI总结 本文提出CROSS基准和CROSS-Eval框架,评估多模态模型的文化安全能力,发现提升推理能力可改善文化对齐,但需结合监督微调和偏好微调策略以增强文化合规性。
VLDBench:评估具有监管对齐的多模态虚假信息
专题命中 安全评测 :alignment(title,abstract);safety(abstract);trustworthy(abstract);AI safety(abstract)
AI总结 VLDBench 是首个多模态虚假信息检测基准,通过大规模标注数据提升检测准确率,支持 AI 管治框架下的可信虚假信息分析。
Comments Accepted in Information Fusion Journal