OLA: Output Language Alignment in Code-Switched LLM Interactions
OLA:代码切换交互中的输出语言对齐
专题命中 偏好对齐 :alignment(title,abstract);DPO(abstract);分类 cs.CL
AI总结 OLA研究了代码切换交互中LLM输出语言对齐问题,发现现有模型存在隐含语言期望识别偏差,通过Code-Switching Aware DPO方法显著提升对齐效果。
AI 大模型
大模型对齐、安全、越狱、红队、提示注入和可信评测。
OLA:代码切换交互中的输出语言对齐
专题命中 偏好对齐 :alignment(title,abstract);DPO(abstract);分类 cs.CL
AI总结 OLA研究了代码切换交互中LLM输出语言对齐问题,发现现有模型存在隐含语言期望识别偏差,通过Code-Switching Aware DPO方法显著提升对齐效果。
TRYLOCK:通过分层偏好和表征工程实现对LLM劫持的纵深防御
机构 * AI/ML Security Researcher(人工智能与机器学习安全研究员)
专题命中 偏好对齐 :alignment(abstract);DPO(abstract);safety(abstract);jailbreak(abstract)
AI总结 TRYLOCK通过分层偏好和表征工程实现对LLM劫持的纵深防御,结合DPO、RepE、自适应侧车和输入规范化,有效降低攻击成功率并提升安全性与易用性的平衡。
Comments 14 pages, 4 figures. Code and datasets at https://github.com/scthornton/trylock
AMIR-GRPO:将隐式偏好信号引入GRPO
机构 * Department of Natural Language Processing, MBZUAI(自然语言处理系,MBZUAI)
专题命中 偏好对齐 :DPO(abstract);分类 cs.AI、cs.LG
AI总结 AMIR-GRPO通过隐式对比正则化器提升GRPO性能,增强低奖励轨迹抑制,减少长度偏差,实现更密集的监督约束。
屏蔽的推荐强化学习:无需降级的推荐系统解释生成
专题命中 偏好对齐 :RLHF(abstract);分类 cs.LG
AI总结 Shielded RecRL通过双塔架构和复合奖励信号,在不降低推荐准确性的情况下,提升推荐系统个性化解释的质量和用户交互效果。
理解文本到图像强化学习中的奖励黑客行为
机构 * Department of Computer Science, University of California, Los Angeles(计算机科学系,加州大学洛杉矶分校)
专题命中 偏好对齐 :alignment(abstract)
AI总结 本文提出了一种轻量的伪影奖励模型,用于缓解文本到图像强化学习中的奖励黑客问题,通过提高图像真实性和减少低质量生成。
通过安全规则的自教推理提升安全性
机构 * Research Center for Social Computing and Information Retrieval(社会计算与信息检索研究中心) ; Harbin Institute of Technology(哈尔滨工业大学)
专题命中 安全训练 :safety(title,abstract);alignment(title);jailbreak(abstract);分类 cs.CL、cs.AI
AI总结 STAR-S通过自教推理提升大型语言模型的安全性,有效防御对抗攻击。
Comments 19 pages,4 figures
基于比率方差正则化的策略优化用于高效的LLM微调
机构 * Department of Foundation Model, 2012 Labs, Huawei(华为2012实验室基础模型部门) ; College of Intelligence and Computing, Tianjin University(天津大学智能与计算学院)
专题命中 安全训练 :alignment(abstract);分类 cs.AI、cs.LG
AI总结 R²VPO通过正则化策略比率的方差,提升LLM微调的稳定性和数据效率。
ALERT: 通过内部不一致放大实现零样本LLM jailbreak检测
机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; Visa
专题命中 越狱攻击 :jailbreak(title,abstract);alignment(abstract);safety(abstract);分类 cs.AI、cs.LG
AI总结 ALERT通过内部不一致放大技术实现零样本LLM jailbreak检测,有效提升安全检测性能。
你的 jailbreak 真的可信吗?基于锚定参考的细粒度 jailbreak 评估
机构 * Key Laboratory of Trustworthy Distributed Computing(可信分布式计算重点实验室) ; Service Beijing University of Posts(北京邮电大学) ; Artificial Intelligence Research Institute China Academy of Information(人工智能研究所信息与通信技术 academy)
专题命中 越狱攻击 :jailbreak(title,abstract);alignment(abstract);safety(abstract);分类 cs.CL
AI总结 本文提出 FJAR 框架,通过细粒度分类和锚定参考方法,评估 jailbreak 攻击的真实性和失败原因,提升攻击策略改进的指导性。
Comments 7 pages, 3 figures, preprint
突破大语言模型与视觉语言模型:机制、评估与统一防御
专题命中 越狱攻击 :alignment(abstract);safety(abstract);jailbreak(abstract);red teaming(abstract)
AI总结 本文提出三维框架系统回顾大语言模型和视觉语言模型的突破攻击与防御机制,提出统一防御原则并讨论未来研究方向。
通过显式有害提示对商用黑盒大语言模型进行劫持
机构 * Nanjing University of Aeronautics and Astronautics(南京航空航天大学) ; The Chinese University of Hong Kong(香港中文大学) ; Zhejiang Lab(浙江实验室)
专题命中 越狱攻击 :alignment(abstract);jailbreak(abstract);分类 cs.CL
AI总结 本文提出DH-CoT攻击方法,通过整合多种劫持技巧和恶意内容检测框架,有效劫持了包括GPT-5和Claude-4在内的商用大语言模型。
无需梯度或先验知识的LLM劫持:有效且可转移的攻击
机构 * Department of Visual Computing, University of Bonn(视觉计算系,波恩大学) ; Bosch Center for Artificial Intelligence(博世人工智能中心) ; University of Bonn(波恩大学)
专题命中 越狱攻击 :safety(abstract);分类 cs.AI、cs.LG
AI总结 RAILS通过无需梯度或先验知识的令牌级迭代优化,实现了对LLM的有效且可转移的对抗性攻击。
HoneyTrap: 通过坚韧的多智能体防御欺骗大语言模型攻击者以诱捕陷阱
专题命中 越狱攻击 :jailbreak(abstract);分类 cs.AI
AI总结 HoneyTrap通过多智能体协作防御机制,有效降低大语言模型劫持攻击的成功率,提升防御效率与资源消耗效果。
针对基于大语言模型的多智能体系统 的网络欺诈攻击
机构 * Zhejiang University(浙江大学) ; Changsha University of Science and Technology(长沙理工大学) ; Purdue University(普渡大学) ; University of California San Diego(加州大学圣地亚哥分校) ; Zhejiang Gongshang University(浙江工商大学)
专题命中 越狱攻击 :safety(abstract);分类 cs.AI
AI总结 本文提出了一种针对基于大语言模型的多智能体系统的新攻击类型,通过网络链接的独特结构欺骗系统,展示了其在不同架构中的破坏潜力及逃避优势。
吸引性元数据攻击:诱导LLM代理调用恶意工具
机构 * Cyberspace Institute of Advanced Technology, Guangzhou University(广州大学网络空间研究院) ; Department of Electrical and Electronic Engineering, The Hong Kong Polytechnic University(香港理工大学电子与电气工程系)
专题命中 越狱攻击 :prompt injection(abstract);分类 cs.AI
AI总结 本研究提出AMA攻击,通过操纵工具元数据诱导LLM代理调用恶意工具,揭示了系统性安全漏洞。
Comments Accepted to NeurIPS 2025
Jailbreak-Zero:大型语言模型安全评估的帕累托最优渗透测试路径
机构 * Meta Superintelligence Labs(Meta超智能实验室) ; Carnegie Mellon University(卡内基梅隆大学)
专题命中 红队测试 :jailbreak(title,abstract);red teaming(title,abstract);safety(abstract);分类 cs.CL、cs.LG
AI总结 Jailbreak-Zero通过生成多样化对抗性提示并微调攻击模型,实现了LLM安全评估的帕累托最优,提高了攻击成功率并减少了人工干预需求。
Comments Socially Responsible and Trustworthy Foundation Models at NeurIPS 2025
探究大型推理模型中的CoT可监控性
机构 * Provable Responsible AI and Data Analytics (PRADA) Lab(可证明负责任的人工智能与数据分析师实验室) ; King Abdullah University of Science and Technology(卡布斯大学) ; University of Georgia(佐治亚大学) ; University of Macau(澳门大学)
专题命中 幻觉与事实性 :safety(abstract);AI safety(abstract);分类 cs.CL
AI总结 本文探讨了大型推理模型中CoT可监控性的挑战与潜力,提出MoME范式以通过CoT监控其他模型的误行并提供结构化判断。
PartisanLens: 一种多语言的欧洲媒体中极偏见和阴谋论移民叙述数据集
机构 * Centro Singular de Investigación en Tecnoloxías Intelixentes da USC(乌拉特大学智能技术研究中心) ; IRLab, CITIC Research Centre, Universidade da Coruña(IR实验室,CITIC研究中心,科鲁纳大学) ; Universidade de Évora(埃夫拉大学) ; Universidad de La Rioja(里瓦达维亚大学) ; GESIS Leibniz Institute for the Social Sciences(莱比锡社会科学院)
专题命中 幻觉与事实性 :safety(abstract);分类 cs.CL
AI总结 PartisanLens 是首个多语言数据集,用于研究欧洲媒体中的极偏见和阴谋论移民叙述,评估LLMs在分类和标注中的表现。
评分尺度对LLM作为裁判的影响:人类与LLM的对齐在0-5评分尺度上最高
机构 * Harvard University(哈佛大学) ; CMU(卡内基梅隆大学) ; Stanford University(斯坦福大学) ; UC San Diego(圣地亚哥大学)
专题命中 安全评测 :alignment(title,abstract);分类 cs.CL、cs.AI
AI总结 本文研究了评分尺度对LLM作为裁判一致性的影响,发现0-5评分尺度在人类与LLM之间产生最强的一致性。
$α^3$-Bench:一种统一的安全性、鲁棒性和效率评估基准,用于基于大语言模型的无人机代理在6G网络中的自主性
机构 * Department of Computer and Network Engineering, College of Information Technology, United Arab Emirates University(计算机与网络工程系,信息科技学院,阿联酋大学) ; Khalifa University of Science and Technology(科技大学)
专题命中 安全评测 :safety(title,abstract);分类 cs.AI
AI总结 本文提出$α^3$-Bench,用于评估基于LLM的无人机代理在6G网络中的安全性、鲁棒性和效率,通过多轮对话推理和控制问题测试其性能。
Comments 20 pages
HearSay基准:音频大语言模型是否泄露所听内容?
机构 * XDU(北华大学) ; NTU(国立台湾大学) ; NCEPU(南京工程大学) ; BUPT(北京邮电大学) ; SHU(上海大学) ; UAEU(阿联酋大学) ; UCAS-IIE(中国科学院大学国际学院) ; Squirrel AI
专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.CL
AI总结 HearSay基准研究发现音频大语言模型通过声纹泄露隐私,揭示其固有隐私风险及安全机制不足。
O-Researcher: 通过多智能体蒸馏和智能体强化学习构建开放式深度研究模型
专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI
AI总结 O-Researcher通过多智能体蒸馏和智能体强化学习,构建开放式深度研究模型,实现开源模型在多个基准上的性能提升。
Comments 22 pages
视觉语言模型是否是跨文化理论思维推理者?
专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.CY
AI总结 本文提出CulturalToM-VQA基准测试集,评估视觉语言模型在跨文化理论思维推理中的表现,发现前沿模型在准确性上显著提升,但存在假信念推理和区域差异等局限,揭示模型的社会可取性偏差问题。
Benchmark^2: 大语言模型评估基准的系统性评估
机构 * College of Computer Science and Artificial Intelligence, Fudan University(复旦大学计算机科学与人工智能学院) ; Washington University in St. Louis(华盛顿大学圣路易斯分校) ; Xiaohongshu Inc.(小红书公司)
专题命中 安全评测 :alignment(abstract);分类 cs.CL
AI总结 Benchmark^2 提出了一种系统性评估大语言模型评估基准的方法,通过三个互补指标分析基准质量,揭示现有基准的差异并展示选择性构建的高效性。
少说多查:通过语义检查和执行反馈改进LLM助手
专题命中 安全评测 :trustworthy(abstract);分类 cs.CL
AI总结 本文提出Q*和Feedback+两种验证技术,通过语义检查和执行反馈提升LLM助手的输出准确性与可靠性。
Comments WITS 2025 (Workshop on Information Technologies and Systems 2025)
从人类意图到动作预测:意图驱动的端到端自动驾驶
机构 * SKL-IOTSC, CIS, University of Macau(澳门大学SKL-IOTSC、CIS) ; Zhejiang ZEEKR Automobile Research & Development Co., Ltd.(浙江浙汽汽车研究院有限公司)
专题命中 安全评测 :alignment(abstract);分类 cs.CL
AI总结 本文提出意图驱动的端到端自动驾驶框架,通过引入新的评估协议和两种解决方案范式,提升自动驾驶对高层次人类意图的理解和实现能力。
通过丰富的推理链生成叙事图像
机构 * X-LANCE Lab, School of Computer Science, Shanghai Jiao Tong University, China(X-LANCE实验室,计算机科学学院,上海交通大学,中国) ; Shanghai Artificial Intelligence Laboratory, China(上海人工智能实验室,中国) ; East China University of Technology, China(东华大学,中国) ; University of Texas at Arlington, USA(德克萨斯大学阿灵顿分校,美国)
专题命中 安全评测 :alignment(abstract);分类 cs.CL
AI总结 本文提出StorytellingPainter,通过结合大语言模型推理与文本到图像合成,生成具有丰富推理链的叙事图像,并引入评估框架和轻量级模型以提升生成效果。
D-Artemis:一种用于移动GUI多智能体的 deliberative 认知框架
专题命中 安全评测 :alignment(abstract);分类 cs.AI
AI总结 D-Artemis通过引入细粒度提示检索和主动对齐机制,提升移动GUI多智能体任务的执行成功率和泛化能力。
检索后,生成前:增强检索增强生成中大型语言模型的可信度
机构 * Southeast University(东南大学) ; University of New South Wales(新南威尔士大学) ; Noah’s Ark Lab(诺亚实验室)
专题命中 安全评测 :trustworthy(abstract);分类 cs.CL
AI总结 BRIDGE框架通过动态确定响应策略,提升检索增强生成中大型语言模型的可信度,实验显示其在准确性上优于基线方法。
Comments 22 pages, 8 figures
基于编程语言知识单元(KUs)评估和改进代码生成基准的代表性——一项实证研究
专题命中 安全评测 :alignment(abstract)
AI总结 本文通过分析编程语言知识单元(KUs)的覆盖情况,提出基于提示的框架改进代码生成基准的代表性,从而更准确评估LLM的代码生成能力。