Q-based Variational Inverse Reinforcement Learning
基于Q的变分逆强化学习
专题命中 安全训练 :safety(abstract);分类 cs.LG
AI总结 提出新型贝叶斯逆强化学习方法QVIRL,兼具可扩展性与不确定性量化能力,在多类任务的学徒学习中表现优异,是首个可从原始像素观测训练的贝叶斯IRL方法。
AI 大模型
大模型对齐、安全、越狱、红队、提示注入和可信评测。
基于Q的变分逆强化学习
专题命中 安全训练 :safety(abstract);分类 cs.LG
AI总结 提出新型贝叶斯逆强化学习方法QVIRL,兼具可扩展性与不确定性量化能力,在多类任务的学徒学习中表现优异,是首个可从原始像素观测训练的贝叶斯IRL方法。
HAF:通过分层动作流与谱潜在线性RL将通用VLAs适配至人形机器人全身运动操作
机构 * Xi’an Jiaotong University(西安交通大学) ; Peking University(北京大学) ; Nankai University(南开大学)
专题命中 安全训练 :safety(abstract);分类 cs.AI
AI总结 研究针对通用VLAs难以适配人形机器人全身运动操作的问题,提出HAF框架,通过分层动作流生成器与潜空间RL流水线实现高效迁移优化,在7项任务上性能优于单阶段VLA基线。
Comments Project page: https://grange007.github.io/HAF
大语言模型拒绝回答中的对称性破缺:答案释放比拒绝恢复更具局部性
机构 * University of Manchester(曼彻斯特大学) ; Shanghai University of Finance and Economics(上海财经大学)
专题命中 安全训练 :safety(abstract);分类 cs.AI
AI总结 本研究通过受控保留设置揭示大语言模型拒绝回答存在对称性破缺:答案释放具高度局部性,拒绝恢复需更广干预,拒绝并非简单对称开关,对安全审计具启示。
VARM-Bench:中文辱骂内容审核中可验证的结构化推理基准测试
机构 * NUAA(南京航空航天大学)
专题命中 安全训练 :alignment(abstract);分类 cs.AI
AI总结 针对中文辱骂内容审核缺乏可验证决策依据的问题,提出VARM-Bench基准,通过确定性协议评估模型,发现标签级性能可能掩盖记录错误,提供可审计的评估基准。
超出界限:评估LLM训练数据中极端主义言论的流行程度与内容
机构 * University of Manchester(曼彻斯特大学)
专题命中 安全训练 :trustworthy(abstract);分类 cs.CL
AI总结 本研究针对LLM训练数据的极端主义言论问题,以Dolma语料库为对象,经多步骤提取得出其含数十万份极端主义文档的下限,并探讨相关数据整理与预训练影响。
Comments Accepted to the CPSS workshop @ KONVENS 2026
无干净参考的智能体数据清洗:能力与权衡的实验研究
机构 * Faculty of Arts and Sciences(文理学院) ; University of Sciences and Arts in Lebanon(黎巴嫩科学与艺术大学)
专题命中 安全训练 :alignment(abstract);分类 cs.AI
AI总结 本研究提出整合多组件的基于证据的无参考智能体数据清洗框架,经多数据集实验发现,额外能力会在多指标间引入权衡,无配置在所有标准上最优。
Comments 21 pages, 3 figures, Submitted to New Generation Computing
将反向KL重新思考为自适应熵蒸馏
机构 * School of Computer Science and Engineering, Sun Yat-sen University(中山大学计算机科学与工程学院) ; School of Science and Technology, Hong Kong Metropolitan University(香港都会大学科技学院)
专题命中 安全训练 :alignment(abstract);分类 cs.LG
AI总结 该研究针对知识蒸馏难以平衡忠实模仿与鲁棒生成的问题,提出自适应熵蒸馏(AED)方法,通过分解反向KL目标函数并利用教师熵动态校准模仿强度,在指令遵循与数学推理基准上表现更优。
通过危险信息合成包络确保城市移动中的安全物理人工智能
机构 * Xortech DOO
专题命中 安全训练 :safety(abstract);分类 cs.AI
AI总结 针对异构机器人城市部署的安全挑战,提出结合危险分析与运行时执行的统一框架,通过跨层安全转换保障物理AI的城市移动安全。
Comments The 2026 International Conference on Control, Robotics Engineering and Technology (CRET 2026), https://www.cret.net/
微调Qwen3-27B实现C到Rust代码翻译:预训练、调试感知监督微调与任务特定监督微调的三阶段课程
专题命中 安全训练 :safety(abstract);分类 cs.AI
AI总结 本研究针对C到Rust代码翻译任务,对Qwen3-27B采用三阶段微调课程,结合SACTOR框架评估后,其性能优于基线模型及其他LLM。
熟能生险:自我改进的大语言模型智能体中的技能误演化
机构 * Adelaide University(阿德莱德大学) ; City University of Hong Kong(香港城市大学)
专题命中 安全训练 :safety(abstract);分类 cs.AI
AI总结 该研究针对自我改进LLM智能体的技能误演化问题,构建SkillMisevo-Gym与SkillMisevo-Bench基准,提出SafeEvolve方法,可显著降低不安全检索与新会话危害,同时对良性效用影响极小。
SBCO:面向规划智能体的自监督、验证器驱动的工具链优化器
专题命中 安全训练 :alignment(abstract);分类 cs.AI
AI总结 本研究针对规划任务提出SBCO,一种自监督的验证器驱动工具链优化器,其性能优于或相当的定制基线,且计算成本仅为其1/4至1/5.5。
SAFE-CHEM:面向稳健机器人化学的不确定性感知策略切换
机构 * School of Computer Science & Informatics, University of Liverpool(利物浦大学计算机科学与信息学院) ; Department of Chemistry, University of Liverpool(利物浦大学化学系)
专题命中 安全训练 :safety(abstract);分类 cs.LG
AI总结 本研究针对机器人化学实验的安全风险,提出SAFE-CHEM不确定性感知框架,通过混合控制架构在不确定性超阈值时切换至备份控制器,提升任务成功率并减少安全违规,实现零样本仿真到真实的迁移。
JustLLMGRPO:面向胸部X射线生成的放射学控制
专题命中 安全训练 :alignment(abstract);分类 cs.AI
AI总结 JustLLMGRPO仅对LLM提示词策略应用GRPO,在冻结Sana生成器的前提下,提升了胸部X射线生成的质量,同时维持了提示词对齐度,实现了最优性能。
面向智能制造中大型语言模型增强的多智能体强化学习(MARL)中心参考架构
专题命中 安全训练 :safety(abstract);分类 cs.AI
AI总结 本文针对智能制造自适应控制的耦合需求,提出以MARL为中心的三层参考架构,探讨LLM在MARL中的附着点,明确传统MARL与LLM组件的适配场景,为相关研究提供结构化框架。
CircuitSteer:基于稀疏自编码器回路的几何对齐多层引导方法
机构 * University of Southern California(南加利福尼亚大学)
专题命中 安全训练 :alignment(abstract);分类 cs.LG
AI总结 CircuitSteer是利用SAEs识别多层语义回路的新型框架,通过几何对齐合成引导向量实现多点干预,在多任务多模型上,其引导效果优于牺牲流畅性或覆盖不足的对比方法。
用于带旋转的鲁棒终身多智能体路径规划的搜索辅助联合智能体-环境强化学习
专题命中 安全训练 :safety(abstract);分类 cs.AI
AI总结 针对带旋转约束的鲁棒终身多智能体路径规划难题,提出搜索辅助联合强化学习方法,通过结合Causal PIBT与联合优化智能体-环境策略,在高密度地图及混合现实仓库环境中取得显著性能提升。
人工智能整合型研究生态系统的未来愿景
专题命中 安全训练 :trustworthy(abstract);分类 cs.CY
AI总结 本文探讨生成式AI渗透研究生涯后科学交流的演变,提出从管控AI转向构建溯源、校准与问责基础设施的愿景,并邀请学界参与相关对话。
Comments 4 pages, accepted to ACM AI Leadership Summit
面向开放式护理计划协调的自适应竞技场式可争议专家论证网络
机构 * University of New Brunswick(新不伦瑞克大学) ; National Research Council Canada(加拿大国家研究委员会)
专题命中 安全训练 :safety(abstract);分类 cs.AI
AI总结 针对开放式护理计划协调中单一LLM流程的不足,提出多Agent神经符号框架CANOE,经医学微调模型在相关数据集上表现出强临床正确性,且CANOE具备可解释性与人类可争议性。
Comments Accepted at the 4th International Conference on Frontiers of Artificial Intelligence, Ethics, and Multidisciplinary Applications
无辜的面板,仇恨的故事:评估与检测多轮视觉故事生成中的仇恨意图
机构 * CISPA Helmholtz Center for Information Security(CISPA亥姆霍兹信息安全中心) ; Hewlett Packard Enterprise(惠普企业)
专题命中 安全训练 :safety(abstract);分类 cs.AI
AI总结 本研究针对多轮视觉故事生成的组级仇恨意图问题,构建了专用评估数据集,发现现有审核系统存在漏检,提出互补防御方法,强调安全需适配视觉叙事的发展。
Comments 16 pages, 5 figures, 10 tables
智能交通系统中语言模型的内联控制架构
专题命中 安全训练 :safety(abstract);分类 cs.AI
AI总结 针对V2X系统中LLM的提示级攻击问题,提出Guarded-V2X内联语义护栏架构,经四阶段实验验证其可降低入侵成功率且不超延迟预算。
Comments 18 pages, under minor revision (IEEE transactions)
LatentGuard:面向大语言模型安全防护的高效可检查潜在推理方法
专题命中 安全训练 :safety(abstract);分类 cs.AI
AI总结 LatentGuard是将连续潜在推理引入防护模型的高效可检查框架,其8B参数版本在提升安全判定性能的同时大幅降低推理成本,还具备良好的审计效用,为可部署的LLM安全防护提供了可行路径。
onepot-Bench 0:面向实验室实际场景的计算机化学基准测试
专题命中 安全训练 :safety(abstract);分类 cs.LG
AI总结 本研究推出专有基准测试onepot-Bench 0,通过三个互补评估衡量语言模型在湿实验室合成化学场景下的基础能力、可靠性等,弥补现有评估的不足。
利用视觉语言模型推进Web规模搜索的相关性测量
专题命中 安全训练 :alignment(abstract);分类 cs.LG
AI总结 本研究提出基于VLM的自动化相关性评估流水线,部署于Pinterest搜索A/B实验,验证其与人工标注一致性,提升评估效率,降低MDEs,助力优化搜索体验。
Comments RecSys'26 Industry track
面向通用搜索智能体的跨域混合在线策略蒸馏
机构 * Yuanbao Team, Tencent Shanghai Innovation Institute(腾讯上海研究院元宝团队)
专题命中 安全训练 :alignment(abstract);分类 cs.CL
AI总结 本研究提出基于混元3架构的元宝搜索智能体训练框架,通过跨域混合在线策略蒸馏联合优化搜索专业化与通用能力,缓解对齐损耗,在现实搜索场景中实现两者的良好平衡。
AiFlow:面向流式大语言模型应用的带界背压令牌原生反应式编排框架
专题命中 安全训练 :safety(abstract);分类 cs.AI
AI总结 针对现有流式LLM工作流编排的背压等管理缺陷,提出AiFlow令牌原生反应式编排模型,经实验验证可降低应用TTFPT并控制队列深度。
Comments 24 pages, 5 figures, 12 tables, 1 algorithm, and 1 code listing. Public implementation: https://github.com/ModelEngine-Group/fit-framework
将大型语言模型中的知识蒸馏为用于自主网络操作的轻量级强化学习智能体
机构 * Royal Military College of Canada(加拿大皇家军事学院) ; Defence Research and Development Canada(加拿大国防研究与发展部) ; Polytechnique Montreal(蒙特利尔理工学院)
专题命中 安全训练 :alignment(abstract);分类 cs.LG
AI总结 该研究针对自主网络操作中强化学习智能体训练不稳定的问题,通过提示工程证明80亿参数网络安全LLM性能优于基线RL智能体,再经在线策略蒸馏将其防御知识迁移至仅64910参数的轻量级RL智能体,为前沿网络安全模型的实用化提供了可行方案。
现实世界临床护理中的推理:为何大型语言模型(LLM)尚不适合自主临床决策支持
机构 * Atman Labs(阿特曼实验室) ; Oxford University Hospitals(牛津大学医院) ; University of Oxford(牛津大学) ; NIHR Oxford Biomedical Research Centre(英国国立卫生研究院牛津生物医学研究中心) ; Imperial College London(伦敦帝国理工学院) ; Technical University of Munich(慕尼黑工业大学) ; Massachusetts General Hospital(麻省总医院) ; Mass General Brigham(麻省总医院布里格姆医疗系统) ; Harvard Medical School(哈佛医学院) ; Barts Health NHS Trust(巴特保健国民保健信托基金会) ; the University of Texas at Austin(德克萨斯大学奥斯汀分校)
专题命中 安全训练 :safety(abstract);分类 cs.AI
AI总结 本文指出,尽管LLM在医学考试和部分病例推理上表现出色,但因存在信息收集缺陷等问题,尚不适合用于无医生参与的自主临床分诊。
Comments 3 figures
可证明自身利用行为的智能体:用于安全利用对手的置信度调度受限响应
专题命中 安全训练 :safety(abstract);分类 cs.AI
AI总结 该研究提出CS-RNR方法,通过置信序列跟踪对手行动频率,生成可自我审计的安全利用策略,在Leduc等博弈中实现远超基准的收益且符合预算要求。
Comments 21 pages, 5 figures
旧技巧,新模型:简单图像变换如何破解基于现代AI的内容审核
专题命中 安全训练 :safety(abstract);分类 cs.AI
AI总结 该研究通过黑盒评估发现,商用多模态图像审核API可被简单图像变换绕过,且不同服务稳健性差异大,表明这类API无法单独作为可靠安全过滤器,需结合分层审核管道部署。
选择 moderation 的位置与方式:过滤点与响应重写的端到端权衡
机构 * Microsoft Responsible AI(微软负责任人工智能部门) ; Goodfire(古德法尔公司)
专题命中 安全训练 :safety(abstract);分类 cs.CL
AI总结 该研究针对内容审核部署中的过滤点与响应方式,对比不同方案的有用性、有害暴露等指标,发现响应重写可平衡流量恢复与安全,支持按部署约束选择审核配置。