Learning to Attack and Defend: Adaptive Red Teaming of Language Models via GRPO
学习攻击与防御:通过GRPO对语言模型进行自适应红队测试
机构 * Microsoft AI Red Team(微软AI红队) ; Microsoft Azure(微软Azure)
AI总结 提出AdvGRPO框架,通过密集多通道奖励和分离优势归一化实现GRPO在攻击者-防御者联合优化中的稳定训练,产生高效可迁移攻击,防御者优于基线。
大厂专区
学习攻击与防御:通过GRPO对语言模型进行自适应红队测试
机构 * Microsoft AI Red Team(微软AI红队) ; Microsoft Azure(微软Azure)
AI总结 提出AdvGRPO框架,通过密集多通道奖励和分离优势归一化实现GRPO在攻击者-防御者联合优化中的稳定训练,产生高效可迁移攻击,防御者优于基线。
PRISM:从语言模型激活中恢复指令集
机构 * Center for Cybersecurity Systems & Networks, Amrita Vishwa Vidyapeetham(阿姆里塔·维什瓦·维迪亚佩瑟姆网络安全系统与网络中心) ; Microsoft(微软) ; Ben-Gurion University of the Negev(内盖夫本-古里安大学)
AI总结 提出PRISM方法,通过激活条件解码从冻结目标模型隐藏状态中恢复活跃指令集,利用法官引导的GRPO优化,在多种场景下优于基线方法。
Comments Under Review
SIFT: 利用注意力不变性实现RAG预填充快速计算的索引选择
机构 * Georgia Institute of Technology(佐治亚理工学院) ; Microsoft(微软)
AI总结 针对RAG查询中文档重复导致预填充计算冗余和TTFT增加的问题,提出SIFT方法,通过离线提取文档高注意力分数位置并利用注意力不变性,在预填充时仅计算标记位置,将TTFT提升1.71倍且精度损失在1%以内。
CapRL++:基于可验证奖励的统一强化学习用于密集图像和视频描述生成
机构 * Tsinghua University(清华大学) ; University of Science and Technology of China(中国科学技术大学) ; Microsoft(微软) ; Shanghai AI Laboratory(上海人工智能实验室) ; Shanghai Innovation Institute(上海创新研究院) ; Alibaba Cloud(阿里云) ; The Chinese University of Hong Kong(香港中文大学)
AI总结 提出CapRL++框架,利用可验证奖励的强化学习(RLVR)优化多模态描述生成,通过非视觉语言模型回答问题的准确性作为奖励,提升密集描述质量,在20多个基准上超越传统监督微调。
Comments 26 pages, 10 figures. Project page: https://github.com/InternLM/CapRL. arXiv admin note: text overlap with arXiv:2509.22647
文本就是一切?文本作为语音大语言模型的通用信息瓶颈
机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) ; Microsoft Corporation(微软公司) ; Microsoft Research Asia(微软亚洲研究院)
AI总结 提出Convex Gate(C-Gate)桥接语音与LLM,通过凸包约束将语音表示限制在LLM输入嵌入流形内,在ASR和情感识别上取得联合最优性能,并揭示几何结构而非离散性是关键设计因素。
"所以这里有个第22条军规":构建多智能体LLM系统的早期采用者如何概念化透明度
机构 * Purdue University(普渡大学) ; Cornell University(康奈尔大学) ; Microsoft Research(微软研究院)
AI总结 通过访谈13位早期采用者,研究多智能体LLM系统构建者如何理解透明度,提出包含可重复性、调试、边界设定、可视化和审计的多维框架,强调透明度作为情境化的社会技术实践。
通过API实现差分隐私合成数据 4: 表格数据
机构 * Microsoft(微软)
AI总结 提出Tab-PE算法,将Private Evolution框架扩展至表格数据,通过启发式算子迭代优化候选数据集,在保持差分隐私的同时高效处理高阶相关性,相比基线AIM分类准确率提升最高10%,速度提升28倍。
Comments ICML'26
工业场景中的零样本学习:新的大规模基准、挑战与基线
机构 * Zhejiang University(浙江大学) ; Alibaba Group(阿里巴巴集团) ; Huawei Technologies(华为技术有限公司) ; Tsinghua University(清华大学) ; Microsoft Research(微软研究院)
AI总结 针对工业场景中视觉语言模型应用难、数据稀缺的问题,提出大规模多模态工业开放数据集MMIO和精炼文本-视觉提示RTVP,实现零样本工业缺陷检测,在MMIO上达到SOTA。
从大脑解码自然情感动态:一种LLM增强的回归框架
机构 * NTNU(挪威科技大学) ; Kavli Institute for Systems Neuroscience, NTNU(挪威科技大学卡弗里系统神经科学研究所) ; Microsoft(微软)
AI总结 提出多目标回归框架,利用LLM从自然叙事中提取连续情感特征,结合动态功能连接和机器学习算法,实现从fMRI数据中解码连续情感轨迹,并揭示可解释的情感特异性脑网络拓扑。