Learning to Attack and Defend: Adaptive Red Teaming of Language Models via GRPO
学习攻击与防御:通过GRPO对语言模型进行自适应红队测试
机构 * Microsoft AI Red Team(微软AI红队) ; Microsoft Azure(微软Azure)
AI总结 提出AdvGRPO框架,通过密集多通道奖励和分离优势归一化实现GRPO在攻击者-防御者联合优化中的稳定训练,产生高效可迁移攻击,防御者优于基线。
大厂专区
学习攻击与防御:通过GRPO对语言模型进行自适应红队测试
机构 * Microsoft AI Red Team(微软AI红队) ; Microsoft Azure(微软Azure)
AI总结 提出AdvGRPO框架,通过密集多通道奖励和分离优势归一化实现GRPO在攻击者-防御者联合优化中的稳定训练,产生高效可迁移攻击,防御者优于基线。
PRISM:从语言模型激活中恢复指令集
机构 * Center for Cybersecurity Systems & Networks, Amrita Vishwa Vidyapeetham(阿姆里塔·维什瓦·维迪亚佩瑟姆网络安全系统与网络中心) ; Microsoft(微软) ; Ben-Gurion University of the Negev(内盖夫本-古里安大学)
AI总结 提出PRISM方法,通过激活条件解码从冻结目标模型隐藏状态中恢复活跃指令集,利用法官引导的GRPO优化,在多种场景下优于基线方法。
Comments Under Review
SIFT: 利用注意力不变性实现RAG预填充快速计算的索引选择
机构 * Georgia Institute of Technology(佐治亚理工学院) ; Microsoft(微软)
AI总结 针对RAG查询中文档重复导致预填充计算冗余和TTFT增加的问题,提出SIFT方法,通过离线提取文档高注意力分数位置并利用注意力不变性,在预填充时仅计算标记位置,将TTFT提升1.71倍且精度损失在1%以内。
CapRL++:基于可验证奖励的统一强化学习用于密集图像和视频描述生成
机构 * Tsinghua University(清华大学) ; University of Science and Technology of China(中国科学技术大学) ; Microsoft(微软) ; Shanghai AI Laboratory(上海人工智能实验室) ; Shanghai Innovation Institute(上海创新研究院) ; Alibaba Cloud(阿里云) ; The Chinese University of Hong Kong(香港中文大学)
AI总结 提出CapRL++框架,利用可验证奖励的强化学习(RLVR)优化多模态描述生成,通过非视觉语言模型回答问题的准确性作为奖励,提升密集描述质量,在20多个基准上超越传统监督微调。
Comments 26 pages, 10 figures. Project page: https://github.com/InternLM/CapRL. arXiv admin note: text overlap with arXiv:2509.22647
文本就是一切?文本作为语音大语言模型的通用信息瓶颈
机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) ; Microsoft Corporation(微软公司) ; Microsoft Research Asia(微软亚洲研究院)
AI总结 提出Convex Gate(C-Gate)桥接语音与LLM,通过凸包约束将语音表示限制在LLM输入嵌入流形内,在ASR和情感识别上取得联合最优性能,并揭示几何结构而非离散性是关键设计因素。
"所以这里有个第22条军规":构建多智能体LLM系统的早期采用者如何概念化透明度
机构 * Purdue University(普渡大学) ; Cornell University(康奈尔大学) ; Microsoft Research(微软研究院)
AI总结 通过访谈13位早期采用者,研究多智能体LLM系统构建者如何理解透明度,提出包含可重复性、调试、边界设定、可视化和审计的多维框架,强调透明度作为情境化的社会技术实践。
通过API实现差分隐私合成数据 4: 表格数据
机构 * Microsoft(微软)
AI总结 提出Tab-PE算法,将Private Evolution框架扩展至表格数据,通过启发式算子迭代优化候选数据集,在保持差分隐私的同时高效处理高阶相关性,相比基线AIM分类准确率提升最高10%,速度提升28倍。
Comments ICML'26
工业场景中的零样本学习:新的大规模基准、挑战与基线
机构 * Zhejiang University(浙江大学) ; Alibaba Group(阿里巴巴集团) ; Huawei Technologies(华为技术有限公司) ; Tsinghua University(清华大学) ; Microsoft Research(微软研究院)
AI总结 针对工业场景中视觉语言模型应用难、数据稀缺的问题,提出大规模多模态工业开放数据集MMIO和精炼文本-视觉提示RTVP,实现零样本工业缺陷检测,在MMIO上达到SOTA。
从大脑解码自然情感动态:一种LLM增强的回归框架
机构 * NTNU(挪威科技大学) ; Kavli Institute for Systems Neuroscience, NTNU(挪威科技大学卡弗里系统神经科学研究所) ; Microsoft(微软)
AI总结 提出多目标回归框架,利用LLM从自然叙事中提取连续情感特征,结合动态功能连接和机器学习算法,实现从fMRI数据中解码连续情感轨迹,并揭示可解释的情感特异性脑网络拓扑。
CollabSim: 一种基于CSCW的方法,通过受控多智能体实验研究LLM智能体的协作能力
机构 * Northeastern University(东北大学) ; Microsoft Research Asia(微软亚洲研究院)
AI总结 提出CollabSim框架,结合CSCW理论定义协作能力、控制交互条件并探测智能体内部状态,以系统分析LLM多智能体系统的协作能力。
人类的ALMANAC:用于智能体协作的动作级心智模型标注的人类协作数据集
机构 * Northeastern University(东北大学) ; University of Notre Dame(Notre Dame 大学) ; University of Waterloo(滑铁卢大学) ; Carnegie Mellon University(卡内基梅隆大学) ; Adobe(Adobe公司) ; Microsoft Research Asia(微软亚洲研究院)
AI总结 为解决当前LLM智能体缺乏协作中心智模型能力的问题,构建了基于Map Task的ALMANAC数据集,包含2987个协作动作及其心智模型标注,并评估了六种LLM在预测人类行为和心智模型上的表现。
ReVision:通过时间视觉冗余减少扩展计算机使用代理
机构 * University of British Columbia(不列颠哥伦比亚大学) ; Microsoft Research(微软研究院)
AI总结 ReVision通过去除冗余视觉片段,减少token使用并提升成功率,使代理能处理更长轨迹。
AI生成受欢迎但模板化的共情回应
机构 * Department of Psychology, The University of Texas at Austin(心理学系,德克萨斯大学奥斯汀分校) ; Department of Linguistics, The University of Texas at Austin(语言学系,德克萨斯大学奥斯汀分校) ; Department of Computer Science and Engineering, The University of Washington(计算机科学与工程系,华盛顿大学) ; Microsoft Research(微软研究院) ; Toyota Research Institute(丰田研究院)
AI总结 研究发现LLM生成的共情回应高度模板化,采用10种共情语言策略,覆盖81-92%的回应内容,而人类写作则更多样。
RepoLaunch:跨语言和平台的代码仓库构建与管理自动化
机构 * Microsoft(微软)
AI总结 RepoLaunch通过自动化依赖解析、编译和测试结果提取,提升了多语言多平台代码仓库的构建效率,其构建成功率达78%,并展示了全自动SWE数据集创建流程。
Comments Under peer review. 22 pages, 5 figures, 9 tables
你的自对弈算法其实是一个对抗性模仿者:通过模仿学习的视角理解LLM自对弈
机构 * University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校) ; Microsoft Research(微软研究院)
AI总结 本文通过将自对弈微调建模为模型与自身参数化的正则化隐式奖励玩家之间的极小极大博弈,统一了自对弈模仿与偏好对齐,并提出了基于χ²散度的新算法,在多种语言模型微调任务上优于现有方法。
Comments 26 pages, 6 tables, 5 figures
DIVERGE: 面向开放式信息检索的多样性增强RAG
机构 * Aarhus University(奥胡斯大学) ; Microsoft Research(微软研究院)
AI总结 针对现有RAG系统忽略开放式信息检索中多样性需求的问题,提出Diverge框架,通过迭代反思引导的多样化视角探索和多样性感知检索支持,在保持质量的同时将多样性提升约2倍。
发现数据结构:最近邻搜索及其他
机构 * Université de Montréal(蒙特利尔大学) ; Mila ; HEC Montréal(蒙特利尔高等商学院) ; Microsoft Research(微软研究院) ; University of Southern California(南加州大学) ; Stanford University(斯坦福大学)
AI总结 提出一个端到端学习数据结构的通用框架,自动适应数据分布并控制查询与空间复杂度,在最近邻搜索中逆向工程出二分搜索、插值搜索、k-d树和局部敏感哈希等算法。
Comments Neurips 2025 Version