Spurious Advantage Hidden in GRPO
GRPO中隐藏的虚假优势
机构 * Rochester Institute of Technology(罗切斯特理工学院) ; Adobe Research(奥多比研究院)
AI总结 该研究发现GRPO存在虚假优势会误导策略走向猜测行为,提出SIGNBALANCE算法,在有界答案数学任务和搜索智能体上性能优于GRPO,开放答案数学任务表现相当。
大厂专区
GRPO中隐藏的虚假优势
机构 * Rochester Institute of Technology(罗切斯特理工学院) ; Adobe Research(奥多比研究院)
AI总结 该研究发现GRPO存在虚假优势会误导策略走向猜测行为,提出SIGNBALANCE算法,在有界答案数学任务和搜索智能体上性能优于GRPO,开放答案数学任务表现相当。
VeriPhy:用于世界模型评估与优化的智能体物理推理系统
机构 * Carnegie Mellon University(卡内基梅隆大学) ; Georgia Institute of Technology(佐治亚理工学院) ; Northeastern University(东北大学) ; Adobe Research(奥多比研究院)
AI总结 本文提出可审计的物理验证系统VeriPhy,通过纯文本规划器编译物理义务,结合冻结低级专家与三值状态裁决,在1500片段语料库评估中缺陷识别效果优于对比方法,可用于世界模型评估优化。
CRISP:考虑 Cliff 的输入自适应稀疏预填充与基于结构质量的路由
机构 * University of Oregon(俄勒冈大学) ; Adobe Research(奥多比研究院) ; Hanoi University of Science and Technology(河内国家大学自然科学大学)
AI总结 针对长上下文 LLM 注意力预填充的二次缩放瓶颈,提出 CRISP 方法,通过结构代理路由和感知汇阈值消除噪声,在多基准上实现最优稀疏注意力性能及显著加速。
Comments Accepted to EMNLP 2026 (Main Conference). 16 pages, 7 figures, 12 tables
探索语言智能体与非语言智能体之间的协作
机构 * Adobe Media and Data Science Research (MDSR)(Adobe媒体与数据科学研究(MDSR)) ; IIIT-Delhi(德里印度信息技术学院) ; IIT Kanpur(坎普尔印度理工学院) ; SUNY at Buffalo(纽约州立大学布法罗分校)
AI总结 本研究针对LLM与非语言智能体协作的 verbalization 瓶颈,提出潜在状态内化方法,构建LLAMIA-Bench基准,发现该方法优于 verbalization 集成,140亿参数的LLAMIA模型性能超越相关模型且分布外泛化能力强。
Comments Accepted at EMNLP 2026
不值得再增加一个Token:面向高效深度研究智能体的边际价值估计
机构 * University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校) ; The University of Texas at Austin(德克萨斯大学奥斯汀分校) ; Adobe Research(奥多比研究院)
AI总结 该研究针对长周期研究智能体的上下文冗余问题,系统比较不同阶段的剪枝策略,发现早期剪枝可大幅降本,轻量级启发式方法能减73%Token用量且质量损失小,为高效智能体设计提供指导。
混合图表曲面:一种用于光滑曲面拟合的无缝显式表示
机构 * Adobe
AI总结 提出混合图表曲面,一种无网络、显式且光滑的曲面表示,通过代理网格和多项式映射联合优化,融合局部图表实现全局光滑,支持微分量和能量计算。
Comments 18 pages, 18 figures (17 in main paper, 1 in supplemental)
Chameleon: 面向跨域对象合成的风格-内容解耦框架
机构 * CMLab, Chung-Ang University(Chung-Ang大学CMLab) ; Adobe Research(Adobe研究)
AI总结 提出基于大规模数据集ChameleonDataset的两阶段训练框架Chameleon,通过联合硬对比学习和时空注意力门控实现跨域对象合成的风格-内容解耦与自适应风格化。
Comments The last two authors are co-corresponding authors. Please visit our project page at https://cmlab-korea.github.io/Chameleon/
CHARM:面向跨文化角色扮演基准的角色幻觉研究
机构 * Sungkyunkwan University(成均馆大学) ; Adobe Research(奥多比研究院)
AI总结 本文提出跨文化角色扮演基准CHARM,通过两阶段评估区分大语言模型的边界意识与遵守能力,发现角色幻觉主要由遵守失败驱动,且存在系统性文化差异。
Comments 16 pages, 1 figure. Accepted to Findings of EMNLP 2026
一瞥足矣:采用SimLoss的单遍细粒度图像字幕生成
机构 * Adobe Research(奥多比研究院)
AI总结 该研究针对现有图像字幕模型遗漏视觉细节、多阶段系统延迟高的问题,提出SimLoss,实现单遍细粒度图像字幕生成,相关变体在精度、召回率等指标上表现优异且推理速度快。
ViTAL-X:具备跨模态时序编辑的视频-文本对齐模型
机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; Adobe Research(奥多比研究中心)
AI总结 本文针对视频-文本模型的时序盲问题,提出跨模态时序编辑(XTE)自监督框架,构建轻量模型ViTAL-X,在6个时序基准上实现最优性能,参数和训练数据远少于同类模型。
LILAC:用于扩散模型多概念定制的分层独立LoRAs和级联条件处理
机构 * Adobe Research, Romania(罗马尼亚Adobe研究院) ; Department of Computer Science, University of Bucharest, Romania(罗马尼亚布加勒斯特大学计算机科学系) ; International Computer High School of Bucharest, Romania(罗马尼亚布加勒斯特国际计算机高中)
AI总结 研究个性化文本到图像扩散模型渲染特定主题的难题,提出LILAC框架,通过分层独立训练低秩适配器并级联条件处理,避免参数干扰,无需联合训练,线性扩展且与主干无关,效果良好。
Comments 13 pages, 9 figures
滚动汇:在有限时间训练和开放-ended测试之间架桥
机构 * UC San Diego(加州大学圣地亚哥分校) ; Adobe Research(Adobe研究院)
AI总结 本文提出Rolling Sink,通过分析AR缓存维护,实现无需训练的超长视频生成,提升视觉质量和时间一致性。
Comments Project page: https://rolling-sink.github.io/
优势加权匹配:在扩散模型中对齐强化学习与预训练
机构 * UCAS(中国科学院大学) ; Adobe Research(Adobe研究) ; HKU(香港大学) ; MIT(麻省理工学院)
AI总结 本研究提出优势加权匹配(AWM)方法,解决扩散模型RL与预训练目标不一致的问题,在多个基准测试中实现最高34倍加速且不损害生成质量。
Comments Accepted at ICML 2026; updated to the camera-ready version
用于流视频理解的动态轮辐式记忆
机构 * Northeastern University(东北大学) ; University of Alabama at Birmingham(阿拉巴马大学伯明翰分校) ; Tulane University(杜兰大学) ; University of Virginia(弗吉尼亚大学) ; Adobe Research(奥多比研究院)
AI总结 针对流视频理解需同时紧凑记忆长程历史与高效检索相关证据的挑战,提出动态轮辐式记忆(D-HSM)框架,结合结构化文本记忆与近期视觉标记,在基准上提升VLM性能并优于现有基线。
Comments Accepted to Findings of EMNLP 2026
面向潜在语言模型技能的引导与优化:一项实证研究
机构 * New York University(纽约大学) ; Adobe Research(奥多比研究院) ; UC San Diego(加州大学圣迭戈分校)
AI总结 本研究通过实证探究发现大型语言模型(LLM)的过程技能可表征为激活空间中的向量方向,且可通过向量操作实现技能引导与优化,为LLM过程技能的潜在空间操控提供了表征级视角。
Agent2UCB:用于生成式引擎优化的智能系统
机构 * UC San Diego(加州大学圣地亚哥分校) ; Adobe Research(奥多比研究院)
AI总结 该研究提出智能GEO系统Agent2UCB,通过评估9种策略并结合多臂老虎机策略优化内容,在GEO-Bench实验中实现可见性提升且保留SEO质量,还提供SEO评估与演示功能。
指令蒸馏:将文本指令作为视觉示例
机构 * IIT Kanpur(印度理工学院坎普尔分校) ; Adobe Research(奥多比研究院)
AI总结 该研究针对视觉上下文学习的高成本问题,提出指令蒸馏方法,为每个训练图像生成结构化指令,在细粒度视觉分类任务中提升性能并降低推理成本,且视觉与文本ICL信号互补。
SketchVLM:视觉语言模型可以注释图像以解释思路并引导用户
机构 * Auburn University(阿伯拉罕大学) ; Adobe Research(Adobe研究)
AI总结 SketchVLM通过生成可编辑的SVG叠加图提升视觉推理和绘图任务的准确性与注释质量,实现高达28.5%的精度提升和1.48倍的注释质量提升。
Comments Accepted at EMNLP 2026 (Main Conference)
Lizard:一种高效的大型语言模型线性化框架
机构 * University of Oregon(俄勒冈大学) ; Adobe Research(Adobe研究院)
AI总结 Lizard提出一种高效线性化框架,将预训练的Transformer大型语言模型转换为亚二次架构,通过亚二次注意力机制提升计算效率,实现模型质量与内存控制的平衡。
Comments ACL 2026 (Main)
Journal ref Proceedings of the 64th Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers), pp. 34935-34948 (2026)
超越可见范围:通过代理动态图实现的遮挡感知编辑
机构 * Inria - Université Côte d’Azur(法国国家信息与自动化技术研究院-埃克塞特大学) ; University of Edinburgh(爱丁堡大学) ; Adobe Research(Adobe研究部) ; UCL(伦敦大学学院)
AI总结 通过代理动态图实现遮挡感知编辑,结合运动规范与外观合成,实现可控的图像到视频生成。
超越原子布局:基于视觉-语言模型的组合式设计理解
机构 * Northeastern University(东北大学) ; Adobe Research(奥多比研究院)
AI总结 本文针对组合式布局理解任务,提出后训练范式MASON,利用约2万布局的CoDeLayout数据集,使Qwen2.5-VL 7B准确率达91.66%,优于基线及全数据微调。
Comments ECCV 2026
Memory-V2V: 通过记忆增强的视频到视频扩散模型实现一致的多轮编辑
机构 * Adobe Research(Adobe研究实验室) ; KAIST AI(韩国科学技术院人工智能研究所) ; Adobe Internship(Adobe实习) ; Project Lead(项目负责人)
AI总结 Memory-V2V通过引入外部记忆模块,解决多轮视频编辑中的跨轮一致性问题,提升编辑连贯性并保持视觉质量,优于现有基线模型。
Comments 38 pages, 22 figures, ECCV 2026, Project page: https://dohunlee1.github.io/MemoryV2V
代码切换揭示多语言大模型中的语言锚定
机构 * Chung-Ang University(中央大学) ; Adobe Research(Adobe研究院)
AI总结 通过语法强制代码切换诊断多语言大模型中的语言锚定现象,提出锚定偏差度量并设计CANVAS干预方法,有效缓解代码切换导致的问答性能下降。
Comments EMNLP 2026 Findings
POOL:基于相似样本传播的不确定性
机构 * Adobe Research, India(印度奥多比研究院)
AI总结 该研究提出高性价比置信度估计框架POOL,结合混合估计器Hy@5,在多个数据集和黑盒大语言模型上,以更少采样数实现更高AUROC,同时大幅节省生成成本。
EditStream:用于交互式视频生成与编辑的统一自回归框架
机构 * Adobe Research(Adobe研究院) ; University of Rochester(罗切斯特大学)
AI总结 本研究提出EditStream框架,整合多类视频生成编辑任务,通过两阶段蒸馏方法优化自回归模型,实现高质量交互式视频创作,填补了扩散模型与创意工作流的衔接空白。
Comments 25 pages, 12 figures, Project page: https://real-time-video-research.github.io/editstream/
潜在奖励引导:一种自适应推理时框架,隐式促进推理大语言模型中的认知行为
机构 * Rutgers University(罗格斯大学) ; South China Agricultural University(华南农业大学) ; Columbia University(哥伦比亚大学) ; Fenz.AI ; QuantaAlpha ; Adobe ; Santa Clara University(圣克拉拉大学) ; City University of Hong Kong(香港城市大学)
AI总结 提出潜在奖励引导(LRS)框架,通过优化稀疏自编码器潜在状态隐式促进认知行为,利用最终答案正确性训练潜在奖励模型估计中间状态质量,并在推理时提供状态特定的修正方向,实验表明该方法能提升推理性能并修复原始推理错误。
Comments Accepted at EMNLP 2026
稀疏光场采样提升 casual 三维与四维重建
机构 * Cornell University(康奈尔大学) ; Adobe(奥多比公司) ; University of California, Berkeley(加州大学伯克利分校) ; Georgia Institute of Technology(佐治亚理工学院)
AI总结 本文针对消费级多视图相机,提出稀疏视图3DGS与4DGS基线方法,验证多相机稀疏采样可显著提升单帧、少帧及casual视频的三维与四维重建质量,尤其适用于动态场景。
Comments Project page: https://shamus.li/lightfield-gaussian-splatting
ES-VP:用于高效模型适配的能量型动态视觉提示
机构 * Rutgers University(罗格斯大学) ; Zhejiang University(浙江大学) ; University at Buffalo, SUNY(纽约州立大学布法罗分校) ; Adobe Research(奥多比研究院) ; University of Connecticut(康涅狄格大学) ; Washington University(华盛顿大学)
AI总结 本文提出ES-VP方法,以低秩初始化和能量引导动态适配生成图像特异性提示,参数效率更高、泛化性更好,在多架构多数据集上均优于现有SOTA视觉提示方法。
ID-V2V:保留身份的视频风格化
机构 * Netflix(网飞公司) ; Eyeline Labs(眼线实验室) ; Adobe(奥多比公司)
AI总结 研究如何在视频风格化中保留人类身份和表演,提出将身份保留与视频合成解耦的方法,引入ID-V2V框架,通过互补控制信号实现,实验证明其在面部相似度等方面表现优异,优于现有方法。
Comments Accepted to SIGGRAPH Asia 2026
LumiTokens:基于标记空间光照变换的三维重光照
机构 * Northeastern University(东北大学) ; Adobe Research(奥多比研究院)
AI总结 LumiTokens是将三维重光照转化为潜在场景标记直接变换的框架,支持渐进式可组合光照编辑,重光照质量优于或媲美现有方法。