arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

大厂专区

共收录 966
2609.04063 2026-09-04 cs.AI 新提交

Spurious Advantage Hidden in GRPO

GRPO中隐藏的虚假优势

Jiamian Wang, Samyadeep Basu, Koustava Goswami, Tong Yu, Zhiqiang Tao

机构 * Rochester Institute of Technology(罗切斯特理工学院) Adobe Research(奥多比研究院)

AI总结 该研究发现GRPO存在虚假优势会误导策略走向猜测行为,提出SIGNBALANCE算法,在有界答案数学任务和搜索智能体上性能优于GRPO,开放答案数学任务表现相当。

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.03153 2026-09-04 cs.CV 新提交

VeriPhy: Agentic Physical Reasoning for World Model Evaluation and Refinement

VeriPhy:用于世界模型评估与优化的智能体物理推理系统

Wenzhuo Xu, Yuchen Zhu, Chongjian Ge, Xuan Shen, Jing Shi, Jason Kuen, Yongxin Chen, Molei Tao, Christopher McComb, Noelia Grande Gutiérrez, Jiuxiang Gu

机构 * Carnegie Mellon University(卡内基梅隆大学) Georgia Institute of Technology(佐治亚理工学院) Northeastern University(东北大学) Adobe Research(奥多比研究院)

AI总结 本文提出可审计的物理验证系统VeriPhy,通过纯文本规划器编译物理义务,结合冻结低级专家与三值状态裁决,在1500片段语料库评估中缺陷识别效果优于对比方法,可用于世界模型评估优化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.01925 2026-09-03 cs.LG cs.CL 新提交

CRISP: Cliff-awaRe Input-adaptive Sparse Prefilling with Structural-Mass-Motivated Routing

CRISP:考虑 Cliff 的输入自适应稀疏预填充与基于结构质量的路由

Huu Huy Nguyen, Chien Van Nguyen, Franck Dernoncourt, Ryan A. Rossi, Linh Ngo Van, Jieyang Chen, Thien Huu Nguyen

机构 * University of Oregon(俄勒冈大学) Adobe Research(奥多比研究院) Hanoi University of Science and Technology(河内国家大学自然科学大学)

AI总结 针对长上下文 LLM 注意力预填充的二次缩放瓶颈,提出 CRISP 方法,通过结构代理路由和感知汇阈值消除噪声,在多基准上实现最优稀疏注意力性能及显著加速。

Comments Accepted to EMNLP 2026 (Main Conference). 16 pages, 7 figures, 12 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.00474 2026-09-03 cs.CL cs.AI 版本更新

Exploring Collaboration between a language and a non-language agent

探索语言智能体与非语言智能体之间的协作

Harini S, Somesh Singh, Yaman K Singla, Rajiv Ratn Shah, David Doermann, Balaji Krishnamurthy

机构 * Adobe Media and Data Science Research (MDSR)(Adobe媒体与数据科学研究(MDSR)) IIIT-Delhi(德里印度信息技术学院) IIT Kanpur(坎普尔印度理工学院) SUNY at Buffalo(纽约州立大学布法罗分校)

AI总结 本研究针对LLM与非语言智能体协作的 verbalization 瓶颈,提出潜在状态内化方法,构建LLAMIA-Bench基准,发现该方法优于 verbalization 集成,140亿参数的LLAMIA模型性能超越相关模型且分布外泛化能力强。

Comments Accepted at EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08389 2026-09-03 cs.AI cs.IR cs.MA 版本更新

Not Worth Another Token: Marginal Value Estimation for Efficient Deep Research Agents

不值得再增加一个Token:面向高效深度研究智能体的边际价值估计

Harshitha Kolukuluru, Reshma Ashok, Kirat Arora, Evan William Ciccarelli, Nischal Ashok Kumar, Lunyiu Nie, Franck Dernoncourt, Samyadeep Basu, Ryan A. Rossi, Nedim Lipka

机构 * University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校) The University of Texas at Austin(德克萨斯大学奥斯汀分校) Adobe Research(奥多比研究院)

AI总结 该研究针对长周期研究智能体的上下文冗余问题,系统比较不同阶段的剪枝策略,发现早期剪枝可大幅降本,轻量级启发式方法能减73%Token用量且质量损失小,为高效智能体设计提供指导。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18069 2026-09-03 cs.GR cs.CG cs.CV 版本更新

Blended Chart Surfaces: A Seamless Explicit Representation for Smooth Surface Fitting

混合图表曲面:一种用于光滑曲面拟合的无缝显式表示

Romy Williamson, Niloy Mitra

机构 * Adobe

AI总结 提出混合图表曲面,一种无网络、显式且光滑的曲面表示,通过代理网格和多项式映射联合优化,融合局部图表实现全局光滑,支持微分量和能量计算。

Comments 18 pages, 18 figures (17 in main paper, 1 in supplemental)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01079 2026-09-03 cs.CV 版本更新

Chameleon: Style-Content Disentangled Framework for Cross-Domain Object Compositing

Chameleon: 面向跨域对象合成的风格-内容解耦框架

Sukhun Ko, Soo Ye Kim, Jihyong Oh

机构 * CMLab, Chung-Ang University(Chung-Ang大学CMLab) Adobe Research(Adobe研究)

AI总结 提出基于大规模数据集ChameleonDataset的两阶段训练框架Chameleon,通过联合硬对比学习和时空注意力门控实现跨域对象合成的风格-内容解耦与自适应风格化。

Comments The last two authors are co-corresponding authors. Please visit our project page at https://cmlab-korea.github.io/Chameleon/

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.01352 2026-09-02 cs.CL cs.AI 新提交

CHARM: Character Hallucination for Multicultural Role Play Benchmark

CHARM:面向跨文化角色扮演基准的角色幻觉研究

Sunkyung Han, Nahyeon Park, Gaeun Seo, Seunghyun Yoon, JinYeong Bak

机构 * Sungkyunkwan University(成均馆大学) Adobe Research(奥多比研究院)

AI总结 本文提出跨文化角色扮演基准CHARM,通过两阶段评估区分大语言模型的边界意识与遵守能力,发现角色幻觉主要由遵守失败驱动,且存在系统性文化差异。

Comments 16 pages, 1 figure. Accepted to Findings of EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.00591 2026-09-02 cs.CV 新提交

A Glance Is All You Need: Single-Pass Fine-Grained Image Captioning with SimLoss

一瞥足矣:采用SimLoss的单遍细粒度图像字幕生成

Suryaansh Jain, Rahasya Barkur, Vishal G, Ryan Rossi, Franck Dernoncourt, Jack Wang, Koustava Goswami, Nedim Lipka, Puneet Mathur, Samyadeep Basu, Seunghyun Yoon

机构 * Adobe Research(奥多比研究院)

AI总结 该研究针对现有图像字幕模型遗漏视觉细节、多阶段系统延迟高的问题,提出SimLoss,实现单遍细粒度图像字幕生成,相关变体在精度、召回率等指标上表现优异且推理速度快。

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.00505 2026-09-02 cs.CV 新提交

ViTAL-X: Video-Text Alignment with Cross-Modal Temporal Edits

ViTAL-X:具备跨模态时序编辑的视频-文本对齐模型

Sethuraman T, Savya Khosla, Onkar Kishor Susladkar, Aditi Tiwari, Seoung Wug Oh, Kushal Kafle, Joon-Young Lee, Derek Hoiem, Simon Jenni

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Adobe Research(奥多比研究中心)

AI总结 本文针对视频-文本模型的时序盲问题,提出跨模态时序编辑(XTE)自监督框架,构建轻量模型ViTAL-X,在6个时序基准上实现最优性能,参数和训练数据远少于同类模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04801 2026-09-02 cs.CV 版本更新

LILAC: Layer-Wise Independent LoRAs and Cascaded Conditioning for Multi-Concept Customization of Diffusion Models

LILAC:用于扩散模型多概念定制的分层独立LoRAs和级联条件处理

Marian Lupascu, Sebastian Ripa, Mihai Trascau, Mariana-Iuliana Georgescu, Ionut Mironica

机构 * Adobe Research, Romania(罗马尼亚Adobe研究院) Department of Computer Science, University of Bucharest, Romania(罗马尼亚布加勒斯特大学计算机科学系) International Computer High School of Bucharest, Romania(罗马尼亚布加勒斯特国际计算机高中)

AI总结 研究个性化文本到图像扩散模型渲染特定主题的难题,提出LILAC框架,通过分层独立训练低秩适配器并级联条件处理,避免参数干扰,无需联合训练,线性扩展且与主干无关,效果良好。

Comments 13 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07775 2026-09-02 cs.CV

Rolling Sink: Bridging Limited-Horizon Training and Open-Ended Testing in Autoregressive Video Diffusion

滚动汇:在有限时间训练和开放-ended测试之间架桥

Haodong Li, Shaoteng Liu, Zhe Lin, Manmohan Chandraker

机构 * UC San Diego(加州大学圣地亚哥分校) Adobe Research(Adobe研究院)

AI总结 本文提出Rolling Sink,通过分析AR缓存维护,实现无需训练的超长视频生成,提升视觉质量和时间一致性。

Comments Project page: https://rolling-sink.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25050 2026-09-02 cs.LG 版本更新

Advantage Weighted Matching: Aligning RL with Pretraining in Diffusion Models

优势加权匹配:在扩散模型中对齐强化学习与预训练

Shuchen Xue, Chongjian Ge, Shilong Zhang, Yichen Li, Zhi-Ming Ma

机构 * UCAS(中国科学院大学) Adobe Research(Adobe研究) HKU(香港大学) MIT(麻省理工学院)

AI总结 本研究提出优势加权匹配(AWM)方法,解决扩散模型RL与预训练目标不一致的问题,在多个基准测试中实现最高34倍加速且不损害生成质量。

Comments Accepted at ICML 2026; updated to the camera-ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30294 2026-09-01 cs.CV 新提交

Dynamic Hub-and-Spoke Memory for Streaming Video Understanding

用于流视频理解的动态轮辐式记忆

Xinru Jiang, Lin Zhao, Xi Xiao, Yunbei Zhang, Janet Wang, Chenrui Ma, Haolin Li, Yanzhi Wang, Yifan Gong, Octavia Camps

机构 * Northeastern University(东北大学) University of Alabama at Birmingham(阿拉巴马大学伯明翰分校) Tulane University(杜兰大学) University of Virginia(弗吉尼亚大学) Adobe Research(奥多比研究院)

AI总结 针对流视频理解需同时紧凑记忆长程历史与高效检索相关证据的挑战,提出动态轮辐式记忆(D-HSM)框架,结合结构化文本记忆与近期视觉标记,在基准上提升VLM性能并优于现有基线。

Comments Accepted to Findings of EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29459 2026-09-01 cs.AI 新提交

Toward Latent Language Model Skills Steering and Optimization: An Empirical Study

面向潜在语言模型技能的引导与优化:一项实证研究

Xunyi Jiang, Junda Wu, Yuxin Xiong, Sheldon Yu, Tong Yu, David Arbour, Ritwik Sinha, Julian McAuley, Hongyi Wen

机构 * New York University(纽约大学) Adobe Research(奥多比研究院) UC San Diego(加州大学圣迭戈分校)

AI总结 本研究通过实证探究发现大型语言模型(LLM)的过程技能可表征为激活空间中的向量方向,且可通过向量操作实现技能引导与优化,为LLM过程技能的潜在空间操控提供了表征级视角。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29063 2026-09-01 cs.AI 新提交

Agent2UCB: Agentic System for Generative Engine Optimization

Agent2UCB:用于生成式引擎优化的智能系统

Sheldon Yu, Rui Wang, Tong Yu, Sungchul Kim, Doga Dogan, Junda Wu, Julian McAuley

机构 * UC San Diego(加州大学圣地亚哥分校) Adobe Research(奥多比研究院)

AI总结 该研究提出智能GEO系统Agent2UCB,通过评估9种策略并结合多臂老虎机策略优化内容,在GEO-Bench实验中实现可见性提升且保留SEO质量,还提供SEO评估与演示功能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28696 2026-09-01 cs.CV 新提交

Instruction Distillation: Text Instructions as Visual Examples

指令蒸馏:将文本指令作为视觉示例

Hardik Jindal, Soumyabrata Pal, Sayak Ray Chowdhury

机构 * IIT Kanpur(印度理工学院坎普尔分校) Adobe Research(奥多比研究院)

AI总结 该研究针对视觉上下文学习的高成本问题,提出指令蒸馏方法,为每个训练图像生成结构化指令,在细粒度视觉分类任务中提升性能并降低推理成本,且视觉与文本ICL信号互补。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22875 2026-09-01 cs.CV cs.AI 版本更新

SketchVLM: Vision language models can annotate images to explain thoughts and guide users

SketchVLM:视觉语言模型可以注释图像以解释思路并引导用户

Brandon Collins, Logan Bolton, Hung Huy Nguyen, Mohammad Reza Taesiri, Trung Bui, Anh Totti Nguyen

机构 * Auburn University(阿伯拉罕大学) Adobe Research(Adobe研究)

AI总结 SketchVLM通过生成可编辑的SVG叠加图提升视觉推理和绘图任务的准确性与注释质量,实现高达28.5%的精度提升和1.48倍的注释质量提升。

Comments Accepted at EMNLP 2026 (Main Conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.09025 2026-09-01 cs.CL cs.LG

Lizard: An Efficient Linearization Framework for Large Language Models

Lizard:一种高效的大型语言模型线性化框架

Chien Van Nguyen, Huy Nguyen, Ruiyi Zhang, Hanieh Deilamsalehy, Puneet Mathur, Viet Dac Lai, Haoliang Wang, Jayakumar Subramanian, Ryan A. Rossi, Trung Bui, Nikos Vlassis, Franck Dernoncourt, Thien Huu Nguyen

机构 * University of Oregon(俄勒冈大学) Adobe Research(Adobe研究院)

AI总结 Lizard提出一种高效线性化框架,将预训练的Transformer大型语言模型转换为亚二次架构,通过亚二次注意力机制提升计算效率,实现模型质量与内存控制的平衡。

Comments ACL 2026 (Main)

Journal ref Proceedings of the 64th Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers), pp. 34935-34948 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13392 2026-09-01 cs.CV 版本更新

A Study of the Design Space of Motion and Disocclusion Control in Video Generation

超越可见范围:通过代理动态图实现的遮挡感知编辑

Anran Qi, Changjian Li, Adrien Bousseau, Niloy J. Mitra

机构 * Inria - Université Côte d’Azur(法国国家信息与自动化技术研究院-埃克塞特大学) University of Edinburgh(爱丁堡大学) Adobe Research(Adobe研究部) UCL(伦敦大学学院)

AI总结 通过代理动态图实现遮挡感知编辑,结合运动规范与外观合成,实现可控的图像到视频生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26716 2026-08-28 cs.CV 新提交

Beyond Atomic Layouts: Compositional Design Understanding with Vision-Language Models

超越原子布局:基于视觉-语言模型的组合式设计理解

Yiyang Huang, Zhaowen Wang, Simon Jenni, Jing Shi, Yitian Zhang, Yizhou Wang, Yun Fu

机构 * Northeastern University(东北大学) Adobe Research(奥多比研究院)

AI总结 本文针对组合式布局理解任务,提出后训练范式MASON,利用约2万布局的CoDeLayout数据集,使Qwen2.5-VL 7B准确率达91.66%,优于基线及全数据微调。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16296 2026-08-27 cs.CV cs.AI cs.LG 版本更新

Memory-V2V: Memory-Augmented Video-to-Video Diffusion for Consistent Multi-Turn Editing

Memory-V2V: 通过记忆增强的视频到视频扩散模型实现一致的多轮编辑

Dohun Lee, Chun-Hao Paul Huang, Xuelin Chen, Jong Chul Ye, Duygu Ceylan, Hyeonho Jeong

机构 * Adobe Research(Adobe研究实验室) KAIST AI(韩国科学技术院人工智能研究所) Adobe Internship(Adobe实习) Project Lead(项目负责人)

AI总结 Memory-V2V通过引入外部记忆模块,解决多轮视频编辑中的跨轮一致性问题,提升编辑连贯性并保持视觉质量,优于现有基线模型。

Comments 38 pages, 22 figures, ECCV 2026, Project page: https://dohunlee1.github.io/MemoryV2V

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19668 2026-08-26 cs.CL 版本更新

Code-Switching Reveals Language Anchoring in Multilingual LLMs

代码切换揭示多语言大模型中的语言锚定

Jeonghyun Park, Seunghyun Yoon, Yonghyun Jun, Hwanhee Lee

机构 * Chung-Ang University(中央大学) Adobe Research(Adobe研究院)

AI总结 通过语法强制代码切换诊断多语言大模型中的语言锚定现象,提出锚定偏差度量并设计CANVAS干预方法,有效缓解代码切换导致的问答性能下降。

Comments EMNLP 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23086 2026-08-25 cs.AI 新提交

POOL: Propagated Uncertainty Over Lookalikes

POOL:基于相似样本传播的不确定性

Rounak Sharma, Ananya B. Sai, Soumyabrata Pal

机构 * Adobe Research, India(印度奥多比研究院)

AI总结 该研究提出高性价比置信度估计框架POOL,结合混合估计器Hy@5,在多个数据集和黑盒大语言模型上,以更少采样数实现更高AUROC,同时大幅节省生成成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21424 2026-08-25 cs.CV cs.GR cs.HC cs.LG cs.MM 新提交

EditStream: A Unified Autoregressive Framework for Interactive Video Generation and Editing

EditStream:用于交互式视频生成与编辑的统一自回归框架

Yuqian Zhou, Zhenghong Zhou, Zongze Wu, Cameron Smith, Richard Zhang, Jiebo Luo, Eli Shechtman, Zhe Lin

机构 * Adobe Research(Adobe研究院) University of Rochester(罗切斯特大学)

AI总结 本研究提出EditStream框架,整合多类视频生成编辑任务,通过两阶段蒸馏方法优化自回归模型,实现高质量交互式视频创作,填补了扩散模型与创意工作流的衔接空白。

Comments 25 pages, 12 figures, Project page: https://real-time-video-research.github.io/editstream/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00726 2026-08-25 cs.AI 版本更新

Latent Reward Steering: An Adaptive Inference-Time Framework that Implicitly Promotes Cognitive Behaviors in Reasoning LLMs

潜在奖励引导:一种自适应推理时框架,隐式促进推理大语言模型中的认知行为

Jiakang Li, Guanyu Zhu, Can Jin, Chenxi Huang, Dexu Yu, Ronghao Chen, Yang Zhou, Hongwu Peng, Xuanqi Lan, Dimitris N. Metaxas, Youhua Li

机构 * Rutgers University(罗格斯大学) South China Agricultural University(华南农业大学) Columbia University(哥伦比亚大学) Fenz.AI QuantaAlpha Adobe Santa Clara University(圣克拉拉大学) City University of Hong Kong(香港城市大学)

AI总结 提出潜在奖励引导(LRS)框架,通过优化稀疏自编码器潜在状态隐式促进认知行为,利用最终答案正确性训练潜在奖励模型估计中间状态质量,并在推理时提供状态特定的修正方向,实验表明该方法能提升推理性能并修复原始推理错误。

Comments Accepted at EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20602 2026-08-24 eess.IV cs.CV 新提交

Sparse Light Field Sampling Improves Casual 3D and 4D Reconstruction

稀疏光场采样提升 casual 三维与四维重建

Shamus Li, Ruiming Cao, Laura Waller, Kristina Monakhova, Sara Fridovich-Keil

机构 * Cornell University(康奈尔大学) Adobe(奥多比公司) University of California, Berkeley(加州大学伯克利分校) Georgia Institute of Technology(佐治亚理工学院)

AI总结 本文针对消费级多视图相机,提出稀疏视图3DGS与4DGS基线方法,验证多相机稀疏采样可显著提升单帧、少帧及casual视频的三维与四维重建质量,尤其适用于动态场景。

Comments Project page: https://shamus.li/lightfield-gaussian-splatting

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21194 2026-08-24 cs.CV 新提交

ES-VP : Energy-Shaped Dynamic Visual Prompting for Efficient Model Adaptation

ES-VP:用于高效模型适配的能量型动态视觉提示

Can Jin, Ying Li, Jingchen Sun, Hongwu Peng, Jiahui Zhao, Yang Zhou, Lei Li, Dimitris N. Metaxas

机构 * Rutgers University(罗格斯大学) Zhejiang University(浙江大学) University at Buffalo, SUNY(纽约州立大学布法罗分校) Adobe Research(奥多比研究院) University of Connecticut(康涅狄格大学) Washington University(华盛顿大学)

AI总结 本文提出ES-VP方法,以低秩初始化和能量引导动态适配生成图像特异性提示,参数效率更高、泛化性更好,在多架构多数据集上均优于现有SOTA视觉提示方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22830 2026-08-21 cs.CV 版本更新

ID-V2V: Identity-Preserving Video Restylization

ID-V2V:保留身份的视频风格化

Yuancheng Xu, Mingming He, Pablo Salamanca, Li Ma, Yash Kant, Emmett Steven, Paul Debevec, Ning Yu

机构 * Netflix(网飞公司) Eyeline Labs(眼线实验室) Adobe(奥多比公司)

AI总结 研究如何在视频风格化中保留人类身份和表演,提出将身份保留与视频合成解耦的方法,引入ID-V2V框架,通过互补控制信号实现,实验证明其在面部相似度等方面表现优异,优于现有方法。

Comments Accepted to SIGGRAPH Asia 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18215 2026-08-20 cs.CV 新提交

LumiTokens: 3D Relighting via Token-Space Lighting Transformation

LumiTokens:基于标记空间光照变换的三维重光照

Yiwen Chen, Matheus Gadelha, Huaizu Jiang

机构 * Northeastern University(东北大学) Adobe Research(奥多比研究院)

AI总结 LumiTokens是将三维重光照转化为潜在场景标记直接变换的框架,支持渐进式可组合光照编辑,重光照质量优于或媲美现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏