arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

大厂专区

2026-03-31 至 2026-03-31 共收录 11
2603.28718 2026-03-31 cs.LG cs.AI cs.CV

Stepwise Credit Assignment for GRPO on Flow-Matching Models

分步信用分配用于流匹配模型中的GRPO

Yash Savani, Branislav Kveton, Yuchen Liu, Yilin Wang, Jing Shi, Subhojyoti Mukherjee, Nikos Vlassis, Krishna Kumar Singh

机构 * Carnegie Mellon University(卡内基梅隆大学) Adobe Research(Adobe研究院)

AI总结 本文提出分步流GRPO,通过分步奖励改进提升样本效率和收敛速度,引入DDIM启发的SDE提升奖励质量。

Comments Accepted to the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR), 2026 Project page: https://stepwiseflowgrpo.com

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03619 2026-03-31 cs.CV

LAMP: Language-Assisted Motion Planning for Controllable Video Generation

LAMP:语言辅助运动规划用于可控视频生成

Muhammed Burak Kizil, Enes Sanli, Niloy J. Mitra, Erkut Erdem, Aykut Erdem, Duygu Ceylan

机构 * Koç University(科奇大学) University College London(伦敦大学学院) Hacettepe University(哈斯特帕大学) Adobe Research(Adobe研究院)

AI总结 LAMP通过大语言模型生成3D轨迹,实现基于自然语言的视频生成,提升运动可控性和用户意图对齐。

Comments CVPR 2026. Project Page: https://cyberiada.github.io/LAMP/

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.06233 2026-03-31 cs.CV

AnthroTAP: Learning Point Tracking with Real-World Motion

AnthroTAP: 通过真实世界运动学习点跟踪

Inès Hyeonsu Kim, Seokju Cho, Jahyeok Koo, Junghyun Park, Jiahui Huang, Honglak Lee, Joon-Young Lee, Seungryong Kim

机构 * KAIST AI(韩国科学技术院人工智能) Adobe Research(Adobe研究院) University of Michigan(密歇根大学) LG AI Research(LG人工智能研究院)

AI总结 AnthroTAP通过生成大规模伪标注点跟踪数据提升真实世界视频的点跟踪性能,利用人类运动的结构复杂性,结合SMPL模型和光流一致性过滤,实现优于现有方法的性能。

Comments CVPR 2026. Project Page: https://cvlab-kaist.github.io/AnthroTAP/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27539 2026-03-31 cs.MA cs.AI cs.CE

Toward Reliable Evaluation of LLM-Based Financial Multi-Agent Systems: Taxonomy, Coordination Primacy, and Cost Awareness

迈向可靠的LLM基于金融多智能体系统评估:分类学、协调优先性与成本意识

Phat Nguyen, Thang Pham

机构 * Georgia Institute of Technology(佐治亚理工学院) Adobe Inc.(Adobe公司)

AI总结 本文提出一种四维分类法,探讨多智能体系统中协调优先性对交易决策质量的影响,并识别五种评估失效现象,提出协调平衡收益指标以评估多智能体协调的真实价值。

Comments Accepted at the DMO-FinTech Workshop, PAKDD 2026, Hong Kong

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27520 2026-03-31 cs.CV

TokenDial: Continuous Attribute Control in Text-to-Video via Spatiotemporal Token Offsets

TokenDial: 通过时空token偏移实现文本到视频的连续属性控制

Zhixuan Liu, Peter Schaldenbrand, Yijun Li, Long Mai, Aniruddha Mahapatra, Cusuh Ham, Jean Oh, Jui-Hsien Wang

机构 * Adobe Research(Adobe研究院) Carnegie Mellon University(卡内基梅隆大学)

AI总结 TokenDial通过在中间时空视觉patch-token空间中添加偏移实现文本到视频生成模型的连续属性控制,通过调整偏移量实现外观和运动动态的可预测编辑,优于现有基线。

Comments Project page: https://tokendial.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27209 2026-03-31 cs.CV cs.CL cs.GR cs.LG

LightMover: Generative Light Movement with Color and Intensity Controls

LightMover:具有颜色和强度控制的生成式光移动

Gengze Zhou, Tianyu Wang, Soo Ye Kim, Zhixin Shu, Xin Yu, Yannick Hold-Geoffroy, Sumit Chaturvedi, Qi Wu, Zhe Lin, Scott Cohen

机构 * AIML, Adelaide University(阿德莱德大学机器学习研究所) Adobe Research(Adobe研究院) University of Hong Kong(香港大学) Yale University(耶鲁大学)

AI总结 LightMover通过视频扩散先验生成单图像中可控的光照变化,统一处理空间和外观控制,提升操控与光照理解,并引入自适应令牌修剪机制,减少控制序列长度41%同时保持编辑保真度。

Comments CVPR 2026. 10 pages, 5 figures, 6 tables in main paper; supplementary material included

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27083 2026-03-31 cs.CV

LightCtrl: Training-free Controllable Video Relighting

LightCtrl: 不需要训练的可控视频重照明

Yizuo Peng, Xuelin Chen, Kai Zhang, Xiaodong Cun

机构 * Tsinghua University(清华大学) GVC Lab, Great Bay University(大湾区大学GVC实验室) Adobe Research(Adobe研究院)

AI总结 LightCtrl是首个无需训练的可控视频重照明方法,通过用户提供的光照轨迹实现对视频光照的显式控制,结合预训练扩散模型提升时间一致性,实验显示其在光照变化多样性和可控性上优于基线方法。

Comments Accepted at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07775 2026-03-31 cs.CV

Rolling Sink: Bridging Limited-Horizon Training and Open-Ended Testing in Autoregressive Video Diffusion

滚动汇:在有限时间训练和开放-ended测试之间架桥

Haodong Li, Shaoteng Liu, Zhe Lin, Manmohan Chandraker

机构 * UC San Diego(加州大学圣地亚哥分校) Adobe Research(Adobe研究院)

AI总结 本文提出Rolling Sink,通过分析AR缓存维护,实现无需训练的超长视频生成,提升视觉质量和时间一致性。

Comments v5: Fix some typos. Figures were compressed to 150 dpi to comply with arXiv's submission size limit. Project page: https://rolling-sink.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10950 2026-03-31 cs.CV

E-RayZer: Self-supervised 3D Reconstruction as Spatial Visual Pre-training

E-RayZer:基于空间视觉预训练的自监督3D重建

Qitao Zhao, Hao Tan, Qianqian Wang, Sai Bi, Kai Zhang, Kalyan Sunkavalli, Shubham Tulsiani, Hanwen Jiang

机构 * Carnegie Mellon University(卡内基梅隆大学) Adobe Research(Adobe研究院) Harvard University(哈佛大学)

AI总结 本文提出E-RayZer,一种通过未标注图像直接学习几何基础表示的自监督3D视觉模型,通过显式几何实现3D重建,优于现有方法。

Comments CVPR 2026 Camera-ready. Project website: https://qitaozhao.github.io/E-RayZer

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05145 2026-03-31 cs.DC cs.AI cs.MA

Efficient Tree-Structured Deep Research with Adaptive Resource Allocation

高效树状深度研究与自适应资源分配

Lunyiu Nie, Nedim Lipka, Ryan A. Rossi, Swarat Chaudhuri

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校) Adobe Research(Adobe研究院)

AI总结 本文提出ParallelResearch框架,通过动态分解复杂查询为树状子任务,解决深度研究中序列处理的瓶颈问题,实现高效并行处理,实验显示性能提升达5倍。

Comments ICLR 2026 Workshop on Agents in the Wild (Spotlight)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.05970 2026-03-31 cs.CV

OmniStyle2: Learning to Stylize by Learning to Destylize

OmniStyle2:通过学习去风格化来学习风格化

Ye Wang, Zili Yi, Yibo Zhang, Peng Zheng, Xuping Xie, Jiang Lin, Yijun Li, Yilin Wang, Rui Ma

机构 * Jilin University(吉林大学) Nanjing University(南京大学) Shanghai Innovation Institute(上海创新研究院) Adobe Engineering Research Center of Knowledge-Driven Human-Machine Intelligence, MOE, China(中国教育部知识驱动人机智能工程研究中心)

AI总结 OmniStyle2通过逆向学习去风格化来提升风格化质量,提出DeStylePipe框架与DestyleCoT-Filter模块,构建DeStyle-350K数据集并设计BCS-Bench基准,验证去风格化作为可靠监督范式。

Comments Our project page: https://wangyephd.github.io/projects/DeStyle/index.html

详情

展开后加载摘要…

URL PDF HTML 收藏