arXivDaily arXiv每日学术速递 周一至周五更新

大厂专区

2026-03-10 至 2026-03-10 共收录 7
2603.08059 2026-03-10 cs.CV cs.AI

ImageEdit-R1: Boosting Multi-Agent Image Editing via Reinforcement Learning

ImageEdit-R1: 通过强化学习提升多智能体图像编辑

Yiran Zhao, Yaoqi Ye, Xiang Liu, Michael Qizhe Shieh, Trung Bui

机构 * National University of Singapore(新加坡国立大学) Adobe Research(Adobe研究)

AI总结 ImageEdit-R1通过强化学习实现多智能体图像编辑,提升复杂指令下的编辑效果与上下文感知能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07540 2026-03-10 cs.CV cs.AI

How Long Can Unified Multimodal Models Generate Images Reliably? Taming Long-Horizon Interleaved Image Generation via Context Curation

统一多模态模型能可靠生成图像多长?通过上下文筛选驯服长周期交错图像生成

Haoyu Chen, Qing Liu, Yuqian Zhou, He Zhang, Zhaowen Wang, Mengwei Ren, Jingjing Ren, Xiang Wang, Zhe Lin, Lei Zhu

机构 * The Hong Kong University of Science(香港科学与技术大学) Adobe Research(Adobe研究) Huazhong University of Science(华中科技大学)

AI总结 本研究提出UniLongGen,通过动态筛选模型记忆以提升长周期图像生成的稳定性和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07401 2026-03-10 cs.CV

VIVECaption: A Split Approach to Caption Quality Improvement

VIVECaption:一种改进标题质量的分步方法

Varun Ananth, Baqiao Liu, Haoran Cai

机构 * Adobe Inc.(Adobe公司)

AI总结 VIVECaption通过双面方法改进标题质量,利用分层抽样和模型对齐策略提升图像-标题对齐效果,提供高质量训练数据解决方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07392 2026-03-10 cs.CL

Can Large Language Models Keep Up? Benchmarking Online Adaptation to Continual Knowledge Streams

大语言模型能否跟上?连续知识流的在线适应基准测试

Jiyeon Kim, Hyunji Lee, Dylan Zhou, Sue Hyun Park, Seunghyun Yoon, Trung Bui, Franck Dernoncourt, Sungmin Cha, Minjoon Seo

机构 * KAIST AI(韩国科学技术院人工智能研究所) UNC Chapel Hill(北卡罗来纳大学教堂山分校) Google(谷歌公司) KRAFTON(KRAFTON公司) Adobe Research(Adobe研究院) New York University(纽约大学)

AI总结 本文提出OAKS基准测试,用于评估大语言模型在动态连续知识流中的在线适应能力,发现现有模型在持续更新知识时存在显著局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.07365 2026-03-10 cs.SD cs.AI cs.CL cs.MM eess.AS

Multi-Domain Audio Question Answering Benchmark Toward Acoustic Content Reasoning

多领域音频问答基准:面向声音内容推理

Chao-Han Huck Yang, Sreyan Ghosh, Qing Wang, Jaeyeon Kim, Hengyi Hong, Sonal Kumar, Guirui Zhong, Zhifeng Kong, S Sakshi, Vaibhavi Lokegaonkar, Oriol Nieto, Ramani Duraiswami, Dinesh Manocha, Gunhee Kim, Jun Du, Rafael Valle, Bryan Catanzaro

机构 * NVIDIA University of Maryland, College Park(马里兰大学 College Park 分校) University of Science and Technology of China(中国科学技术大学) Seoul National University(首尔国立大学) Adobe

AI总结 DCASE 2025挑战赛提出多领域音频问答基准,通过生物声学、时间声音景观和复杂问答子集测试音频-语言模型在多样声音场景中的交互式问答能力,推动音频理解和推理能力发展。

Comments Dataset: https://huggingface.co/datasets/PeacefulData/2025_DCASE_AudioQA_Official DCASE Task-5 challenge: dcase.community/challenge2025/task-audio-question-answering. Accepted to ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07148 2026-03-10 cs.LG

Agentic Planning with Reasoning for Image Styling via Offline RL

基于推理的图像风格化代理规划 via 离线强化学习

Subhojyoti Mukherjee, Stefano Petrangeli, Branislav Kveton, Trung Bui, Franck Dernoncourt, Arko Mukherjee

机构 * Adobe Research(Adobe研究)

AI总结 本文提出基于推理的代理规划框架,通过结构化规划和工具链提升图像风格化效果,采用合成数据生成和离线强化学习方法,验证在视觉质量和指令遵循上的优越性。

Comments 85 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.24667 2026-03-10 cs.CV

SAGE: Structure-Aware Generative Video Transitions between Diverse Clips

SAGE: 介于多样剪辑之间的结构感知生成视频过渡

Mia Kan, Yilin Liu, Niloy Mitra

机构 * University College London(伦敦大学学院) Autodesk Research(Autodesk研究) Adobe Research(Adobe研究)

AI总结 SAGE通过结构感知生成方法实现多样剪辑间的平滑过渡,无需微调且无需训练数据。

Comments Project Website: https://kan32501.github.io/sage.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏