ImageEdit-R1: Boosting Multi-Agent Image Editing via Reinforcement Learning
ImageEdit-R1: 通过强化学习提升多智能体图像编辑
机构 * National University of Singapore(新加坡国立大学) ; Adobe Research(Adobe研究)
AI总结 ImageEdit-R1通过强化学习实现多智能体图像编辑,提升复杂指令下的编辑效果与上下文感知能力。
大厂专区
ImageEdit-R1: 通过强化学习提升多智能体图像编辑
机构 * National University of Singapore(新加坡国立大学) ; Adobe Research(Adobe研究)
AI总结 ImageEdit-R1通过强化学习实现多智能体图像编辑,提升复杂指令下的编辑效果与上下文感知能力。
统一多模态模型能可靠生成图像多长?通过上下文筛选驯服长周期交错图像生成
机构 * The Hong Kong University of Science(香港科学与技术大学) ; Adobe Research(Adobe研究) ; Huazhong University of Science(华中科技大学)
AI总结 本研究提出UniLongGen,通过动态筛选模型记忆以提升长周期图像生成的稳定性和效率。
VIVECaption:一种改进标题质量的分步方法
机构 * Adobe Inc.(Adobe公司)
AI总结 VIVECaption通过双面方法改进标题质量,利用分层抽样和模型对齐策略提升图像-标题对齐效果,提供高质量训练数据解决方案。
大语言模型能否跟上?连续知识流的在线适应基准测试
机构 * KAIST AI(韩国科学技术院人工智能研究所) ; UNC Chapel Hill(北卡罗来纳大学教堂山分校) ; Google(谷歌公司) ; KRAFTON(KRAFTON公司) ; Adobe Research(Adobe研究院) ; New York University(纽约大学)
AI总结 本文提出OAKS基准测试,用于评估大语言模型在动态连续知识流中的在线适应能力,发现现有模型在持续更新知识时存在显著局限性。
多领域音频问答基准:面向声音内容推理
机构 * NVIDIA ; University of Maryland, College Park(马里兰大学 College Park 分校) ; University of Science and Technology of China(中国科学技术大学) ; Seoul National University(首尔国立大学) ; Adobe
AI总结 DCASE 2025挑战赛提出多领域音频问答基准,通过生物声学、时间声音景观和复杂问答子集测试音频-语言模型在多样声音场景中的交互式问答能力,推动音频理解和推理能力发展。
Comments Dataset: https://huggingface.co/datasets/PeacefulData/2025_DCASE_AudioQA_Official DCASE Task-5 challenge: dcase.community/challenge2025/task-audio-question-answering. Accepted to ICASSP 2026
基于推理的图像风格化代理规划 via 离线强化学习
机构 * Adobe Research(Adobe研究)
AI总结 本文提出基于推理的代理规划框架,通过结构化规划和工具链提升图像风格化效果,采用合成数据生成和离线强化学习方法,验证在视觉质量和指令遵循上的优越性。
Comments 85 pages
SAGE: 介于多样剪辑之间的结构感知生成视频过渡
机构 * University College London(伦敦大学学院) ; Autodesk Research(Autodesk研究) ; Adobe Research(Adobe研究)
AI总结 SAGE通过结构感知生成方法实现多样剪辑间的平滑过渡,无需微调且无需训练数据。
Comments Project Website: https://kan32501.github.io/sage.github.io/