RetouchIQ: MLLM Agents for Instruction-Based Image Retouching with Generalist Reward
RetouchIQ: 基于指令的图像修复MLLM代理与通用奖励模型
机构 * Adobe Research(Adobe研究院)
AI总结 RetouchIQ通过通用奖励模型提升指令基于图像编辑的语义一致性和感知质量,展现灵活可解释的编辑能力。
Comments 10 pages, 6 figures
大厂专区
RetouchIQ: 基于指令的图像修复MLLM代理与通用奖励模型
机构 * Adobe Research(Adobe研究院)
AI总结 RetouchIQ通过通用奖励模型提升指令基于图像编辑的语义一致性和感知质量,展现灵活可解释的编辑能力。
Comments 10 pages, 6 figures
AudioChat: 通过Transfusion Forcing实现统一的音频讲故事、编辑与理解
机构 * Language Technologies Institute, Carnegie Mellon University(卡内基梅隆大学语言技术研究所) ; Adobe Research(Adobe研究) ; OpenAI. Work performed while at Adobe(OpenAI)
AI总结 AudioChat通过Transfusion Forcing实现音频故事的生成、编辑与理解,结合LLM工具调用和结构化推理提升多轮交互能力。
WS-GRPO:弱监督组相对策略优化用于高效推理
机构 * University of California, San Diego(加州大学圣地亚哥分校) ; University of Toronto(多伦多大学) ; Adobe Research(Adobe研究) ; The University of New South Wales(新南威尔士大学)
AI总结 WS-GRPO 通过将终端奖励转换为正确性感知的指导,提高推理效率并减少冗余思考,同时保持准确性。
生成音频扩展与变形
机构 * Adobe Research(Adobe研究院)
AI总结 本文提出了一种生成音频扩展与变形的方法,通过遮蔽潜在表示并应用分类器自由引导变体,实现了音频的双向扩展和无缝变形,并通过客观指标和主观测试验证了其有效性。
Comments Accepted to ICASSP 2026