arXivDaily arXiv每日学术速递 周一至周五更新

大厂专区

2026-05-26 至 2026-05-26 共收录 6
2605.26111 2026-05-26 cs.CV cs.AI cs.GR cs.LG cs.MM

Squeezing Capacity from Multimodal Large Language Models for Subject-driven Generation

从多模态大语言模型中榨取能力用于主题驱动生成

Shuhong Zheng, Aashish Kumar Misraa, Yu-Teng Li, Yu-Jhe Li, Igor Gilitschenski

机构 * University of Toronto & Vector Institute(多伦多大学及向量研究所) Adobe(Adobe公司) Google(谷歌公司)

AI总结 提出一种结合多模态大语言模型和VAE身份条件的方法,通过双层级聚合模块和多阶段去噪策略,在主题驱动图像生成中实现多模态理解与身份保持的平衡,优于现有方法。

Comments 33 pages, 18 figures, Project Page: https://zsh2000.github.io/squeeze-mllm-subject-gen/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26013 2026-05-26 cs.LG cs.AI cs.CV

AdvantageFlow: Advantage-Weighted Least Squares for RL in Flow Models

AdvantageFlow: 流模型中基于优势加权的强化学习最小二乘法

Branislav Kveton, Anup Rao, Subhojyoti Mukherjee, Krishna Kumar Singh, Viet Dac Lai

机构 * Adobe Research(Adobe研究)

AI总结 提出AdvantageFlow算法,通过优势加权前向过程预测损失和 rollout 策略正则化,在图像生成任务中优于Flow-GRPO和负感知微调基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01183 2026-05-26 cs.CV cs.LG

Refining Context-Entangled Content Segmentation via Curriculum Selection and Anti-Curriculum Promotion

通过课程选择与反课程促进优化上下文纠缠内容分割

Chunming He, Rihan Zhang, Fengyang Xiao, Dingming Zhang, Zhiwen Cao, Sina Farsiu

机构 * Duke University(杜克大学) Adobe(Adobe公司)

AI总结 提出CurriSeg双阶段学习框架,结合课程学习与反课程学习原理,通过动态数据选择与频谱盲性微调提升上下文纠缠内容分割的鲁棒性和泛化能力。

Comments ICML 2026, 8 figures, 11 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25204 2026-05-26 cs.CL

Clarification Is Not Enough: Post-Clarification Answering Remains the Bottleneck in Multi-Turn QA

澄清不够:澄清后的回答仍是多轮问答中的瓶颈

Jinyan Su, Jennifer Healey

机构 * Cornell University(康奈尔大学) Adobe Research(Adobe研究)

AI总结 本文通过分解多轮问答为澄清策略和澄清后回答两个组件,利用PACIFIC基准实验发现监督微调能快速提升澄清策略,但最终答案准确率仍显著偏低,表明理解并正确解释用户回应是关键瓶颈。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24398 2026-05-26 cs.CV cs.AI cs.GR

VectorArk: Learning Practical Image Vectorization with Rounded Polygon Representation

VectorArk: 学习基于圆角多边形表示的实际图像矢量化

Tarun Gehlaut, Difan Liu, Charu Bansal, Krutik Malani, Souymodip Chakraborty, Ankit Phogat, Matthew Fisher, Vineet Batra

机构 * Adobe

AI总结 提出VectorArk模型,采用圆角多边形表示和退化模型,实现鲁棒且实用的图像矢量化,在多个数据集上取得优越的几何完整性和伪影抑制效果。

Comments CVPR 2026. Project page: https://vectorark.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24266 2026-05-26 cs.CL cs.AI

An Interactive Paradigm for Deep Research

深度研究的交互式范式

Lin Ai, Victor S. Bursztyn, Xiang Chen, Julia Hirschberg, Saayan Mitra

机构 * Adobe Research(Adobe研究院) Department of Computer Science, Columbia University(哥伦比亚大学计算机科学系)

AI总结 提出SteER框架,通过可解释的中间过程控制、成本效益决策和实时用户模型,在深度研究中实现用户对齐,性能优于现有基线。

详情

展开后加载摘要…

URL PDF HTML 收藏