Uniworld-V2: Reinforce Image Editing with Diffusion Negative-aware Finetuning and MLLM Implicit Feedback
专题命中 VLM训练与架构 :MLLM(title,abstract);multimodal large language model(abstract);分类 cs.CV
AI 大模型
视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。
专题命中 VLM训练与架构 :MLLM(title,abstract);multimodal large language model(abstract);分类 cs.CV
机构 * College of Computer Science and Technology, National University of Defense Technology, China(中国国防科技大学计算机科学与技术学院) ; Beijing University of Posts and Telecommunications, China(北京邮电大学) ; School of Computer Science, Wuhan University, China(武汉大学计算机学院) ; Zhongguancun Academy, China(中关村学院) ; Tsinghua University, China(清华大学) ; Beihang University, China(北航大学)
专题命中 VLM训练与架构 :multimodal large language model(title,abstract);LLaVA(abstract);分类 cs.CV
Comments NeurlPS 2025 Spotlight
专题命中 VLM训练与架构 :VLM(title,abstract);vision-language model(abstract)
机构 * The Graduate Center, CUNY(CUNY研究生中心) ; Brooklyn College, CUNY(CUNY布鲁克林学院) ; Borough of Manhattan Community College, CUNY(CUNY曼哈顿社区学院) ; The City College of New York, CUNY(CUNY纽约城市学院)
专题命中 VLM训练与架构 :MLLM(title,abstract)
专题命中 VLM训练与架构 :vision-language model(abstract);vision language model(abstract);分类 cs.CV
Comments Need more refinement
专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.AI、cs.LG
机构 * EPFL(瑞士联邦理工学院) ; Kempner Institute, Harvard University(哈佛大学凯普纳研究所) ; CBS-NTT Program in Physics of Intelligence, Harvard University(哈佛大学物理智能CBSTNTT项目) ; Physics of Artificial Intelligence Group, NTT Research, Inc., Sunnyvale, CA, USA(NTT研究公司人工智能物理研究组) ; University of Alberta(阿尔伯塔大学) ; Alberta Machine Intelligence Institute (Amii)(阿尔伯塔人工智能研究所) ; SEAS, Harvard University(哈佛大学工程与应用科学学院)
专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.LG
Comments 39th Conference on Neural Information Processing Systems (NeurIPS 2025)
机构 * Mila, University of Montreal(蒙特利尔大学Mila) ; Turing Inc.(图灵公司) ; Sony AI(索尼人工智能) ; Sony AI, UT Austin(索尼人工智能、得克萨斯大学奥斯汀分校)
专题命中 VLM训练与架构 :VLM(abstract);分类 cs.AI