Unveiling Chain of Step Reasoning for Vision-Language Models with Fine-grained Rewards
Honghao Chen, Xingzhou Lou, Xiaokun Feng, Kaiqi Huang, Xinlong Wang
机构
*
Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)
;
School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院)
;
Beijing Academy of Artificial Intelligence(北京人工智能研究院)
机构
*
Indian Institute of Technology Patna(印度理工学院帕纳巴分校)
;
Banasthali Vidyapeeth University(班纳萨利大学)
;
Pandit Deendayal Energy University(德英德能源大学)
;
Manipal University Jaipur(马哈拉施特拉邦大学贾伊普尔分校)
;
Dwarkadas J. Sanghvi College of Engineering(德瓦尔卡斯J.桑格维工程学院)
机构
*
La Sapienza University of Rome(拉维亚大学罗马分校)
;
Peoples' Friendship University of Russia (RUDN University)(俄罗斯人民友谊大学)
;
Joint Institute for Nuclear Research(联合核子研究所)
;
Vrije Universiteit Amsterdam(阿姆斯特丹自由大学)
;
University of Skövde(斯德哥尔摩大学)
Split Matching for Inductive Zero-shot Semantic Segmentation
Jialei Chen, Xu Zheng, Dongyue Li, Chong Yi, Seigo Ito, Danda Pani Paudel, Luc Van Gool, Hiroshi Murase, Daisuke Deguchi
机构
*
Graduate School of Informatics, Nagoya University (NU)(名古屋大学信息研究生院)
;
Artificial Intelligence Thrust, The Hong Kong University of Science and Technology (Guangzhou) (HKUST (GZ))(香港科学与技术大学(广州)人工智能推进部)
;
Institute for Computer Science, Artificial Intelligence and Technology (INSAIT), Sofia University, St. Kliment Ohridski(索菲亚大学计算机科学、人工智能与技术研究所)
Finite Groundings for ASP with Functions: A Journey through Consistency
Lukas Gerlach, David Carral, Markus Hecher
机构
*
Knowledge-Based Systems Group, TU Dresden(图腾大学达姆施塔特分校知识系统小组)
;
LIRMM, Inria, University of Montpellier, CNRS(里尔毫米研究所、法国国家信息与自动化技术研究院、蒙彼利埃大学、国家科学研究中心)
;
Massachusetts Institute of Technology(麻省理工学院)
SINGER: An Onboard Generalist Vision-Language Navigation Policy for Drones
Maximilian Adang, JunEn Low, Ola Shorinwa, Mac Schwager
机构
*
Department of Aeronautics and Astronautics, Stanford University(航空与航天系,斯坦福大学)
;
Department of Mechanical Engineering, Stanford University(机械工程系,斯坦福大学)
Automating Steering for Safe Multimodal Large Language Models
Lyucheng Wu, Mengru Wang, Ziwen Xu, Tri Cao, Nay Oo, Bryan Hooi, Shumin Deng
机构
*
Zhejiang University(浙江大学)
;
Zhejiang University - Ant Group Joint Lab of Knowledge Graph(浙江大学-蚂蚁集团知识图谱联合实验室)
;
National University of Singapore, NUS-NCS Joint Lab(新加坡国立大学NUS-NCS联合实验室)
专题命中
幻觉与鲁棒性
:multimodal large language model(title,abstract);LLaVA(abstract);分类 cs.AI、cs.LG
CommentsEMNLP 2025 Main Conference. 23 pages (8+ for main); 25 figures; 1 table
机构
*
University of Notre Dame(notre dame 大学)
;
University of Washington(华盛顿大学)
;
Johns Hopkins University(约翰霍普金斯大学)
;
Georgia Institute of Technology(佐治亚理工学院)
专题命中
幻觉与鲁棒性
:multimodal large language model(title,abstract);MLLM(abstract);分类 cs.AI
CommentsA lightweight and model-agnostic decoding framework that dynamically adjusts token generation based on multimodal context
Mitigating Hallucination in Large Vision-Language Models through Aligning Attention Distribution to Information Flow
Jianfei Zhao, Feng Zhang, Xin Sun, Chong Feng
机构
*
School of Computer Science and Technology, Beijing Institute of Technology(计算机科学与技术学院,北京理工大学)
;
Zhongguancun Academy(中关村学院)
;
Southeast Academy of Information Technology, Beijing Institute of Technology(信息技术东南学院,北京理工大学)
Bayesian Calibration and Model Assessment of Cell Migration Dynamics with Surrogate Model Integration
Christina Schenk, Jacobo Ayensa Jiménez, Ignacio Romero
机构
*
IMDEA Materials Institute(IMDEA材料研究所)
;
Universidad Politécnica de Madrid(马德里理工大学)
;
Aragón Institute of Engineering Research (I3A)(阿伦工程技术研究所(I3A))
机构
*
The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))
;
KU Leuven(根特大学)
;
École Polytechnique Fédérale de Lausanne(洛桑联邦理工学院)
;
Carleton University(卡尔顿大学)
专题命中
VLM训练与架构
:multimodal large language model(title,abstract);vision-language model(abstract);VLM(abstract);MLLM(abstract)
Benchmarking Vision-Language and Multimodal Large Language Models in Zero-shot and Few-shot Scenarios: A study on Christian Iconography
Gianmarco Spinaci, Lukas Klic, Giovanni Colavizza
机构
*
Gianmarco Spinaci Department of Classical Philology and Italian Studies, University of Bologna, Italy Villa i Tatti, The Harvard University Center for Italian Renaissance Studies, Florence, Italy(Gianmarco Spinaci 文艺复兴研究系,博洛尼亚大学,意大利 塔蒂别墅,哈佛大学意大利文艺复兴研究中心,佛罗伦萨,意大利)
;
Lukas Klic Villa i Tatti, The Harvard University Center for Italian Renaissance Studies, Florence, Italy(Lukas Klic 塔蒂别墅,哈佛大学意大利文艺复兴研究中心,佛罗伦萨,意大利)
;
Giovanni Colavizza Department of Classical Philology and Italian Studies, University of Bologna, Italy Department of Communication, University of Copenhagen, Denmark(Giovanni Colavizza 文艺复兴研究系,博洛尼亚大学,意大利 传播系,哥本哈根大学,丹麦)
专题命中
VLM训练与架构
:multimodal large language model(title,abstract);vision language model(abstract);分类 cs.CV
Large Vision-Language Model Alignment and Misalignment: A Survey Through the Lens of Explainability
Dong Shu, Haiyan Zhao, Jingyu Hu, Weiru Liu, Ali Payani, Lu Cheng, Mengnan Du
机构
*
Northwestern University(西北大学)
;
New Jersey Institute of Technology(新泽西理工学院)
;
University of Bristol(布里斯托大学)
;
Cisco Research(思科研究)
;
University of Illinois Chicago(伊利诺伊大学芝加哥分校)