MV-GEL: Language-Driven Multi-View Geometric Entity Localization on Meshes
MV-GEL:语言驱动的多视图网格几何实体定位
Kartik Bali, Roland Aydin
机构
*
Helmholtz Zentrum Hereon(亥姆霍兹赫里恩研究中心)
;
Institute for Continuum and Material Mechanics, Hamburg University of Technology(汉堡工业大学连续介质与材料力学研究所)
;
German Research Center for Artificial Intelligence(德国人工智能研究中心)
专题命中
视觉定位与Grounding
:VLM(summary_cn,abstract);vision language model(abstract);grounding(abstract);分类 cs.CV
RoboGaze: Evaluating Robot World Models via Structured Vision-Language Analysis
RoboGaze: 通过结构化视觉-语言分析评估机器人世界模型
Minh-Loi Nguyen, Nghiem Tuong Diep, Hung Khang Nguyen, Minh Le, Doanh Le Thien, Hoang H. Tran, Dung D. Le, Vu N. Duong, Daniel Sonntag, An Thai Le, Duy Minh Ho Nguyen, Vien Anh Ngo, Tran Van Nhiem
机构
*
Ho Chi Minh City University of Science, Vietnam National University(越南国家科学大学胡志明市大学)
;
VinRobotics
;
VinUniversity
;
German Research Center for AI (DFKI)(人工智能研究中心(DFKI))
;
University of Stuttgart(斯图加特大学)
;
Max Planck Research School for Intelligent Systems(智能系统马克斯·普朗克研究学校)
;
Technische Universität Darmstadt(达姆施塔特技术大学)
CARMA: Context-Aware Situational Grounding of Human-Robot Group Interactions by Combining Vision-Language Models with Object and Action Recognition
Joerg Deigmoeller, Stephan Hasler, Nakul Agarwal, Daniel Tanneberg, Anna Belardinelli, Reza Ghoddoosian, Chao Wang, Felix Ocker, Fan Zhang, Behzad Dariush, Michael Gienger
机构
*
Honda Research Institute Europe(本田欧洲研究院)
;
Honda Research Institute USA(本田美国研究院)
From Alignment to Synthesis Contrastive Volumetric Grounding for Text-to-CT Generation
从对齐到合成:用于文本到CT生成的对比体 grounding
Daniele Molino, Camillo Maria Caruso, Filippo Ruffini, Paolo Soda, Valerio Guarrasi
机构
*
Unit of Artificial Intelligence and Computer Systems, Department of Engineering, Università Campus Bio-Medico di Roma(人工智能与计算机系统单位,工程系,罗马生物医学大学)
;
Department of Diagnostics and Intervention, Biomedical Engineering and Radiation Physics, Umeå University(诊断与干预部门,生物医学工程与放射物理学,乌梅拉大学)
Vision-Language Model Purified Semi-Supervised Semantic Segmentation for Remote Sensing Images
面向遥感图像的视觉-语言模型纯化半监督语义分割
Shanwen Wang, Xin Sun, Danfeng Hong, Fei Zhou
机构
*
Faculty of Data Science, City University of Macau(数据科学学院,澳门城市大学)
;
School of Automation, Southeast University(自动化学院,东南大学)
;
College of Oceanography and Space Informatics, China University of Petroleum (East China)(海洋与空间信息学院,中国石油大学(华东))
3D-DefectBench: A Controlled Factorial Study of Vision-Language Model Evaluation Pipelines for Fine-Grained 3D Generation Defects
3D-缺陷基准:用于细粒度3D生成缺陷的视觉语言模型评估管道的控制因子研究
Zhenyu Zhao, Nanshan Jia, Jihyeon Je, Yifu Tang, Alvin Chan, Michael Spedden, Michael V. Palleschi, Sui Huang, Jingshen Wang, Zeyu Zheng
机构
*
Roblox Corporation(罗布乐思公司)
;
Berkeley AI Research Lab & Department of Industrial Engineering and Operations Research, University of California, Berkeley(加州大学伯克利分校伯克利人工智能研究实验室及工业工程与运筹学系)
;
Computer Science Department, Stanford University(斯坦福大学计算机科学系)
;
Division of Biostatistics, University of California, Berkeley(加州大学伯克利分校生物统计学系)
MMBU: A Massive Multi-modal Biomedical Understanding Benchmark to Probe the Perception Capabilities of Vision-Language Models
MMBU: 大规模多模态生物医学理解基准,用于探测视觉语言模型的感知能力
Ryan D'Cunha, Alejandro Lozano, Xiaoxiao Sun, Daniel Vela Jarquin, Min Woo Sun, Josiah Aklilu, James Burgess, Yuhui Zhang, Ryan Nayebi, Paola Avila, Robayo, Jin Ye, Ming Hu, Zhongying Deng, Junjun He, Xin Chen, Yue Yao, Robert Tibshirani, Jeffrey J. Nirschl, Serena Yeung-Levy
机构
*
Stanford University(斯坦福大学)
;
University of Wisconsin–Madison(威斯康星大学麦迪逊分校)
;
Instituto Tecnológico de Monterrey(蒙特雷技术学院)
;
Monash University(墨尔本大学)
;
University of Cambridge(剑桥大学)
;
Shanghai Jiao Tong University(上海交通大学)
;
Shandong University(山东大学)
Are Vision-Language Models Ready for Dietary Assessment? Exploring the Next Frontier in AI-Powered Food Image Recognition
视觉-语言模型是否准备好进行饮食评估?探索AI驱动的食品图像识别的下一个前沿
Sergio Romero-Tapiador, Ruben Tolosana, Blanca Lacruz-Pleguezuelos, Laura Judith Marcos Zambrano, Guadalupe X. Bazán, Isabel Espinosa-Salinas, Julian Fierrez, Javier Ortega-Garcia, Enrique Carrillo de Santa Pau, Aythami Morales
机构
*
Biometrics and Data Pattern Analytics Lab, Universidad Autonoma de Madrid(生物度量与数据模式分析实验室,马德里自治大学)
;
IMDEA Food, CEI UAM+CSIC(IMDEA食品,CEI UAM+CSIC)