ReScene: Structured Indoor Scene Reconstruction from Multi-View Captures
ReScene: 基于多视角图像的结构化室内场景重建
Haoran Xu, Lechao Zhang, Daoguo Dong, Yan Gao, Xin Tan
机构
*
School of Computer Science and Technology, East China Normal University(华东师范大学计算机科学与技术学院)
;
Institute of Trustworthy Embodied AI, Fudan University(复旦大学可信具身智能研究院)
机构
*
Beijing University of Posts and Telecommunications(北京邮电大学)
;
QiYuanLab(启元实验室)
;
Tsinghua University(清华大学)
;
University of Electronic Science and Technology of China(电子科技大学)
专题命中
视觉问答
:visual question answering(abstract);multimodal large language model(abstract);分类 cs.CV
Paying More Attention to Visual Tokens in Self-Evolving Large Multimodal Models
在自进化大型多模态模型中更加关注视觉标记
Shravan Venkatraman, Ritesh Thawkar, Omkar Thawakar, Rao Muhammad Anwer, Hisham Cholakkal, Salman Khan, Fahad Khan
机构
*
Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)
;
Aalto University(阿尔托大学)
;
Australian National University(澳大利亚国立大学)
;
Linköping University(林雪平大学)
MMSI-Bench: A Benchmark for Multi-Image Spatial Intelligence
MMSI-Bench:多图像空间智能基准
Sihan Yang, Runsen Xu, Yiman Xie, Sizhe Yang, Mo Li, Jingli Lin, Chenming Zhu, Xiaochen Chen, Haodong Duan, Xiangyu Yue, Dahua Lin, Tai Wang, Jiangmiao Pang
机构
*
Shanghai AI Laboratory(上海人工智能实验室)
;
The Chinese University of Hong Kong(香港中文大学)
;
Zhejiang University(浙江大学)
;
Tsinghua University(清华大学)
;
Shanghai Jiaotong University(上海交通大学)
;
University of Hong Kong(香港大学)
;
Beijing Normal University(北京师范大学)
专题命中
视觉问答
:grounding(abstract);multimodal large language model(abstract);分类 cs.CV
BARISTA: A Multi-Task Egocentric Benchmark for Compositional Visual Understanding
BARISTA:一种多任务第一人称视角基准,用于组合视觉理解
Patrick Knab, Orgest Xhelili, Inis Buzi, Drago Andres Guggiana Nilo, Mohd Saquib Khan, Lorenz Kolb, Manuel Scherzer, Kerem Yildirir, Christian Bartelt, Philipp Johannes Schubert
机构
*
Ramblr.ai Research(Ramblr.ai 研究院)
;
Technical University of Clausthal(Clausthal 技术大学)
WaferSAGE: Large Language Model-Powered Wafer Defect Analysis via Synthetic Data Generation and Rubric-Guided Reinforcement Learning
WaferSAGE:基于大语言模型的晶圆缺陷分析:通过合成数据生成与评分引导的强化学习
Ke Xu, Zhongyuan Lian
机构
*
Shanghai Huahong Grace Semiconductor Manufacturing Corporation(上海华虹格瑞半导体制造有限公司)
;
Dept. of Automation, School of Information Science and Engineering, East China University of Science and Technology(自动化系,信息科学与工程学院,东华大学)
机构
*
Ant Digital Technologies, Ant Group(蚂蚁集团数字技术部)
;
College of Computing and Data Science, Nanyang Technological University(南洋理工大学计算机与数据科学学院)
;
CFAR, Agency for Science, Technology and Research(科技研究局CFAR)
专题命中
视觉问答
:vision language model(abstract);visual question answering(abstract);分类 cs.CV
机构
*
Yale University(耶鲁大学)
;
Broad Institute of MIT and Harvard(麻省理工学院-哈佛大学博德研究所)
;
Google DeepMind(谷歌DeepMind)
;
Stanford University(斯坦福大学)
;
Genentech(基因泰克)
;
University of Wisconsin–Madison(威斯康星大学麦迪逊分校)
;
Cornell University(康奈尔大学)
;
Harvard University(哈佛大学)