Seeing Once is Enough? Online Geometry-Aware Token Pruning for 3D Question Answering
看一次就够了?用于3D问答的在线几何感知令牌剪枝
Ruei-Chi Lai, Bolivar Solarte, Chin-Hsuan Wu, Yi-Hsuan Tsai, Min Sun
机构
*
National Tsing Hua University(国立清华大学)
;
Industrial Technology Research Institute ITRI(工业技术研究院)
;
University of Toronto(多伦多大学)
;
Atmanity Inc(Atmanity公司)
A Pathway to General-Purpose Scientific AI: Multimodal Comprehension of Scientific Images
通用科学人工智能的实现路径:科学图像的多模态理解
Jennifer D'Souza, Fahad Ahmed, Cecilia Andrea Bustamante Andrade, Lina Frolova, Poorani Gnanasambandan, Dilshad Hussain, Muhammad Uzair Khan, Nkembeng Kevin Nkengfoa, Paul Praveen J., Fabio Priante, Sjoerd Franciscus van der Werf, Thomas Frederik Jan van Roeden
机构
*
TIB Leibniz Information Centre for Science and Technology(莱布尼茨科学与技术信息中心(TIB))
;
Eindhoven University of Technology(埃因霍温理工大学)
;
Freie Universität Berlin(柏林自由大学)
;
International Center for Chemical and Biological Sciences, University of Karachi(卡拉奇大学国际化学与生物科学中心)
;
National University of Sciences and Technology(国家科技大学)
;
University of Warwick(华威大学)
;
PSG College of Technology(PSG理工学院)
;
Aalto University(阿尔托大学)
Confidence Calibration for Multimodal LLMs: An Empirical Study through Medical VQA
多模态大语言模型的置信度校准:基于医学视觉问答的实证研究
Yuetian Du, Yucheng Wang, Ming Kong, Tian Liang, Qiang Long, Bingdi Chen, Qiang Zhu
机构
*
College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院)
;
School of Computer Science and Technology, Xidian University(西安电子科技大学计算机科学与技术学院)
;
Zhihui Medical Technology (Shanghai) Co., Ltd.(智汇医疗科技(上海)有限公司)
专题命中
视觉问答
:visual question answering(abstract);multimodal large language model(abstract);分类 cs.CV、cs.AI
机构
*
School of Computer Science and Engineering, Southeast University(东南大学计算机科学与工程学院)
;
Key Laboratory of Computer Network and Information Integration, Southeast University, Ministry of Education(东南大学计算机网络和信息集成教育部重点实验室)
;
Huawei Noah’s Ark Lab(华为诺亚方舟实验室)
TrustRoboReward: Preference-Ordered Isotonic Score Editing for Multi-Paradigm Robot Reward Models
TrustRoboReward:面向多范式机器人奖励模型的偏好有序保序分数编辑方法
Yidong Wang, Yan Zhan, Ziteng Feng, Zhenyu Cui, Ziyi Zhou, Renzhao Liang, Jiaxuan Zhu, Zilei Yang, Yiran Zhao, Zhongkuan Mao, Bo Jia, Hanchu Ni, Chenggang Xie, Biao Liu, Yi Zhang, Yong Dai, Xiaozhu Ju, Wei Ye, Shikun Zhang
机构
*
Peking University(北京大学)
;
Beijing Innovation Center of Humanoid Robotics(北京人形机器人创新中心)
;
University of Science and Technology of China(中国科学技术大学)
;
Southeast University(东南大学)
;
Southern University of Science and Technology(南方科技大学)
;
Beijing University of Aeronautics and Astronautics(北京航空航天大学)
;
Beijing Language and Culture University(北京语言大学)
;
Sichuan University(四川大学)
;
Beijing University of Posts and Telecommunications(北京邮电大学)
EvoGraph-R1: Self-Evolving Multimodal Knowledge Hypergraphs for Agentic Retrieval
EvoGraph-R1:用于智能检索的自进化多模态知识超图
Jiashi Lin, Changhong Jiang, Xiangru Lin, Ruifei Zhang, Xinyi Zhu, Jiyao Liu, Cheng Tang, Ye Du, Shujian Gao, Junzhi Ning, Lihao Liu, Ziyan Huang, Tianbin Li, Jin Ye, Junjun He
机构
*
Northwestern Polytechnical University(西北工业大学)
;
Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)
;
The University of Hong Kong(香港大学)
;
Monash University(莫纳什大学)
;
The Chinese University of Hong Kong (Shenzhen)(香港中文大学(深圳))
专题命中
视觉问答
:grounding(abstract);multimodal large language model(abstract);分类 cs.CV
ReScene: Structured Indoor Scene Reconstruction from Multi-View Captures
ReScene: 基于多视角图像的结构化室内场景重建
Haoran Xu, Lechao Zhang, Daoguo Dong, Yan Gao, Xin Tan
机构
*
School of Computer Science and Technology, East China Normal University(华东师范大学计算机科学与技术学院)
;
Institute of Trustworthy Embodied AI, Fudan University(复旦大学可信具身智能研究院)
机构
*
Beijing University of Posts and Telecommunications(北京邮电大学)
;
QiYuanLab(启元实验室)
;
Tsinghua University(清华大学)
;
University of Electronic Science and Technology of China(电子科技大学)
专题命中
视觉问答
:visual question answering(abstract);multimodal large language model(abstract);分类 cs.CV