arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

The University of Hong Kong(香港大学)

2025-12-01 至 2025-12-01 共收录 9
2511.23239 2025-12-01 cs.LG stat.ML

Towards Understanding Transformers in Learning Random Walks

向理解变换器在学习随机游走中的能力

Wei Shi, Yuan Cao

机构 * School of Computing & Data Science, The University of Hong Kong(计算与数据科学学院,香港大学)

AI总结 本文研究了变换器在学习随机游走中的能力和可解释性,证明单层变换器在预测随机游走时能达到最优准确性,并揭示了其可解释性机制。

Comments 45 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.23031 2025-12-01 cs.CV cs.AI

From Illusion to Intention: Visual Rationale Learning for Vision-Language Reasoning

从幻觉到意图:用于视觉-语言推理的视觉理由学习

Changpeng Wang, Haozhe Wang, Xi Chen, Junhan Liu, Taofeng Xue, Chong Peng, Donglian Qi, Fangzhen Lin, Yunfeng Yan

机构 * Zhejiang University(浙江大学) The University of Hong Kong(香港大学) Meituan(美团)

AI总结 本文提出视觉理由学习(ViRL),通过将视觉动作作为核心推理元素,提升视觉-语言推理模型的透明度和可信度。

Comments 19 pages, 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22911 2025-12-01 eess.IV cs.AI cs.CV

MICCAI STS 2024 Challenge: Semi-Supervised Instance-Level Tooth Segmentation in Panoramic X-ray and CBCT Images

MICCAI STS 2024挑战:在全景X光和CBCT图像中实现半监督实例级牙齿分割

Yaqi Wang, Zhi Li, Chengyu Wu, Jun Liu, Yifan Zhang, Jiaxue Ni, Qian Luo, Jialuo Chen, Hongyuan Zhang, Jin Liu, Can Han, Kaiwen Fu, Changkai Ji, Xinxu Cai, Jing Hao, Zhihao Zheng, Shi Xu, Junqiang Chen, Qianni Zhang, Dahong Qian, Shuai Wang, Huiyu Zhou

机构 * Innovation Center for Electronic Design Automation Technology(电子设计自动化技术创新中心) School of Cyberspace(网络空间学院) Hangzhou Dianzi University(杭州电子科技大学) Hangzhou Geriatric Stomatology Hospital(杭州老年牙科医院) Shenzhen University(深圳大学) Queen Mary University of London(伦敦大学Queen Mary分校) Shandong University(山东大学) Xidian University(西安电子科技大学) Shanghai Jiao Tong University(上海交通大学) Harbin Institute of Technology(哈尔滨工业大学) The University of Hong Kong(香港大学) Chinese Academy of Sciences(中国科学院) Yunnan Provincial Stomatology Hospital(云南省牙科医院) Shanghai MediWorks Precision Instruments Co., Ltd(上海 MediWorks 精密仪器有限公司) University of Leicester(莱斯特大学)

AI总结 MICCAI STS 2024挑战通过半监督学习方法在全景X光和CBCT图像中实现实例级牙齿分割,展示了SSL在数据稀缺情况下的显著性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22664 2025-12-01 cs.CV

VaMP: Variational Multi-Modal Prompt Learning for Vision-Language Models

VaMP:用于视觉-语言模型的变分多模态提示学习

Silin Cheng, Kai Han

机构 * Visual AI Lab, The University of Hong Kong(香港大学视觉人工智能实验室)

AI总结 VaMP提出了一种变分多模态提示学习框架,通过实例条件提示和不确定性建模提升视觉-语言模型在少样本和领域泛化任务中的性能。

Comments Accepted to NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22609 2025-12-01 cs.CV cs.RO

MG-Nav: Dual-Scale Visual Navigation via Sparse Spatial Memory

MG-Nav:基于稀疏空间记忆的双尺度视觉导航

Bo Wang, Jiehong Lin, Chenzhi Liu, Xinting Hu, Yifei Yu, Tianjia Liu, Zhongrui Wang, Xiaojuan Qi

机构 * The University of Hong Kong(香港大学) Southern University of Science and Technology(南方科技大学)

AI总结 MG-Nav通过稀疏空间记忆图和VGGT-adapter模块实现双尺度视觉导航,结合全局规划与局部控制,实现零样本导航的高鲁棒性与高性能。

Comments 10pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22429 2025-12-01 cs.CV

Fin3R: Fine-tuning Feed-forward 3D Reconstruction Models via Monocular Knowledge Distillation

Fin3R:通过单目知识蒸馏细调馈送式3D重建模型

Weining Ren, Hongjun Wang, Xiao Tan, Kai Han

机构 * Visual AI Lab, The University of Hong Kong(香港大学视觉人工智能实验室) Department of Computer Vision Technology (VIS), Baidu Inc.(百度公司计算机视觉技术部)

AI总结 Fin3R通过单目知识蒸馏细调馈送式3D重建模型,提升几何精度和鲁棒性,仅增加微小权重。

Comments NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22055 2025-12-01 cs.CV cs.MM

OralGPT-Omni: A Versatile Dental Multimodal Large Language Model

OralGPT-Omni: 一种多功能的牙科多模态大语言模型

Jing Hao, Yuci Liang, Lizhuo Lin, Yuxuan Fan, Wenkai Zhou, Kaixin Guo, Zanting Ye, Yanpeng Sun, Xinyu Zhang, Yanqi Yang, Qiankun Li, Hao Tang, James Kit-Hon Tsoi, Linlin Shen, Kuo Feng Hung

机构 * Faculty of Dentistry, The University of Hong Kong(香港大学牙科学院) College of Computer Science and Software Engineering, Shenzhen University(深圳大学计算机科学与软件工程学院) The Hong Kong University of Science and Technology (GZ)(香港科学与技术大学) School of Biomedical Engineering, Southern Medical University(南方医科大学生物医学工程学院) Singapore University of Technology and Design(新加坡科技与设计大学) University of Auckland(奥克兰大学) University of Science and Technology of China(中国科学技术大学) School of Computer Science, Peking University(北京大学计算机学院) College of Artificial Intelligence, Shenzhen University(深圳大学人工智能学院)

AI总结 OralGPT-Omni是一种专门用于牙科的多模态大语言模型,通过TRACE-CoT数据集和四阶段训练范式,实现了对牙科图像的高效分析和高准确率评估。

Comments 47 pages, 42 figures, 13 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21937 2025-12-01 cs.CV

Interpretable Multimodal Cancer Prototyping with Whole Slide Images and Incompletely Paired Genomics

可解释的多模态癌症原型生成:结合整张滑片图像与不完全配对的基因组学

Yupei Zhang, Yating Huang, Wanming Hu, Lequan Yu, Hujun Yin, Chao Li

机构 * Department of Clinical Neurosciences, University of Cambridge, UK(剑桥大学临床神经科学系) Department of Electrical & Electronic Engineering, The University of Manchester, UK(曼彻斯特大学电气与电子工程系) Department of Pathology, State Key Laboratory of Oncology in South China, Guangdong Provincial Clinical Research Center for Cancer, Sun Yat-sen University Cancer Center, China(南方医科大学肿瘤学国家重点实验室、广东省癌症临床研究中心、中山大学肿瘤中心病理学部) Department of Statistics and Actuarial Science, The University of Hong Kong, Hong Kong SAR, China(香港大学统计与精算科学系) Department of Clinical Neurosciences and Department of Applied Mathematics and Theoretical Physics, University of Cambridge(剑桥大学临床神经科学系和应用数学与理论物理系;邓迪大学科学与工程学院和医学学院) School of Science and Engineering and School of Medicine, University of Dundee, UK

AI总结 本文提出了一种可解释的多模态原型生成框架,通过整合整张滑片图像和不完整的基因组学数据,提升精准肿瘤学中的多模态整合效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21688 2025-12-01 cs.CV cs.AI cs.CL

G$^2$VLM: Geometry Grounded Vision Language Model with Unified 3D Reconstruction and Spatial Reasoning

G$^2$VLM:基于几何的视觉语言模型,实现统一的3D重建与空间推理

Wenbo Hu, Jingli Lin, Yilin Long, Yunlong Ran, Lihan Jiang, Yifan Wang, Chenming Zhu, Runsen Xu, Tai Wang, Jiangmiao Pang

机构 * Shanghai AI Lab(上海人工智能实验室) UCLA(加州大学洛杉矶分校) SJTU(上海交通大学) FDU(福建师范大学) ZJU(浙江大学) USTC(中国科学技术大学) HKU(香港大学) CUHK(香港中文大学)

AI总结 G$^2$VLM通过统一3D重建与空间推理,提升视觉语言模型在空间智能任务中的性能。

Comments code are released at https://github.com/InternRobotics/G2VLM

详情

展开后加载摘要…

URL PDF HTML 收藏