OmniSpace: Efficient Geometry Awareness for Autonomous Vehicles MLLMs
OmniSpace: 自动驾驶多模态大语言模型的高效几何感知
Hao Vo, Phu Loc Nguyen, Khoa Vo, Sieu Tran, Duc Minh Nguyen, Ngo Xuan Cuong, Nghi D. Q. Bui, Anh Nguyen, Duy Minh Ho Nguyen, Ngan Le
机构
*
University of Arkansas(阿肯色大学)
;
Google Research, Google(谷歌研究院)
;
University of Liverpool(利物浦大学)
;
Max Planck Research School for Intelligent Systems(马克斯·普朗克智能系统研究所)
专题命中
视觉推理
:MLLM(summary_cn);multimodal large language model(abstract);分类 cs.CV
机构
*
Faculty of Electronic and Information Engineering, Xi’an Jiaotong University(西安交通大学电子与信息工程学院)
;
Ministry of Education Key Laboratory of Intelligent Networks and Network Security(教育部智能网络与网络安全重点实验室)
机构
*
School of Information Science and Engineering, Lanzhou University(兰州大学信息科学与工程学院)
;
Beijing University of Posts and Telecommunications(北京邮电大学)
;
Cloud and AI BU, Huawei(华为云与AI业务部)
;
School of Computing, National University of Singapore(新加坡国立大学计算机学院)
专题命中
视觉推理
:MLLM(abstract,abstract_cn);multimodal large language model(abstract);分类 cs.CV
Digital Twin Driven Textile Classification and Foreign Object Recognition in Automated Sorting Systems
数字孪生驱动的自动化分拣系统中的纺织品分类与异物识别
Serkan Ergun, Tobias Mitterer, Hubert Zangl
机构
*
Institute of Smart Systems Technologies(智能系统技术研究所)
;
University of Klagenfurt(克雷格弗特大学)
;
AAU SAL USE Laboratory(AAU SAL USE实验室)
;
Silicon Austria Labs(硅 Austria 实验室)
专题命中
视觉推理
:VLM(abstract,abstract_cn);visual language model(abstract);分类 cs.CV
MODF-SIR: A Multi-agent Omni-modal Distilled Framework for Social Intelligence Reasoning
MODF-SIR:面向社交智能推理的多智能体全模态蒸馏框架
Shang Ma, Jisheng Dang, Wencan Zhang, Yifan Zhang, Bimei Wang, Hong Peng, Bin Hu, Qi Tian, Tat-Seng Chua
机构
*
School of Information Science and Engineering, Lanzhou University(兰州大学信息科学与工程学院)
;
School of Medical Technology, Beijing Institute of Technology(北京理工大学医学技术学院)
;
Cloud and AI BU, Huawei(华为云与AI业务部)
;
School of Computing, National University of Singapore(新加坡国立大学计算机学院)
专题命中
视觉推理
:MLLM(abstract,abstract_cn);multimodal large language model(abstract);分类 cs.AI
CP-Agent: Context-Aware Multimodal Reasoning for Cellular Morphological Profiling under Chemical Perturbations
CP-Agent: 化学扰动下细胞形态学轮廓的上下文感知多模态推理
Yuxin Zhang, Yiyao Li, Ping Shu Ho, Simon See, Zhenqin Wu, Kevin Tsia
机构
*
Department of Electrical and Computer Engineering, The University of Hong Kong(香港大学电子与计算机工程系)
;
School of Computing and Data Science, The University of Hong Kong(香港大学计算与数据科学学院)
;
School of Biomedical Engineering, The University of Hong Kong(香港大学生物医学工程学院)
;
Nvidia AI Technology Center(NVIDIA人工智能技术中心)
;
Advanced Biomedical Instrumentation Centre(先进生物医学仪器中心)
专题命中
视觉推理
:MLLM(abstract,abstract_cn);multimodal large language model(abstract);分类 cs.AI
Perceive Before Reasoning: A Pre-Reasoning Perception Framework for Efficient and Reliable Proactive Mobile Agents
先感知后推理:一种用于高效可靠主动移动代理的预推理感知框架
Zhijie Ding, Weinan Hong, Zicheng Zhu, Lei Li, Dezhi Kong, Hao Wang, Peng Zhou, Xuchu Jiang, Jiaming Xu
机构
*
HyperAI Team, Xiaomi Corporation(HyperAI团队,小米公司)
;
Zhongnan University of Economics and Law(中南财经政法大学)
;
Jilin University(吉林大学)
;
The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))
专题命中
视觉推理
:MLLM(abstract,abstract_cn);multimodal large language model(abstract);分类 cs.AI
iVGR: Internalizing Visually Grounded Reasoning for MLLMs with Reinforcement Learning
iVGR: 通过强化学习将视觉基础推理内化到多模态大语言模型中
Chang-Bin Zhang, Yujie Zhong, Qiang Zhang, Kai Han
机构
*
Visual AI Lab, The University of Hong Kong(香港大学视觉人工智能实验室)
;
Independent Researcher(独立研究者)
;
University of Science and Technology of China(中国科学技术大学)
专题命中
视觉推理
:grounding(abstract);multimodal large language model(abstract);MLLM(abstract_cn);分类 cs.CV
SVSR: A Self-Verification and Self-Rectification Paradigm for Multimodal Reasoning
SVSR:一种用于多模态推理的自我验证与自我修正范式
Zhe Qian, Nianbing Su, Zhonghua Wang, Hebei Li, Zhongxing Xu, Yueying Li, Fei Luo, Zhuohan Ouyang, Yanbiao Ma
机构
*
South China Agricultural University(华南农业大学)
;
University of Glasgow(格拉斯哥大学)
;
University of Electronic Science and Technology of China(电子科技大学)
;
Monash University(莫纳什大学)
;
University of Science and Technology of China(中国科学技术大学)
;
National University of Defense Technology(国防科技大学)
;
Renmin University of China(中国人民大学)
;
South China Normal University(华南师范大学)
DermAgent: A Self-Reflective Agentic System for Dermatological Image Analysis with Multi-Tool Reasoning and Traceable Decision-Making
DermAgent: 一种用于皮肤病图像分析的自反思代理系统,具备多工具推理和可追溯决策制定
Yize Liu, Siyuan Yan, Ming Hu, Lie Ju, Xieji Li, Feilong Tang, Wei Feng, Zongyuan Ge
机构
*
AIM for Health Lab, Faculty of Information Technology, Monash University, Melbourne, Australia(健康人工智能实验室,信息科技学院,墨尔本大学,澳大利亚)
;
Faculty of Information Technology, Monash University, Melbourne, Australia(信息科技学院,墨尔本大学,澳大利亚)
;
University College London, Institute of Ophthalmology, London, United Kingdom(伦敦大学学院,眼科研究所,英国)
专题命中
视觉推理
:grounding(abstract,abstract_cn);multimodal large language model(abstract);分类 cs.CV
机构
*
University of Science and Technology of China(中国科学技术大学)
;
Kling Team, Kuaishou Technology(快手科技 Kling 团队)
;
Institute of Software Chinese Academy of Sciences(中国科学院软件研究所)
专题命中
视觉推理
:MLLM(abstract,abstract_cn);multimodal large language model(abstract);分类 cs.CV