机构
*
College of Intelligence Science and Technology, National University of Defense Technology(智能科学与技术学院,国防科技大学)
;
College of Computer Science and Technology, National University of Defense Technology(计算机科学与技术学院,国防科技大学)
PointLLM-R: Enhancing 3D Point Cloud Reasoning via Chain-of-Thought
PointLLM-R: 通过链式推理增强3D点云推理
Chaoqi Chen, Qile Xu, Wenjun Zhou, Hui Huang
机构
*
Visual Computing Research Center (VCC), College of Computer Science(视觉计算研究中心(VCC),计算机科学学院)
;
Software Engineering (CSSE) Shenzhen University China(软件工程(CSSE)深圳大学中国)
;
VCC, CSSE Shenzhen University China(VCC,CSSE 深圳大学中国)
;
Shenzhen University(深圳大学)
机构
*
School of Physics Science and Technology, Beijing University of Posts and Telecommunications(北京邮电大学物理科学与技术学院)
;
Guangdong Institute of Intelligence Science and Technology(广东智能科学技术研究院)
;
Beijing Chaoyang Hospital, Capital Medical University(北京朝阳医院)
;
Sleep Medical Center, Huzhou Third Municipal Hospital, Affiliated Hospital of Wenzhou Medical University(湖州第三人民医院睡眠医学中心,温州医科大学附属医院)
;
University of Macau(澳门大学)
;
Renyixun Health Technology Co., Ltd(仁颐讯健康科技有限公司)
;
Academy for Advanced Interdisciplinary Studies, Peking University(北京大学交叉学科研究院)
机构
*
Peking University(北京大学)
;
MIT(麻省理工学院)
;
TUM(技术大学(TUM))
;
Meituan(美团)
;
Peking University School of CIT, MCML, MDSIEECS and CSAIL(北京大学计算机学院、MCML、MDSIEECS以及CSAIL)
VideoSeeker: Incentivizing Instance-level Video Understanding via Native Agentic Tool Invocation
VideoSeeker:通过原生代理工具调用激励实例级视频理解
Yiming Zhao, Yu Zeng, Wenxuan Huang, Zhen Fang, Qing Miao, Qisheng Su, Jiawei Zhao, Jiayin Cai, Lin Chen, Zehui Chen, Yukun Qi, Yao Hu, Xiaolong Jiang, Feng Zhao
机构
*
University of Science and Technology of China(中国科学技术大学)
;
Xiaohongshu Inc.(小红书公司)
;
East China Normal University(华东师范大学)
;
Xi’an Jiaotong University(西安交通大学)
Honey, I shrunk the hypothesis space (through logical preprocessing)
我缩小了假设空间(通过逻辑预处理)
Andrew Cropper, Filipe Gouveia, David M. Cerna
机构
*
ELLIS Institute(ELLIS研究所)
;
University of Helsinki(赫尔辛基大学)
;
Czech Academy of Sciences Institute of Computer Science(捷克科学院计算机科学研究所)
;
Dynatrace Research(Dynatrace研究)
Response-G1: Explicit Scene Graph Modeling for Proactive Streaming Video Understanding
响应-G1:面向前瞻性流视频理解的显式场景图建模
Ke Ma, Jiaqi Tang, Bin Guo, Xueting Han, Ruonan Xu, Qingfeng He, Ziheng Wang, Xu Wang, Qifeng Chen, Zhiwen Yu, Yunhao Liu
机构
*
Northwestern Polytechnical University(北华大学)
;
Tsinghua University(清华大学)
;
The Hong Kong University of Science and Technology(香港科技大学)
;
Harbin Engineering University(哈尔滨工程大学)
Towards Conversational Medical AI with Eyes, Ears and a Voice
面向有眼睛、耳朵和声音的对话式医疗AI
Meet Shah, Jason Gusdorf, Anil Palepu, Chunjong Park, Jack W. O'Sullivan, Vishnu Ravi, Tim Strother, Pavel Dubov, Aliya Rysbek, Toshiyuki Fukuzawa, Yana Lunts, Jan Freyberg, Michael B. Chang, Aniruddh Raghu, David Stutz, Devora Berlowitz, Eliseo Papa, Taylan Cemgil, JD Velasquez, Jack Chen, Arthur Chen, Doug Fritz, Charlie Taylor, Katya Tregubova, Jing Rong Lim, Richard Green, Sara Mahdavi, Mahvish Nagda, Jihyeon Lee, Craig Schiff, Liviu Panait, Sukhdeep Singh, Valentin Liévin, David G. T. Barrett, Hannah Gladman, Anna Cupani, Francesca Pietra, Uchechi Okereke, Katherine Tong, Clemens Meyer, Erwan Rolland, Mili Sanwalka, Michael D. Howell, Shixiang Shane Gu, Bibo Xu, Euan A. Ashley, S. M. Ali Eslami, Gregory Wayne, Pushmeet Kohli, Vivek Natarajan, Adam Rodman, Alan Karthikesalingam, Ryutaro Tanno
机构
*
Google DeepMind(谷歌DeepMind)
;
Google Research(谷歌研究)
;
Beth Israel Deaconess Medical Center, Harvard Medical School(贝塞斯达医院, 哈佛医学院)
;
Stanford University(斯坦福大学)
Prompt to Protection: A Comparative Study of Multimodal LLMs in Construction Hazard Recognition
提示到保护:多模态大语言模型在建筑危险识别中的比较研究
Nishi Chaudhary, S M Jamil Uddin, Sathvik Sharath Chandra, Anto Ovid, Alex Albert
机构
*
Department of Construction Management, Colorado State University(科罗拉多州立大学建设管理系)
;
Department of Civil, Construction, and Environmental Engineering, North Carolina State University(北卡罗来纳州立大学土木、建设与环境工程系)
专题命中
视觉推理
:multimodal large language model(abstract);分类 cs.CV、cs.AI
LithoBench: Benchmarking Large Multimodal Models for Remote-Sensing Lithology Interpretation
LithoBench:用于遥感岩石学解释的大型多模态模型基准测试
Jun Wang, Fengpeng Li, Hang Dong, Tianjin Huang, Wei Han
机构
*
School of Computer Science, China University of Geosciences(中国地质大学(北京)计算机学院)
;
PRADA Lab, King Abdullah University of Science and Technology(科廷大学PRADA实验室)
;
Department of Computer Science, University of Exeter(埃克塞特大学计算机科学系)
机构
*
Shanghai AI Laboratory(上海人工智能实验室)
;
Shanghai Jiao Tong University(上海交通大学)
;
The Chinese University of Hong Kong(香港中文大学)
;
Nanjing University(南京大学)
;
Tongji University(同济大学)
;
Wuhan University(武汉大学)
Neurosymbolic Framework for Concept-Driven Logical Reasoning in Skeleton-Based Human Action Recognition
基于骨架的人体动作识别的概念驱动逻辑推理神经符号框架
Talha Ilyas, Deval Mehta, Zongyuan Ge
机构
*
Department of ECSE, Faculty of Engineering, Monash University, Australia(莫纳什大学工程学院电子与计算机工程系,澳大利亚)
;
AIM for Health Lab, Faculty of Information Technology, Monash University, Australia(莫纳什大学信息科技学院健康人工智能实验室,澳大利亚)
;
Department of DSAI, Faculty of Information Technology, Monash University, Australia(莫纳什大学信息科技学院数据科学与人工智能系,澳大利亚)