机构
*
J. Mike Walker ’66 Department of Mechanical Engineering, Texas A&M University, College Station, TX 77843, USA(杰米·沃克’66机械工程系,德克萨斯A&M大学,学院站,TX 77843,美国)
;
The Department of Engineering Technology and Industrial Distribution Texas A&M University, College Station, TX 77843, USA(工程技术与工业分配系,德克萨斯A&M大学,学院站,TX 77843,美国)
3DMedAgent: Unified Perception-to-Understanding for 3D Medical Analysis
3DMedAgent:面向3D医学分析的统一感知-理解框架
Ziyue Wang, Linghan Cai, Chang Han Low, Haofeng Liu, Junde Wu, Jingyu Wang, Rui Wang, Lei Song, Jiang Bian, Jingjing Fu, Yueming Jin
机构
*
National University of Singapore(新加坡国立大学)
;
Microsoft Research(微软研究院)
;
TUD Dresden University of Technology(德累斯顿技术大学)
;
University of Oxford(牛津大学)
专题命中
视觉推理
:multimodal large language model(abstract);MLLM(abstract);分类 cs.CV
StruVis: Enhancing Reasoning-based Text-to-Image Generation via Thinking with Structured Vision
StruVis: 通过结构化视觉进行推理的文本到图像生成增强
Yuanhuiyi Lyu, Kaiyu Lei, Ziqiao Weng, Xu Zheng, Lutao Jiang, Teng Li, Yangfu Li, Ziyuan Huang, Linfeng Zhang, Xuming Hu
机构
*
Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))
;
Ant Group(蚂蚁集团)
;
Shanghai Jiao Tong University(上海交通大学)
;
Hong Kong University of Science and Technology(香港科技大学)
;
East China Normal University(华东师范大学)
Cognition Envelopes for Bounded Decision Making in Autonomous UAS Operations
认知边界用于自主无人机操作中的有限决策
Pedro Antonio Alarcon Granadeno, Arturo Miguel Bernal Russell, Sofia Nelson, Demetrius Hernandez, Maureen Petterson, Michael Murphy, Walter J. Scheirer, Jane Cleland-Huang
ACE-Brain-0: Spatial Intelligence as a Shared Scaffold for Universal Embodiments
ACE-Brain-0:空间智能作为通用具身化体系的共享框架
Ziyang Gong, Zehang Luo, Anke Tang, Zhe Liu, Shi Fu, Zhi Hou, Ganlin Yang, Weiyun Wang, Xiaofeng Wang, Jianbo Liu, Gen Luo, Haolan Kang, Shuang Luo, Yue Zhou, Yong Luo, Li Shen, Xiaosong Jia, Yao Mu, Xue Yang, Chunxiao Liu, Junchi Yan, Hengshuang Zhao, Dacheng Tao, Xiaogang Wang
机构
*
Shanghai Jiao Tong University(上海交通大学)
;
Nanyang Technological University(南洋理工大学)
;
The Chinese University of Hong Kong(香港中文大学)
;
The University of Hong Kong(香港大学)
;
University of Science(科学技术大学)
;
Fudan University(复旦大学)
;
Xiamen University(厦门大学)
;
East China Normal University(华东师范大学)
;
Wuhan University(武汉大学)
;
Sun Yat-sen University(中山大学)
专题命中
视觉推理
:multimodal large language model(abstract);MLLM(abstract);分类 cs.CV
AI总结
ACE-Brain-0 通过空间智能作为共享框架,统一了自动驾驶、机器人和 UAVs 的具身化任务,采用 SSR 范式和 GRPO 方法实现跨领域泛化和领域精通的平衡。
BindWeave: Subject-Consistent Video Generation via Cross-Modal Integration
BindWeave:通过跨模态整合实现主体一致的视频生成
Zhaoyang Li, Dongjun Qian, Kai Su, Qishuai Diao, Xiangyang Xia, Chang Liu, Wenfei Yang, Tianzhu Zhang, Zehuan Yuan
机构
*
University of Science and Technology of China(中国科学技术大学)
;
ByteDance(字节跳动)
;
National Key Laboratory of Deep Space Exploration, Deep Space Exploration Laboratory(国家深空探测重点实验室,深空探测实验室)
专题命中
视觉推理
:multimodal large language model(abstract);MLLM(abstract);分类 cs.CV
机构
*
Shanghai Jiao Tong University(上海交通大学)
;
Institute of Digital Twin, Eastern Institute of Technology(数字孪生研究院,东部技术研究所)
;
Ningbo Key Laboratory of Spatial Intelligence and Digital Derivative(宁波空间智能与数字衍生关键实验室)
专题命中
视觉推理
:multimodal large language model(abstract);MLLM(abstract);分类 cs.CV
机构
*
School of Data Science, Fudan University(复旦大学数据科学学院)
;
Shanghai Innovation Institute(上海创新研究院)
;
Eastern Institute of Technology(技术东院)
;
Imperial College London(伦敦帝国理工学院)
;
University of Surrey(萨里大学)
Scale Can't Overcome Pragmatics: The Impact of Reporting Bias on Vision-Language Reasoning
规模无法克服语用学:报告偏差对视觉-语言推理的影响
Amita Kamath, Jack Hessel, Khyathi Chandu, Jena D. Hwang, Kai-Wei Chang, Ranjay Krishna
机构
*
University of Washington(华盛顿大学)
;
University of California, Los Angeles(加州大学洛杉矶分校)
;
Samaya AI(Samaya人工智能)
;
Mistral AI(Mistral人工智能)
;
Allen Institute for AI(人工智能研究所)
MindDriver: Introducing Progressive Multimodal Reasoning for Autonomous Driving
MindDriver: 引入渐进多模态推理用于自动驾驶
Lingjun Zhang, Yujian Yuan, Changjie Wu, Xinyuan Chang, Xin Cai, Shuang Zeng, Linzhe Shi, Sijin Wang, Hang Zhang, Mu Xu
机构
*
Amap, Alibaba Group(阿里集团蚂巴公司)
;
The Hong Kong University of Science and Technology(香港科学与技术大学)
;
The Chinese University of Hong Kong(香港中文大学)
;
Xi’an Jiaotong University(西安交通大学)
V-Retrver: Evidence-Driven Agentic Reasoning for Universal Multimodal Retrieval
V-Retrver: 以证据驱动的代理推理用于通用多模态检索
Dongyang Chen, Chaoyang Wang, Dezhao Su, Xi Xiao, Zeyu Zhang, Jing Xiong, Qing Li, Yuzhang Shang, Shichao Kan
机构
*
Tsinghua University(清华大学)
;
University of Central Florida(中央佛罗里达大学)
;
Fudan University(复旦大学)
;
The Australian National University(澳大利亚国立大学)
;
The University of Hong Kong(香港大学)
;
Pengcheng Laboratory(鹏城实验室)
;
Central South University(中南大学)
专题命中
视觉推理
:multimodal large language model(abstract);MLLM(abstract);分类 cs.CV
DREAM: Domain-aware Reasoning for Efficient Autonomous Underwater Monitoring
DREAM:面向高效自主水下监测的领域感知方法
Zhenqi Wu, Abhinav Modi, Angelos Mavrogiannis, Kaustubh Joshi, Nikhil Chopra, Yiannis Aloimonos, Nare Karapetyan, Ioannis Rekleitis, Xiaomin Lin
机构
*
Electrical Engineering, University of South Florida(佛罗里达州立大学电气工程系)
;
Maryland Robotics Center (MRC), University of Maryland(马里兰大学机器人中心)
;
Woods Hole Oceanographic Institution (WHOI)(伍兹霍尔海洋研究所)
;
Mechanical Engineering, University of Delaware(德雷克塞尔大学机械工程系)
专题命中
视觉推理
:vision language model(abstract);VLM(abstract);分类 cs.AI