机构
*
Institute of Artificial Intelligence, Beihang University(北京航空航天大学人工智能研究院)
;
Huawei Noah’s Ark Lab(华为诺亚方舟实验室)
;
University of Science and Technology Beijing(北京科技大学)
专题命中
多模态Agent
:multimodal(abstract);multimodal foundation model(abstract);分类 cs.AI
Agent Planning Benchmark: A Diagnostic Framework for Planning Capabilities in LLM Agents
Agent规划基准:LLM Agent规划能力的诊断框架
Haoyu Sun, Wenxuan Wang, Mingyang Song, Jujie He, Weinan Zhang, Yang Liu, Yang Yang, Yu Cheng
机构
*
Tongji University(同济大学)
;
Shanghai AI Laboratory(上海人工智能实验室)
;
Harbin Institute of Technology(哈尔滨工业大学)
;
Fudan University(复旦大学)
;
Skywork AI
;
University of California, Santa Cruz(加州大学圣克鲁兹分校)
;
Shanghai Jiao Tong University(上海交通大学)
;
The Chinese University of Hong Kong(香港中文大学)
iVGR: Internalizing Visually Grounded Reasoning for MLLMs with Reinforcement Learning
iVGR: 通过强化学习将视觉基础推理内化到多模态大语言模型中
Chang-Bin Zhang, Yujie Zhong, Qiang Zhang, Kai Han
机构
*
Visual AI Lab, The University of Hong Kong(香港大学视觉人工智能实验室)
;
Independent Researcher(独立研究者)
;
University of Science and Technology of China(中国科学技术大学)
VLA-Trace: Diagnosing Vision-Language-Action Models through Representation and Behavior Tracing
VLA-Trace: 通过表示与行为追踪诊断视觉-语言-动作模型
Haoyuan Shi, Xiancong Ren, Yingji Zhang, Qinfan Zhang, Jiayu Hu, Haozhe Shan, Han Dong, Jinpeng Lu, Yinda Chen, Yi Zhang, Yong Dai, Xiaozhu Ju
机构
*
University of Science and Technology of China(中国科学技术大学)
;
University of Manchester(曼彻斯特大学)
;
Beihang University(北航)
;
Fudan University(复旦大学)
;
University of New South Wales(新南威尔士大学)
机构
*
Nanjing University(南京大学)
;
Beihang University(北京航空航天大学)
;
Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)
;
BMW (Nanjing) Information Technology Co., Ltd.(宝马(南京)信息技术有限公司)
;
University of Rochester(罗切斯特大学)
WorldArena 2.0: Extending Embodied World Model Benchmarking on Modality, Functionality and Platform
WorldArena 2.0: 扩展模态、功能和平台的具身世界模型基准测试
Yu Shang, Yinzhou Tang, Yiding Ma, Zhuohang Li, Lei Jin, Weikang Su, Xin Jin, Zhaolu Wang, Ziyou Wang, Xin Zhang, Haisheng Su, Weizhen He, Wei Wu, Haoyi Duan, Gordon Wetzstein, Xihui Liu, Dhruv Shah, Zhaoxiang Zhang, Zhibo Chen, Jun Zhu, Yonghong Tian, Tat-Seng Chua, Wenwu Zhu, Chen Gao, Yong Li
机构
*
Tsinghua University(清华大学)
;
Shanghai Jiao Tong University(上海交通大学)
;
Zhejiang University(浙江大学)
;
Stanford University(斯坦福大学)
;
The University of Hong Kong(香港大学)
;
Princeton University(普林斯顿大学)
;
Chinese Academy of Sciences(中国科学院)
;
University of Science and Technology of China(中国科学技术大学)
;
Peking University(北京大学)
;
National University of Singapore(新加坡国立大学)
CommentsThis study has been Accepted by ICML 2026. The current version is a manuscript, please refer to the official version released at ICML 2026 for the final published version
机构
*
vivo AI Lab(vivo人工智能实验室)
;
Zhejiang Lab(浙江实验室)
;
CUHK MMLab(香港大学多模态实验室)
;
Hubei University(湖北省大学)
;
Hangzhou Institute for Advanced Study, University of Chinese Academy of Sciences(中国科学院大学杭州高等研究院)
机构
*
Beijing Institute of Technology(北京理工大学)
;
Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)
;
University of Sanya(三亚学院)
;
Beijing University of Posts and Telecommunications(北京邮电大学)
;
Hunan University(湖南大学)
;
Beihang University(北京航空航天大学)
;
Flying Intelligence Team (Virtual Research Community)(飞行智能团队(虚拟研究社区))
3DMedAgent: Unified Perception-to-Understanding for 3D Medical Analysis
3DMedAgent:面向3D医学分析的统一感知-理解框架
Ziyue Wang, Linghan Cai, Chang Han Low, Haofeng Liu, Junde Wu, Jingyu Wang, Rui Wang, Lei Song, Jiang Bian, Jingjing Fu, Yueming Jin
机构
*
National University of Singapore(新加坡国立大学)
;
Microsoft Research(微软研究院)
;
TUD Dresden University of Technology(德累斯顿技术大学)
;
University of Oxford(牛津大学)