Commentsadditional experiments added, title changed from "Visual Scratchpads: Enabling Global Reasoning in Vision" to "Chain-of-Sketch: Enabling Global Visual Reasoning"
Pest-Thinker: Learning to Think and Reason like Entomologists via Reinforcement Learning
Pest-Thinker: 通过强化学习学习像昆虫学家一样思考和推理
Xueheng Li, Yu Wang, Tao Hu, Ji Huang, Ke Cao, Qize Yang, Rui Li, Jie Zhang, Chengjun Xie
机构
*
Institute of Intelligent Machines, Hefei Institute of Physical Science, Chinese Academy of Sciences(智能机器研究所、合肥物理科学研究所、中国科学院)
;
University of Science and Technology of China(中国科学技术大学)
;
Zhongke Hefei Institute of Technology Innovation Engineering(中科创新合肥科技研究院)
;
Hefei University of Technology(合肥工业大学)
机构
*
State Key Laboratory of General Artificial Intelligence, BIGAI(通用人工智能国家重点实验室(BIGAI))
;
Beijing Institute of Technology(北京理工大学)
;
Institute for Artificial Intelligence, Peking University(北京大学人工智能研究院)
;
State Key Lab of General AI, School of Intelligence Science and Technology, Peking University(通用人工智能国家重点实验室、北京大学智能科学与技术学院)
Johan Bjorck, Zhiqi Li, Yunze Man, Jing Wang, An-Chieh Cheng, Sifei Liu, Shihao Wang, Zhiding Yu, Abhishek Badki, Stan Birchfield, Valts Blukis, Yevgen Chebotar, Siyi Chen, Sicong Leng, Yu-Cheng Chou, Tianli Ding, Boyi Li, Zhengyi Luo, Hang Su, Jonathan Tremblay, Tingwu Wang, Bowen Wen, Jimmy Wu, Xianghui Xie, Hanrong Ye, Hongxu Yin, K. R. Zentner, Liangyan Gui, Yu-Xiong Wang, Yuke Zhu, Linxi "Jim" Fan, Jan Kautz
机构
*
University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)
;
University of California, San Diego(加州大学圣地亚哥分校)
;
The Hong Kong Polytechnic University(香港理工大学)
;
University of Michigan(密歇根大学)
;
Nanyang Technological University(南洋理工大学)
;
Johns Hopkins University(约翰霍普金斯大学)
;
University of Tübingen(图宾根大学)
Reinforcing Dual-Path Reasoning in Spatial Vision Language Models
空间视觉语言模型中的双路径推理强化
Yatai Ji, An-Chieh Cheng, Yang Fu, Yukang Chen, Han Zhang, Zhaojing Yang, Wei Huang, Ka Chun Cheung, Song Han, Vidya Nariyambut Murali, Pavlo Molchanov, Jan Kautz, Simon See, Hongxu Yin, Ping Luo, Sifei Liu
机构
*
The University of Hong Kong(香港大学)
;
NVIDIA(英伟达)
;
University of California, San Diego(加州大学圣迭戈分校)
机构
*
School of Instrument Science and Engineering, Southeast University(东南大学仪器科学与工程学院)
;
School of Electronic and Information Engineering, Tongji University(同济大学电子与信息工程学院)
;
College of Transportation, Shandong University of Science and Technology(山东科技大学交通学院)
;
National University of Defense Technology(国防科技大学)
MIRAGE: Mobile Agents with Implicit Reasoning and Generative World Models
MIRAGE: 具有隐式推理和生成世界模型的移动智能体
Zhichao Yang, Yuanze Hu, Haojie Hao, Longkun Hao, Dongshuo Huang, Hongyu Lin, Gen Li, Lanqing Hong, Yihang Lou, Yan Bai
机构
*
Beihang University(北京航空航天大学)
;
Northwestern Polytechnical University(西北工业大学)
;
Institute of Software, Chinese Academy of Sciences(中国科学院软件研究所)
;
National University of Singapore(新加坡国立大学)
;
Peking University(北京大学)
Seg-Agent: Test-Time Multimodal Reasoning for Training-Free Language-Guided Segmentation
Seg-Agent: 无训练语言引导分割的测试时多模态推理
Chao Hao, Jun Xu, Ji Du, Shuo Ye, Ziyue Qiao, Xiaodong Cun, Guangcong Wang, Xubin Zheng, Zitong Yu
机构
*
School of Computing and Information Technology(计算与信息科技学院)
;
Great Bay University(大湾大学)
;
Hangzhou International Innovation Institute(杭州国际创新研究院)
;
Beihang University(北航大学)
;
Department of Computing(计算系)
;
The Hong Kong Polytechnic University(香港理工大学)
CommentsDORA stress-tests LLM agents on real-world disaster operations that demand comprehensive orchestration of 108 specialized tools over heterogeneous geospatial data