Draw2Think: Harnessing Geometry Reasoning through Constraint Engine Interaction
Draw2Think: 通过约束引擎交互增强几何推理
Juncheng Hu, Jiawei Du, Xin Zhang, Joey Tianyi Zhou
机构
*
National University of Singapore(新加坡国立大学)
;
Centre for Frontier AI Research, Agency for Science, Technology and Research(科技研究局前沿人工智能研究中心)
;
Institute of High Performance Computing, Agency for Science, Technology and Research(科技研究局高性能计算研究所)
Query-Conditioned Knowledge Alignment for Reliable Cross-System Medical Reasoning
基于查询的知识对齐用于可靠的跨系统医学推理
Yan Jiao, Jingran Xu, Pin-Han Ho, Limei Peng
机构
*
Shenzhen Institute for Advanced Study, University of Electronic Science and Technology of China(深圳先进研究院,电子科技大学)
;
Department of Electrical and Computer Engineering, University of Waterloo(滑铁卢大学电气与计算机工程系)
;
School of Computer Science and Engineering, Kyungpook National University(庆北国立大学计算机科学与工程学院)
机构
*
The Hong Kong Polytechnic University(香港理工大学)
;
Guangzhou University(广州大学)
;
Queen Mary University of London(伦敦玛丽女王大学)
;
HKUST(Guangzhou)(香港科技大学(广州))
专题命中
视觉推理
:multimodal large language model(abstract);分类 cs.CV
机构
*
Shanghai Jiao Tong University(上海交通大学)
;
Ningbo Key Laboratory of Spatial Intelligence and Digital Derivative(宁波空间智能与数字衍生关键实验室)
;
Ningbo Institute of Digital Twin(宁波数字孪生研究院)
;
Eastern Institute of Technology(东部技术研究院)
;
University of Science and Technology of China(中国科学技术大学)
;
Yokohama National University(Yokohama国立大学)
EgoIntrospect: An Egocentric Dataset and Benchmark for User-Centric Internal State Reasoning
EgoIntrospect: 一个用于用户中心内部状态推理的注视数据集和基准
Zeyu Wang, Chang Liu, Eduardus Tjitrahardja, Yuntao Wang, Borislav Pavlov, Fangfei Gou, Jose Manuel Davila, Dai Shi, Ran Xu, Yue Pan, Jiayi Tan, Shuting Chang, Qi Wang, Jinzhao Li, Jiacheng Hua, Yifei Huang, Jingwei Sun, Yu Zhang, Liuxin Zhang, Guocai Yao, Jia Jia, Yin Li, Qianying Wang, Yuanchun Shi, Miao Liu
机构
*
Tsinghua University(清华大学)
;
Tongji University(同济大学)
;
Renmin University of China(中国人民大学)
;
The University of Tokyo(东京大学)
;
Lenovo Group(联想集团)
;
Peking University(北京大学)
;
University of Wisconsin–Madison(威斯康星大学麦迪逊分校)
;
Shanghai Qi Zhi Institute(上海启智研究院)
专题命中
视觉推理
:multimodal large language model(abstract);分类 cs.CV
PluRule: A Benchmark for Moderating Pluralistic Communities on Social Media
PluRule:一种用于社交媒体上多元社区调节的基准测试
Zoher Kachwala, Bao Tran Truong, Rasika Muralidharan, Haewoon Kwak, Jisun An, Filippo Menczer
机构
*
Observatory on Social Media, Indiana University, USA(社交媒体观察站,印第安纳大学,美国)
;
Center Synergy of Systems, TUD Dresden University of Technology, Germany(系统协同中心,德累斯顿技术大学,德国)
When Robots Do the Chores: A Benchmark and Agent for Long-Horizon Household Task Execution
当机器人做家务:一个基准和代理用于长期家庭任务执行
Zilin Zhu, Longteng Guo, Yanghong Mei, Bowen Pang, Zongxun Zhang, Xingjian He, Ruyi Ji, Jing Liu
机构
*
Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)
;
Zhongguancun Academy(中关村学院)
;
University of Chinese Academy of Sciences(中国科学院大学)
From Pixels to Places: A Systematic Benchmark for Evaluating Image Geolocalization Ability in Large Language Models
从像素到地点:一个系统性基准,用于评估大语言模型中的图像地理定位能力
Lingyao Li, Runlong Yu, Qikai Hu, Bowei Li, Min Deng, Yang Zhou, Xiaowei Jia
机构
*
University of South Florida Tampa USA
;
University of Alabama Tuscaloosa USA
;
University of Michigan Ann Arbor USA
;
Texas Tech University Lubbock USA
;
Texas A \& M University College Station USA
;
University of Pittsburgh Pittsburgh USA
;
University of South Florida
;
University of Alabama
;
University of Michigan
;
Texas Tech University
;
Texas A \& M University
;
University of Pittsburgh
Chain-of-Glimpse: Search-Guided Progressive Object-Grounded Reasoning for Video Understanding
链式窥视:面向视频理解的搜索引导渐进性对象基础推理
Zhixuan Wu, Quanxing Zha, Teng Wang, Genbao Xu, Wenyuan Gu, Wei Rao, Nan Ma, Bo Cheng, Soujanya Poria
机构
*
State Key Laboratory of Networking and Switching Technology, Beijing University of Posts and Telecommunications, Beijing, China.(网络与交换技术国家重点实验室,北京邮电大学,北京,中国)
;
Institute of Big Data, College of Computer Science and Artificial Intelligence, Fudan University, China.(大数据研究院,复旦大学计算机科学与人工智能学院,中国)
;
ARC Lab, Tencent PCG, Shenzhen, China.(腾讯PCG深圳实验室,深圳,中国)
;
School of Artificial Intelligence, Beijing University of Technology, Beijing, China.(北京理工大学人工智能学院,北京,中国)
Tinghui Zhu, Sheng Zhang, James Y. Huang, Selena Song, Xiaofei Wen, Yuankai Li, Hoifung Poon, Muhao Chen
机构
*
University of California, Davis(加州大学戴维斯分校)
;
Microsoft Research(微软研究院)
;
University of Southern California(南加州大学)
;
University of California, Santa Cruz(加州大学圣克鲁兹分校)
From Table to Cell: Attention for Better Reasoning with TABALIGN
从表格到单元格:用于基于TABALIGN的更好推理的注意力
Tung Sum Thomas Kwok, Zeyong Zhang, Xinyu Wang, Chunhe Wang, Xiaofeng Lin, Hanwei Wu, Lei Ding, Guang Cheng, Zhijiang Guo
机构
*
University of California, Los Angeles(加州大学洛杉矶分校)
;
New Jersey Institute of Technology(新泽西理工学院)
;
McGill University(麦吉尔大学)
;
Université de Montréal(蒙特利尔大学)
;
University of Manitoba(曼尼托巴大学)
;
SimpleWay
;
The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))
Junho Kim, Eun Sun Lee, Gwangtak Bae, Seunggu Kang, Young Min Kim
机构
*
Dept. of Electrical and Computer Engineering, Seoul National University(电子与计算机工程系,首尔国立大学)
;
Interdisciplinary Program in Artificial Intelligence and INMC, Seoul National University(人工智能交叉计划和INMC,首尔国立大学)
GeoLaux: A Benchmark for Evaluating MLLMs' Geometry Performance on Long-Step Problems Requiring Auxiliary Lines
GeoLaux:一个评估多模态大语言模型在需要辅助线的长步骤问题上几何性能的基准
Yumeng Fu, Jiayin Zhu, Lingling Zhang, Wenjun Wu, Bo Zhao, Shaoxuan Ma, Yushun Zhang, Jun Liu
机构
*
School of Computer Science and Technology, Xi’an Jiaotong University(西安交通大学计算机科学与技术学院)
;
Ministry of Education Key Laboratory of Intelligent Networks and Network Security, China(教育部智能网络与网络安全重点实验室)
;
Shaanxi Province Key Laboratory of Big Data Knowledge Engineering, China(陕西省大数据知识工程重点实验室)
;
School of Software Engineering, Xi’an Jiaotong University(西安交通大学软件工程学院)
专题命中
视觉推理
:multimodal large language model(abstract);分类 cs.AI
机构
*
Wuhan University of Technology(武汉理工大学)
;
Tsinghua University(清华大学)
;
Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)
;
Shanghai AI Lab(上海人工智能实验室)
;
University of Oxford(牛津大学)
;
INSAIT, Sofia Un. St Kliment Ohridski(索菲亚大学克里门特·欧里迪斯基学院)
专题命中
视觉推理
:multimodal large language model(abstract);分类 cs.CV
Learn to Think: Improving Multimodal Reasoning through Vision-Aware Self-Improvement Training
学会思考:通过视觉感知的自我改进训练提升多模态推理
Qihuang Zhong, Liang Ding, Wenjie Xuan, Juhua Liu, Bo Du, Dacheng Tao
机构
*
School of Computer Science, National Engineering Research Center for Multimedia Software, Institute of Artificial Intelligence(计算机学院、多媒体软件国家工程研究中心、人工智能研究院)
;
Hubei Key Laboratory of Multimedia(湖北多媒体重点实验室)
;
Network Communication Engineering, Wuhan University, China(网络通信工程、武汉大学,中国)
;
The University of Sydney, Australia(悉尼大学,澳大利亚)
;
Nanyang Technological University, Singapore(南洋理工大学,新加坡)
专题命中
视觉推理
:multimodal large language model(abstract);分类 cs.CV