EgoIntrospect: An Egocentric Dataset and Benchmark for User-Centric Internal State Reasoning
EgoIntrospect: 一个用于用户中心内部状态推理的注视数据集和基准
Zeyu Wang, Chang Liu, Eduardus Tjitrahardja, Yuntao Wang, Borislav Pavlov, Fangfei Gou, Jose Manuel Davila, Dai Shi, Ran Xu, Yue Pan, Jiayi Tan, Shuting Chang, Qi Wang, Jinzhao Li, Jiacheng Hua, Yifei Huang, Jingwei Sun, Yu Zhang, Liuxin Zhang, Guocai Yao, Jia Jia, Yin Li, Qianying Wang, Yuanchun Shi, Miao Liu
机构
*
Tsinghua University(清华大学)
;
Tongji University(同济大学)
;
Renmin University of China(中国人民大学)
;
The University of Tokyo(东京大学)
;
Lenovo Group(联想集团)
;
Peking University(北京大学)
;
University of Wisconsin–Madison(威斯康星大学麦迪逊分校)
;
Shanghai Qi Zhi Institute(上海启智研究院)
专题命中
视觉推理
:multimodal large language model(abstract);分类 cs.CV
PluRule: A Benchmark for Moderating Pluralistic Communities on Social Media
PluRule:一种用于社交媒体上多元社区调节的基准测试
Zoher Kachwala, Bao Tran Truong, Rasika Muralidharan, Haewoon Kwak, Jisun An, Filippo Menczer
机构
*
Observatory on Social Media, Indiana University, USA(社交媒体观察站,印第安纳大学,美国)
;
Center Synergy of Systems, TUD Dresden University of Technology, Germany(系统协同中心,德累斯顿技术大学,德国)
When Robots Do the Chores: A Benchmark and Agent for Long-Horizon Household Task Execution
当机器人做家务:一个基准和代理用于长期家庭任务执行
Zilin Zhu, Longteng Guo, Yanghong Mei, Bowen Pang, Zongxun Zhang, Xingjian He, Ruyi Ji, Jing Liu
机构
*
Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)
;
Zhongguancun Academy(中关村学院)
;
University of Chinese Academy of Sciences(中国科学院大学)
From Pixels to Places: A Systematic Benchmark for Evaluating Image Geolocalization Ability in Large Language Models
从像素到地点:一个系统性基准,用于评估大语言模型中的图像地理定位能力
Lingyao Li, Runlong Yu, Qikai Hu, Bowei Li, Min Deng, Yang Zhou, Xiaowei Jia
机构
*
University of South Florida Tampa USA
;
University of Alabama Tuscaloosa USA
;
University of Michigan Ann Arbor USA
;
Texas Tech University Lubbock USA
;
Texas A \& M University College Station USA
;
University of Pittsburgh Pittsburgh USA
;
University of South Florida
;
University of Alabama
;
University of Michigan
;
Texas Tech University
;
Texas A \& M University
;
University of Pittsburgh
EPIC-Bench: A Perception-Centric Benchmark for Fine-Grained Embodied Visual Grounding in Vision-Language Models
EPIC-Bench: 一种以感知为中心的细粒度具身视觉 grounding 的基准
Haozhe Shan, Xiancong Ren, Han Dong, Haoyuan Shi, Yingji Zhang, Jiayu Hu, Yi Zhang, Yong Dai, Bin Shen, Lizhen Qu, Zenglin Xu, Xiaozhu Ju
机构
*
X-Humanoid
;
Fudan University(复旦大学)
;
University of Science and Technology of China(中国科学技术大学)
;
University of Manchester(曼彻斯特大学)
;
Monash University(墨尔本大学)
;
Celonis AI
;
University of New South Wales(新南威尔士大学)
机构
*
School of AI for Science, Peking University(科学人工智能学院,北京大学)
;
School of Electronic and Computer Engineering, Peking University(电子与计算机工程学院,北京大学)
;
School of Computer Science, Peking University(计算机科学学院,北京大学)
Training-Free Zero-Shot Temporal Action Detection with Vision-Language Models
无需训练的零样本时序动作检测与视觉-语言模型
Chaolei Han, Hongsong Wang, Jidong Kuang, Lei Zhang, Jie Gui
机构
*
Southeast University School of Cyber Science and Engineering(东南大学网络安全科学与工程学院)
;
Southeast University School of Computer Science and Engineering(东南大学计算机科学与工程学院)
;
Nanjing Normal University School of Electrical Engineering and Automation(南京师范大学电气工程与自动化学院)
机构
*
Université Sorbonne Paris Nord(索邦巴黎北大学)
;
University of Dubai(迪拜大学)
;
Northwestern University(西北大学)
;
IULM University(IULM大学)
;
Norwegian University of Science and Technology(挪威科学与技术大学)
;
University of Geneva(日内瓦大学)
RadGame: An AI-Powered Platform for Radiology Education
RadGame:一种基于人工智能的放射学教育平台
Mohammed Baharoon, Siavash Raissi, John S. Jun, Thibault Heintz, Mahmoud Alabbad, Ali Alburkani, Sung Eun Kim, Kent Kleinschmidt, Abdulrahman O. Alhumaydhi, Mohannad Mohammed G. Alghamdi, Jeremy Francis Palacio, Mohammed Bukhaytan, Noah Michael Prudlo, Rithvik Akula, Brady Chrisler, Benjamin Galligos, Mohammed O. Almutairi, Mazeen Mohammed Alanazi, Nasser M. Alrashdi, Joel Jihwan Hwang, Sri Sai Dinesh Jaliparthi, Luke David Nelson, Nathaniel Nguyen, Sathvik Suryadevara, Steven Kim, Mohammed F. Mohammed, Yevgeniy R. Semenov, Kun-Hsing Yu, Abdulrhman Aljouie, Hassan AlOmaish, Adam Rodman, Pranav Rajpurkar
机构
*
Harvard Medical School(哈佛医学院)
;
Mass General Brigham(麻省总医院)
;
Maastricht University(马斯特里赫特大学)
;
Department of Medical Imaging, King Abdulaziz Medical City, Ministry of National Guard, Riyadh, Saudi Arabia(国王阿卜杜勒-阿齐兹医疗城医学影像科,沙特阿拉伯)
;
National Strategic Technology Research Institute, Seoul National University Hospital(全国战略技术研究所,首尔国立大学医院)
;
Saint Louis University School of Medicine(圣路易斯大学医学院)
;
College of Medicine, King Saud bin Abdulaziz University for Health Sciences(国王萨勒曼·本·阿卜杜勒阿齐兹大学医学院)
;
Tufts University School of Medicine(塔夫茨大学医学院)
;
Department of Biomedical Informatics, Harvard Medical School(哈佛医学院生物医学信息学系)
SCICONVBENCH: Benchmarking LLMs on Multi-Turn Clarification for Task Formulation in Computational Science
SCICONVBENCH: 评估LLM在计算科学任务公式化中的多轮澄清能力
Nithin Somasekharan, Youssef Hassan, Shiyao Lin, Gihan Panapitiya, Patrick Emami, Anurag Acharya, Sameera Horawalavithana, Shaowu Pan
机构
*
Rensselaer Polytechnic Institute(拉特格斯理工学院)
;
University of Texas at Arlington(德克萨斯大学阿灵顿分校)
;
Pacific Northwest National Laboratory(太平洋西北国家实验室)
;
National Renewable Energy Laboratory(国家可再生能源实验室)