Do AI Models Perform Human-like Abstract Reasoning Across Modalities?
AI模型在不同模态下是否能进行类人抽象推理?
Claas Beger, Ryan Yi, Shuhao Fu, Kaleda Denton, Arseny Moskvichev, Sarah W. Tsai, Sivasankaran Rajamanickam, Melanie Mitchell
机构
*
Santa Fe Institute, New Mexico, USA(圣菲研究所)
;
Sandia National Laboratories, New Mexico, USA(桑迪亚国家实验室)
;
Advanced Micro Devices Inc., Texas, USA(先进微器件公司)
机构
*
School of Computer Science Chongqing University(重庆大学计算机学院)
;
MAIS Institute of Automation Chinese Academy of Sciences(中国科学院自动化研究所MAIS研究所)
;
The First Affiliated Hospital of Chongqing Medical University(重庆医科大学第一附属医院)
MedFrameQA: A Multi-Image Medical VQA Benchmark for Clinical Reasoning
MedFrameQA: 一个多图像医学视觉问答基准用于临床推理
Suhao Yu, Haojin Wang, Juncheng Wu, Luyang Luo, Jingshen Wang, Cihang Xie, Pranav Rajpurkar, Carl Yang, Yang Yang, Kang Wang, Yannan Yu, Yuyin Zhou
机构
*
University of Pennsylvania(宾夕法尼亚大学)
;
University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)
;
UC Santa Cruz(加州大学圣克鲁兹分校)
;
Harvard University(哈佛大学)
;
UC Berkeley(加州大学伯克利分校)
;
Emory University(埃默里大学)
;
UC San Francisco(旧金山加州大学)
MM-SCALE: Grounded Multimodal Moral Reasoning via Scalar Judgment and Listwise Alignment
MM-SCALE: 基于标量判断和列表对齐的 grounded 多模态道德推理
Eunkyu Park, Wesley Hanwen Deng, Cheyon Jin, Matheus Kunzler Maldaner, Jordan Wheeler, Jason I. Hong, Hong Shen, Adam Perer, Ken Holstein, Motahhare Eslami, Gunhee Kim
机构
*
Seoul National University(首尔国立大学)
;
Carnegie Mellon University(卡内基梅隆大学)
;
University of Florida(佛罗里达大学)
;
Epic Games
机构
*
The Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)
;
School of Automation, Beijing Institute of Technology(北京理工大学自动化学院)
;
School of Information and Intelligent Engineering, University of Sanya(三亚大学信息与智能工程学院)
;
School of Mechanical and Vehicle Engineering, Hunan University(湖南大学机械与车辆工程学院)
;
State Key Lab of Intelligent Transportation Systems, School of Transportation Science and Engineering, Beihang University(北京航空航天大学交通科学与工程学院)
TurkBench: A Benchmark for Evaluating Turkish Large Language Models
TurkBench:评估土耳其大型语言模型的基准测试
Çağrı Toraman, Ahmet Kaan Sever, Ayse Aysu Cengiz, Elif Ecem Arslan, Görkem Sevinç, Mete Mert Birdal, Yusuf Faruk Güldemir, Ali Buğra Kanburoğlu, Sezen Felekoğlu, Osman Gürlek, Sarp Kantar, Birsen Şahin Kütük, Büşra Tufan, Elif Genç, Serkan Coşkun, Gupse Ekin Demir, Muhammed Emin Arayıcı, Olgun Dursun, Onur Gungor, Susan Üsküdarlı, Abdullah Topraksoy, Esra Darıcı
TIDE: Trajectory-based Diagnostic Evaluation of Test-Time Improvement in LLM Agents
基于轨迹的测试时改进诊断评估:LLM代理中的测试时改进
Hang Yan, Xinyu Che, Fangzhi Xu, Qiushi Sun, Zichen Ding, Kanzhi Cheng, Jian Zhang, Tao Qin, Jun Liu, Qika Lin
机构
*
Xi’an Jiaotong University(西安交通大学)
;
The University of Hong Kong(香港大学)
;
Shanghai AI Laboratory(上海人工智能实验室)
;
Nanjing University(南京大学)
;
National University of Singapore(新加坡国立大学)
MAPGD: Multi-Agent Prompt Gradient Descent for Collaborative Prompt Optimization
MAPGD:多智能体提示梯度下降用于协作提示优化
Yichen Han, Yuhang Han, Siteng Huang, Guanyu Liu, Zhengpeng Zhou, Bojun Liu, Yujia Zhang, Isaac N Shi, Lewei He, Tianyu Shi
机构
*
South China Normal University(华南师范大学)
;
Shanghai Jiao Tong University(上海交通大学)
;
Zhejiang University(浙江大学)
;
University of Macau(澳门大学)
;
University of Sydney(悉尼大学)
;
Silicon Sapiens LLC
;
University of Alberta(阿尔伯塔大学)
;
University of Toronto(多伦多大学)
机构
*
Department of Robotics
;
Mechatronics Engineering, University of Dhaka, Bangladesh
;
Center for Computational \& Data Sciences, Independent University, Bangladesh