AstroAlertBench: Evaluating the Accuracy, Reasoning, and Honesty of Multimodal LLMs in Astronomical Classification
AstroAlertBench: 评估多模态大语言模型在天文学分类中的准确性、推理和诚实性
Claire Chen, Jiabao Sean Xiao, Shuze Daniel Liu, Facundo Perez Paolino, Luke Handley, Theophile Jegou du Laz, Ricky Nilsson, Alice Zou, Matthew Graham, Ashish Mahabal
机构
*
California Institute of Technology(加州理工学院)
;
Massachusetts Institute of Technology(麻省理工学院)
;
Purdue University(普渡大学)
RE-MCDF: Closed-Loop Multi-Expert LLM Reasoning for Knowledge-Grounded Clinical Diagnosis
RE-MCDF:闭环多专家LLM推理用于知识驱动的临床诊断
Shaowei Shen, Xiaohong Yang, Jie Yang, Lianfen Huang, Yongcai Zhang, Yang Zou, Seyyedali Hosseinalipour
机构
*
School of Informatics, Xiamen University, China(厦门大学信息学系, 中国)
;
National Institute for Data Science in Health and Medicine, Xiamen University, China(健康医学数据科学国家研究院, 厦门大学, 中国)
;
Key Laboratory of Intelligent Manufacturing Equipment and Industrial Internet Technology, Fujian Provincial Universities, the School of Information Science and Technology, Xiamen University Tan Kah Kee College, and also with the Department of Informatics and Communication Engineering, Xiamen University, China(福建省智能制造装备与工业互联网技术重点实验室, 福建省高校, 厦门大学信息科学系, 厦门大学坦克 Kee 学院, 以及厦门大学信息与通信工程系, 中国)
;
School of Medicine, Xiamen University, China(厦门大学医学院, 中国)
;
School of Electronic and Information Engineering, Tongji University, China(同济大学电子与信息工程学院, 中国)
;
department of Electrical Engineering, University at Buffalo-SUNY, Buffalo, NY, USA(University at Buffalo-SUNY 电气工程系, Buffalo, NY, 美国)
OMHBench: Benchmarking Balanced and Grounded Omni-Modal Multi-Hop Reasoning
OMHBench: 多模态多跳推理的基准测试
Seunghee Kim, Ingyu Bang, Seokgyu Jang, Changhyeon Kim, Sanghwan Bae, Jihun Choi, Richeng Xuan, Taeuk Kim
机构
*
Hanyang University(翰阳大学)
;
NAVER Cloud(NAVER云)
;
Knowledge Work Inc.(知识工作公司)
;
Beijing Academy of Artificial Intelligence(北京人工智能研究院)
;
Sony AI(索尼人工智能)
EmoTrans: A Benchmark for Understanding, Reasoning, and Predicting Emotion Transitions in Multimodal LLMs
EmoTrans:一个多模态大语言模型中情感过渡理解、推理和预测的基准测试
He Hu, Tengjin Weng, Zebang Cheng, Yu Wang, Jiachen Luo, Björn Schuller, Zheng Lian, Laizhong Cui
机构
*
Shenzhen University(深圳大学)
;
Guangdong Laboratory of Artificial Intelligence(广东人工智能与数字经济实验室)
;
Queen Mary University of London(女王学院伦敦大学)
;
Technical University of Munich(慕尼黑技术大学)
;
Imperial College London(伦敦帝国学院)
;
Tongji University(同济大学)
Improving Clinical Diagnosis with Counterfactual Multi-Agent Reasoning
通过反事实多智能体推理提升临床诊断
Zhiwen You, Xi Chen, Aniket Vashishtha, Simo Du, Gabriel Erion-Barner, Hongyuan Mei, Hao Peng, Yue Guo
机构
*
University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)
;
Jacobi Medical Center, Albert Einstein College of Medicine(雅各布医疗中心,阿尔伯特·爱因斯坦学院)
;
Department of Emergency Medicine, Beth Israel Deaconess Medical Center(贝斯以色列医疗中心急诊科)
;
Leaning machines(Leanings machines)
Training-free retrieval-augmented generation with reinforced reasoning for flood damage nowcasting
无需训练的检索增强生成与强化推理用于洪水损害现在预测
Lipai Huang, Kai Yin, Chia-Fu Liu, Ali Mostafavi
机构
*
Urban Resilience.AI Lab, Zachry Department of Civil and Environmental Engineering(城市韧性.AI实验室,土木与环境工程系)
;
Department of Computer Science and Engineering(计算机科学与工程系)
;
Department of Civil, Environmental and Architectural Engineering(土木、环境与建筑工程系)
;
Institute for a Disaster Resilient Texas(德克萨斯灾害韧性研究所)
Reasoning-Aware AIGC Detection via Alignment and Reinforcement
基于对齐与强化的学习的推理感知AIGC检测
Zhao Wang, Max Xiong, Jianxun Lian, Zhicheng Dou
机构
*
Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学北京校区人工智能学院)
;
Duke University(杜克大学)
;
Microsoft Research Asia(微软亚洲研究院)
Beyond Itinerary Planning-A Real-World Benchmark for Multi-Turn and Tool-Using Travel Tasks
超越行程规划——多轮和工具使用旅行任务的现实世界基准
Xiang Cheng, Yulan Hu, Xiangwen Zhang, Lu Xu, Lide Tan, Zheng Pan, Xin Li, Yong Liu
机构
*
Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学光林人工智能学院)
;
National University of Singapore(新加坡国立大学)
;
Beihang University(北航)
;
AMAP, Alibaba Group(阿里云实验室)
机构
*
Institute of Advanced Technology, University of Science and Technology of China(中国科学技术大学先进技术研究院)
;
Institute of Artificial Intelligence, Hefei Comprehensive National Science Center(合肥综合性国家科学中心人工智能研究院)
;
School of Physics, University of Science and Technology of China(中国科学技术大学物理学院)
;
School of Electronics and Information Engineering, Anhui University(安徽大学电子与信息工程学院)
;
School of Computing, National University of Singapore(新加坡国立大学计算机学院)
Persona-Based Requirements Engineering for Explainable Multi-Agent Educational Systems: A Scenario Simulator for Clinical Reasoning Training
基于角色的可解释多智能体教育系统需求工程:用于临床推理训练的场景模拟器
Weibing Zheng, Laurah Turner, Jess Kropczynski, Matthew Kelleher, Murat Ozer, Shane Halse
机构
*
School of Information Technology University of Cincinnati, OH Cincinnati, USA(信息科技学院 奥地利辛辛那提大学)
;
College of Medicine University of Cincinnati, OH Cincinnati, USA(医学院 奥地利辛辛那提大学)
MeasHalu: Mitigation of Scientific Measurement Hallucinations for Large Language Models with Enhanced Reasoning
MeasHalu:通过增强推理缓解大型语言模型中的科学测量幻觉
Ruijun Huang, Zhiqiao Kang, Yuxuan Zhu, Junxiong Li, Jiahao Zhao, Minghuan Tan, Feng Jiang, Min Yang
机构
*
Shenzhen Key Laboratory for High Performance Data Mining(深圳高性能数据挖掘重点实验室)
;
Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences(深圳先进技术研究院,中国科学院)
;
Artificial Intelligence Research Institute, Shenzhen University of Advanced Technology(深圳先进技术大学人工智能研究院)