YUKTI: From Natural-Language Situations to Robust, Verifiable Decisions An Uncertainty-Typed Proposition IR, Assumption-Robust Pareto Frontiers, and a Regret Certificate
Are LLMs Ready to Assist Physicians? PhysAssistBench for Interactive Doctor-Patient-EHR Assistance
LLMs 是否已准备好辅助医生?PhysAssistBench:交互式医患-电子病历辅助基准
Tianming Du, Peijie Yu, Sihan Shang, Danli Shi, My Linh Nguyen, Shengbo Gao, Guangyuan Li, Yinghong Yu, Yan Jiang, Qianlong Zhao, Behzad Bozorgtabar, Shaoxiong Ji, Jiazhen Pan, Daniel Rueckert, Jiancheng Yang
机构
*
Aalto University(阿尔托大学)
;
Tencent(腾讯)
;
Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳))
;
Hong Kong Polytechnic University(香港理工大学)
;
Aarhus University(奥胡斯大学)
;
Technical University of Munich(慕尼黑工业大学)
SPADE-Bench: Evaluating Spontaneous Strategic Deception in Agents via Plan-Action Divergence
SPADE-Bench:通过计划-行动分歧评估智能体中的自发性策略欺骗
Yuyan Bu, Haowei Li, Qirui Zheng, Bowen Dong, Kaiyue Yang, Jiaming Ji, Yingshui Tan, Wenxin Li, Yaodong Yang, Juntao Dai
机构
*
Beijing Academy of Artificial Intelligence(北京人工智能研究院)
;
Peking University(北京大学)
;
University of Science and Technology of China(中国科学技术大学)
;
University of Chinese Academy of Science(中国科学院大学)
;
Alibaba Group(阿里巴巴集团)
机构
*
School of Control Science and Engineering, Shandong University(控制科学与工程学院,山东大学)
;
Key Laboratory of Machine Intelligence and System Control, Shandong University(机器智能与系统控制重点实验室,山东大学)
;
Department of Medicine and Therapeutics, The Chinese University of Hong Kong(医学与治疗学系,香港中文大学)
;
Department of Geriatric Medicine, Qilu Hospital of Shandong University(老年医学科,山东大学齐鲁医院)
;
Department of Psychiatry, The Chinese University of Hong Kong(精神病学系,香港中文大学)
;
Li Chiu Kong Family Sleep Assessment Unit, Department of Psychiatry, Faculty of Medicine, The Chinese University of Hong Kong(李秋虹家庭睡眠评估单元,精神病学系,医学院,香港中文大学)
;
Li Ka Shing Institute of Health Sciences, Faculty of Medicine, The Chinese University of Hong Kong(李嘉诚健康科学研究院,医学院,香港中文大学)
;
Gerald Choa Neuroscience Institute, Department of Medicine and Therapeutics, The Chinese University of Hong Kong(Gerald Choa 神经科学研究所,医学与治疗学系,香港中文大学)
SorryDB: Can AI Provers Complete Real-World Lean Theorems?
SorryDB: AI证明者能完成现实世界的Lean定理吗?
Austin Letson, Leopoldo Sarra, Auguste Poiroux, Oliver Dressler, Paul Lezeau, Dhyan Aranha, Frederick Pu, Aaron Hill, Miguel Corredera Hidalgo, Julian Berman, George Tsoukalas, Lenny Taelman
机构
*
University of California, Berkeley(加州大学伯克利分校)
Automated Creativity Evaluation of Language Models Across Open-Ended Tasks
语言模型在开放式任务中的自动化创造力评估
Min Sen Tan, Zachary Kit Chun Choy, Syed Ali Redha Alsagoff, Nadya Yuki Wangsajaya, Mohor Banerjee, Swaagat Bikash Saikia, Alvin Chan
机构
*
Raffles Institution(莱佛士书院)
;
College of Computing and Data Science, Nanyang Technological University(南洋理工大学计算与数据科学学院)
;
Lee Kong Chian School of Medicine, Nanyang Technological University(南洋理工大学李光前医学院)
;
Centre of AI in Medicine (C-AIM), Nanyang Technological University(南洋理工大学人工智能医学中心)
机构
*
The University of Hong Kong(香港大学)
;
Qwen Team, Alibaba Inc.(阿里巴巴集团Qwen团队)
;
University of California, San Diego(加州大学圣地亚哥分校)
;
Tsinghua University(清华大学)
MCERF: Advancing Multimodal LLM Evaluation of Engineering Documentation with Enhanced Retrieval
MCERF:通过增强检索推进工程文档的多模态大语言模型评估
Kiarash Naghavi Khanghah, Hoang Anh Nguyen, Anna C. Doris, Amir Mohammad Vahedi, Daniele Grandi, Faez Ahmed, Hongyi Xu
机构
*
School of Mechanical, Aerospace, and Manufacturing Engineering, University of Connecticut, Storrs, CT 06269(机械、航空航天与制造工程学院,康涅狄格大学,斯托尔斯,CT 06269)
;
Department of Mechanical Engineering, Massachusetts Institute of Technology, Cambridge, MA 02139, USA(机械工程系,麻省理工学院,剑桥,MA 02139,美国)
Comments18 pages, 2 figures, 9 tables. Technical report. First place in both Open and Efficient tracks of MindGames Arena Generalization Track at NeurIPS 2025