Comments6 pages, 5 figures, 1 table, accepted at the 23rd IFAC World Congress, Busan, South Korea, Aug. 23-26, 2026. Open invited track 9-131: "Control and Optimization for Smart Cities"
机构
*
University of Virginia(弗吉尼亚大学)
;
National Institutes of Health(美国国家卫生研究院)
;
Dana-Farber Cancer Institute(达纳-法伯癌症研究所)
;
Yale University(耶鲁大学)
;
Weill Cornell Medicine(韦氏 Cornell 医学院)
No More, No Less: Task Alignment in Terminal Agents
无需更多,无需更少:终端代理的任务对齐
Sina Mavali, David Pape, Jonathan Evertz, Samira Abedini, Devansh Srivastav, Thorsten Eisenhofer, Sahar Abdelnabi, Lea Schönherr
机构
*
CISPA Helmholtz Center for Information Security(CISPA 涅槃中心信息安全研究所)
;
ELLIS Institute Tübingen and MPI for Intelligent Systems(图宾根 ELLIS 研究所和智能系统 MPI)
;
Tübingen AI Center(图宾根人工智能中心)
AcuityBench: Evaluating Clinical Acuity Identification and Uncertainty Alignment
AcuityBench:评估语言模型对医疗紧急情况识别和不确定性对齐
Robin Linzmayer, Georgianna Lin, Di Coneybeare, Jason Chu, Trudi Cloyd, Manish Garg, Miles Gordon, Elizabeth Hartofilis, Benjamin Hong, Ashraf Hussain, Eugene Y. Kim, Oluchi Iheagwara King, Ross McCormack, Erica Olsen, John K. Riggins, Mustafa N. Rasheed, Dana L. Sacco, Vinay Saggar, Osman R. Sayan, Amit Shembekar, Janice Shin-Kim, Wendy W. Sun, Bernard P. Chang, David Kessler, Noémie Elhadad
机构
*
Department of Computer Science, Columbia University, New York, NY, USA(计算机科学系,哥伦比亚大学,纽约,纽约州,美国)
;
Department of Biomedical Informatics, Columbia University, New York, NY, USA(生物医学信息学系,哥伦比亚大学,纽约,纽约州,美国)
;
Department of Emergency Medicine, Columbia University Irving Medical Center, New York, NY, USA(急诊医学系,哥伦比亚大学伊文思医疗中心,纽约,纽约州,美国)
AssayBench: An Assay-Level Virtual Cell Benchmark for LLMs and Agents
AssayBench: 一个基于实验层面的虚拟细胞基准,用于LLMs和代理
Edward De Brouwer, Carl Edwards, Alexander Wu, Jenna Collier, Graham Heimberg, Xiner Li, Meena Subramaniam, Ehsan Hajiramezanali, David Richmond, Jan-Christian Hütter, Sara Mostafavi, Gabriele Scalia
PrimeKG-CL: A Continual Graph Learning Benchmark on Evolving Biomedical Knowledge Graphs
PrimeKG-CL:一个在演进生物医学知识图谱上的持续图学习基准
Yousef A. Radwan, Yao Li, Qing Qing, Ziqi Xu, Xingtong Yu, Jiaxing Huang, Renqiang Luo, Xikun Zhang
机构
*
Technology, Innovation, Entrepreneurship Department(技术、创新与创业系)
;
King Abdullah University of Science and Technology(国王阿卜杜勒阿齐兹大学)
;
School of Computing and Information Systems(计算与信息系)
;
The University of Melbourne(墨尔本大学)
;
College of Computer Science and Technology(计算机科学与技术学院)
;
School of Computing Technologies(计算技术学院)
;
Jilin University(吉林大学)
;
RMIT University(皇家墨尔本理工大学)
;
Department of Systems Engineering and Engineering Management(系统工程与工程管理系)
;
The Chinese University of Hong Kong(香港中文大学)
;
Department of Data Science and Artificial Intelligence(数据科学与人工智能系)
;
Hong Kong Polytechnic University(香港理工大学)
Towards Conversational Medical AI with Eyes, Ears and a Voice
面向有眼睛、耳朵和声音的对话式医疗AI
Meet Shah, Jason Gusdorf, Anil Palepu, Chunjong Park, Jack W. O'Sullivan, Vishnu Ravi, Tim Strother, Pavel Dubov, Aliya Rysbek, Toshiyuki Fukuzawa, Yana Lunts, Jan Freyberg, Michael B. Chang, Aniruddh Raghu, David Stutz, Devora Berlowitz, Eliseo Papa, Taylan Cemgil, JD Velasquez, Jack Chen, Arthur Chen, Doug Fritz, Charlie Taylor, Katya Tregubova, Jing Rong Lim, Richard Green, Sara Mahdavi, Mahvish Nagda, Jihyeon Lee, Craig Schiff, Liviu Panait, Sukhdeep Singh, Valentin Liévin, David G. T. Barrett, Hannah Gladman, Anna Cupani, Francesca Pietra, Uchechi Okereke, Katherine Tong, Clemens Meyer, Erwan Rolland, Mili Sanwalka, Michael D. Howell, Shixiang Shane Gu, Bibo Xu, Euan A. Ashley, S. M. Ali Eslami, Gregory Wayne, Pushmeet Kohli, Vivek Natarajan, Adam Rodman, Alan Karthikesalingam, Ryutaro Tanno
机构
*
Google DeepMind(谷歌DeepMind)
;
Google Research(谷歌研究)
;
Beth Israel Deaconess Medical Center, Harvard Medical School(贝塞斯达医院, 哈佛医学院)
;
Stanford University(斯坦福大学)
Do Benchmarks Underestimate LLM Performance? Evaluating Hallucination Detection With LLM-First Human-Adjudicated Assessment
基准是否低估了大语言模型的性能?通过大语言模型优先的人类仲裁评估来评估幻觉检测
I. F. Atasoy, B. Mutlu, E. A. Sezer, A. Wahdan
机构
*
Department of Computer Engineering, Hacettepe University(哈切塔佩大学计算机工程系)
;
Department of Computer Engineering, Ankara University(安卡拉大学计算机工程系)
;
Zephlen AI and Information Technologies Inc.(泽夫伦人工智能与信息技术公司)
TRIP-Evaluate: An Open Multimodal Benchmark for Evaluating Large Models in Transportation
TRIP-Evaluate: 一个用于评估交通领域大模型的开放多模态基准
Han Gong, Zhen Zhou, Yunyang Shi, Yan Tan, Jinbiao Huo, Qi Hong, Zhiyuan Liu
机构
*
School of Transportation(交通学院)
;
Southeast University(东南大学)
;
School of Artificial Intelligence and Computer Science(人工智能与计算机科学学院)
;
Jiangnan University(江南大学)
;
Department of Civil and Environmental Engineering(土木与环境工程系)
;
Hong Kong Polytechnic University(香港理工大学)
Green Shielding: A User-Centric Approach Towards Trustworthy AI
绿色防护:面向可信AI的用户导向方法
Aaron J. Li, Nicolas Sanchez, Hao Huang, Ruijiang Dong, Jaskaran Bains, Katrin Jaradeh, Zhen Xiang, Bo Li, Feng Liu, Aaron Kornblith, Bin Yu
机构
*
University of California, Berkeley(加州大学伯克利分校)
;
University of Melbourne(墨尔本大学)
;
University of California, San Francisco(加州大学旧金山分校)
;
University of Georgia(佐治亚大学)
;
University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)