The complexities of patient-centred conversational artificial intelligence
以患者为中心的对话式人工智能的复杂性
João Matos, Olivia Buege, Donny Cheung, Gary S. Collins, Paula Dhiman, Nan Li, Bingyu Mao, Benjamin W. Nelson, Michail Ouroutzoglou, Paul Varghese, Jonathan Amar
专题命中
评测与基准
:large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
PluraMath: Extending Mathematical Reasoning Evaluation Beyond High-Resource Languages
PluraMath:将数学推理评估扩展到资源丰富语言之外
Daryna Dementieva, Nikolay Babakov, Kathy Hämmerl, Ilseyar Alimova, Jindřich Libovický, Shu Okabe, Miras Baisbay, Lukas Edman, Abrorkhon Inomkhujaev, Antonia Karamolegkou, Mateusz Lango, Volkan Özer, Nikola Selic, Subhankar Swain, Tsedeniya Kinfe Temesgen, Galit Bary Weisberg, Alexander Fraser
机构
*
Technical University of Munich(慕尼黑技术大学)
;
Munich Center for Machine Learning(慕尼黑机器学习中心)
;
Munich Data Science Institute(慕尼黑数据科学研究所)
;
Applied AI Institute(应用人工智能研究所)
;
Charles University(查尔斯大学)
;
Nazarbayev University(纳扎尔拜大学)
;
Inria(法国国家信息与自动化研究所)
;
Indian Institute of Technology, Kharagpur (IIT Kharagpur)(印度Kharagpur理工学院)
;
German University of Digital Science(德国数字科学大学)
专题命中
评测与基准
:large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
Comments28 pages, 4 figures. Pre-registered cross-provider evaluation harness and per-regime results at github.com/canonic-canonic/canonic-pub. Construction claims resolve to commands run at the evidence-window-close ref (see Appendix C)
Your AI Travel Agent Would Book You a Bullfight: An Agentic Benchmark for Implicit Animal Welfare in Frontier AI Models
你的AI旅行代理会为你预订斗牛:前沿AI模型中隐含动物福利的代理基准
Jasmine Brazilek, Joel Christoph, Maheep Chaudhary, Oliver Tullio, Carol Kline, Miles Tidmarsh, Arturs Kanepajs
机构
*
Compassion Aligned Machine Learning(同情对齐机器学习)
;
Sentient Futures(感知未来)
;
Harvard Kennedy School(哈佛肯尼迪学院)
;
Appalachian State University Department of Management(阿巴拉契亚州立大学管理系)
专题命中
评测与基准
:large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
CommentsProceedings of the 6th Workshop on Trustworthy NLP (TrustNLP 2026), ACL 2026, San Diego, California, USA. Available at https://openreview.net/forum?id=WJCalficPT
Is Our Benchmark Enough? An Analysis of Continual Learning for MLLMs
我们的基准测试足够吗?多模态大语言模型持续学习分析
Van-Tuan Tran, Shruthi Gowda, Merim Dzaferagic, Marco Ruffini
机构
*
School of Computer Science and Statistics, Trinity College Dublin(都柏林圣三一学院计算机科学与统计学院)
;
Department of Mathematics and Computer Science, Eindhoven University of Technology(埃因霍温理工大学数学与计算机科学系)
专题命中
评测与基准
:large language model(abstract);language model(abstract);分类 cs.AI、cs.LG