Time Present and Time Past: Benchmarking Large Language Models on Temporally Evolving Document Understanding
当下与过往时间:针对时间演进的文档理解的大语言模型基准测试
Mahbub E Sobhani, Md. Faiyaz Abdullah Sayeedi, Fahmid Hasan Chowdhury, Md Adnan Arefeen, Farig Sadeque, Md. Faizul Bari, Swakkhar Shatabda
机构
*
BRAC University(BRAC大学)
;
United International University(联合国际大学)
;
North South University(北南大学)
;
Spectrum Software & Consulting Ltd.(斯佩克特软件咨询有限公司)
专题命中
评测与基准
:large language model(title);language model(title);LLM(abstract,abstract_cn);分类 cs.AI
Performance of large language models in the optical diagnosis of colorectal polyps
大型语言模型在结直肠息肉光学诊断中的性能
Joshua C. Vences, William T. Tran, Nikko Gimpaya, Catharine M. Walsh, Rishad J. Khan, Robert Bechara, Asher C. Wiggins, Celine N. Rousan, Kaitlyn V. G. L. Morgado, Angie Ibrahim, Kevin H. M. Kuo, Daniel von Renteln, Alexander Hann, Dennis L. Shung, Michael A. Scaffidi, Charles Ménard, Joshua Landy, Samir C. Grover
专题命中
评测与基准
:large language model(title,abstract);language model(title,abstract);分类 cs.AI
AI总结
本研究评估Claude Opus 4等5款大型语言模型对结直肠息肉的光学诊断性能,发现其区分息肉亚型的准确率接近专家共识,但灵敏度与特异度未达ESGE标准,需进一步研究方可临床应用。
Can Foundation Models Hear What Made That Sound? A Tiered Benchmark of Audio-Language Models and Traditional Classifiers for Closed-Set Sound Source Identification
基础模型能否识别声音的来源?针对闭集声源识别的音频-语言模型与传统分类器的分层基准测试
Sajjad Abdoli, Ghassan Al-Sumaidaee, Ahmad ElShiekh, Ahmed Rashad
机构
*
Department of Computer Science and Engineering (AI & ML), Kakatiya Institute of Technology and Science(卡凯蒂亚理工学院计算机科学与工程系(人工智能与机器学习))
;
Department of Computer Science and Engineering, Kakatiya Institute of Technology and Science(卡凯蒂亚理工学院计算机科学与工程系)
;
Boston University(波士顿大学)
专题命中
评测与基准
:large language model(title,abstract);language model(title,abstract);分类 cs.AI
机构
*
TJUNLP Lab, School of Computer Science and Technology, Tianjin University(天津大学计算机科学与技术学院TJUNLP实验室)
;
The International Joint Institute of Tianjin University(天津大学国际联合研究院)
专题命中
评测与基准
:large language model(title,abstract);language model(title,abstract);分类 cs.CL