HEARTS: Benchmarking LLM Reasoning on Health Time Series
HEARTS:基于健康时间序列的LLM推理基准测试
专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG
AI总结 HEARTS是一个统一的基准测试,用于评估LLM在一般健康时间序列上的分层推理能力,包含16个真实世界数据集和110个任务,揭示了LLM在多步时间推理上的不足。