arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-01-26 至 2026-01-26 共收录 1 信号源:cs.CL, cs.AI, cs.LG

1. 逻辑推理 1 篇

2509.04744 2026-01-26 cs.SD cs.CL eess.AS 79%

WildScore: Benchmarking MLLMs in-the-Wild Symbolic Music Reasoning

WildScore: 多模态符号音乐推理在现实中的基准测试

Gagan Mundada, Yash Vishe, Amit Namburi, Xin Xu, Zachary Novack, Julian McAuley, Junda Wu

机构 * University of California, San Diego(加州大学圣地亚哥分校)

专题命中 逻辑推理 :reasoning(title,abstract);分类 cs.CL

AI总结 WildScore是首个用于评估多模态大语言模型在现实世界中符号音乐推理能力的基准测试,通过真实音乐作品和用户生成问题,系统性评估模型在音乐学分析中的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏