arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2025-07-28 至 2025-07-28 共收录 5 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 5 篇

2507.19478 2025-07-28 cs.CV cs.CL 70%

MMBench-GUI: Hierarchical Multi-Platform Evaluation Framework for GUI Agents

Xuehui Wang, Zhenyu Wu, JingJing Xie, Zichen Ding, Bowen Yang, Zehao Li, Zhaoyang Liu, Qingyun Li, Xuan Dong, Zhe Chen, Weiyun Wang, Xiangyu Zhao, Jixuan Chen, Haodong Duan, Tianbao Xie, Chenyu Yang, Shiqian Su, Yue Yu, Yuan Huang, Yiqian Liu, Xiao Zhang, Yanting Zhang, Xiangyu Yue, Weijie Su, Xizhou Zhu, Wei Shen, Jifeng Dai, Wenhai Wang

机构 * Shanghai AI Laboratory(上海人工智能实验室) Shanghai Jiao Tong University(上海交通大学) Xiamen University(厦门大学) University of Science and Technology of China(中国科学技术大学) The Hong Kong University of Science and Technology(香港科技大学) Harbin Institute of Technology(哈尔滨工业大学) Tsinghua University(清华大学) Nanjing University(南京大学) Fudan University(复旦大学) University of Hong Kong(香港大学) Donghua University(东华大学) The Chinese University of Hong Kong(香港中文大学)

专题命中 推理评测 :reasoning(abstract);planning(abstract);分类 cs.CL

Comments in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.19477 2025-07-28 cs.LG cs.AI cs.CL 67%

Advancing Event Forecasting through Massive Training of Large Language Models: Challenges, Solutions, and Broader Impacts

Sang-Woo Lee, Sohee Yang, Donghyun Kwak, Noah Y. Siegel

机构 * Google Deepmind(谷歌DeepMind)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.19132 2025-07-28 cs.AI cs.CL cs.CV cs.HC 62%

OS-MAP: How Far Can Computer-Using Agents Go in Breadth and Depth?

Xuetian Chen, Yinghao Chen, Xinfeng Yuan, Zhuo Peng, Lu Chen, Yuekeng Li, Zhoujia Zhang, Yingqian Huang, Leyan Huang, Jiaqing Liang, Tianbao Xie, Zhiyong Wu, Qiushi Sun, Biqing Qi, Bowen Zhou

机构 * Fudan University(复旦大学) Shanghai AI Lab(上海人工智能实验室) Tsinghua University(清华大学) The University of Hong Kong(香港大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.05465 2025-07-28 cs.LG cs.AI 62%

2048: Reinforcement Learning in a Delayed Reward Environment

Prady Saligram, Tanvir Bhathal, Robby Manihani

专题命中 推理评测 :planning(abstract);分类 cs.AI、cs.LG

Comments We found an issue with our result aggregation scripts: some evaluation logs were incomplete and others duplicated, causing incorrect numbers in tables and figures. Because these graphs and tables underpin key comparisons, we are withdrawing the paper to regenerate verified results

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.18884 2025-07-28 cs.CL 57%

MindFlow+: A Self-Evolving Agent for E-Commerce Customer Service

Ming Gong, Xucheng Huang, Ziheng Xu, Vijayan K. Asari

机构 * Xiaoduo AI Lab, Shanghai, China(小多AI实验室,上海,中国) University of Dayton, Dayton, Ohio, United States(Dayton大学,俄亥俄州,美国)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏