arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2025-08-12 至 2025-08-12 共收录 2 信号源:cs.CL, cs.AI, cs.LG

1. 测试时计算 2 篇

2508.07827 2025-08-12 cs.CL 77%

Evaluating Large Language Models as Expert Annotators

Yu-Min Tseng, Wei-Lin Chen, Chung-Chi Chen, Hsin-Hsi Chen

机构 * National Taiwan University(台湾大学) Virginia Tech(弗吉尼亚理工大学) University of Virginia(弗吉尼亚大学) AIST, Japan(日本产业技术综合研究所) AINTU, Taiwan(台湾人工智能技术研究所)

专题命中 测试时计算 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL

Comments Accepted to COLM 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.22648 2025-08-12 cs.CL 57%

WebDancer: Towards Autonomous Information Seeking Agency

Jialong Wu, Baixuan Li, Runnan Fang, Wenbiao Yin, Liwen Zhang, Zhengwei Tao, Dingchu Zhang, Zekun Xi, Gang Fu, Yong Jiang, Pengjun Xie, Fei Huang, Jingren Zhou

机构 * Tongyi Lab , Alibaba Group(通义实验室,阿里巴巴集团)

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏