Agent Planning Benchmark: A Diagnostic Framework for Planning Capabilities in LLM Agents
Agent规划基准:LLM Agent规划能力的诊断框架
Haoyu Sun, Wenxuan Wang, Mingyang Song, Jujie He, Weinan Zhang, Yang Liu, Yang Yang, Yu Cheng
机构
*
Tongji University(同济大学)
;
Shanghai AI Laboratory(上海人工智能实验室)
;
Harbin Institute of Technology(哈尔滨工业大学)
;
Fudan University(复旦大学)
;
Skywork AI
;
University of California, Santa Cruz(加州大学圣克鲁兹分校)
;
Shanghai Jiao Tong University(上海交通大学)
;
The Chinese University of Hong Kong(香港中文大学)
Commentsv2: major revision. Five restructured findings separating order sensitivity, QQ imbalance, and residual contextuality; two-layer discriminant table; pipeline figure and per-item joint table; envelope pooling and certified Gamma bounds specified; retrospective batch-1 G3 re-validation (all verdicts preserved). No new pilot measurements
Towards Automated Kernel Generation in the Era of LLMs
面向LLM时代的自动化内核生成
Yang Yu, Peiyu Zang, Chi Hsu Tsai, Haiming Wu, Yixin Shen, Jialing Zhang, Haoyu Wang, Zhiyou Xiao, Jingze Shi, Yuyu Luo, Wentao Zhang, Chunlei Men, Guang Liu, Yonghua Lin
机构
*
Beijing Academy of Artificial Intelligence(北京人工智能研究院)
;
Beijing Normal University(北京师范大学)
;
Peking University(北京大学)
;
Beijing Institute of Technology(北京理工大学)
;
Cornell University(康奈尔大学)
;
Beijing Jiaotong University(北京交通大学)
;
Renmin University of China(中国人民大学)
;
Hong Kong University of Science and Technology (Guangzhou)(广州科技大学)
专题命中
评测与基准
:LLM(title_cn,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG
Comments71 pages (main text + four appendices: full generation/evaluation prompts, the anchor submission excerpt, and a council-evaluation excerpt), 1 figure, 17 tables. Github repo with pages/figures/tables/code and data for reproducing results: https://github.com/dnordfors/metanym-game-paper