BrowseComp-Plus: A More Fair and Transparent Evaluation Benchmark of Deep-Research Agent
Zijian Chen, Xueguang Ma, Shengyao Zhuang, Ping Nie, Kai Zou, Andrew Liu, Joshua Green, Kshama Patel, Ruoxi Meng, Mingyi Su, Sahel Sharifymoghaddam, Yanxi Li, Haoran Hong, Xinyu Shi, Xuye Liu, Nandan Thakur, Crystina Zhang, Luyu Gao, Wenhu Chen, Jimmy Lin
机构
*
University of Waterloo(滑铁卢大学)
;
CSIRO(澳大利亚联邦科学与工业研究组织)
;
Independent(独立研究者)
;
Carnegie Mellon University(卡内基梅隆大学)
;
The University of Queensland(昆士兰大学)
机构
*
Computer Science, Virginia Tech, Blacksburg, Virginia, USA(计算机科学,弗吉尼亚理工学院,弗吉尼亚州黑斯堡,美国;弗吉尼亚理工学院黑斯堡弗吉尼亚美国)
;
Virginia Tech Blacksburg Virginia USA
专题命中
Agent评测
:agent(abstract);分类 cs.AI、cs.SE
CommentsSubmitted to International Journal of Human-Computer Studies. Bond and Choe: Drafting, Review, Editing, Validation, Software, Methodology, Investigation, Data Analysis, Conceptualization, Experiment training. Hasan and Siddiqui: Experimental and Data Analysis Support. Jeon: Supervision, Review, Resources, Project Admin, Methodology, Conceptualization. Total 34 pages
A Research Agenda for Usability and Generalisation in Reinforcement Learning
Dennis J. N. J. Soemers, Spyridon Samothrakis, Kurt Driessens, Mark H. M. Winands
机构
*
Department of Advanced Computing Sciences, Maastricht University(马斯特里赫特大学高级计算科学系)
;
Institute for Analytics and Data Science, University of Essex(埃塞克斯大学分析与数据科学研究所)
专题命中
Agent评测
:agent(abstract);分类 cs.AI
CommentsTo appear in Revised Selected Papers for ICAART 2025. Extended version of ICAART 2025 publication