PolyWorkBench: Benchmarking LLM Agents for Cross-Lingual Long-Horizon Workflows
PolyWorkBench:多语言长视野语言模型智能体基准测试
机构 * Beijing Jiaotong University(北京交通大学) ; Weixin AI, Tencent Inc(腾讯微云人工智能实验室)
AI总结 研究多语言长视野工作流程中LLM智能体的表现,提出PolyWorkBench基准测试及结合多种评估方式的混合框架,发现最先进LLM智能体在多语言设置中性能降,强调联合建模语言变化和程序决策对智能体评估的重要性。
Comments 17 Pages, 5 figures