arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-08-11 至 2026-08-11 共收录 427 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 记忆与上下文管理 25 篇

2608.06257 2026-08-11 cs.CV cs.HC 版本更新 67%

MASS: Multiplayer World Models with Authoritative Shared State

MASS:具有权威共享状态的多人世界模型

Ziqi Cai, Siqi Yang, Yimu Wang, Zixian Gao, Yunheng Liu, Shuchen Weng, Erwin Wu, Kaipeng Zhang, Boxin Shi

机构 * Alaya Lab(Alaya实验室) Peking University(北京大学) Institute of Science Tokyo(东京科学大学)

专题命中 记忆与上下文管理 :agent(abstract);multi-agent(abstract)

AI总结 该研究提出MASS模型,通过将世界动态与视图渲染解耦,解决现有视频世界模型在多人环境中的缺陷,在多人Snake基准测试中实现更优状态精度,为多智能体世界模拟提供实用基础。

Comments Project Page: https://alaya-lab.github.io/MASS/

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.01952 2026-08-11 cs.CL cs.AI cs.LG 版本更新 67%

WebChoreArena: Evaluating Web Browsing Agents on Realistic Tedious Web Tasks

WebChoreArena:在现实繁琐网页任务上评估网页浏览智能体

Atsuyuki Miyai, Zaiying Zhao, Kazuki Egashira, Atsuki Sato, Tatsumi Sunada, Shota Onohara, Hiromasa Yamanishi, Mashiro Toyooka, Kunato Nishina, Ryoma Maeda, Kiyoharu Aizawa, Toshihiko Yamasaki

专题命中 记忆与上下文管理 :agent(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 本文提出WebChoreArena,作为WebArena的扩展,包含532个耗时300多小时开发的繁琐网页任务,从大规模记忆、计算、长期记忆三维度评估网页浏览智能体,实验显示其能清晰衡量LLM进展且难度高于WebArena。

Comments COLM2026. Project Page: https://webchorearena.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07663 2026-08-11 cs.CV cs.AI cs.CL 新提交 62%

Keep It Simple: Multi-Key Episodic Memory Retrieval for Ultra-Long Video Understanding

保持简洁:用于超长视频理解的多键情景记忆检索

Yeeun Choi, Youngbeom Yoo, Joon-Young Lee, Hyolim Kang, Seon Joo Kim

机构 * Yonsei University(延世大学) Adobe Research(奥多比研究院)

专题命中 记忆与上下文管理 :agentic(abstract);分类 cs.AI、cs.CL

AI总结 针对超长视频理解的两阶段范式需求,提出MERIT框架,通过多键表示与按需时间扩展实现精准检索,在三个长视频基准数据集上取得最优性能。

Comments Accepted to ECCV 2026 (Oral). Project Page: https://choi-yeeun.github.io/MERIT/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09480 2026-08-11 cs.AI 新提交 57%

From Prompt to Harness: Coderlet from Scratch

从提示到管控:从零开始构建Coderlet

Mengfan Li

专题命中 记忆与上下文管理 :agent(abstract);分类 cs.AI

AI总结 本文研究了一种紧凑的编程智能体管控设计,通过模型、执行、状态边界连接各组件,实现模型生成到环境动作的转换,可逐步优化并在可执行工件中实现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07915 2026-08-11 cs.LG 新提交 57%

SPECTRA: Pushing the KV Cache Beyond the 2-Bit Cliff via Spectral Transform Coding

SPECTRA:通过谱变换编码将KV缓存推向2比特极限之外

Jiamu Zhang, Liang Wu, Kelly Wan, Hanjie Chen, Liangjie Hong

机构 * Nokia(诺基亚) Rice University(莱斯大学)

专题命中 记忆与上下文管理 :agentic(abstract);分类 cs.LG

AI总结 SPECTRA是一种无需训练的KV缓存压缩编解码器,通过谱变换编码将比特预算集中于关键通道,在Llama-3.1-8B等模型上实现最高12倍压缩,突破2比特极限,提升长上下文处理能力

Comments 28 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13884 2026-08-11 cs.AI 版本更新 57%

Experience Memory Graph: One-Shot Error Correction for Agents

经验记忆图:智能体的一次性错误纠正

Wenjun Wang, Yuchen Fang, Fengrui Liu, Zibo Liang, Kai Zheng

机构 * University of Electronic Science and Technology of China(电子科技大学)

专题命中 记忆与上下文管理 :agent(abstract);分类 cs.AI

AI总结 研究针对大语言模型智能体在复杂任务中易出错且难恢复的问题,提出经验记忆图框架,将失败恢复转化为图匹配问题,训练时提取相关子图和路径存储,测试时指导智能体,实验证明其性能优于现有基线且无需测试时反复试验。

Comments 11 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08482 2026-08-11 cs.DC 新提交 50%

FlashBoot: Sub-Second Weight Loading for Large Models at Rack Scale

FlashBoot:机架级大模型的亚秒级权重加载方案

Issac Zhu, Hscos Zhang, Keith Jiang, Jack Li, Hugh Yin, Jason Zhao

专题命中 记忆与上下文管理 :workflow(abstract)

AI总结 FlashBoot是基于SGLang设计的机架级大模型权重加载子系统,通过FabricArena布局等技术解决现有方案的结构性缺陷,将单节点及机架级权重加载速度大幅提升,性能远超现有最先进方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09661 2026-08-11 quant-ph cs.ET 新提交 50%

Memory-, Circuit-, and Ansatz-Efficient VQLS for CFD on Hybrid Quantum-HPC Systems

面向混合量子-高性能计算系统的、内存、电路与本征态拟设高效的变分量子线性求解器(VQLS)用于计算流体动力学(CFD)

Chao Lu, Muralikrishnan Gopalakrishnan Meena, Eduardo Antonio Coello Perez, Kalyana Chakravarthi Gottiparthi, Seongmin Kim

专题命中 记忆与上下文管理 :workflow(abstract)

AI总结 本研究针对混合量子-HPC系统上VQLS用于CFD的三大挑战,通过基准测试编码策略、评估本征态拟设、在Frontier超算部署工作流,建立了实用基线并明确了更大规模问题的瓶颈。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00729 2026-08-11 econ.TH 版本更新 50%

On the Sparsity of Optimal Information Structures

论最优信息结构的稀疏性

Masaki Miyashita

专题命中 记忆与上下文管理 :agent(abstract)

AI总结 本文研究最优信息结构的稀疏性,通过线性规划方法发现其稀疏特性,并在含网络效应的创新采用问题中验证,高状态下确定性推荐全采用,低状态下随机化嵌套行动组合以最大化采用者数量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19381 2026-08-11 quant-ph cond-mat.dis-nn 版本更新 50%

A calibrated diagnostic for reverse-anneal sampling in programmable quantum annealers

子系统弛豫和一种校准的采样诊断方法用于可编程量子退火机

Luis Lozano

专题命中 记忆与上下文管理 :workflow(abstract)

AI总结 本文研究了可编程量子退火机中子系统弛豫现象,并提出了一种校准的采样诊断方法,用于评估量子退火机的采样性能和记忆保持能力。

Comments v2: substantially revised: title and framing updated, benchmarking section removed following a reproducibility audit, claims narrowed; reformatted to revtex4-2 (11 pages, 5 figures + supplemental material as ancillary file). All remaining results regenerate from the deposited raw data

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11603 2026-08-11 quant-ph physics.chem-ph 版本更新 50%

Dissipative continuation for ground-state preparation at chemical transition states

在化学转变态上快速耗散基态制备

Thomas W. Watts, Soumya Sarkar, Daniel Collins, Nam Nguyen, Luke Quezada, Michael J. Bremner, Samuel J. Elman

专题命中 记忆与上下文管理 :workflow(abstract)

AI总结 该研究提出了一种利用反应路径作为计算原语的耗散基态制备协议,通过Procrustes对齐轨道旋转和工程化耗散冷却,在强相关区域中以~O(N_o^3/ε_E)的复杂度制备化学系统基态。

Comments 15 + 13 pages, 4+1 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09672 2026-08-11 physics.acc-ph 50%

X-ray reflection: a FLUKA model and its application in the design of synchrotron light beamlines and CERN's Future Circular Collider

X射线反射:FLUKA模型及其在同步辐射光束线和CERN未来圆形对撞机设计中的应用

Giuseppe Mazzola, Sunil Chitra, Arnaud Devienne, Alessandro Frasca, María José García Fusté, Dominique Heinis, Anton Lechner, Giuseppe Lerner, Luca Rebuffi, Manuel Sanchez del Rio, David L. Windt, Eugeni Graugés, Francesc Salvat Pujol

专题命中 记忆与上下文管理 :workflow(abstract)

AI总结 FLUKA开发了X射线反射模型,用于同步辐射光束线和CERN未来圆形对撞机设计,实现了复杂模拟的一站式处理。

Comments 14 pages, 17 figures, to be published

详情

展开后加载摘要…

URL PDF HTML 收藏

2. Agent评测 78 篇

2608.09666 2026-08-11 cs.AI 新提交 89%

Open Evaluation Agent: Efficient and Promptable Evaluation of Visual Generative Models

开放评估智能体:视觉生成模型的高效且可提示的评估

Shulin Tian, Ziqi Huang, Fan Zhang, Hongyuan Zhu, Yu Qiao, Ziwei Liu

机构 * S-Lab, Nanyang Technological University(南洋理工大学S-Lab) Agency for Science, Technology and Research (A*STAR)(科学、技术与研究局(A*STAR)) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 Agent评测 :agent(title,summary_cn);planning(abstract);分类 cs.AI

AI总结 该研究提出Evaluation Agent框架及基于其构建的Open-EA,可高效评估视觉生成模型,将评估时间减至传统方法的10%,还通过EA-CoT-10K和EA-3B减少对专有骨干的依赖,验证了其在多基准及跨家族的有效性。

Comments Journal extension of our ACL 2025 paper (arXiv:2412.09645). 12 pages. Code: https://github.com/Vchitect/Evaluation-Agent

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18556 2026-08-11 cs.HC 版本更新 88%

ChatMuse: Supporting In-Person Small-Group Conversation Experience with a Proactive Assistive AI Agent in Mixed Reality

ChatMuse:在混合现实中通过主动辅助人工智能代理支持面对面小团体对话体验

Shaoze Zhou, Joaquin Frangi, Diana Nelly Rivera Rodriguez, Rawan Alghofaili, Janet G. Johnson, Lingyao Li, Renkai Ma, Christine Lisetti, Chen Chen

专题命中 Agent评测 :agent(title,abstract);AI agent(title,abstract)

AI总结 研究旨在解决面对面小团体对话有效支持信息的设计生成问题,提出ChatMuse系统,它能分析参与者线索并提供实时指导,利用用户行为反应改进支持能力,通过受试者内研究证明了该系统在协助小团体对话方面的可行性和有效性。

Comments 19 pages, 9 figures, 4 tables, Proceedings of the 39th Annual ACM Symposium on User Interface Software and Technology (UIST '26), Detroit, MI, USA

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07965 2026-08-11 cs.AI 新提交 85%

CyberAGENTS: Structured Autonomy for Agentic Gamified Learning in Cybersecurity

CyberAGENTS:面向网络安全领域智能体游戏化学习的结构化自主机制

Ivan Hornung, Deepthi Marasinghe Arachchige, Tharindu Kumarage, Garima Agrawal, Yuli Deng, Ying-Chih Chen, Huan Liu

机构 * Arizona State University(亚利桑那州立大学) Amazon AGI(亚马逊AGI)

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);AI agent(abstract);分类 cs.AI

AI总结 本研究提出CyberAGENTS框架,通过结构化自主机制实现游戏化网络安全学习,经课堂评估验证其可提升学习者参与度与对AI响应的信任度,为相关系统设计提供蓝图。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15434 2026-08-11 cs.MA cs.AI cs.CR 版本更新 85%

Coercion and Deception in AI-to-AI Management: An Agentic Benchmark of Unprompted Escalation

人工智能对人工智能管理中的胁迫与欺骗:无提示升级的代理基准测试

Jasmine Brazilek, Maheep Chaudhary, Zoe Lu, Miles Tidmarsh

机构 * CaML Sentient Futures

专题命中 Agent评测 :agentic(title);agent(abstract);AI agent(abstract);multi-agent(abstract)

AI总结 研究人工智能管理中代理升级问题,引入管理者胁迫基准测试,通过九级阶梯衡量升级,对五个家族六个模型实验,发现权威增加胁迫,伪造成功局限于部分模型,发布基准测试和代码,为管理多智能体动态提供重要参考。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.02687 2026-08-11 cs.AI cs.CL 版本更新 84%

The Collaboration Gap: Exploration and Benchmarking of Open-World Agentic Cooperation

协作差距:开放世界智能体协作的探索与基准测试

Tim R. Davidson, Adam Fourney, Saleema Amershi, Robert West, Eric Horvitz, Ece Kamar

机构 * EPFL(瑞士联邦理工学院) Microsoft Research(微软研究院)

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);分类 cs.AI、cs.CL

AI总结 该研究提出协作迷宫求解基准,评估32个模型的协作能力,发现模型存在协作差距,提出中继推理等缓解措施,强调协作相关评估、训练与交互设计的重要性。

Comments Accepted to COLM 2026, code available at https://github.com/trdavidson/collaboration_gap

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02478 2026-08-11 cs.AI 版本更新 83%

AIVV: Neuro-Symbolic LLM Agent-Integrated Verification and Validation for Trustworthy Autonomous Systems

AIVV: 用于可信自主系统的神经符号LLM代理集成验证与验证

Jiyong Kwon, Ujin Jeon, Sooji Lee, Guang Lin

机构 * School of Mechanical Engineering, Purdue University(普渡大学机械工程学院) School of Electrical and Computer Engineering, Purdue University(普渡大学电气与计算机工程学院) Department of Computer Science, Purdue University(普渡大学计算机科学系) Department of Mathematics, Purdue University(普渡大学数学系)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI

AI总结 本文提出AIVV框架,利用LLM作为决策外层循环,通过语义验证区分真实故障与干扰故障,生成可操作的V&V成果,提升自主系统验证效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.16481 2026-08-11 cs.LG 版本更新 83%

Benchmarking the Robustness of Agentic Systems to Adversarially-Induced Harms

评估智能体系统对抗恶意诱导危害的鲁棒性

Jonathan Nöther, Adish Singla, Goran Radanovic

机构 * Max Planck Institute for Software Systems(马克斯·普朗克软件系统研究所)

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);分类 cs.LG

AI总结 该研究提出智能体系统危害分类法与BAD-ACTS基准,评估LLM类智能体对抗恶意诱导的鲁棒性,发现其攻击成功率达40%-90%,并提出零样本消息监控防御方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09567 2026-08-11 cs.CR 新提交 82%

From Runnable to Verifiable: An Independent Reproducibility Study of LLM/Agent-Driven Vulnerability Validation Artifacts

从可运行到可验证:LLM/智能体驱动的漏洞验证制品的独立可复现性研究

Bo Chen

专题命中 Agent评测 :agent(title,abstract);workflow(abstract)

AI总结 本研究通过预注册可复现性审计,发现LLM/智能体驱动的漏洞验证制品存在标识符不一致、可运行率低、预言机不可靠等问题,提出的审计方案可作为安全可复现性社区的复用模板。

Comments 16 pages, 2 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08070 2026-08-11 cs.RO 新提交 82%

SurgWMBench: A Vision-Based Benchmark for World-Modeling Surgical Instrument Motion Planning

SurgWMBench:面向世界建模的手术器械运动规划视觉基准

Huanrong Liu, Weiliang Huang, Bob Zhang, Weichao Cai, Chunlin Tian, Qingbiao Li

机构 * University of Macau(澳门大学) National University of Singapore(新加坡国立大学) Xiamen University(厦门大学)

专题命中 Agent评测 :planning(title,abstract);workflow(abstract)

AI总结 本文提出SurgWMBench,一种面向短程手术运动规划的视觉基准,可评估手术世界模型的器械运动预测与连续回推稳定性,解决现有指标与器械规划需求不匹配的问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07545 2026-08-11 cs.NE cs.AI cs.LG cs.SE 新提交 82%

DarwinX: Evolving Agent Harnesses Through Natural Selection

DarwinX:通过自然选择进化智能体控制程序

Yifan Zhang, Yutong Dai, Juntao Tan, Luyu Yang, Rishi Mullur, Thai Hoang, Zhiyuan Hu, James Zhu, Phil Mui, Silvio Savarese, Ran Xu, Zeyuan Chen

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI、cs.LG、cs.SE

AI总结 DarwinX是模型参数冻结时通过自然选择进化控制程序的方法,在四个基准中平均提升约17个百分点,控制程序可迁移,进化通用能力而非基准特定补丁。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09068 2026-08-11 cs.SE 新提交 81%

Pseudo2CodeQA: A Benchmark for LLM-Based Structured Algorithmic Reasoning in Code Generation

Pseudo2CodeQA:面向基于大语言模型的代码生成中结构化算法推理的基准测试

Shadikur Rahman, Umme Ayman Koana, Syed Muhammad Danish

专题命中 Agent评测 :agentic(summary_cn,abstract);分类 cs.SE

AI总结 本文提出Pseudo2Code基准测试及Pseudo2Code Agentic Framework,实验表明该框架性能优于现有基线,验证了结构化伪代码对代码生成的提升作用。

Comments 8 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09254 2026-08-11 cs.AI cs.CL 新提交 81%

Business Truth, not SQL Accuracy: A Rule-Gated 7B Analytics Agent Outperforms a Direct-Prompted 32B Baseline

业务真值,而非SQL准确率:规则门控的7B分析智能体优于直接提示的32B基线

Morris Lee

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI、cs.CL

AI总结 该研究针对LLM分析智能体的评估缺陷,提出WarehouseReliabilityBench基准,开发规则门控的7B智能体QueryProof,其业务真值率优于直接提示的32B基线,且成本显著降低,假成功比例大幅下降。

Comments 20 pages, 7 figures, 11 tables. Benchmark, code, run records, pre-registration and one-command reproduction: https://github.com/k-w-lee/query_proof

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07639 2026-08-11 cs.LG cs.AI 新提交 81%

SkillConsist: Detecting Inconsistencies in Agent Skills via Bidirectional Graph Alignment

SkillConsist:通过双向图对齐检测智能体技能中的不一致性

Chaofan Meng, Yuhang Zheng, Yingnan Zhou, Sihan Xu

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI、cs.LG

AI总结 SkillConsist针对智能体技能不一致检测的挑战,通过双向图对齐等技术构建基准并取得优于基线的检测性能,提升了技能一致性检测效果。

Comments 11 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21597 2026-08-11 cs.SE cs.CL cs.IR 版本更新 81%

ATLAS: Agentic Taxonomy of Large-Scale Software Ecosystems

ATLAS: 大规模软件生态系统的智能体分类体系

Junyi Lu, Mengyao Lyu, Jiahui Wu, Lei Yu, Chengwei Liu, Fengjun Zhang, Li Yang, Chun Zuo, Yang Liu

机构 * Institute of Software, Chinese Academy of Sciences(中国科学院软件研究所) University of Chinese Academy of Sciences(中国科学院大学) Nanyang Technological University(南洋理工大学) Nankai University(南开大学) Sinosoft Company Limited(中软国际有限公司)

专题命中 Agent评测 :agentic(title);agent(abstract);分类 cs.CL、cs.SE

AI总结 提出ATLAS框架,结合LLM全局知识与实际仓库分布,通过智能体协作和自修正循环自动构建软件仓库的层次化分类体系,在54,387个GitHub仓库上评估,分类质量F1达83.13%,优于基线15个百分点。

Comments Accepted at the 41st IEEE/ACM International Conference on Automated Software Engineering (ASE 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08852 2026-08-11 cs.AI cs.CY cs.HC cs.MA 新提交 79%

Findings of the First Teaching Monster Challenge: A Benchmark of Pedagogical Content Knowledge in AI Agents

首届“教学怪兽挑战赛”的研究发现:AI智能体的教学内容知识基准

Yi-Cheng Lin, Yu-Kai Guo, Szu-Chi Chen, Bo-Han Feng, Yun-Man Hsu, Hsiang Hsieh, Yu-Jung Lin, Yue-Ling Wu, Jia-Kai Dong, An-Yu Cheng, Yu-Han Huang, Lok-Lam Ieong, Kuan-Yu Chen, Ming-Douo Tchouang, Shao-Hua Sun, Che Lin, Jian-Jiun Ding, Hung-yi Lee

专题命中 Agent评测 :AI agent(title,abstract);分类 cs.AI

AI总结 研究推出首个以学习者角色为评估标准的教学视频生成基准“教学怪兽挑战赛”,测试发现当前AI教学系统内容适配能力不足,自动裁判存在局限,发布相关资源供后续研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08468 2026-08-11 cs.CR cs.AI 新提交 79%

SkillsMetric: Mapping the Detection Boundary of Static Analysis for Malicious Agent Skills

SkillsMetric:映射恶意智能体技能静态分析的检测边界

Xinze Chen, Chi Zhang, Ping Ji, Yimin Liu

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI

AI总结 本研究提出五阶段静态分析框架SkillsMetric,构建含2266个技能的对抗性数据集,发现静态分析对部分攻击检测不足,需结合静态预筛选与语义审查的纵深防御架构。

Comments 6 pages, 3 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07899 2026-08-11 cs.AI 新提交 79%

TelemetrySuffBench: Is Agent Telemetry Sufficient for Failure-Origin Diagnosis?

TelemetrySuffBench:智能体遥测是否足以用于故障起源诊断?

Yuxuan Zhu, Peng Pu

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI

AI总结 该研究推出TelemetrySuffBench基准,评估五个前沿语言模型的故障起源诊断能力,发现检测与定位存在差距,安全弃权(不执行)具强模型依赖性,需决策-来源链接与弃权保障。

Comments 10 pages, 3 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09282 2026-08-11 cs.AI cs.CL 新提交 79%

ComboShoppingBench: Evaluating LLM Agents for Budget-Constrained Basket Shopping with Coupons

ComboShoppingBench:评估大型语言模型智能体在带优惠券的预算约束组合购物篮任务中的表现

Adrian Li, Kelong Mao, Yudong Guo, Heming Xia, Xinwei Yang, Lirui Luo, Jace Wong, Pu Yao, Sulong Xu, Simiu Gu

专题命中 Agent评测 :agent(abstract);planning(abstract);agentic(abstract);分类 cs.AI、cs.CL

AI总结 本研究推出ComboShoppingBench组合购物基准,通过探索智能体、LLM评判者及确定性验证,发现各类LLM智能体在该基准上表现不佳,凸显其在约束感知组合购物上仍有巨大改进空间。

详情

展开后加载摘要…

URL PDF HTML 收藏