arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

共收录 15819 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. Agent评测 15819 篇

2509.07013 2026-04-03 cs.LG q-bio.PE stat.ME 79%

Generalized Machine Learning for Fast Calibration of Agent-Based Epidemic Models

通用机器学习用于快速校准基于代理的流行病模型

Sima Najafzadehkhoei, George Vega Yon, Derek S. Meyer, Bernardo Modenesi

专题命中 Agent评测 :agent(title,abstract);分类 cs.LG

AI总结 本文提出DeepIMC框架,利用BiLSTM神经网络快速校准基于代理的流行病模型,提升参数估计精度并大幅降低计算时间。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01235 2026-04-03 cs.AI 79%

Runtime Burden Allocation for Structured LLM Routing in Agentic Expert Systems: A Full-Factorial Cross-Backend Methodology

结构化大语言模型路由在代理专家系统中的运行时负担分配:一种全因子跨后端方法论

Zhou Hanlin, Chan Huah Yong

机构 * School of Computer Sciences, Universiti Sains Malaysia (USM)(马来西亚理科大学计算机科学学院) Xiamen Software Vocational & Technical College(厦门软件职业技术学院)

专题命中 Agent评测 :agentic(title,abstract);分类 cs.AI

AI总结 本文探讨了结构化LLM路由在代理专家系统中的负担分配问题,提出了一种全因子跨后端方法论,通过全面评估不同后端配置下的性能,揭示了后端特定交互效应对性能的主导作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00284 2026-04-02 cs.AI cs.MA 79%

Improvisational Games as a Benchmark for Social Intelligence of AI Agents: The Case of Connections

即兴游戏作为AI代理社交智能的基准测试:以Connections为例

Gaurav Rajesh Parikh, Angikar Ghosal

机构 * Duke University(杜克大学) Stanford University(斯坦福大学)

专题命中 Agent评测 :AI agent(title,abstract);分类 cs.AI

AI总结 本文通过即兴词游戏Connections探讨AI代理的推理能力,提出该游戏作为测试社交智能的基准,涵盖知识检索、总结及认知状态意识等核心能力。

Comments https://wordplay-workshop.github.io/wordplay2024/pdfs/16.pdf

Journal ref https://wordplay-workshop.github.io/wordplay2024/pdfs/16.pdf

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29318 2026-04-01 cs.AI 79%

PSPA-Bench: A Personalized Benchmark for Smartphone GUI Agent

PSPA-Bench:面向智能手机GUI代理的个性化基准

Hongyi Nie, Xunyuan Liu, Yudong Bai, Yaqing Wang, Yang Liu, Quanming Yao, Zhen Wang

机构 * Northwestern Polytechnical University(西北工业大学) Tsinghua University(清华大学) Peking University(北京大学) Beijing Institute of Mathematical Sciences and Applications(北京数学科学与应用研究院)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI

AI总结 本文提出PSPA-Bench,用于评估智能手机GUI代理的个性化能力,通过12855条个性化指令和22款移动应用,揭示现有方法在个性化场景下的不足,并提出改进方向。

Comments 28 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28815 2026-04-01 cs.CR cs.AI 79%

SkillTester: Benchmarking Utility and Security of Agent Skills

SkillTester:智能体技能的评估与安全性的基准测试

Leye Wang, Zixing Wang, Anjie Xu

机构 * Key Laboratory of High Confidence Software Technologies, Ministry of Education, Peking University(高可信软件技术教育部重点实验室(北京大学)) Northwestern Polytechnical University(西北工业大学)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI

AI总结 SkillTester通过对比原则和用户友好原则,评估智能体技能的实用性和安全性,提供标准化评分和安全状态标签,旨在提升智能体技能的质量保障。

Comments Technical report, 13 pages, 2 figures, 9 tables. Project page: https://skilltester.ai. Code: https://github.com/skilltester-ai/skilltester

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25068 2026-03-27 cs.MA cs.LG 79%

Ultra-fast Traffic Nowcasting and Control via Differentiable Agent-based Simulation

通过可微代理模拟实现超快交通现在预测与控制

Fumiyasu Makinoshima, Yuya Yamaguchi, Eigo Segawa, Koichiro Niinuma, Sean Qian

机构 * Fujitsu Limited(富士通株式会社) Fujitsu Research of America(富士通美国研究院) Carnegie Mellon University(卡内基梅隆大学)

专题命中 Agent评测 :agent(title,abstract);分类 cs.LG

AI总结 本文提出一种可微代理交通模拟器,实现大规模网络的超快模型校准、交通现在预测与控制,通过可微计算技术提升效率,实现30分钟数据校准、1小时预测和728秒控制,构建完整的校准-预测-控制闭环。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22853 2026-03-25 cs.CR cs.AI 79%

Agent Audit: A Security Analysis System for LLM Agent Applications

代理审计:用于大语言模型代理应用的安全分析系统

Haiyue Zhang, Yi Nian, Yue Zhao

机构 * University of Southern California(南加州大学)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI

AI总结 本文提出Agent Audit系统,用于检测LLM代理应用中的安全漏洞,通过数据流分析、凭证检测等方法,提高召回率并保持快速扫描速度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00415 2026-03-25 cs.AI 79%

Towards Self-Evolving Benchmarks: Synthesizing Agent Trajectories via Test-Time Exploration under Validate-by-Reproduce Paradigm

迈向自演化基准:通过验证-再生产范式下的测试时间探索合成代理轨迹

Dadi Guo, Tianyi Zhou, Dongrui Liu, Chen Qian, Qihan Ren, Shuai Shao, Zhiyuan Fan, Yi R. Fung, Kun Wang, Linfeng Zhang, Jing Shao

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Hong Kong University of Science and Technology(香港科技大学) University of Michigan(密歇根大学) Renmin University of China(中国人民大学) Shanghai Jiao Tong University(上海交通大学) Nanyang Technological University(南洋理工大学)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI

AI总结 本文提出TRACE框架,通过测试时间探索使代理在原有任务基础上自演化更复杂的任务,提升基准的动态性和可靠性,适应并改进了AIME-2024等推理数据集。

Comments This is a work in progress due to methodology refinement and further evaluation

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20470 2026-03-24 cs.AI 79%

DiffGraph: An Automated Agent-driven Model Merging Framework for In-the-Wild Text-to-Image Generation

DiffGraph: 一种自动化代理驱动的模型融合框架用于真实场景的文本到图像生成

Zhuoling Li, Hossein Rahmani, Jiarui Zhang, Yu Xue, Majid Mirmehdi, Jason Kuen, Jiuxiang Gu, Jun Liu

机构 * Lancaster University(兰卡斯特大学) University of Bristol(布里斯托大学) Adobe Research(Adobe研究院)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI

AI总结 DiffGraph通过自动化整合在线专家资源,灵活融合不同模型以满足多样化的真实用户需求,提升了文本到图像生成的效能。

Comments CVPR

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.01536 2026-03-20 cs.AI 79%

Algebras of actions in an agent's representations of the world

动作代数在代理对世界的表示中的代数

Alexander Dean, Eduardo Alonso, Esther Mondragon

机构 * Artificial Intelligence Research Centre (CitAI), Department of Computer Science, City St George's, University of London(人工智能研究与应用中心(CitAI)、计算机科学系、圣乔治学院、伦敦大学)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI

AI总结 本文提出从代理视角提取世界变换代数的框架,通过计算方法提取简单强化学习场景中的变换代数并分类,推广SBDRL的等变条件和解缠定义到任意代数的变换属性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15903 2026-03-18 cs.CL 79%

Agent-based imitation dynamics can yield efficiently compressed population-level vocabularies

基于代理的模仿动力学可以产生高效压缩的群体层面词汇

Nathaniel Imel, Richard Futrell, Michael Franke, Noga Zaslavsky

机构 * Department of Psychology, New York University(纽约大学心理学系) Department of Language Science, University of California, Irvine(加州大学欧文分校语言科学系) Department of Linguistics, University of Tübingen(图宾根大学语言学系)

专题命中 Agent评测 :agent(title,abstract);分类 cs.CL

AI总结 本文探讨了基于代理的模仿动力学如何在信号游戏中实现词汇的高效压缩,结合进化博弈论与信息瓶颈框架,揭示了词汇优化的机制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15798 2026-03-18 cs.AI 79%

CUBE: A Standard for Unifying Agent Benchmarks

CUBE:统一智能体基准的标准化

Alexandre Lacoste, Nicolas Gontier, Oleh Shliazhko, Aman Jaiswal, Kusha Sareen, Shailesh Nanisetty, Joan Cabezas, Manuel Del Verme, Omar G. Younis, Simone Baratta, Matteo Avalle, Imene Kerboua, Xing Han Lù, Elron Bandel, Michal Shmueli-Scheuer, Asaf Yehudai, Leshem Choshen, Jonathan Lebensold, Sean Hughes, Massimo Caccia, Alexandre Drouin, Siva Reddy, Tao Yu, Yu Su, Graham Neubig, Dawn Song

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI

AI总结 本文提出CUBE标准,通过MCP和Gym构建统一协议,实现智能体基准的标准化,减少碎片化,提升研究效率。

Comments Position paper. 10 pages. Reference implementation: https://github.com/The-AI-Alliance/cube-standard

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15714 2026-03-18 cs.CR cs.AI 79%

How Vulnerable Are AI Agents to Indirect Prompt Injections? Insights from a Large-Scale Public Competition

AI代理对间接提示注入攻击的易受攻击性有多大?来自大规模公开竞赛的见解

Mateusz Dziemian, Maxwell Lin, Xiaohan Fu, Micha Nowak, Nick Winter, Eliot Jones, Andy Zou, Lama Ahmad, Kamalika Chaudhuri, Sahana Chennabasappa, Xander Davies, Lauren Deason, Benjamin L. Edelman, Tanner Emek, Ivan Evtimov, Jim Gust, Maia Hamin, Kat He, Klaudia Krawiecka, Riccardo Patana, Neil Perry, Troy Peterson, Xiangyu Qi, Javier Rando, Zifan Wang, Zihan Wang, Spencer Whitman, Eric Winsor, Arman Zharmagambetov, Matt Fredrikson, Zico Kolter

机构 * Gray Swan AI OpenAI Meta Anthropic US CAISI(美国CAISI) UK AISI(英国AISI) Carnegie Mellon University(卡内基梅隆大学) Center for AI Safety(人工智能安全中心)

专题命中 Agent评测 :AI agent(title);agent(abstract);分类 cs.AI

AI总结 本文通过大规模公开竞赛评估了AI代理在工具调用、编程和计算机使用中的双重目标,发现所有模型均易受间接提示注入攻击,攻击成功率从0.5%到8.5%不等,并揭示了指令遵循架构的根本性弱点。

Comments 38 pages, 16 figures. Newer version to cover Q1 competition results on latest models in progress. Code at https://github.com/grayswansecurity/ipi_arena_os Partial Dataset at https://huggingface.co/datasets/sureheremarv/ipi_arena_attacks

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15457 2026-03-17 cs.CR cs.AI 79%

Evasive Intelligence: Lessons from Malware Analysis for Evaluating AI Agents

逃避式智能:从恶意软件分析中汲取的AI评估教训

Simone Aonzo, Merve Sahin, Aurélien Francillon, Daniele Perito

机构 * Eurecom SAP Labs(SAP实验室) Depthfirst

专题命中 Agent评测 :AI agent(title,abstract);分类 cs.AI

AI总结 本文探讨了AI代理评估中因适应性行为导致的安全性误判问题,借鉴恶意软件沙盒逃避的研究,提出评估原则以应对潜在的对抗性环境。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13424 2026-03-17 cs.CR cs.AI 79%

Agent Privilege Separation in OpenClaw: A Structural Defense Against Prompt Injection

OpenClaw中代理特权分离:一种对抗提示注入的结构性防御

Darren Cheng, Wen-Kwang Tsao

机构 * TrendAI Lab(TrendAI实验室)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI

AI总结 本文提出通过代理隔离和JSON格式化相结合的结构化防御机制,有效阻止提示注入攻击,在OpenClaw平台上实现零攻击成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11834 2026-03-13 cs.MA cs.AI cs.GT 79%

Hybrid Human-Agent Social Dilemmas in Energy Markets

混合人类-智能体社会困境在能源市场中的应用

Isuri Perera, Frits de Nijs, Julian Garcia

机构 * Department of Data Science and AI, Faculty of Information Technology(数据科学与人工智能系,信息科技学院)

专题命中 Agent评测 :agent(title);autonomous agent(abstract);分类 cs.AI

AI总结 本文研究了在能源市场中人类与智能体的混合群体中合作行为的产生,通过引入智能体和实验展示协调机制,探讨部分采用对整体结果的影响及战略部署中的挑战。

Comments 20 pages, 7 figures. Submitted to Proceedings of the Royal Society A, Special Issue on "The evolution of sociality in hybrid human AI populations"

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01213 2026-03-13 cs.MA cs.LG 79%

Can AI Agents Agree?

AI代理能否达成一致?

Frédéric Berdoz, Leonardo Rugli, Roger Wattenhofer

专题命中 Agent评测 :AI agent(title);agent(abstract);分类 cs.LG

AI总结 研究发现,基于LLM的代理在无质押设置中难以可靠达成一致,群体规模增大和拜占庭代理的存在显著降低共识成功率,活锁问题主导了失败原因。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.11997 2026-03-12 cs.CL 79%

SAGE: A Top-Down Bottom-Up Knowledge-Grounded User Simulator for Multi-turn AGent Evaluation

SAGE: 一种面向多轮智能体评估的上下文知识引导用户模拟器

Ryan Shea, Yunan Lu, Liang Qiu, Zhou Yu

专题命中 Agent评测 :agent(title,abstract);分类 cs.CL

AI总结 SAGE通过整合业务上下文知识,提出一种多轮智能体评估的用户模拟框架,生成更真实的交互并提高错误检测能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.09021 2026-03-10 cs.LG 79%

A Champion-level Vision-based Reinforcement Learning Agent for Competitive Racing in Gran Turismo 7

一款冠军级基于视觉的强化学习代理用于Gran Turismo 7中的竞争赛车

Hojoon Lee, Takuma Seno, Jun Jet Tai, Kaushik Subramanian, Kenta Kawamoto, Peter Stone, Peter R. Wurman

机构 * KAIST(韩国科学技术院) Sony AI(索尼人工智能) Coventry University(科文特大学) University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 Agent评测 :agent(title,abstract);分类 cs.LG

AI总结 本文提出了一种基于视觉的自主赛车代理,通过仅使用车载传感器数据和摄像头视角,在Gran Turismo 7中实现了冠军级的赛车性能。

Comments Accepted for Publication at the IEEE Robotics and Automation Letters (RA-L) 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10534 2026-03-06 cs.AI 79%

Achieving Olympia-Level Geometry Large Language Model Agent via Complexity Boosting Reinforcement Learning

通过复杂度提升强化学习实现奥lympia级几何大语言模型代理

Haiteng Zhao, Junhao Shen, Yiming Zhang, Songyang Gao, Kuikun Liu, Tianyou Ma, Fan Zheng, Dahua Lin, Wenwei Zhang, Kai Chen

机构 * Shanghai AI Laboratory(上海人工智能实验室) Shanghai Jiao Tong University(上海交通大学) Peking University(北京大学) ICMAT Spanish National Research Council(西班牙国家研究委员会ICMAT) The Chinese University of Hong Kong(香港中文大学)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI

AI总结 InternGeometry通过复杂度提升强化学习实现几何问题求解,仅用13K训练示例解决44个IMO问题,超越平均金牌得主得分。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03761 2026-03-05 cs.AI cs.IR 79%

AgentSelect: Benchmark for Narrative Query-to-Agent Recommendation

AgentSelect: 用于叙述查询到代理推荐的基准测试

Yunxiao Shi, Wujiang Xu, Tingwei Chen, Haoning Shang, Ling Yang, Yunfeng Wan, Zhuo Cao, Xing Zi, Dimitris N. Metaxas, Min Xu

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI

AI总结 AgentSelect是一个用于叙述查询到代理推荐的基准测试,通过统一的数据和评估基础设施,填补了代理推荐领域的研究空白,展示了基于能力匹配的代理推荐方法。

Comments under review by conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02176 2026-03-03 cs.CL 79%

Organizing, Orchestrating, and Benchmarking Agent Skills at Ecosystem Scale

在生态系统层面组织、协调和基准测试代理技能

Hao Li, Chunjiang Mu, Jianhao Chen, Siyue Ren, Zhiyao Cui, Yiqun Zhang, Lei Bai, Shuyue Hu

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 Agent评测 :agent(title,abstract);分类 cs.CL

AI总结 本文提出AgentSkillOS框架,通过树状检索和DAG协调提升大规模技能生态系统的管理和任务解决能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.06361 2026-03-03 q-fin.TR cs.CL 79%

Large Language Model Agent in Financial Trading: A Survey

金融交易中的大语言模型代理:综述

Han Ding, Yinheng Li, Junhao Wang, Hang Chen, Doudou Guo, Yunbai Zhang

机构 * Columbia University(哥伦比亚大学) New York University(纽约大学)

专题命中 Agent评测 :agent(title,abstract);分类 cs.CL

AI总结 本文综述了利用大语言模型作为代理进行金融交易的研究,探讨了代理架构、数据输入、回测表现及面临的挑战,并展望了未来研究方向。

Journal ref International Conference on Computers in Management and Business 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01024 2026-03-03 cs.HC cs.AI cs.MA 79%

SimAB: Simulating A/B Tests with Persona-Conditioned AI Agents for Rapid Design Evaluation

SimAB:基于人格条件化AI代理的A/B测试模拟用于快速设计评估

Tim Rieder, Marian Schneider, Mario Truss, Vitaly Tsaplin, Alina Rublea, Sinem Dere, Francisco Chicharro Sanz, Tobias Reiss, Mustafa Doga Dogan

机构 * ETH Zurich(苏黎世联邦理工学院) Adobe(Adobe公司) Adobe Research(Adobe研究)

专题命中 Agent评测 :AI agent(title,abstract);分类 cs.AI

AI总结 SimAB通过人格条件化AI代理模拟A/B测试,实现快速设计评估,准确率达67%,在高置信度案例中提升至83%。

Comments 18 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00285 2026-03-03 cs.AI 79%

TraderBench: How Robust Are AI Agents in Adversarial Capital Markets?

TraderBench: AI代理在对抗性资本市场中的鲁棒性如何?

Xiaochuang Yuan, Hui Xu, Silvia Xu, Cui Zou, Jing Xiong

机构 * Amazon.com Inc.(亚马逊公司) Stony Brook University(石溪大学) Stanford University(斯坦福大学) University of Oklahoma(俄克拉荷马大学) UC Santa Cruz(加州大学圣克鲁兹分校)

专题命中 Agent评测 :AI agent(title,abstract);分类 cs.AI

AI总结 TraderBench通过结合静态任务与对抗性交易模拟,评估AI代理在动态市场中的鲁棒性,发现现有模型在加密交易中表现稳定但缺乏真实适应性。

Comments Equal Contribution: Xiaochuang Yuan and Hui Xu contributed equally to this work. All correspondence should be directed to yxc20098@gmail.com. Submitted to Agents in the Wild Workshop, ICLR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15909 2026-03-02 eess.AS cs.AI cs.DB cs.HC cs.MA cs.SD 79%

Resp-Agent: An Agent-Based System for Multimodal Respiratory Sound Generation and Disease Diagnosis

Resp-Agent:一种基于代理的多模态呼吸声生成与疾病诊断系统

Pengfei Zhang, Tianxin Xie, Minghao Yang, Li Liu

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港理工大学(广州))

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI

AI总结 Resp-Agent是一种基于代理的多模态系统,通过主动对抗课程代理和模态编织器提升呼吸声生成与疾病诊断的鲁棒性。

Comments 24 pages, 3 figures. Published as a conference paper at ICLR 2026

Journal ref The Fourteenth International Conference on Learning Representations (ICLR 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20156 2026-02-26 cs.CR cs.LG 79%

Skill-Inject: Measuring Agent Vulnerability to Skill File Attacks

Skill-Inject: 评估代理对技能文件攻击的脆弱性

David Schmotz, Luca Beurer-Kellner, Sahar Abdelnabi, Maksym Andriushchenko

机构 * Max Planck Institute for Intelligent Systems, ELLIS Institute Tübingen, Tübingen AI Center(马克斯·普朗克智能系统研究所、图宾根ELLIS研究所、图宾根人工智能中心)

专题命中 Agent评测 :agent(title,abstract);分类 cs.LG

AI总结 SkillInject通过评估代理对技能文件攻击的脆弱性,揭示了当前LLM代理在安全性和合规性方面的严重问题,指出需采用上下文感知的授权框架来提升安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21127 2026-02-25 cs.HC cs.AI cs.CR cs.SI 79%

"Are You Sure?": An Empirical Study of Human Perception Vulnerability in LLM-Driven Agentic Systems

你确定吗?:一项关于LLM驱动代理系统中人类感知脆弱性的实证研究

Xinfeng Li, Shenyu Dai, Kelong Zheng, Yue Xiao, Gelei Deng, Wei Dong, Xiaofeng Wang

机构 * Nanyang Technological University(南洋理工大学) KTH(皇家理工学院) William & Mary(威廉与玛丽学院)

专题命中 Agent评测 :agentic(title);agent(abstract);分类 cs.AI

AI总结 研究通过实证分析揭示人类对LLM驱动代理系统中代理介导欺骗的脆弱性,并提出基于HAT-Lab的防御策略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21825 2026-02-25 cs.AI 79%

DS-STAR: Data Science Agent for Solving Diverse Tasks across Heterogeneous Formats and Open-Ended Queries

DS-STAR:跨异构格式和开放性查询的多样化任务数据科学代理

Jaehyun Nam, Jinsung Yoon, Jiefeng Chen, Raj Sinha, Jinwoo Shin, Tomas Pfister

机构 * Google Cloud(谷歌云) KAIST(韩国科学技术院)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI

AI总结 DS-STAR是一种专门设计用于跨异构数据格式和开放性查询的代理,能生成高质量研究报告并超越传统问答能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17017 2026-02-20 cs.AI 79%

Sales Research Agent and Sales Research Bench

销售研究代理与销售研究基准

Deepanjan Bhol

机构 * Microsoft(微软)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI

AI总结 本文提出销售研究代理和基准,通过实时CRM数据提供高质量决策洞察,并在测试中超越其他AI系统。

Comments Technical report. 2 figures. Microsoft Dynamics 365 Sales

详情

展开后加载摘要…

URL PDF HTML 收藏