arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

共收录 15866 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. Agent评测 15866 篇

2604.08805 2026-04-13 cs.CR cs.AI 57%

Building Better Environments for Autonomous Cyber Defence

构建更好的自主网络防御环境

Chris Hicks, Elizabeth Bates, Shae McFadden, Isaac Symes Thompson, Myles Foley, Ed Chapman, Nickolas Espinosa Dice, Ankita Samaddar, Joshua Sylvester, Himanshu Neema, Nicholas Butts, Nate Foster, Ahmad Ridley, Zoe M, Paul Jones

机构 * The Alan Turing Institute(艾伦·图灵研究所) University College London(伦敦大学学院) Cornell University(康奈尔大学) Vanderbilt University(范德比尔特大学) Microsoft(微软) NSA(美国国家安全局)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 本文通过工作坊总结,提出构建更有效的强化学习环境框架和最佳实践指南,以提升自主网络防御系统的训练与评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08788 2026-04-13 cs.CL 57%

MedConceal: A Benchmark for Clinical Hidden-Concern Reasoning Under Partial Observability

MedConceal:一个用于在部分可观测性下进行临床隐藏关切推理的基准

Yikun Han, Joey Chan, Jingyuan Chen, Mengting Ai, Simo Du, Yue Guo

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) NYC Health + Hospitals/Jacobi(纽约市健康与医院管理局/雅可比医疗中心)

专题命中 Agent评测 :agent(abstract);分类 cs.CL

AI总结 MedConceal通过交互式患者模拟器评估医疗对话中的隐藏关切推理,包含300个案例和600个医生-LLM交互,研究确认和干预能力,发现前沿模型在确认指标上表现优异,而人类医生在干预成功率上表现最佳。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04292 2026-04-13 cs.CL 57%

SQuARE: Structured Query & Adaptive Retrieval Engine For Tabular Formats

SQuARE:结构化查询与自适应检索引擎用于表格格式

Chinmay Gondhalekar, Urjitkumar Patel, Fang-Chun Yeh

专题命中 Agent评测 :agent(abstract);分类 cs.CL

AI总结 SQuARE通过结构化查询和自适应检索引擎解决表格中多行标题、合并单元格等问题,提升表格问答精度与鲁棒性。

Comments Accepted in The IEEE International Workshop on Large Language Models in Finance, Dec 8-11, Macau, China, 2025, Preprint Copy

Journal ref 2025 IEEE International Conference on Big Data (BigData), Macau, China

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.07514 2026-04-13 cs.CV cs.AI 57%

Mitigating Domain Drift in Multi Species Segmentation with DINOv2: A Cross-Domain Evaluation in Herbicide Research Trials

通过DINOv2缓解多物种分割中的领域漂移:在除草剂研究试验中的跨领域评估

Artzai Picon, Itziar Eguskiza, Daniel Mugica, Javier Romero, Carlos Javier Jimenez, Eric White, Gabriel Do-Lago-Junqueira, Christian Klukas, Ramon Navarra-Mestre

机构 * TECNALIA, Basque Research and Technology Alliance (BRTA)(TECNALIA,巴斯克研究与技术联盟(BRTA)) University of the Basque Country(巴斯克大学) BASF Corporation(巴斯夫公司)

专题命中 Agent评测 :workflow(abstract);分类 cs.AI

AI总结 本文提出利用DINOv2和层级分类推理提升多物种分割在农业环境中的鲁棒性,通过多地区、多设备和多传感器的实验验证了模型在领域漂移下的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07551 2026-04-10 cs.CR cs.AI 57%

MCP-DPT: A Defense-Placement Taxonomy and Coverage Analysis for Model Context Protocol Security

MCP-DPT:模型上下文协议安全的防御放置分类与覆盖分析

Mehrdad Rostamzadeh, Sidhant Narula, Nahom Birhan, Mohammad Ghasemigol, Daniel Takabi

机构 * Old Dominion University(老道明大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 本文提出MCP-DPT框架,分析模型上下文协议的安全性,识别防御点并揭示架构不匹配导致的安全漏洞。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07423 2026-04-10 cs.RO cs.LG 57%

OpenPRC: A Unified Open-Source Framework for Physics-to-Task Evaluation in Physical Reservoir Computing

OpenPRC: 一个用于物理共振计算中任务评估的统一开源框架

Yogesh Phalak, Wen Sin Lor, Apoorva Khairnar, Benjamin Jantzen, Noel Naughton, Suyi Li

机构 * Virginia Tech(弗吉尼亚理工大学) Department of Mechanical Engineering, Virginia Tech(弗吉尼亚理工大学机械工程系) Department of Philosophy, Virginia Tech(弗吉尼亚理工大学哲学系) Department of Computer Science, Virginia Tech(弗吉尼亚理工大学计算机科学系)

专题命中 Agent评测 :workflow(abstract);分类 cs.LG

AI总结 OpenPRC通过统一的数据接口整合高保真模拟轨迹和实验测量,提供可重复的评估、分析和物理感知优化,支持多种物理子系统和数据源。

Comments 23 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22683 2026-04-10 cs.CV cs.AI 57%

SUPERGLASSES: Benchmarking Vision Language Models as Intelligent Agents for AI Smart Glasses

SUPERGLASSES:基于智能眼镜的视觉语言模型智能体基准测试

Zhuohang Jiang, Xu Yuan, Haohao Qu, Shanru Lin, Kanglong Liu, Wenqi Fan, Qing Li

机构 * The Hong Kong Polytechnic University(香港理工大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 本文提出SUPERGLASSES基准,通过真实世界数据评估智能眼镜的多模态交互能力,提出SUPERLENS模型在VQA任务中超越GPT-4o,揭示了任务特定解决方案的重要性。

Journal ref 2026 IEEE/CVF Conference on Computer Vision and Pattern Recognition- FINDINGS Track (CVPRF)

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.15512 2026-04-10 cs.LG 57%

SALSA-RL: Stability Analysis in the Latent Space of Actions for Reinforcement Learning

SALSA-RL:强化学习中动作潜空间的稳定性分析

Xuyang Li, Romit Maulik

机构 * Pennsylvania State University(宾夕法尼亚州立大学)

专题命中 Agent评测 :agent(abstract);分类 cs.LG

AI总结 SALSA-RL通过动作潜空间的局部稳定性分析,为强化学习提供可解释性,使在不损害性能的前提下评估预训练智能体的动作稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06227 2026-04-09 cs.LG econ.EM 57%

A Benchmark of Classical and Deep Learning Models for Agricultural Commodity Price Forecasting on A Novel Bangladeshi Market Price Dataset

一种农业商品价格预测的经典与深度学习模型基准测试:基于一个新颖的孟加拉国市场价格数据集

Tashreef Muhammad, Tahsin Ahmed, Meherun Farzana, Md. Mahmudul Hasan, Abrar Eyasir, Md. Emon Khan, Mahafuzul Islam Shawon, Ferdous Mondol, Mahmudul Hasan, Muhammad Ibrahim

机构 * Southeast University, Dhaka, Bangladesh(东南大学(达卡)) University of Dhaka, Bangladesh(达卡大学)

专题命中 Agent评测 :planning(abstract);分类 cs.LG

AI总结 本文基于新颖的孟加拉国市场价格数据集,评估了七种预测方法,包括经典模型和深度学习架构,揭示了农业商品价格预测的异质性及不同模型的性能差异。

Comments 26 pages, 22 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05172 2026-04-09 cs.AI 57%

ClawsBench: Evaluating Capability and Safety of LLM Productivity Agents in Simulated Workspaces

ClawsBench: 评估LLM生产力代理在模拟工作区中的能力和安全性

Xiangyi Li, Kyoung Whan Choe, Yimin Liu, Xiaokun Chen, Chujun Tao, Bingran You, Wenbo Chen, Zonglin Di, Jiankai Sun, Shenghan Zheng, Jiajun Bao, Yuanli Wang, Weixiang Yan, Yiyuan Li, Han-chung Lee

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 ClawsBench通过高保真模拟服务和结构化任务评估LLM代理在真实生产力场景中的能力与安全性,揭示了代理在多服务协作和安全关键场景中的表现及潜在风险。

Comments 25 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.07176 2026-04-09 cs.NI cs.CL 57%

Graph Representation-based Model Poisoning on the Heterogeneous Internet of Agents

基于图表示的模型中毒攻击:异构物联网中的攻击

Hanlin Cai, Houtianfu Wang, Haofan Dong, Kai Li, Sai Zou, Ozgur B. Akan

机构 * Internet of Everything (IoE) Group, Department of Engineering, University of Cambridge(剑桥大学工程系万物互联组) CISTER Research Centre(CISTER研究中心) Guizhou University(贵州大学) Center for neXt-Generation Communications (CXC), Koç University(科奇大学下一代通信中心)

专题命中 Agent评测 :agent(abstract);分类 cs.CL

AI总结 本文提出一种基于图表示的模型中毒攻击,利用监听到的良性更新构建特征相关图,并利用变分图自编码器生成恶意更新,以降低不同LLM模型的准确性,逃避现有防御机制。

Comments This paper has been accepted by the IEEE 22nd International Wireless Communications & Mobile Computing Conference (IWCMC 2026, Shanghai, China)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05875 2026-04-08 cs.AI 57%

Joint Knowledge Base Completion and Question Answering by Combining Large Language Models and Small Language Models

通过结合大语言模型和小语言模型实现知识库补全与问答的联合处理

Yinan Liu, Dongying Lin, Sigang Luo, Xiaochun Yang, Bin Wang

机构 * School of Computer Science and Engineering, Northeastern University, Shenyang, China(东北大学计算机科学与工程学院,沈阳,中国) National Frontiers Science Center for Industrial Intelligence and Systems optimization, Northeastern University, Shenyang, China(东北大学工业智能与系统优化国家级前沿科学中心,沈阳,中国)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 本文提出JCQL框架,结合大语言模型与小语言模型,通过迭代增强知识库补全与问答任务,提升两者性能。

Comments 20 pages, 11 figures

Journal ref ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05775 2026-04-08 cs.CL q-bio.GN 57%

PhageBench: Can LLMs Understand Raw Bacteriophage Genomes?

PhageBench: LLMs能否理解原始噬菌体基因组?

Yusen Hou, Weicai Long, Haitao Hu, Houcheng Su, Junning Feng, Yanlin Zhang

机构 * Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

专题命中 Agent评测 :workflow(abstract);分类 cs.CL

AI总结 PhageBench通过模拟生物信息学专家流程,评估LLM对噬菌体基因组的理解能力,发现通用模型在噬菌体contig识别和宿主预测上表现优异,但在复杂推理任务中存在明显局限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05753 2026-04-08 cs.SE 57%

An End-to-End Approach for Fixing Concurrency Bugs via SHB-Based Context Extractor

一种基于SHB上下文提取器的端到端并发bug修复方法

Zhuang Li, Qiuping Yi, Keyang Xiao, Zongcheng Ji, Hongliang Liang

专题命中 Agent评测 :agent(abstract);分类 cs.SE

AI总结 本文提出ConFixAgent,一种基于LLM的端到端并发bug修复工具,通过静态发生前图识别相关代码段,提升修复准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04938 2026-04-08 cs.AI 57%

Operational Noncommutativity in Sequential Metacognitive Judgments

顺序元认知判断中的操作非交换性

Enso O. Torres Alegre, Diana E. Mora Jimenez

机构 * Pontifical Catholic University of Chile(智利天主教大学) University of Notre Dame(圣母大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 本文提出一个操作框架,区分元认知评估中的顺序依赖性与经典状态变化,通过引入反事实确定性和评估非侵入性假设,证明非交换性存在并提供三维旋转模型和实验范式。

Comments 15 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06565 2026-04-08 cs.CL 57%

EVM-QuestBench: An Execution-Grounded Benchmark for Natural-Language Transaction Code Generation

EVM-QuestBench: 一个基于执行的自然语言交易代码生成基准测试

Pei Yang, Wanyi Chen, Ke Wang, Lynn Ai, Eric Yang, Tianyu Shi

机构 * Gradient Soochow University(苏州大学)

专题命中 Agent评测 :workflow(abstract);分类 cs.CL

AI总结 本文提出EVM-QuestBench,一个基于执行的自然语言交易脚本生成基准测试,包含107个任务,通过动态评估和模块化架构评估20个模型,发现单步精度与多步流程完成存在显著差异。

Comments 10 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04246 2026-04-08 cs.AI 57%

Toward Virtuous Reinforcement Learning: A Critique and Roadmap

迈向道德强化学习:一种批评与路线图

Majid Ghasemi, Mark Crowley

机构 * University of Waterloo(滑铁卢大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 本文批评了强化学习中常见的伦理模式,提出以美德为中心的替代方法,强调规则导向方法和单一目标强化学习的局限性,并提出通过社会学习、多目标优化、正则化和伦理传统操作化来构建道德强化学习的框架。

Comments Accepted as a workshop paper at Machine Ethics: From Formal Methods to Emergent Machine Ethics workshop at the AAAI 2026 Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.06387 2026-04-08 cs.LG cs.GT econ.TH 57%

How Humans Help LLMs: Assessing and Incentivizing Human Preference Annotators

人类如何帮助大语言模型:评估和激励人类偏好标注者

Shang Liu, Hanzhao Wang, Zhongyao Ma, Xiaocheng Li

机构 * Imperial College Business School, Imperial College London(帝国理工学院商学院,帝国理工学院) University of Sydney Business School, University of Sydney(悉尼大学商学院,悉尼大学) Meta

专题命中 Agent评测 :agent(abstract);分类 cs.LG

AI总结 本文研究如何监控人类偏好标注者质量及激励机制,提出自一致性监控方案并分析样本复杂度,揭示标注样本数量与合同性能的关系。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04662 2026-04-07 cs.LG q-fin.MF q-fin.PR q-fin.ST 57%

Anticipatory Reinforcement Learning: From Generative Path-Laws to Distributional Value Functions

前瞻性强化学习:从生成路径法则到分布价值函数

Daniel Bloch

机构 * Quant Finance Ltd College of Engineering and Computer Science, VinUniversity(VinUniversity工程与计算机科学学院) University of Paris 6(巴黎第六大学) VinUniversity

专题命中 Agent评测 :agent(abstract);分类 cs.LG

AI总结 本文提出前瞻性强化学习(ARL),通过生成路径法则和分布价值函数,解决非马尔可夫决策过程与传统强化学习架构在单观测轨迹约束下的衔接问题,提升在高波动连续时间环境中的风险管理和策略稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04448 2026-04-07 cs.AI 57%

PSY-STEP: Structuring Therapeutic Targets and Action Sequences for Proactive Counseling Dialogue Systems

PSY-STEP:结构化治疗目标和行动序列用于前瞻性咨询对话系统

Jihyun Lee, Yejin Min, Yejin Jeon, SungJun Yang, Hyounghun Kim, Gary Geunbae Lee

机构 * Graduate School of Artificial Intelligence, POSTECH(浦项工业大学人工智能研究生院) Department of Computer Science and Engineering, POSTECH(浦项工业大学计算机科学与工程系) MILA McGill University(麦吉尔大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 本文提出PSY-STEP框架,通过结构化治疗目标和行动序列提升咨询对话系统的主动性和有效性,实验表明其在临床相关性、连贯性和个性化方面优于现有模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04171 2026-04-07 cs.AI 57%

A Model of Understanding in Deep Learning Systems

深度学习系统中的理解模型

David Peter Wallis Freeborn

机构 * Northeastern University London(伦敦东北大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 本文提出深度学习系统中系统性理解的模型,指出其虽能实现理解但缺乏科学理解的象征一致性、明确还原性和强统一性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.09228 2026-04-07 cs.CV cs.AI 57%

Clear Roads, Clear Vision: Advancements in Multi-Weather Restoration for Smart Transportation

清晰的道路,清晰的视野:智能交通中多天气恢复的进展

Vijay M. Galshetwar, Praful Hambarde, Prashant W. Patil, Akshay Dudhane, Sachin Chaudhary

机构 * Finolex Academy of Management and Technology(Finolex管理与技术学院) Drone Lab, Centre for Artificial Intelligence and Robotics, IIT Mandi(印度理工学院曼迪分校人工智能与机器人中心无人机实验室) Mehta Family School of Data Science and Artificial Intelligence, IIT Guwahati(印度理工学院古瓦哈提分校梅塔家族数据科学与人工智能学院) SPACE42 Centre of Excellence: Artificial Intelligence, School of Computer Science, UPES Dehradun(UPES德拉敦分校计算机科学学院人工智能卓越中心)

专题命中 Agent评测 :agentic(abstract);分类 cs.AI

AI总结 本文综述了图像和视频恢复技术,以缓解天气引起的视觉障碍,分类了传统方法和数据驱动模型,并讨论了多天气系统和未来方向。

Comments Accepted for publication in IEEE Transactions on Intelligent Transportation Systems (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04060 2026-04-07 cs.CR cs.AI 57%

CoopGuard: Stateful Cooperative Agents Safeguarding LLMs Against Evolving Multi-Round Attacks

CoopGuard:基于协作代理的有状态多轮防御框架用于抵御LLM的演变攻击

Siyuan Li, Zehao Liu, Xi Lin, Qinghua Mao, Yuliang Chen, Haoyu Li, Jun Wu, Jianhua Li, Xiu Su

机构 * School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学与工程学院) Department of Computer Science, University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校计算机科学系) Big Data Institute, Central South University(中南大学大数据研究院)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 本文提出CoopGuard,通过协作代理维护和更新内部防御状态,有效应对多轮演变攻击。实验显示其在攻击成功率、欺骗率和攻击效率上均优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03239 2026-04-07 cs.AI 57%

To Throw a Stone with Six Birds: On Agents and Agenthood

用六只鸟投掷石头:关于代理与代理性

Ioannis Tsiokos

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 本文基于六鸟理论探讨代理性,提出通过类型正确的方法区分代理与代理性,通过四个可检查组件验证代理性,结果展示了代理性与代理的分离测试。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05912 2026-04-07 cs.AI 57%

DeepFact: Co-Evolving Benchmarks and Agents for Deep Research Factuality

DeepFact: 深度研究事实性共演基准与智能体

Yukun Huang, Leonardo F. R. Ribeiro, Momchil Hardalov, Bhuwan Dhingra, Markus Dreyer, Venkatesh Saligrama

机构 * Duke University(杜克大学) Amazon AGI(亚马逊AGI) Boston University(波士顿大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 本文提出DeepFact-Bench基准和DeepFact-Eval智能体,通过审计-评分机制提升事实性验证的可靠性,并在深度研究报告中实现高准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02869 2026-04-06 cs.AI 57%

Multi-Turn Reinforcement Learning for Tool-Calling Agents with Iterative Reward Calibration

多轮强化学习用于工具调用代理的迭代奖励校准

Wachiravit Modecrua, Krittanon Kaewtawee, Krittin Pachtrachai, Touchapon Kraisingkorn

机构 * Amity Research and Application Center (ARAC)(Amity研究与应用中心(ARAC))

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 本文提出MT-GRPO与GTPO结合的方法,通过迭代奖励校准提升工具调用代理性能,在真实客服任务中取得显著改进。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02834 2026-04-06 cs.AI 57%

ESL-Bench: An Event-Driven Synthetic Longitudinal Benchmark for Health Agents

ESL-Bench: 一个基于事件的合成纵向基准用于健康代理

Chao Li, Cailiang Liu, Ang Gao, Kexin Deng, Shu Zhang, Langping Xu, Xiaotong Shi, Xionghao Ding, Jian Pei, Xun Jiang

机构 * Shanda Group(盛大集团)

专题命中 Agent评测 :planning(abstract);分类 cs.AI

AI总结 ESL-Bench通过合成100个用户数据,涵盖健康档案、多阶段叙事计划、日常设备测量、定期检查记录和事件日志,评估健康代理在多源轨迹推理中的性能,发现数据库代理在比较和解释任务中显著优于记忆增强RAG基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02804 2026-04-06 cs.CV cs.AI cs.MM 57%

PaveBench: A Versatile Benchmark for Pavement Distress Perception and Interactive Vision-Language Analysis

PaveBench: 一种多功能的路面病害感知及交互视觉-语言分析基准

Dexiang Li, Zhenning Che, Haijun Zhang, Dongliang Zhou, Zhao Zhang, Yahong Han

机构 * Harbin Institute of Technology(哈尔滨工业大学) Tianjin University(天津大学) Hefei University of Technology(合肥工业大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 PaveBench针对路面状况评估中的视觉识别与多模态交互需求,提供分类、检测、分割及视觉-语言问答等四项任务,支持多轮交互与事实推理,填补现有数据集在多模态分析与实际应用连接上的空白。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02666 2026-04-06 cs.AI math.OC 57%

Let's Have a Conversation: Designing and Evaluating LLM Agents for Interactive Optimization

让我们交谈:设计和评估用于交互优化的LLM代理

Joshua Drossman, Alexandre Jacquillat, Sébastien Martin

机构 * Operations Research Center and Sloan School of Management, Massachusetts Institute of Technology(麻省理工学院运筹学研究中心和斯隆管理学院) Kellogg School of Management, Northwestern University(西北大学凯洛格管理学院)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 本文提出了一种可扩展的评估方法,通过对话评估优化代理,展示交互优化代理在解决学校调度问题时能获得更高质量的解决方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02348 2026-04-06 cs.LG 57%

Contextual Intelligence The Next Leap for Reinforcement Learning

情境智能:强化学习的下一步

André Biedenkapp

机构 * Albert-Ludwigs-Universität(弗莱堡大学)

专题命中 Agent评测 :agent(abstract);分类 cs.LG

AI总结 本文提出情境智能的新框架,通过区分环境驱动和代理驱动因素,探索异构情境学习、多时间尺度建模和抽象高层情境整合,以提升强化学习的泛化能力与现实应用效率。

Comments Accepted to AAMAS 2025 (Blue Sky Ideas Track)

详情

展开后加载摘要…

URL PDF HTML 收藏