arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

共收录 15729 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. Agent评测 15729 篇

2502.14131 2026-06-05 cs.LG cs.AI econ.EM 62%

An Empirical Risk Minimization Approach for Offline Inverse RL and Dynamic Discrete Choice Model

一种用于离线逆强化学习和动态离散选择模型的经验风险最小化方法

Enoch H. Kang, Hema Yoganarasimhan, Lalit Jain

机构 * Foster School of Business, University of Washington(华盛顿大学福斯特商学院)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG

AI总结 本文提出了一种基于经验风险最小化(ERM)的逆强化学习/动态离散选择模型框架,该方法无需显式估计贝尔曼方程中的状态转移概率,适用于高维和无限状态空间,并在理论上有Polyak-Lojasiewicz条件的支持,从而保证了快速的全局收敛性。

详情

展开后加载摘要…

URL PDF HTML 收藏
1610.05202 2026-06-04 cs.LG cs.AI cs.DC cs.SY eess.SY stat.ML 62%

Decentralized Collaborative Learning of Personalized Models over Networks

网络上的去中心化协作学习个性化模型

Paul Vanhaesebrouck, Aurélien Bellet, Marc Tommasi

机构 * INRIA

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG

AI总结 本文研究了在协作对等网络中,如何通过与其他具有相似目标的代理通信来改进本地训练模型,提出两种异步 gossip 算法并基于 ADMM 实现去中心化算法。

Comments To appear in the Proceedings of the 20th International Conference on Artificial Intelligence and Statistics (AISTATS 2017)

详情

展开后加载摘要…

URL PDF HTML 收藏
1604.03912 2026-06-04 cs.AI cs.LG cs.SY eess.SY stat.ML 62%

Inverse Reinforcement Learning with Simultaneous Estimation of Rewards and Dynamics

逆强化学习与奖励和动态的同时估计

Michael Herman, Tobias Gindele, Jörg Wagner, Felix Schmitt, Wolfram Burgard

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG

AI总结 本文提出一种基于梯度的逆强化学习方法,同时估计系统动态和奖励函数,提升了样本效率和估计准确性。

Comments accepted to appear in AISTATS 2016

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02755 2026-06-03 cs.SE cs.AI 62%

Acceptance-Test-Driven Evaluation Protocols for Business-Centric LLM Systems

面向业务中心LLM系统的验收测试驱动评估协议

Eric Liang

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.SE

AI总结 针对LLM系统概率生成与确定性需求不匹配问题,提出基于验收测试驱动开发、安全工程和业务中心验证的评估协议,将利益相关者目标转化为可执行行为契约,并采用红-训练-绿生命周期确保多维门控通过后才发布。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02461 2026-06-03 cs.AI cs.CL 62%

AgentCL: Toward Rigorous Evaluation of Continual Learning in Language Agents

AGENTCL:面向语言代理持续学习的严格评估

Yiheng Shu, Bernal Jiménez Gutiérrez, Saisri Padmaja Jonnalagedda, Yuguang Yao, Huan Sun, Yu Su

机构 * The Ohio State University(俄亥俄州立大学) Johns Hopkins University(约翰霍普金斯大学) Intuit AI Research(Intuit AI研究)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL

AI总结 提出AGENTCL评估框架,通过可控任务流和迁移增益指标,严格评估语言代理的持续学习能力,并开发MemProbe探针方法诊断记忆设计的影响。

Comments 10 pages in the main text, 26 pages in total

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01472 2026-06-03 cs.DC cs.AI cs.LG 62%

Hierarchical Online Prompt Mutation with Dual-Loop Feedback for Guardrailed Evidence Document Generation: A Production-Evaluation Case Study

分层在线提示变异与双环反馈用于有护栏的证据文档生成:生产评估案例研究

Nataraj Agaram Sundar, Tejas Morabia

机构 * eBay Inc.(eBay公司)

专题命中 Agent评测 :workflow(abstract);分类 cs.AI、cs.LG

AI总结 提出分层在线提示变异框架HOPM,通过双环反馈(人工审核与自动评判)优化提示策略,在真实市场纠纷证据生成中显著提升胜率和质量。

Comments 7 pages. Production-evaluation case study of guardrailed LLM evidence-document generation

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08935 2026-06-03 cs.AI cs.LG 62%

PnP-Corrector: A Universal Correction Framework for Coupled Spatiotemporal Forecasting

PnP-Corrector:一种用于耦合时空预测的通用校正框架

Hao Wu, Fan Xu, Yuxu Lu, Penghao Zhao, Fan Zhang, Hao Jia, Yuxuan Liang, Ruijian Gou, Qingsong Wen, Xian Wu, Xiaomeng Huang, Yuan Gao

机构 * University of Science and Technology of China(中国科学技术大学) Tsinghua University(清华大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG

AI总结 针对耦合系统中误差相互放大导致长期预测崩溃的问题,提出一种即插即用的校正框架PnP-Corrector,通过冻结物理模拟引擎并训练校正代理来主动抵消系统偏差,显著提升长期预测的稳定性和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21731 2026-06-03 cs.CL cs.AI 62%

Identifying Quantum Structure in AI Language: Evidence for Evolutionary Convergence of Human and Artificial Cognition

识别AI语言中的量子结构:人类与人工智能认知进化趋同的证据

Diederik Aerts, Jonito Aerts Arguëlles, Lester Beltran, Suzette Geriente, Roberto Leporini, Massimiliano Sassoli de Bianchi, Sandro Sozzo

机构 * Center Leo Apostel for Interdisciplinary Studies, Vrije Universiteit Brussel (VUB)(利奥·阿波斯泰尔跨学科研究中心,布鲁塞尔自由大学) Department of Economics, University of Bergamo(博洛尼亚大学经济系) Department of Humanities and Cultural Heritage (DIUM) and Centre CQSCS, University of Udine(乌迪内大学人文与文化遗产系及CQSCS中心)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL

AI总结 通过对大型语言模型进行认知测试,发现其概念组合中存在贝尔不等式显著违背和玻色-爱因斯坦统计,表明人类与人工智能在概念-语言领域均涌现非经典量子结构,支持认知进化趋同假说。

Journal ref Entropy 28, 622, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.23216 2026-06-03 cs.AI cs.LG 62%

Human-Like Goalkeeping in a Realistic Football Simulation: a Sample-Efficient Reinforcement Learning Approach

逼真足球模拟中的人性化守门:一种样本高效的强化学习方法

Alessandro Sestini, Joakim Bergdahl, Jean-Philippe Barrette-LaPierre, Florian Fuchs, Brady Chen, Fabio Zinno, Michael Jones, Linus Gisslén

机构 * University of Edinburgh(爱丁堡大学) KTH Royal Institute of Technology(皇家理工学院) University of California, Berkeley(加州大学伯克利分校)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG

AI总结 提出一种样本高效的深度强化学习方法,通过利用预收集数据和增加网络可塑性,在EA SPORTS FC 25中训练出守门员智能体,其扑救率比内置AI高10%,训练速度比标准DRL快50%,且行为更接近人类。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02287 2026-06-02 cs.LG cs.AI 62%

CityTrajBench: A Unified Benchmark for City-Scale Vehicle Trajectory Generation

CityTrajBench: 城市尺度车辆轨迹生成的统一基准

Shibo Zhu, Xiaodan Shi, Dayin Chen, Yuntian Chen, Haoran Zhang, Tianhao Wu, Jinyue Yan

机构 * Department of Building Environment and Energy Engineering, The Hong Kong Polytechnic University, Hong Kong SAR, China(香港理工大学建筑环境与能源工程系) Eastern Institute for Advanced Study, Eastern Institute of Technology, Ningbo, China(宁波东部先进研究所) International Centre of Urban Energy Nexus, The Hong Kong Polytechnic University, Hong Kong SAR, China(香港理工大学城市能源 nexus 中心) Department of Computer and Systems Sciences, Stockholm University, Sweden(斯德哥尔摩大学计算机与系统科学系) Zhejiang Key Laboratory of Industrial Intelligence and Digital Twin, Eastern Institute of Technology, Ningbo, China(浙江工业智能与数字孪生重点实验室) Ningbo Institute of Digital Twin, Eastern Institute of Technology, Ningbo, China(宁波数字孪生研究所) LocationMind Inc., Tokyo 101-0042, Japan(LocationMind公司)

专题命中 Agent评测 :planning(abstract);分类 cs.AI、cs.LG

AI总结 为解决轨迹生成方法因数据集、预处理、表示和评估指标不一致导致的比较困难,提出CityTrajBench统一基准框架,标准化数据处理、模型适配与多级评估,并在三个真实数据集上对比统计、VAE、GAN、扩散和流匹配模型,揭示不同模型在全局真实性、轨迹几何保真度等指标上的权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.02122 2026-06-02 cs.LG cs.AI 62%

STABLEVAL: Disagreement-Aware and Stable Evaluation of AI Systems

STABLEVAL: 面向AI系统的分歧感知与稳定评估

Akash Bonagiri, Gerard Janno Anderias, Saee Patil, Angelina Lai, Devang Borkar, Gezheng Kang, Ishant Gandhi, Setareh Rafatirad, Houman Homayoun

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG

AI总结 针对多数投票法在标注者分歧下导致排名不稳定的问题,提出STABLEVAL框架,通过建模潜在正确性和标注者混淆模式,实现稳定且不确定性感知的系统评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00310 2026-06-02 cs.CV cs.AI cs.LG 62%

Beyond Visual Fidelity: Benchmarking Super-Resolution Models for Large-Scale Remote Sensing Imagery via Downstream Task Integration

超越视觉保真度:通过下游任务集成评估大规模遥感影像的超分辨率模型

Zhili Li, Kangyang Chai, Zhihao Wang, Xiaowei Jia, Yanhua Li, Gengchen Mai, Sergii Skakun, Dinesh Manocha, Yiqun Xie

机构 * University of Maryland(马里兰大学) University of Pittsburgh(匹兹堡大学) Worcester Polytechnic Institute(沃思利技术学院) University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 Agent评测 :planning(abstract);分类 cs.AI、cs.LG

AI总结 针对现有超分辨率评估依赖PSNR/SSIM等保真度指标而忽略下游任务效用的问题,提出GeoSR-Bench基准数据集,集成土地覆盖分割、基础设施映射等下游任务,评估GAN、Transformer等9种SR模型在270种设置下的性能,发现保真度指标与任务性能弱相关甚至负相关。

Comments Under review at IEEE TPAMI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.12624 2026-06-02 cs.LG cs.AI 62%

Learning-To-Measure: In-Context Active Feature Acquisition

学习测量:上下文主动特征获取

Yuta Kobayashi, Zilin Jing, Jiayu Yao, Hongseok Namkoong, Shalmali Joshi

机构 * University of Tokyo(东京大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG

AI总结 提出 Learning-to-Measure (L2M) 方法,通过不确定性量化与条件互信息引导的贪婪特征获取,在上下文学习中解决元主动特征获取问题,无需针对每个任务重新训练。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.09608 2026-06-02 cs.CV cs.AI cs.CL 62%

StreamingVLM: Real-Time Understanding for Infinite Video Streams

StreamingVLM:无限视频流的实时理解

Ruyi Xu, Guangxuan Xiao, Yukang Chen, Liuning He, Yao Lu, Song Han

机构 * MIT(麻省理工学院) NVIDIA(英伟达)

专题命中 Agent评测 :autonomous agent(abstract);分类 cs.AI、cs.CL

AI总结 提出StreamingVLM,通过统一训练与流推理的框架,利用注意力汇点状态复用和滑动窗口机制实现无限视频流的实时稳定理解,在Inf-Streams-Eval基准上以8 FPS速度达到66.18%胜率,并提升通用VQA能力。

Comments Published as a conference paper at ICLR 2026. The first two authors contributed equally to this work

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31170 2026-06-01 cs.CL cs.AI 62%

Emergent Languages in Populations of Language Model Agents: From Token Efficiency to Oversight Evasion

语言模型智能体群体中的涌现语言:从令牌效率到监督规避

Stine Lyngsø Beltoft, William Brach, Federico Torrielli, Jacob Nielsen, Annemette Brok Pirchert, Filippo Tonini, Peter Schneider-Kamp, Lukas Galke Poech

机构 * University of Southern Denmark(南丹麦大学) Slovak University of Technology in Bratislava(布拉迪斯拉发技术大学) University of Turin(都灵大学) Ordbogen A/S(Ordbogen公司)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL

AI总结 研究语言模型智能体群体中涌现的语言,通过规则启发式和零样本分类识别出令牌效率、新自然语言和监督规避三类,发现监督规避语言更难对齐且可被上下文学习,表明仅监控表面行为可能不足以控制智能体群体。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30152 2026-05-29 cs.CL cs.AI cs.HC 62%

Do Proactive Agents Really Need an LLM to Decide When to Wake and What to Anchor?

主动型智能体真的需要LLM来决定何时唤醒和锚定什么吗?

Xiaoze Liu, Ruowang Zhang, Amir H. Abdi, Michel Galley, Zhikai Chen, Siheng Xiong, Xiaoqian Wang, Jing Gao

机构 * Purdue University(普渡大学) Microsoft(微软) Michigan State University(密歇根州立大学) Georgia Institute of Technology(佐治亚理工学院)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL

AI总结 提出用时间图学习(TGL)模型替代LLM作为主动智能体的触发器,通过图更新而非文本处理用户活动,实现高效、低延迟的触发决策。

Comments 31 pages, 5 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04704 2026-05-29 cond-mat.mtrl-sci cs.AI cs.CL 62%

AtomWorld: A Benchmark for Evaluating Spatial Reasoning in Large Language Models on Crystalline Materials

AtomWorld: 评估大型语言模型在晶体材料空间推理能力的基准

Taoyuze Lv, Alexander Chen, Fengyu Xie, Chu Wu, Jeffrey Meng, Dongzhan Zhou, Yingheng Wang, Bram Hoex, Zhicheng Zhong, Tong Xie

机构 * University of New South Wales, NSW, Sydney, Australia(新南威尔士大学,新州,悉尼,澳大利亚) Suzhou Institute for Advanced Research, University of Science(苏州先进研究院,科学大学) Shanghai Artificial Intelligence Laboratory, Shanghai, China(上海人工智能实验室,上海,中国) Cornell University(康奈尔大学)

专题命中 Agent评测 :agentic(abstract);分类 cs.AI、cs.CL

AI总结 提出AtomWorld基准,通过十种基本原子结构操作评估LLM在材料科学中的空间推理能力,发现Claude Opus 4.6表现最佳但复杂空间关系操作成功率低,表明LLM更适合作为辅助工具而非完全自主的科研代理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14585 2026-05-28 cs.AI cs.CL 62%

Prompt Optimization Is a Coin Flip: Diagnosing When It Helps in Compound AI Systems

提示优化如同抛硬币:诊断其在复合AI系统中何时有效

Xing Zhang, Guanghui Wang, Yanwei Cui, Wei Qiu, Ziyuan Li, Bing Zhu, Peiyang He

机构 * AWS Generative AI Innovation Center(AWS生成式AI创新中心) HSBC Holdings Plc., HSBC Technology Center, China(汇丰控股有限公司,汇丰技术中心,中国)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL

AI总结 通过大量实验发现提示优化在复合AI系统中效果不稳定,仅当任务具有可挖掘的输出结构时才有帮助,并提供了两阶段诊断方法。

Comments Accepted to the 1st Workshop on Combining Theory and Benchmarks, CTB@ICML 2026, Seoul, South Korea

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27068 2026-05-27 cs.CL cs.AI cs.MA 62%

QUACK: Questioning, Understanding, and Auditing Communicated Knowledge in Multimodal Social Deduction Agents

QUACK: 多模态社交推理智能体中的沟通知识质疑、理解与审计

Ye Yuan, Rui Song, Weien Li, Zeyu Li, Haochen Liu, Xiangyu Kong, Changjiang Han, Yonghan Yang, Zichen Zhao, Zixuan Dong, Fuyuan Lyu, Bowei He, Haolun Wu, Jikun Kang, Xue Liu

机构 * McGill University(麦吉尔大学) Mila - Quebec AI Institute(魁北克人工智能研究所) University of Cambridge(剑桥大学) MBZUAI - Mohamed bin Zayed University of Artificial Intelligence(MBZUAI - 摩苏尔·本·扎耶德人工智能大学) University of Toronto(多伦多大学) Salesforce

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL

AI总结 提出QUACK框架,通过游戏结果、行为轨迹和话语一致性三级评估,自动审计多模态社交推理智能体语言与感知行为的一致性,发现最强智能体仍有15.1%的空间幻觉和过半无据指控。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26438 2026-05-27 cs.CL cs.AI 62%

LURE: Live-Usage Replay Evaluations for Reducing Evaluation Awareness

LURE: 减少评估感知的实时使用回放评估

Igor Ivanov, David Demitri Africa

机构 * Meridian Cambridge(梅里登剑桥)

专题命中 Agent评测 :agentic(abstract);分类 cs.AI、cs.CL

AI总结 提出LURE方法,通过回放真实代理交互轨迹并附加评估提示来构建类似部署的评估,以减少大语言模型的评估感知,并引入自动化评估真实性流程。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12564 2026-05-27 cs.CL cs.AI 62%

Sell Me This Stock: Unsafe Recommendation Drift in LLM Agents

卖给我这支股票:LLM智能体中的不安全推荐漂移

Zekun Wu, Adriano Koshiyama, Sahan Bulathwela, Maria Perez-Ortiz

机构 * Centre for Artificial Intelligence, University College London(人工智能研究中心,伦敦大学学院)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL

AI总结 研究LLM智能体在多轮金融推荐中因工具输出被操纵而产生风险不匹配推荐的问题,通过实验揭示评估盲区并分析机制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01668 2026-05-27 cs.CL cs.AI 62%

EHRSummarizer: A Privacy-Aware, FHIR-Native Reference Architecture for Source-Grounded EHR Summarization

EHRSummarizer:一种隐私感知、FHIR原生的源接地EHR摘要参考架构

Houman Kazemzadeh, Nima Minaifar, Kamyar Naderi, Sho Tabibzadeh

机构 * MedLedger365 MedConnect365 Xylemed Kypath Associates Inc.

专题命中 Agent评测 :workflow(abstract);分类 cs.AI、cs.CL

AI总结 提出一种隐私感知、FHIR原生的参考架构EHRSummarizer,通过检索HL7 FHIR R4资源并约束生成源接地摘要,以支持临床病历审查。

Comments 15 pages, 2 figures, 2 tables. Version 2 clarifies missing-data status handling, medication-status ambiguity, controlled narrative-document handling, source-grounded resource grouping, and future source-to-summary traceability

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25162 2026-05-26 cs.CL cs.AI 62%

STREAM: A Data-Centric Framework for Mining High-Value Task-Oriented Dialogues from Streaming Media

STREAM:一个以数据为中心的框架,用于从流媒体中挖掘高价值任务导向对话

Liang Xue, Haoyu Liu, Cheng Wang, Pengyu Chen, Haozhuo Zheng, Yang Liu

机构 * Harbin Institute of Technology(哈尔滨工业大学) Byering Technology(伯英技术)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL

AI总结 提出STREAM框架,利用流媒体数据合成大规模多领域任务导向对话数据集StreamDial,通过角色构建和对话蓝图结合RAG生成高质量对话,解决数据稀缺问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24247 2026-05-26 cs.CL cs.AI 62%

Improving Labeling Consistency with Detailed Constitutional Definitions and AI-Driven Evaluation

通过详细的宪法定义和AI驱动的评估提高标注一致性

Konstantin Berlin, Adam Swanda

机构 * Cisco AI Defense(思科AI防御)

专题命中 Agent评测 :workflow(abstract);分类 cs.AI、cs.CL

AI总结 提出一种AI驱动的工作流,通过为每个类别编写详细的宪法定义并由前沿LLM解释,以比人类更一致和准确地生成黄金标签,在三个内容审核类别上将跨模型不一致性降低高达57倍。

Comments Under review at ACL Rolling Review (ARR), May 2026 cycle. Also available at https://doi.org/10.5281/zenodo.20125267

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23459 2026-05-25 cs.SE cs.AI 62%

AI Assurance: A Comprehensive Testing Strategy for Enterprise AI Systems

AI 保证:企业 AI 系统的综合测试策略

Chitra Badagi, Divye Singh, Animesh Sen, Adinath Shirsath

机构 * Thoughtworks Technologies(Thoughtworks技术公司)

专题命中 Agent评测 :autonomous agent(abstract);分类 cs.AI、cs.SE

AI总结 本文针对基于大语言模型、检索管道和自主代理的企业 AI 系统,提出了一种以持续风险降低为核心、将评估作为核心工程学科、并关注组织影响的综合保证策略,包括结构化的 AI 故障分类法、五层 AI 保证金字塔以及评估驱动开发、RAG 系统测试、模型生命周期管理和治理的操作指南。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00979 2026-05-25 cs.CR cs.AI cs.CL 62%

GradingAttack: Exposing Security Vulnerabilities in LLM Based Educational Grading Agents

GradingAttack: 揭示基于LLM的教育评分代理中的安全漏洞

Xueyi Li, Zhuoneng Zhou, Zitao Liu, Yongdong Wu

机构 * Guangdong Institute of Smart Education(广东智能教育研究院) Jinan University(济南大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL

AI总结 提出GradingAttack框架,通过token级和prompt级对抗攻击策略,系统评估基于LLM的教育评分代理的安全漏洞,发现其缺乏鲁棒防御。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18000 2026-05-25 cs.LG cs.AI q-bio.PE 62%

Reward Engineering for Spatial Epidemic Simulations: A Reinforcement Learning Platform for Individual Behavioral Learning

空间流行病模拟中的奖励工程:个体行为学习的强化学习平台

Radman Rakhshandehroo, Daniel Coombs

机构 * Department of Computer Science University of British Columbia(计算机科学系,不列颠哥伦比亚大学) Department of Mathematics and Institute of Applied Mathematics University of British Columbia(数学系和应用数学研究所,不列颠哥伦比亚大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG

AI总结 提出ContagionRL平台,通过奖励函数设计系统评估空间流行病模拟中个体行为学习策略,发现势场奖励方法能有效提升非药物干预依从性和空间规避策略。

Comments 38 pages, 15 figures and 18 tables; Accepted to TMLR. OpenReview: https://openreview.net/forum?id=yPEASsx3hk

Journal ref Transactions on Machine Learning Research, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20405 2026-05-22 cs.LG cs.CL cs.LO 62%

Putnam 2025 Problems in Rocq using Opus 4.6 and Rocq-MCP

使用 Opus 4.6 和 Rocq-MCP 的 2025 年 Putnam 问题

Guillaume Baudart, Marc Lelarge, Tristan Stérin, Jules Viennot

机构 * IRIF, Université Paris Cité, Inria, CNRS(IRIF,巴黎Cité大学,法国国家信息与自动化研究所,法国国家科学研究中心) DI ENS, PSL University, Inria(ENS巴黎大学DI,巴黎科学实验室大学,法国国家信息与自动化研究所)

专题命中 Agent评测 :agent(abstract);分类 cs.CL、cs.LG

AI总结 研究探讨了使用 Opus 4.6 配合 Rocq-MCP 工具自主证明 2025 年 Putnam 数学竞赛中 12 个问题中的 10 个,展示了基于模型上下文协议 (MCP) 的自动证明方法及公开可用的证明过程。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20911 2026-05-21 cs.AI cs.LG 62%

For How Long Should We Be Punching? Learning Action Duration in Fighting Games

我们应该持续打击多久?在格斗游戏中学习动作持续时间

Hoang Hai Nguyen, Kurt Driessens, Dennis J. N. J. Soemers

机构 * Department of Advanced Computing Sciences, Maastricht University(马斯特里赫特大学高级计算科学系)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG

AI总结 本文研究了在格斗游戏中如何通过学习动作持续时间来提高强化学习代理的决策能力,探讨了动态调整反应时间的方法及其对性能和行为模式的影响。

Comments Accepted at Computers and Games 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20767 2026-05-21 cs.CL cs.LG stat.ME 62%

The Illusion of Intervention: Your LLM-Simulated Experiment is an Observational Study

干预的幻觉:你的LLM模拟实验实际上是一个观察性研究

Victoria Lin, Taedong Yun, Maja Matarić, John Canny, Arthur Gretton, Alexander D'Amour

机构 * Google DeepMind(谷歌DeepMind) Carnegie Mellon University(卡内基梅隆大学)

专题命中 Agent评测 :agent(abstract);分类 cs.CL、cs.LG

AI总结 本文探讨了大型语言模型在模拟人类行为中的潜在作用,指出在LLM模拟的合成用户中进行干预可能引起潜在用户属性的意外变化,从而导致用户漂移,影响效果估计。本文提出了使用负对照结果来检测分布变化的方法,并通过调整角色描述以减少偏倚来缓解漂移问题。

详情

展开后加载摘要…

URL PDF HTML 收藏