Playing FPS Games with Deep Reinforcement Learning
专题命中 Agent评测 :agent(abstract);AI agent(abstract);autonomous agent(abstract);分类 cs.AI、cs.LG
Comments The authors contributed equally to this work
AI 大模型
智能体、工具调用、规划、工作流、多智能体和自主任务执行。
专题命中 Agent评测 :agent(abstract);AI agent(abstract);autonomous agent(abstract);分类 cs.AI、cs.LG
Comments The authors contributed equally to this work
专题命中 Agent评测 :agent(abstract,comments);agentic(abstract);multi-agent(abstract);分类 cs.CL
Comments 42p, 17f, 10t. Revisions: Merged paragraphs in Intro to emphasize contributions. Clarified benchmark design (Sec 3.5.1). Added single-agent, OpenAI-guided & 6-round experiments (Sec 5.2). Note: we only ran each experiment once; statistical tests are needed for strong claims. Revised Sec 6. Added acknowledgements, 2 new co-authors, and corrected typos/grammar
专题命中 Agent评测 :agent(abstract);AI agent(abstract);multi-agent(abstract);分类 cs.AI
Journal ref 24th International Conference on Autonomous Agents and Multiagent Systems 2025
EgoErrorVQA:通过程序错误评估自我主体人工智能的以自我为中心的理解能力
机构 * The Hong Kong Polytechnic University(香港理工大学) ; Nanyang Technological University(南洋理工大学)
专题命中 Agent评测 :agentic(title);agent(abstract)
AI总结 针对现有视觉智能体和VLMs忽略以自我为中心视角评估程序理解能力的问题,本文提出EgoErrorVQA任务,开发基于A2A协议的评估智能体,引入Ego-ADR框架提升模型对程序错误的理解,取得良好效果。
人类-人工智能代理交互中混合显性与隐性沟通效果的研究
机构 * The University of Manchester(曼彻斯特大学)
专题命中 Agent评测 :agent(title,abstract)
AI总结 本研究探讨了人类与人工智能代理交互中混合显性与隐性沟通的效果,发现混合沟通能提升代理的接受度和透明度,但对任务执行时间影响不显著。
Comments Main paper with 33 pages, 16 figures, 5 tables. Supplementary material with 39 pages, 44 figures, 2 tables. Submitted to Intelligent Service Robotics
有限周期委托代理问题的倒向随机微分方程刻画
专题命中 Agent评测 :agent(title,abstract)
AI总结 该研究通过倒向随机微分方程刻画有限周期委托代理问题的委托人值函数,绕开完全非线性HJB方程,可处理代理人面临机制切换控制的新型委托代理问题。
Comments 26 pages
利用干湿智能体循环诊断并缩小粉末X射线衍射中的模拟到真实差距
专题命中 Agent评测 :agentic(title);agent(abstract)
AI总结 该研究针对粉末X射线衍射的模拟到真实差距,提出整合实测图谱微调等技术的Xtalyst智能体系统,通过干湿循环优化,提升了物相分析的准确性与覆盖度。
Comments 72 pages, 15 figures, 7 supplementary tables; supplementary material included
去中心化金融真的是去中心化的吗?整合网络理论、基于智能体的模拟以及来自Aave、GHO发行和跨链扩张的纵向证据的跨学科框架
专题命中 Agent评测 :agent(title,abstract)
AI总结 本研究构建跨学科框架,结合网络理论、智能体模拟与Aave等的纵向数据,发现DeFi的去中心化四维维度会背离,且GHO发行与跨链扩张对DeFi的参与度、集中度影响存在差异,可为相关评估提供支撑。
衔接语义与行为:基于智能体的BERTopic主题竞争演化模型
专题命中 Agent评测 :agent(title,abstract)
AI总结 本研究提出结合BERTopic、演化博弈论与智能体模拟的框架,揭示社交媒体主题传播的微观机制,复现真实传播趋势,为在线集体行为研究及相关应用提供支撑。
Comments 21 pages, 6 figures
面向规划的端到端自动驾驶:架构、评估与新兴范式
机构 * University of Macau(澳门大学) ; Chongqing University(重庆大学) ; The Hong Kong University of Science and Technology(香港科技大学) ; Tongji University(同济大学) ; Beihang University(北京航空航天大学)
专题命中 Agent评测 :planning(title,abstract)
AI总结 本综述梳理了端到端自动驾驶从回归任务向面向规划系统的转变,沿四个维度整合方法,分析基准转变,指出需结合一致评估解读架构进展,并总结了多项开放性挑战。
在基于智能体的交通模拟中考虑家庭内部联合出行
专题命中 Agent评测 :agent(title,abstract)
AI总结 该研究针对基于智能体的交通模拟忽略家庭联合出行的问题,提出三步整合方法,经巴黎数据验证可复现相关出行特征,助力更可靠评估差异化交通政策。
Comments Submission for hEART 2026 conference
StocksTalk:一种面向网络数据结构化查询生成的语音赋能对话智能体
机构 * IIIT-Delhi(德里印度信息技术学院) ; Singapore Institute of Technology(新加坡理工学院)
专题命中 Agent评测 :agent(title);分类 cs.AI、cs.CL、cs.LG
AI总结 StocksTalk是一种语音赋能对话系统,可将口语化金融请求转为结构化查询,通过多模块提升准确性,为股票筛选决策提供支持。
智能体模型对公交线路规划问题复杂度的影响
专题命中 Agent评测 :agent(title,abstract)
AI总结 该研究分析公交线路规划问题的复杂度,发现智能体成本模型、是否允许智能体选择步行等因素会影响问题难度,相关结果还证明了其NP-hard性与参数化难解性。
基于核化多臂老虎机的动态委托代理问题中的自适应激励设计
专题命中 Agent评测 :agent(title,abstract)
AI总结 本文针对动态委托代理问题的现有局限,提出引入随机效用模型的Heteroscedastic GP-UCB算法,建立了累积遗憾界,并在V2G激励设计中验证了其更优的经济性能。
零和思维对代理利益的损害在正和世界中有多大?
专题命中 Agent评测 :agent(title,abstract)
AI总结 研究零和决策规则(maximin和minimax)在正和战略环境中的影响,发现maximin在某些情况下比纳什均衡更有利于代理利益,且两者在游戏类别上具有相同的数量级。
一种用于指导零样本加密货币交易的反思型大语言模型智能体
专题命中 Agent评测 :agent(title,abstract)
AI总结 本研究开发了结合链上链下数据分析与反思机制的LLM智能体CryptoTrade,拓展了LLM在加密货币交易的应用,建立了相关策略基准,其收益表现优于传统策略和时间序列基线。
Comments Published at EMNLP 2024 (Main Conference)
SteerBench-Work:动作边界处智能体决策的基准测试
机构 * AgentDock
专题命中 Agent评测 :agent(title);分类 cs.AI、cs.CL、cs.LG
AI总结 本研究推出职场智能体动作边界决策基准SteerBench-Work,发现模型在该任务中存在过度拒绝的显著偏差,且通用能力与引导校准并不等同。
通过代理评估和稳定性感知排名实现多模态大语言模型的鲁棒检查点选择
机构 * Meta AI
专题命中 Agent评测 :agentic(title);分类 cs.AI、cs.CL、cs.LG
AI总结 本文提出了一种多阶段框架,结合了精心挑选的现实世界数据、结构化的LLM判断和多阶段排名协议,以解决多模态大语言模型检查点选择中的鲁棒决策问题,强调数据质量(特别是OCR可读性)对评估有效性的重要性。
作为智能体可调用工具的分光双星探测:从SDSS DR19 APOGEE光谱中探测40000+主序双星候选体
专题命中 Agent评测 :agent(title,abstract)
AI总结 本研究将分光双星探测方法打包为智能体可调用工具,从SDSS DR19 APOGEE光谱中探测出41466个SB2双星候选体,新增大量相关天体并完成多项分析,发布工具与星表。
Comments 23 pages, 16 figures, submitted to OJAp
技能不是文档:面向LLM智能体技能路由的查询条件基准与两阶段检索器
专题命中 Agent评测 :agent(title,abstract)
AI总结 针对LLM智能体技能路由中技能兼容性被忽视的问题,提出Reject-as-Resource Retriever (R3)框架,构建双语基准R3-Skill,并设计两阶段检索系统(R3-Embedding + R3-Reranker)显式建模技能兼容性,显著提升检索效果。
Comments 24 pages, 8 figures
通过智能体引导的精确平方和证书证明4维下的Dittert猜想
专题命中 Agent评测 :agent(title,abstract)
AI总结 该研究通过智能体引导的符号-数值方法构造精确平方和证书,在4维下证明Dittert猜想,确定均匀矩阵为对应Dittert泛函的唯一最大值点,且证书经Lean形式化验证。
基于智能体的犯罪倾向动力学
专题命中 Agent评测 :agent(title,abstract)
AI总结 该研究将进化犯罪学的RRM形式化为智能体动力学系统,扩展有界置信意见动力学并证明收敛条件,发现系统主导行为为持续振荡,揭示了不同环境感知下的群体倾向及两极分化机制。
基于智能体的共同基础形成与演化模型
专题命中 Agent评测 :agent(title,abstract)
AI总结 本研究开发智能体模型,通过蒙特卡洛模拟探究网络上智能体交互的共同基础形成与演化,揭示不同交互情境会导致全球共同基础形成、分裂或完全丧失等现象,凸显数学模型研究文化动态微宏观关联的潜力。
Comments Submission for a journal paper
借助图像外信息思考:由时空信息增益驱动的农田分割智能体
专题命中 Agent评测 :agent(title,abstract)
AI总结 该研究针对现有农田遥感图像分割范式的不足,提出动态分割智能体FarmSeeker,构建支持推理查询的全球高分辨率基准GSFS-Bench,其分割性能比现有方法更稳定。
关于自主智能体时代推荐系统的立场文件
专题命中 Agent评测 :autonomous agent(title,abstract)
AI总结 探讨自主智能体时代推荐系统范式转变,回顾以人类为中心研究见解,将智能体视为独立助手,描述三方互动,指出转变带来新机会与评估等方面独特挑战。
Comments Accepted to the ACM RecSys 2026 Main Track
一切都有价值:人类与语音代理互动中语音的受控全相关性
专题命中 Agent评测 :agent(title,abstract)
AI总结 研究探讨了人类与语音代理互动中语音的全相关性问题,分析了人类如何管理代理的轮流发言行为,以及技术进步对这一现象的影响。
多方对话中与数字代理的语音同步
专题命中 Agent评测 :agent(title,abstract)
AI总结 研究人类群体与数字代理多方互动中的语音同步效应,通过收集含成人及家庭会话的独特数据集,考虑多种同步特征,发现个体局部与人同步,全局及与代理的同步有限且依群体而异。
TGMS:一种原生代理双时态图管理系统
专题命中 Agent评测 :agent(title,abstract)
AI总结 研究针对时态图问题中LLM代理常失败的情况,提出双时态属性图管理系统TGMS,将13个运算符作为代理工具,LLM规划调用,系统计算,能分离有效时间与事务时间,在基准测试中表现优异,开源代码等。
耗尽能源共享池:自我挫败的过度占用作为智能体大语言模型集体中的协调失败
专题命中 Agent评测 :agentic(title);agent(abstract)
AI总结 研究大语言模型智能体在共享可再生能源储备时的协调失败问题,通过让四个同系列智能体自博弈,改变储备再生率,发现它们在需求超阈值时过度占用致自我挫败,实际消耗类似更不耐烦的开放访问基准,孤立响应评估会忽略此系统层面协调失败。
具有跳跃风险和共同噪声的最优相对消费-投资的平均场和N-主体博弈
专题命中 Agent评测 :agent(title,abstract)
AI总结 研究N主体博弈中的最优消费-投资问题,利用随机最大值原理刻画平均场均衡,通过数值实验说明结果及金融含义,还基于此构建N主体博弈的近似纳什均衡。