SteerBench-Work: A Benchmark for Agent Steering at Action Boundaries
SteerBench-Work:动作边界处智能体决策的基准测试
机构 * AgentDock
专题命中 Agent评测 :agent(title);分类 cs.AI、cs.CL、cs.LG
AI总结 本研究推出职场智能体动作边界决策基准SteerBench-Work,发现模型在该任务中存在过度拒绝的显著偏差,且通用能力与引导校准并不等同。
AI 大模型
智能体、工具调用、规划、工作流、多智能体和自主任务执行。
SteerBench-Work:动作边界处智能体决策的基准测试
机构 * AgentDock
专题命中 Agent评测 :agent(title);分类 cs.AI、cs.CL、cs.LG
AI总结 本研究推出职场智能体动作边界决策基准SteerBench-Work,发现模型在该任务中存在过度拒绝的显著偏差,且通用能力与引导校准并不等同。
作为智能体可调用工具的分光双星探测:从SDSS DR19 APOGEE光谱中探测40000+主序双星候选体
专题命中 Agent评测 :agent(title,abstract)
AI总结 本研究将分光双星探测方法打包为智能体可调用工具,从SDSS DR19 APOGEE光谱中探测出41466个SB2双星候选体,新增大量相关天体并完成多项分析,发布工具与星表。
Comments 23 pages, 16 figures, submitted to OJAp
通过智能体引导的精确平方和证书证明4维下的Dittert猜想
专题命中 Agent评测 :agent(title,abstract)
AI总结 该研究通过智能体引导的符号-数值方法构造精确平方和证书,在4维下证明Dittert猜想,确定均匀矩阵为对应Dittert泛函的唯一最大值点,且证书经Lean形式化验证。
基于智能体的犯罪倾向动力学
专题命中 Agent评测 :agent(title,abstract)
AI总结 该研究将进化犯罪学的RRM形式化为智能体动力学系统,扩展有界置信意见动力学并证明收敛条件,发现系统主导行为为持续振荡,揭示了不同环境感知下的群体倾向及两极分化机制。
基于智能体的共同基础形成与演化模型
专题命中 Agent评测 :agent(title,abstract)
AI总结 本研究开发智能体模型,通过蒙特卡洛模拟探究网络上智能体交互的共同基础形成与演化,揭示不同交互情境会导致全球共同基础形成、分裂或完全丧失等现象,凸显数学模型研究文化动态微宏观关联的潜力。
Comments Submission for a journal paper
借助图像外信息思考:由时空信息增益驱动的农田分割智能体
专题命中 Agent评测 :agent(title,abstract)
AI总结 该研究针对现有农田遥感图像分割范式的不足,提出动态分割智能体FarmSeeker,构建支持推理查询的全球高分辨率基准GSFS-Bench,其分割性能比现有方法更稳定。
关于自主智能体时代推荐系统的立场文件
专题命中 Agent评测 :autonomous agent(title,abstract)
AI总结 探讨自主智能体时代推荐系统范式转变,回顾以人类为中心研究见解,将智能体视为独立助手,描述三方互动,指出转变带来新机会与评估等方面独特挑战。
Comments Accepted to the ACM RecSys 2026 Main Track
多方对话中与数字代理的语音同步
专题命中 Agent评测 :agent(title,abstract)
AI总结 研究人类群体与数字代理多方互动中的语音同步效应,通过收集含成人及家庭会话的独特数据集,考虑多种同步特征,发现个体局部与人同步,全局及与代理的同步有限且依群体而异。
耗尽能源共享池:自我挫败的过度占用作为智能体大语言模型集体中的协调失败
专题命中 Agent评测 :agentic(title);agent(abstract)
AI总结 研究大语言模型智能体在共享可再生能源储备时的协调失败问题,通过让四个同系列智能体自博弈,改变储备再生率,发现它们在需求超阈值时过度占用致自我挫败,实际消耗类似更不耐烦的开放访问基准,孤立响应评估会忽略此系统层面协调失败。
具有跳跃风险和共同噪声的最优相对消费-投资的平均场和N-主体博弈
专题命中 Agent评测 :agent(title,abstract)
AI总结 研究N主体博弈中的最优消费-投资问题,利用随机最大值原理刻画平均场均衡,通过数值实验说明结果及金融含义,还基于此构建N主体博弈的近似纳什均衡。
AGENTS4GEOS:用于开源多物理场模拟的智能体平台
专题命中 Agent评测 :agentic(title);agent(abstract)
AI总结 研究针对多物理场模拟计算需求及训练数据集瓶颈,提出基于模型上下文协议的Agents4GEOS智能体框架,借助52个领域感知工具及协调器,自动化日常任务,助力专家专注工作挑战。
Comments 14 pages, 11 Figures
使嵌入模型适应智能体能力检索
专题命中 Agent评测 :agent(title,abstract)
AI总结 研究如何让一般文本检索的现成模型适应智能体能力检索,通过微调三个模型在特定数据集上训练,测试其在未训练目录上的迁移能力,结果显示适应对两个目录均有帮助。
Comments Accepted for oral presentation at the AgentSearch Workshop, SIGIR 2026
具有风险相互依存性的保险委托-代理平均场博弈模型
专题命中 Agent评测 :agent(title,abstract)
AI总结 研究道德风险、内生参与和战略风险相互依存下的保险合同设计问题,用异质平均场博弈近似战略互动,建立下层均衡存在性与唯一性,嵌入上层优化问题,证明相关均衡存在,扩展到有限合同菜单,表明多合同筛选可提高委托人预期收益。
智能体技能安全:威胁模型、攻击、防御与评估
专题命中 Agent评测 :agent(title,abstract)
AI总结 研究智能体可复用技能安全,提出SkillSec-Eval框架,刻画技能生命周期并开发威胁分类法,通过对327个真实技能实证评估,发现多阶段有漏洞,强调需进行生命周期感知安全分析。
PesTwin:一种用于害虫和病媒种群控制的基于模块化代理的框架
专题命中 Agent评测 :agent(title,abstract)
AI总结 针对基因控制技术建模工具滞后问题,提出PesTwin框架,可跨物种等模拟基因控制技术,捕捉多种因素。经与实验室数据验证后可扩展到田间场景,能在基因控制系统实际应用前进行模拟测试,助力相关决策,缩短研发到应用路径。
PHaul:一种用于Sub6增强型综合接入与回传网络的基于近端策略优化(PPO)的转发代理
专题命中 Agent评测 :agent(title,abstract)
AI总结 研究Sub6增强型IAB网络的转发问题,提出PHaul,结合离线启发式算法与基于PPO的在线DRL代理,利用网络数字孪生采样更新映射,相比替代算法,能提升吞吐量效率和公平性,且对拓扑差异有鲁棒性。
Journal ref IEEE Transactions on Network and Service Management, 2024
WebRetriever:用于高效网络智能体评估的大规模综合基准测试
机构 * Mininglamp Technology(旷视科技) ; School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) ; MAIS, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所综合技术集成中心)
专题命中 Agent评测 :agent(title,abstract)
AI总结 针对现有网络智能体评估基准测试的局限,提出WebRetriever这一大规模综合基准测试,涵盖多领域网站和任务。采用NavEval框架及三个评估协议,实验揭示不同协议性能差异,为网络智能体研发提供细粒度见解和严谨基础。
驯服I2V模型用于图像HOI编辑:认知基准与智能体自校正框架
机构 * Wangxuan Institute of Computer Technology, Peking University, Beijing, China(王轩计算机技术研究所,北京大学,北京,中国) ; National Institute of Health Data Science, Peking University, Beijing, China(国家健康数据科学研究院,北京大学,北京,中国)
专题命中 Agent评测 :agentic(title,abstract)
AI总结 提出HOI-Edit基准和SCPE框架,利用I2V模型的时间生成能力进行动态人-物交互编辑,通过自校正提示迭代优化,实现与SOTA竞争的性能。
映射评估前沿:跨11种评估器-智能体条件的偏差-可靠性权衡的实证调查
专题命中 Agent评测 :agent(title);分类 cs.AI、cs.CL、cs.LG
AI总结 通过扩展至11种评估条件,实证验证了LLM评估系统中评估器耦合、策略多样性与小样本测量可靠性之间的权衡,并发布了标准化基准数据集。
Comments 5 pages, 1 figure, 1 table
基于多模态智能体AI和主动波浪补偿的自主无人机稳健海上平台着陆
机构 * Fundação Para a Ciência e a Tecnologia(葡萄牙科学技术基金会)
专题命中 Agent评测 :agentic(title);agent(abstract)
AI总结 提出一种解耦的多飞行器着陆框架,利用双深度强化学习智能体(SAC和模态RL)实现无人机在海上平台的稳健着陆,在15次试验中达到100%成功率。
混合最大和求和代理类型的策略性设施选址与委员会选择
专题命中 Agent评测 :agent(title,abstract)
AI总结 针对代理具有最大型或求和型成本函数的策略性设施选址问题,设计确定性策略证明机制,并证明在代理类型私有但位置已知时近似比为(3-2/k),在位置私有且位于直线度量时近似比为3。
缓解集中流动性AMM中的逆向选择:基于动态费用的代理建模方法
专题命中 Agent评测 :agent(title,abstract)
AI总结 针对Uniswap v3等集中流动性AMM中流动性提供者面临的逆向选择成本,提出基于波动率和订单流毒性的动态费用机制,通过代理建模验证其可补偿损失而非直接降低损失。
具有递归效用的连续时间异质主体模型的有限差分方法
专题命中 Agent评测 :agent(title,abstract)
AI总结 针对Epstein-Zin递归效用下的连续时间异质主体模型,提出Howard-Newton和Howard-Tarski-Kantorovich算法求解离散化的HJB方程,证明算法收敛性及解的存在性,并给出先验误差估计。
通过知识增强的LLM智能体实现左移高层次综合验证
专题命中 Agent评测 :agent(title,abstract)
AI总结 提出一种知识增强的智能体驱动左移验证框架,通过双层级一致性检查、符号执行和HLS验证知识图谱,在综合前自动验证C与HLS-C的功能一致性,覆盖率达98.26%。
桥接创意意图与视觉质量:基于创作者驱动的循环视频生成与代理反馈循环
机构 * University of California, Davis(加州大学戴维斯分校) ; The Harker School(哈克学校) ; Basis Independent Silicon Valley(硅谷贝斯独立学校) ; Saratoga High(萨拉托加高中)
专题命中 Agent评测 :agentic(title);agent(abstract)
AI总结 提出CHIEF框架,通过人类-AI协作的迭代视频精炼,结合创作者驱动和代理主观反馈,提升长视频的叙事连贯性与创意方向。
Comments Accepted to the Workshop on Human-AI Co-Creativity at ICML 2026
AI代理网络的可靠性:密度演化、停止集与架构优化
专题命中 Agent评测 :AI agent(title);agent(abstract)
AI总结 将多代理AI系统建模为稀疏图上的消息传递,扩展LDPC编码的密度演化理论,分析三种擦除失效模式,并证明密度演化定理以预测未解决子声明的渐近比例。
大型语言模型作为监督式提取助手:降低基于智能体建模中文档标准采纳的门槛
专题命中 Agent评测 :agent(title,abstract)
AI总结 本研究探索利用大型语言模型(LLMs)辅助自动化ABM文档标准(如RAT-RS)的采纳,通过四个LLMs从已发表论文中提取报告,发现LLMs在描述性任务上表现可靠,但在解释性和评估性任务上存在局限,并提出了何时依赖LLM、何时需要人工监督的实用启发式方法。
Comments 17 pages, accepted for publication at the Social Simulation Conference 2026, see https://www.durham.ac.uk/research/institutes-and-centres/research-methods/social-simulation-conference-2026/
一个基于主体的风格化模型中的财富不平等与行星边界
专题命中 Agent评测 :agent(title,abstract)
AI总结 通过构建异质主体模型,研究财富不平等如何阻碍绿色转型,发现超过一定阈值后经济锁定在棕色状态,并评估了不同财政政策的效果。
Comments 26 pages, 14 figures
将基于智能体的捕食者-猎物模型调谐至洛特卡-沃尔泰拉动力学
专题命中 Agent评测 :agent(title,abstract)
AI总结 研究通过调整环境与种群参数,使基于智能体的捕食者-猎物模型产生类似洛特卡-沃尔泰拉方程的周期性振荡,并利用基于特征的损失函数优化参数。
Comments 12 pages, 3 figures
极端气候事件频率增加下的迁移决策基于智能体的模型
专题命中 Agent评测 :agent(title,abstract)
AI总结 构建基于智能体的模型,通过感知风险、迁移愿望和迁移能力的共同演化,揭示气候冲击如何非线性地影响迁移决策,并导致脆弱群体陷入困境。
Comments 44 pages including appendix, 14 figures