Dynamic System Instructions and Tool Exposure for Efficient Agentic LLMs
动态系统指令与工具暴露用于高效代理LLM
专题命中 Agent评测 :agentic(title);agent(abstract);autonomous agent(abstract);分类 cs.AI
AI总结 通过动态系统指令和工具暴露技术,ITR显著减少LLM代理的上下文令牌使用和运行成本,提升工具路由准确性,适用于长期自主代理。
AI 大模型
智能体、工具调用、规划、工作流、多智能体和自主任务执行。
动态系统指令与工具暴露用于高效代理LLM
专题命中 Agent评测 :agentic(title);agent(abstract);autonomous agent(abstract);分类 cs.AI
AI总结 通过动态系统指令和工具暴露技术,ITR显著减少LLM代理的上下文令牌使用和运行成本,提升工具路由准确性,适用于长期自主代理。
销售研究代理与销售研究基准
机构 * Microsoft(微软)
专题命中 Agent评测 :agent(title,abstract);分类 cs.AI
AI总结 本文提出销售研究代理和基准,通过实时CRM数据提供高质量决策洞察,并在测试中超越其他AI系统。
Comments Technical report. 2 figures. Microsoft Dynamics 365 Sales
FAMOSE:一种用于自动化特征发现的ReAct方法
机构 * Amazon.com, Inc.(亚马逊公司)
专题命中 Agent评测 :agent(abstract);AI agent(abstract);agentic(abstract);分类 cs.AI、cs.LG
AI总结 FAMOSE通过ReAct方法实现自动化特征发现,显著提升分类和回归任务的性能,展示了AI代理在创新解决方案中的有效性。
Comments 23 pages, 6 figures
注意GAP:在LLM代理中,文本安全不转移到工具调用安全
机构 * Independent Researcher(独立研究者)
专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.SE
AI总结 该研究发现LLM代理中文本安全不等同于工具调用安全,引入GAP基准测试揭示两者差异,强调需专门评估工具调用安全。
Comments 23 pages, 5 figures, 4 tables, code and data at https://github.com/acartag7/gap-benchmark
LiveClin: 一种无泄漏的实时临床基准
机构 * The Chinese University of Hong Kong, ShenZhen(香港中文大学(深圳)) ; Ant Healthcare, Ant Group(蚂蚁集团) ; Zhejiang University(浙江大学) ; The Ohio State University(俄亥俄州立大学)
专题命中 Agent评测 :workflow(abstract);分类 cs.AI、cs.LG
AI总结 LiveClin通过实时更新的临床病例基准,评估医学大语言模型在真实临床场景中的表现,揭示其在复杂医疗任务中的挑战。
AI 游戏商店:通过人类游戏评估机器通用智能的可扩展性和开放性
专题命中 Agent评测 :planning(abstract);分类 cs.AI
AI总结 通过AI GameStore评估机器通用智能,利用人类游戏测试AI在游戏中的表现,发现其在复杂游戏任务中表现不佳。
Comments 29 pages, 14 figures
通过动态谓词发明实现因果模型的持续学习与完善
机构 * University of Bristol(布里斯托大学)
专题命中 Agent评测 :agent(abstract);分类 cs.AI
AI总结 本文提出通过动态谓词发明实现因果模型的持续学习与完善,利用元解释学习提升推理效率,显著提高样本效率。
ConvApparel:一种用于对话推荐系统中用户模拟器的基准数据集和验证框架
机构 * Google(谷歌)
专题命中 Agent评测 :agent(abstract);分类 cs.CL
AI总结 ConvApparel通过双代理数据收集和反事实验证框架,评估对话推荐系统中用户模拟器的现实差距和泛化能力。
Comments EACL 2026
NESSiE: 必要安全基准 -- 识别不应存在的错误
专题命中 Agent评测 :autonomous agent(abstract);分类 cs.SE
AI总结 NESSiE提出了一种轻量级安全基准,用于检测大型语言模型中不应存在的安全故障,揭示模型在帮助与安全之间的偏差。
Comments 13 pages, 6 figures
具有交叉影响传播器的最优投资组合选择
专题命中 Agent评测 :agent(abstract)
AI总结 本文提出了一种基于矩阵值Volterra传播器的最优投资组合选择模型,通过求解随机Fredholm方程组,分析了交叉影响对投资策略及阿尔法衰减的相互作用。
Comments 37 pages, 7 figures
SimulatorCoder: 基于大语言模型的DNN加速器模拟器代码生成与优化
专题命中 Agent评测 :agent(abstract)
AI总结 SimulatorCoder利用大语言模型生成并优化DNN加速器模拟器代码,通过结构化提示和反馈机制提升代码准确性和模拟性能。
GDEV-AI: 对深度学习推理扩展性和架构饱和度的通用评估
专题命中 Agent评测 :planning(abstract)
AI总结 GDEV-AI通过基准测试分析CPU推理的可扩展性和架构饱和度,揭示传统CPU和现代架构在吞吐量和延迟上的差异,为异构数据中心的容量规划提供实证支持。
Comments 14 pages, 18 figures, 20 references
拍卖设计中的公平性:单位需求代理与非准线性偏好
专题命中 Agent评测 :agent(abstract)
AI总结 本文提出了一种基于公平性的拍卖机制,该机制在单位需求代理和非准线性偏好下实现策略可行、个体理性、同等对待、无浪费和无补贴。
在CEX和DEX中使用优先费用和随机延迟的交易
专题命中 Agent评测 :agent(abstract)
AI总结 本文提出了一种结合连续控制与脉冲干预的混合框架,用于在CEX和DEX中优化交易策略,通过优先费用选择最优管理延迟风险。
通过递推视界跟踪生成类人轨迹应用于TickTacking界面
专题命中 Agent评测 :agent(abstract)
AI总结 本文通过递推视界方法在TickTacking界面中生成类人轨迹,通过分析用户行为特征提升人机交互的直观性和效率。