Mobile-Agent-v3.5: Multi-platform Fundamental GUI Agents
Mobile-Agent-v3.5: 多平台基础图形用户界面代理
专题命中 GUI与网页智能体 :agent(title,abstract);multi-agent(abstract);分类 cs.AI、cs.CL
AI总结 GUI-Owl-1.5通过多平台支持和创新算法在GUI任务中取得突破性成绩。
Comments 25 pages, 11 figures, 11 tables
AI 大模型
智能体、工具调用、规划、工作流、多智能体和自主任务执行。
Mobile-Agent-v3.5: 多平台基础图形用户界面代理
专题命中 GUI与网页智能体 :agent(title,abstract);multi-agent(abstract);分类 cs.AI、cs.CL
AI总结 GUI-Owl-1.5通过多平台支持和创新算法在GUI任务中取得突破性成绩。
Comments 25 pages, 11 figures, 11 tables
MolmoSpaces: 一个大规模的开放式生态系统用于机器人导航与操作
机构 * Allen Institute for AI(艾伦人工智能研究所) ; University of Washington(华盛顿大学) ; University of California, Los Angeles(加州大学洛杉矶分校) ; University of California, Berkeley(加州大学伯克利分校)
专题命中 GUI与网页智能体 :planning(abstract);分类 cs.AI
AI总结 MolmoSpaces是一个大规模开放式生态系统,用于支持机器人导航与操作的大规模基准测试,包含230k多样化的室内环境和130k丰富标注的物体资产,通过8个任务的基准测试验证了其在仿真到现实中的强相关性。
RA-Nav:基于语义分割的面向不确定环境的面向风险的导航系统
专题命中 GUI与网页智能体 :planning(abstract)
AI总结 RA-Nav通过语义分割实时识别障碍物并分类,构建风险地图以实现安全高效的路径规划,验证了在突发障碍物场景下的优越性能。
RoboGene: 通过多样性驱动的代理框架提升VLA预训练以生成现实任务
机构 * Beijing Innovation Center of Humanoid Robotics(北京人形机器人创新中心) ; The School of Advanced Manufacturing and Robotics, Peking University(北京大学先进制造与机器人学院) ; Beijing Institute of Technology(北京理工大学) ; The School of Mechanical Engineering and Automation, Beihang University(北航机械工程与自动化学院) ; State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University(北京大学多媒体信息处理国家重点实验室)
专题命中 记忆与上下文管理 :agentic(title,abstract);分类 cs.AI、cs.LG
AI总结 RoboGene通过多样性驱动的代理框架生成多样化、物理合理的机器人操作任务,提升VLA预训练效果。
WarpRec: 统一学术严谨性与工业规模以实现负责任、可重复和高效的推荐
机构 * Politecnico di Bari(巴里理工大学) ; Wideverse ; ISTI-CNR(意大利国家研究委员会ISTI分部) ; UAM(马德里自治大学) ; OVS
专题命中 记忆与上下文管理 :agent(abstract);agentic(abstract);分类 cs.AI
AI总结 WarpRec通过统一学术严谨性与工业规模,实现负责任、可重复和高效的推荐系统,提供高性能框架和可持续的推荐系统架构。
利用强化学习发现泰国东北季风指数以预测降雨
专题命中 记忆与上下文管理 :agent(abstract);分类 cs.LG
AI总结 本文利用强化学习优化东北季风指数,提升泰国降雨预测精度。
动态系统指令与工具暴露用于高效代理LLM
专题命中 Agent评测 :agentic(title);agent(abstract);autonomous agent(abstract);分类 cs.AI
AI总结 通过动态系统指令和工具暴露技术,ITR显著减少LLM代理的上下文令牌使用和运行成本,提升工具路由准确性,适用于长期自主代理。
销售研究代理与销售研究基准
机构 * Microsoft(微软)
专题命中 Agent评测 :agent(title,abstract);分类 cs.AI
AI总结 本文提出销售研究代理和基准,通过实时CRM数据提供高质量决策洞察,并在测试中超越其他AI系统。
Comments Technical report. 2 figures. Microsoft Dynamics 365 Sales
FAMOSE:一种用于自动化特征发现的ReAct方法
机构 * Amazon.com, Inc.(亚马逊公司)
专题命中 Agent评测 :agent(abstract);AI agent(abstract);agentic(abstract);分类 cs.AI、cs.LG
AI总结 FAMOSE通过ReAct方法实现自动化特征发现,显著提升分类和回归任务的性能,展示了AI代理在创新解决方案中的有效性。
Comments 23 pages, 6 figures
注意GAP:在LLM代理中,文本安全不转移到工具调用安全
机构 * Independent Researcher(独立研究者)
专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.SE
AI总结 该研究发现LLM代理中文本安全不等同于工具调用安全,引入GAP基准测试揭示两者差异,强调需专门评估工具调用安全。
Comments 23 pages, 5 figures, 4 tables, code and data at https://github.com/acartag7/gap-benchmark
LiveClin: 一种无泄漏的实时临床基准
机构 * The Chinese University of Hong Kong, ShenZhen(香港中文大学(深圳)) ; Ant Healthcare, Ant Group(蚂蚁集团) ; Zhejiang University(浙江大学) ; The Ohio State University(俄亥俄州立大学)
专题命中 Agent评测 :workflow(abstract);分类 cs.AI、cs.LG
AI总结 LiveClin通过实时更新的临床病例基准,评估医学大语言模型在真实临床场景中的表现,揭示其在复杂医疗任务中的挑战。
AI 游戏商店:通过人类游戏评估机器通用智能的可扩展性和开放性
专题命中 Agent评测 :planning(abstract);分类 cs.AI
AI总结 通过AI GameStore评估机器通用智能,利用人类游戏测试AI在游戏中的表现,发现其在复杂游戏任务中表现不佳。
Comments 29 pages, 14 figures
通过动态谓词发明实现因果模型的持续学习与完善
机构 * University of Bristol(布里斯托大学)
专题命中 Agent评测 :agent(abstract);分类 cs.AI
AI总结 本文提出通过动态谓词发明实现因果模型的持续学习与完善,利用元解释学习提升推理效率,显著提高样本效率。
ConvApparel:一种用于对话推荐系统中用户模拟器的基准数据集和验证框架
机构 * Google(谷歌)
专题命中 Agent评测 :agent(abstract);分类 cs.CL
AI总结 ConvApparel通过双代理数据收集和反事实验证框架,评估对话推荐系统中用户模拟器的现实差距和泛化能力。
Comments EACL 2026
NESSiE: 必要安全基准 -- 识别不应存在的错误
专题命中 Agent评测 :autonomous agent(abstract);分类 cs.SE
AI总结 NESSiE提出了一种轻量级安全基准,用于检测大型语言模型中不应存在的安全故障,揭示模型在帮助与安全之间的偏差。
Comments 13 pages, 6 figures
具有交叉影响传播器的最优投资组合选择
专题命中 Agent评测 :agent(abstract)
AI总结 本文提出了一种基于矩阵值Volterra传播器的最优投资组合选择模型,通过求解随机Fredholm方程组,分析了交叉影响对投资策略及阿尔法衰减的相互作用。
Comments 37 pages, 7 figures
SimulatorCoder: 基于大语言模型的DNN加速器模拟器代码生成与优化
专题命中 Agent评测 :agent(abstract)
AI总结 SimulatorCoder利用大语言模型生成并优化DNN加速器模拟器代码,通过结构化提示和反馈机制提升代码准确性和模拟性能。
GDEV-AI: 对深度学习推理扩展性和架构饱和度的通用评估
专题命中 Agent评测 :planning(abstract)
AI总结 GDEV-AI通过基准测试分析CPU推理的可扩展性和架构饱和度,揭示传统CPU和现代架构在吞吐量和延迟上的差异,为异构数据中心的容量规划提供实证支持。
Comments 14 pages, 18 figures, 20 references
拍卖设计中的公平性:单位需求代理与非准线性偏好
专题命中 Agent评测 :agent(abstract)
AI总结 本文提出了一种基于公平性的拍卖机制,该机制在单位需求代理和非准线性偏好下实现策略可行、个体理性、同等对待、无浪费和无补贴。
在CEX和DEX中使用优先费用和随机延迟的交易
专题命中 Agent评测 :agent(abstract)
AI总结 本文提出了一种结合连续控制与脉冲干预的混合框架,用于在CEX和DEX中优化交易策略,通过优先费用选择最优管理延迟风险。
通过递推视界跟踪生成类人轨迹应用于TickTacking界面
专题命中 Agent评测 :agent(abstract)
AI总结 本文通过递推视界方法在TickTacking界面中生成类人轨迹,通过分析用户行为特征提升人机交互的直观性和效率。
面向代理计算的安全基础
专题命中 其他Agent :agentic(title,abstract);AI agent(abstract)
AI总结 本文从系统安全角度出发,分析代理型AI的安全挑战,提出端到端安全属性研究,涵盖11个现实攻击案例并定义新的研究问题。
迈向完全自主的、原生AI粒子加速器
机构 * Jefferson Laboratory(杰弗逊实验室)
专题命中 其他Agent :agentic(abstract);分类 cs.AI
AI总结 本文提出通过AI共同设计构建完全自主的粒子加速器,旨在实现自主运行和最大化性能。
Comments 14 pages, 1 figure
基于补丁的空间作者归属在人类-机器人协作绘画中
机构 * Robotics, University of Michigan, Ann Arbor, Michigan, United States(机器人学,密歇根大学,安娜堡,密歇根,美国)
专题命中 其他Agent :agentic(abstract)
AI总结 本文提出了一种基于补丁的空间作者归属方法,用于人类-机器人协作绘画,通过实验验证在数据稀缺情况下有效区分混合作者身份。