Optimal Average Disk-Inspection via Fermat's Principle
通过费马原理实现最优平均盘检查
专题命中 GUI与网页智能体 :agent(abstract)
AI总结 本文通过费马原理解决盘检查问题的最优平均成本,推翻Gluss猜想并确定精确成本为3.549259…
Comments 29 pages, 7 figures
AI 大模型
智能体、工具调用、规划、工作流、多智能体和自主任务执行。
通过费马原理实现最优平均盘检查
专题命中 GUI与网页智能体 :agent(abstract)
AI总结 本文通过费马原理解决盘检查问题的最优平均成本,推翻Gluss猜想并确定精确成本为3.549259…
Comments 29 pages, 7 figures
AdaVLN: 向具有移动人类的连续室内环境中的视觉语言导航迈进
机构 * Hiverlab Pte. Ltd.(Hiverlab公司) ; NVIDIA(NVIDIA公司) ; Shanghai University(上海大学) ; Singapore Institute of Technology(新加坡科技学院)
专题命中 GUI与网页智能体 :agent(abstract)
AI总结 AdaVLN通过引入动态人类障碍物和冻结时间机制,提升机器人在连续室内环境中的视觉语言导航能力,以缩小仿真与现实的差距。
基于代理记忆的递归推理用于微服务根因定位
机构 * Peking University(北京大学) ; Alibaba Group(阿里巴巴集团) ; Tsinghua University(清华大学) ; Institute of Artificial Intelligence(人工智能研究院)
专题命中 记忆与上下文管理 :agentic(title,abstract);agent(abstract);multi-agent(abstract);分类 cs.AI、cs.SE
AI总结 本文提出AMER-RCL框架,通过递归推理和代理记忆提升微服务根因定位的准确性和效率。
Comments accepted by ICSE-SEIP'26
EvoRoute: 基于经验的自我路由LLM代理系统
机构 * National University of Singapore(新加坡国立大学) ; Tongyi Lab(通义实验室)
专题命中 记忆与上下文管理 :agent(title,abstract);agentic(abstract);分类 cs.CL
AI总结 EvoRoute通过动态选择最优LLM模型,解决代理系统在性能、成本和延迟间的平衡问题,显著提升效率并降低成本
基于大语言模型的强化学习用于时间序列异常检测
机构 * dept. Computer Science Portland State University(计算机科学系波特兰州立大学) ; dept. Computer Science Smith College(计算机科学系史密斯学院)
专题命中 记忆与上下文管理 :agent(abstract);分类 cs.LG
AI总结 本文提出结合大语言模型与强化学习的统一框架,通过奖励塑造、动态奖励缩放和主动学习提升时间序列异常检测的准确性和效率。
SE+BSF4DM使用手册 -- 一个用于彩色暗物质领域的micrOMEGAs扩展包
专题命中 记忆与上下文管理 :workflow(abstract)
AI总结 SE+BSF4DM是一个用于计算QCD彩色暗物质领域暗物质 relic 密度的micrOMEGAs扩展包,通过整合Sommerfeld效应和束缚态形成效应,提供简便的使用指南。
Comments 20 pages, 4 figures
AgentArch: 一种全面的基准,用于评估企业中的代理架构
机构 * ServiceNow
专题命中 Agent评测 :agent(title,abstract);function calling(abstract);agentic(abstract);multi-agent(abstract)
AI总结 AgentArch提出一个企业特定的基准,评估代理架构在复杂任务中的性能,揭示模型特定的架构偏好及性能瓶颈。
Agent.xpu: 高效调度代理LLM工作负载于异构SoC
机构 * School of Computer Science, Peking University(北京大学计算机科学学院) ; The University of Hong Kong(香港大学) ; National Key Laboratory for Multimedia Information Processing, Peking University(北京大学多媒体信息处理国家重点实验室)
专题命中 Agent评测 :agent(title,abstract);agentic(title);分类 cs.LG
AI总结 Agent.xpu通过异构执行图和流感知协调技术,高效调度代理LLM工作负载,提升主动吞吐量和反应性响应性能
SastBench: 一个用于测试代理SAST分拣的基准
机构 * Rival Labs(Rival实验室)
专题命中 Agent评测 :agentic(title);agent(abstract);分类 cs.AI、cs.CL
AI总结 SastBench是一个用于评估SAST分拣代理性能的基准,结合真实CVE和过滤后的SAST发现,提供性能比较和未来发展的讨论。
AdGT:具有无调优每代理步长的去中心化梯度追踪
专题命中 Agent评测 :agent(title,abstract)
AI总结 AdGT是一种自适应梯度追踪方法,通过根据局部目标的光滑度调整步长,实现去中心化优化的线性收敛。
自我验证就是通过日本司法考试所需
机构 * Keio University(.keio大学)
专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.AI、cs.CL
AI总结 本文提出了一种自我验证模型,通过忠实复制考试格式和评分尺度,首次实现了LLM通过日本司法考试,无需修改原始问题结构或评分规则。
提前传播:基于代理的虚拟传播用于早期虚假新闻检测
专题命中 Agent评测 :agent(title)
AI总结 AVOID通过基于代理的虚拟传播方法,主动模拟早期虚假新闻的扩散行为,从而提升早期检测性能。
ReCCur:一种递归角落案例校准框架,用于开放和边缘场景中的鲁棒视觉-语言理解
机构 * Nanyang Technological University(南洋理工大学) ; Shanghai Jiao Tong University(上海交通大学) ; Beijing University of Posts and Telecommunications(北京邮电大学)
专题命中 Agent评测 :agent(abstract);multi-agent(abstract)
AI总结 ReCCur通过递归框架实现低计算量的角落案例校准,提升开放和边缘场景下的视觉-语言理解鲁棒性。
MASK基准:在人工智能系统中区分诚实与准确性
机构 * Center for AI Safety(人工智能安全中心) ; Scale AI
专题命中 Agent评测 :agentic(abstract);分类 cs.AI、cs.CL、cs.LG
AI总结 本文提出MASK基准,通过大规模人工数据集区分LLM的准确性和诚实性,发现大模型虽更准确但不更诚实,简单干预可提升诚实度,强调需加强评估与干预以确保模型可信。
Comments Website: https://www.mask-benchmark.ai
在SAMI中融入人格因素的社会推荐:探索人格检测在匹配中的作用
专题命中 Agent评测 :agent(abstract);分类 cs.CL、cs.LG
AI总结 本文提出利用GPT零样本能力推断大五人格特质,整合至SAMI社交推荐系统,探索人格检测对社交匹配的影响。
Comments Preprint. Appears in INTED 2026
基于POMDP模型学习CAGE-2的最优防御策略
专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG
AI总结 本文提出BF-PPO方法,基于POMDP模型高效学习CAGE-2的最优防御策略,优于现有最高排名方法CARDIFF。
Comments The paper is accepted for the 21st International Conference on Network and Service Management (CNSM-2025) and the official version is published in the conference proceedings
TextBO: 在语言空间中基于贝叶斯优化的评估高效自改进AI
机构 * University of Washington(华盛顿大学)
专题命中 Agent评测 :agentic(abstract);分类 cs.AI
AI总结 TextBO是一种在语言空间中基于贝叶斯优化的评估高效自改进AI算法,通过结合文本梯度与最佳N选择策略,实现高效自改进。
主观-客观中位数重要性技术(SOMIT)用于多准则可再生能源评估
专题命中 Agent评测 :planning(abstract)
AI总结 SOMIT是一种结合主观和客观方法的新技术,用于确定多准则决策中的标准权重,以提升可再生能源评估的准确性和效率。
Journal ref Applied Energy, 402 (2025) 126872
并非非黑即白:风险规避代理的诚实度
专题命中 Agent评测 :agent(abstract)
AI总结 本文提出风险规避诚实性概念,定义机制的RAT度以衡量其安全操纵抵抗能力。
Comments Accepted to EC 2025
通过混合情感建模与强化学习改进新闻推荐
专题命中 Agent评测 :agent(abstract)
AI总结 本文通过混合情感分析与强化学习方法,改进新闻推荐系统,提升个性化和情感匹配能力。
Comments Masters in information technology, University of Pretoria
自适应数据收集用于拉美社区源的刻板印象评估(LACES)
专题命中 Agent评测 :workflow(abstract)
AI总结 本文提出LACES数据集和自适应数据收集方法,用于评估拉丁美洲地区的刻板印象,以弥补现有研究的地理文化缺口。
Teeth3DS+: 用于牙科内窥镜3D扫描分析的扩展基准
机构 * SMARTS Laboratory, Technopark of Sfax, Sakiet Ezzit 3021, Sfax, Tunisia(SMARTS实验室,Sfax技术园区,Sakiet Ezzit 3021,Sfax,突尼斯) ; Digital Research Center of Sfax, Technopark of Sfax, Sakiet Ezzit 3021, Sfax, Tunisia(Sfax数字研究中心,Sfax技术园区,Sakiet Ezzit 3021,Sfax,突尼斯) ; Inria, Univ. Grenoble Alpes, CNRS, Grenoble INP, LJK, France(Inria,格勒诺布尔阿尔卑斯大学,法国国家科学研究中心,格勒诺布尔INP,LJK,法国)
专题命中 Agent评测 :planning(abstract)
AI总结 Teeth3DS+是一个扩展的牙科内窥镜3D扫描分析基准,提供高质量数据集和标准化评估协议,促进基于学习的3D牙科扫描分析发展。
Comments Draft
多模态数据增强的基础模型用于无线网络中的预测与控制:综述
机构 * School of Electrical Engineering and Computer Science, University of Ottawa(Ottawa 大学电子工程与计算机科学学院) ; Ericsson(埃里克森公司)
专题命中 其他Agent :AI agent(abstract);分类 cs.AI、cs.CL
AI总结 本文综述了多模态数据增强的基础模型在无线网络预测与控制中的应用,探讨了其在无线网络管理中的关键任务和未来发展方向。
Comments 5 figures, 7 tables, IEEE COMST