arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-01-07 至 2026-01-07 共收录 83 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. GUI与网页智能体 4 篇

2509.06334 2026-01-07 cs.DM 50%

Optimal Average Disk-Inspection via Fermat's Principle

通过费马原理实现最优平均盘检查

Konstantinos Georgiou

专题命中 GUI与网页智能体 :agent(abstract)

AI总结 本文通过费马原理解决盘检查问题的最优平均成本,推翻Gluss猜想并确定精确成本为3.549259…

Comments 29 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.18539 2026-01-07 cs.CV cs.RO 50%

AdaVLN: Towards Visual Language Navigation in Continuous Indoor Environments with Moving Humans

AdaVLN: 向具有移动人类的连续室内环境中的视觉语言导航迈进

Dillon Loh, Tomasz Bednarz, Xinxing Xia, Frank Guan

机构 * Hiverlab Pte. Ltd.(Hiverlab公司) NVIDIA(NVIDIA公司) Shanghai University(上海大学) Singapore Institute of Technology(新加坡科技学院)

专题命中 GUI与网页智能体 :agent(abstract)

AI总结 AdaVLN通过引入动态人类障碍物和冻结时间机制,提升机器人在连续室内环境中的视觉语言导航能力,以缩小仿真与现实的差距。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 记忆与上下文管理 4 篇

2601.02732 2026-01-07 cs.SE cs.AI 86%

Agentic Memory Enhanced Recursive Reasoning for Root Cause Localization in Microservices

基于代理记忆的递归推理用于微服务根因定位

Lingzhe Zhang, Tong Jia, Yunpeng Zhai, Leyi Pan, Chiming Duan, Minghua He, Mengxi Jia, Ying Li

机构 * Peking University(北京大学) Alibaba Group(阿里巴巴集团) Tsinghua University(清华大学) Institute of Artificial Intelligence(人工智能研究院)

专题命中 记忆与上下文管理 :agentic(title,abstract);agent(abstract);multi-agent(abstract);分类 cs.AI、cs.SE

AI总结 本文提出AMER-RCL框架,通过递归推理和代理记忆提升微服务根因定位的准确性和效率。

Comments accepted by ICSE-SEIP'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02695 2026-01-07 cs.CL cs.MA 83%

EvoRoute: Experience-Driven Self-Routing LLM Agent Systems

EvoRoute: 基于经验的自我路由LLM代理系统

Guibin Zhang, Haiyang Yu, Kaiming Yang, Bingli Wu, Fei Huang, Yongbin Li, Shuicheng Yan

机构 * National University of Singapore(新加坡国立大学) Tongyi Lab(通义实验室)

专题命中 记忆与上下文管理 :agent(title,abstract);agentic(abstract);分类 cs.CL

AI总结 EvoRoute通过动态选择最优LLM模型,解决代理系统在性能、成本和延迟间的平衡问题,显著提升效率并降低成本

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02511 2026-01-07 cs.LG 57%

LLM-Enhanced Reinforcement Learning for Time Series Anomaly Detection

基于大语言模型的强化学习用于时间序列异常检测

Bahareh Golchin, Banafsheh Rekabdar, Danielle Justo

机构 * dept. Computer Science Portland State University(计算机科学系波特兰州立大学) dept. Computer Science Smith College(计算机科学系史密斯学院)

专题命中 记忆与上下文管理 :agent(abstract);分类 cs.LG

AI总结 本文提出结合大语言模型与强化学习的统一框架,通过奖励塑造、动态奖励缩放和主动学习提升时间序列异常检测的准确性和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02155 2026-01-07 hep-ph 50%

Manual for SE+BSF4DM -- A micrOMEGAs package for Sommerfeld Effect and Bound State Formation in colored Dark Sectors

SE+BSF4DM使用手册 -- 一个用于彩色暗物质领域的micrOMEGAs扩展包

Mathias Becker, Emanuele Copello, Julia Harz, Martin Napetschnig

专题命中 记忆与上下文管理 :workflow(abstract)

AI总结 SE+BSF4DM是一个用于计算QCD彩色暗物质领域暗物质 relic 密度的micrOMEGAs扩展包,通过整合Sommerfeld效应和束缚态形成效应,提供简便的使用指南。

Comments 20 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

3. Agent评测 16 篇

2509.10769 2026-01-07 cs.AI cs.CL cs.MA 88%

AgentArch: A Comprehensive Benchmark to Evaluate Agent Architectures in Enterprise

AgentArch: 一种全面的基准,用于评估企业中的代理架构

Tara Bogavelli, Roshnee Sharma, Hari Subramani

机构 * ServiceNow

专题命中 Agent评测 :agent(title,abstract);function calling(abstract);agentic(abstract);multi-agent(abstract)

AI总结 AgentArch提出一个企业特定的基准,评估代理架构在复杂任务中的性能,揭示模型特定的架构偏好及性能瓶颈。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.24045 2026-01-07 cs.DC cs.LG 86%

Agent.xpu: Efficient Scheduling of Agentic LLM Workloads on Heterogeneous SoC

Agent.xpu: 高效调度代理LLM工作负载于异构SoC

Xinming Wei, Jiahao Zhang, Haoran Li, Jiayu Chen, Haoning Guan, Rui Qu, Maoliang Li, Xiang Chen, Guojie Luo

机构 * School of Computer Science, Peking University(北京大学计算机科学学院) The University of Hong Kong(香港大学) National Key Laboratory for Multimedia Information Processing, Peking University(北京大学多媒体信息处理国家重点实验室)

专题命中 Agent评测 :agent(title,abstract);agentic(title);分类 cs.LG

AI总结 Agent.xpu通过异构执行图和流感知协调技术,高效调度代理LLM工作负载,提升主动吞吐量和反应性响应性能

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02941 2026-01-07 cs.CR cs.AI cs.CL 81%

SastBench: A Benchmark for Testing Agentic SAST Triage

SastBench: 一个用于测试代理SAST分拣的基准

Jake Feiglin, Guy Dar

机构 * Rival Labs(Rival实验室)

专题命中 Agent评测 :agentic(title);agent(abstract);分类 cs.AI、cs.CL

AI总结 SastBench是一个用于评估SAST分拣代理性能的基准,结合真实CVE和过滤后的SAST发现,提供性能比较和未来发展的讨论。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.15196 2026-01-07 math.OC cs.SY eess.SY 78%

AdGT: Decentralized Gradient Tracking with Tuning-free Per-Agent Stepsize

AdGT:具有无调优每代理步长的去中心化梯度追踪

Diyako Ghaderyan, Stefan Werner

专题命中 Agent评测 :agent(title,abstract)

AI总结 AdGT是一种自适应梯度追踪方法,通过根据局部目标的光滑度调整步长,实现去中心化优化的线性收敛。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03144 2026-01-07 cs.CL cs.AI 73%

Self-Verification is All You Need To Pass The Japanese Bar Examination

自我验证就是通过日本司法考试所需

Andrew Shin

机构 * Keio University(.keio大学)

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.AI、cs.CL

AI总结 本文提出了一种自我验证模型,通过忠实复制考试格式和评分尺度,首次实现了LLM通过日本司法考试,无需修改原始问题结构或评分规则。

Comments https://github.com/shinandrew/self_verification

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02750 2026-01-07 cs.IR 71%

Ahead of the Spread: Agent-Driven Virtual Propagation for Early Fake News Detection

提前传播:基于代理的虚拟传播用于早期虚假新闻检测

Bincheng Gu, Min Gao, Junliang Yu, Zongwei Wang, Zhiyi Liu, Kai Shu, Hongyu Zhang

专题命中 Agent评测 :agent(title)

AI总结 AVOID通过基于代理的虚拟传播方法,主动模拟早期虚假新闻的扩散行为,从而提升早期检测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03011 2026-01-07 cs.CV cs.MA 67%

ReCCur: A Recursive Corner-Case Curation Framework for Robust Vision-Language Understanding in Open and Edge Scenarios

ReCCur:一种递归角落案例校准框架,用于开放和边缘场景中的鲁棒视觉-语言理解

Yihan Wei, Shenghai Yuan, Tianchen Deng, Boyang Lou, Enwen Hu

机构 * Nanyang Technological University(南洋理工大学) Shanghai Jiao Tong University(上海交通大学) Beijing University of Posts and Telecommunications(北京邮电大学)

专题命中 Agent评测 :agent(abstract);multi-agent(abstract)

AI总结 ReCCur通过递归框架实现低计算量的角落案例校准,提升开放和边缘场景下的视觉-语言理解鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.03750 2026-01-07 cs.LG cs.AI cs.CL cs.CY 67%

The MASK Benchmark: Disentangling Honesty From Accuracy in AI Systems

MASK基准:在人工智能系统中区分诚实与准确性

Richard Ren, Arunim Agarwal, Mantas Mazeika, Cristina Menghini, Robert Vacareanu, Brad Kenstler, Mick Yang, Isabelle Barrass, Alice Gatti, Xuwang Yin, Eduardo Trevino, Matias Geralnik, Adam Khoja, Dean Lee, Summer Yue, Dan Hendrycks

机构 * Center for AI Safety(人工智能安全中心) Scale AI

专题命中 Agent评测 :agentic(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 本文提出MASK基准,通过大规模人工数据集区分LLM的准确性和诚实性,发现大模型虽更准确但不更诚实,简单干预可提升诚实度,强调需加强评估与干预以确保模型可信。

Comments Website: https://www.mask-benchmark.ai

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.09583 2026-01-07 cs.CL cs.CY cs.HC cs.LG cs.SI 62%

Personality-Enhanced Social Recommendations in SAMI: Exploring the Role of Personality Detection in Matchmaking

在SAMI中融入人格因素的社会推荐:探索人格检测在匹配中的作用

Brittany Harbison, Samuel Taubman, Travis Taylor, Ashok. K. Goel

专题命中 Agent评测 :agent(abstract);分类 cs.CL、cs.LG

AI总结 本文提出利用GPT零样本能力推断大五人格特质,整合至SAMI社交推荐系统,探索人格检测对社交匹配的影响。

Comments Preprint. Appears in INTED 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.06539 2026-01-07 cs.LG cs.AI 62%

Learning Optimal Defender Strategies for CAGE-2 using a POMDP Model

基于POMDP模型学习CAGE-2的最优防御策略

Duc Huy Le, Rolf Stadler

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG

AI总结 本文提出BF-PPO方法,基于POMDP模型高效学习CAGE-2的最优防御策略,优于现有最高排名方法CARDIFF。

Comments The paper is accepted for the 21st International Conference on Network and Service Management (CNSM-2025) and the official version is published in the conference proceedings

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12063 2026-01-07 cs.AI 57%

TextBO: Bayesian Optimization in Language Space for Eval-Efficient Self-Improving AI

TextBO: 在语言空间中基于贝叶斯优化的评估高效自改进AI

Enoch Hyunwook Kang, Hema Yoganarasimhan

机构 * University of Washington(华盛顿大学)

专题命中 Agent评测 :agentic(abstract);分类 cs.AI

AI总结 TextBO是一种在语言空间中基于贝叶斯优化的评估高效自改进AI算法,通过结合文本梯度与最佳N选择策略,实现高效自改进。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03182 2026-01-07 math.OC 50%

Subjective-Objective Median-based Importance Technique (SOMIT) to Aid Multi-Criteria Renewable Energy Evaluation

主观-客观中位数重要性技术(SOMIT)用于多准则可再生能源评估

Ding Ding, Yang Li, Poh Ling Neo, Zhiyuan Wang, Chongwu Xia

专题命中 Agent评测 :planning(abstract)

AI总结 SOMIT是一种结合主观和客观方法的新技术,用于确定多准则决策中的标准权重,以提升可再生能源评估的准确性和效率。

Journal ref Applied Energy, 402 (2025) 126872

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.18805 2026-01-07 cs.GT cs.MA econ.TH 50%

It's Not All Black and White: Degree of Truthfulness for Risk-Avoiding Agents

并非非黑即白:风险规避代理的诚实度

Eden Hartman, Erel Segal-Halevi, Biaoshuai Tao

专题命中 Agent评测 :agent(abstract)

AI总结 本文提出风险规避诚实性概念,定义机制的RAT度以衡量其安全操纵抵抗能力。

Comments Accepted to EC 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02372 2026-01-07 cs.IR 50%

Improving News Recommendations through Hybrid Sentiment Modelling and Reinforcement Learning

通过混合情感建模与强化学习改进新闻推荐

Eunice Kingenga, Mike Wa Nkongolo

专题命中 Agent评测 :agent(abstract)

AI总结 本文通过混合情感分析与强化学习方法,改进新闻推荐系统,提升个性化和情感匹配能力。

Comments Masters in information technology, University of Pretoria

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.24958 2026-01-07 cs.CY 50%

Adaptive Data Collection for Latin-American Community-sourced Evaluation of Stereotypes (LACES)

自适应数据收集用于拉美社区源的刻板印象评估(LACES)

Guido Ivetta, Pietro Palombini, Sofía Martinelli, Marcos J Gomez, M. María Echeveste, Sunipa Dev, Vinodkumar Prabhakaran, Luciana Benotti

专题命中 Agent评测 :workflow(abstract)

AI总结 本文提出LACES数据集和自适应数据收集方法,用于评估拉丁美洲地区的刻板印象,以弥补现有研究的地理文化缺口。

详情

展开后加载摘要…

URL PDF HTML 收藏
2210.06094 2026-01-07 cs.CV 50%

Teeth3DS+: An Extended Benchmark for Intraoral 3D Scans Analysis

Teeth3DS+: 用于牙科内窥镜3D扫描分析的扩展基准

Achraf Ben-Hamadou, Nour Neifar, Ahmed Rekik, Oussama Smaoui, Firas Bouzguenda, Sergi Pujades, Edmond Boyer, Edouard Ladroit

机构 * SMARTS Laboratory, Technopark of Sfax, Sakiet Ezzit 3021, Sfax, Tunisia(SMARTS实验室,Sfax技术园区,Sakiet Ezzit 3021,Sfax,突尼斯) Digital Research Center of Sfax, Technopark of Sfax, Sakiet Ezzit 3021, Sfax, Tunisia(Sfax数字研究中心,Sfax技术园区,Sakiet Ezzit 3021,Sfax,突尼斯) Inria, Univ. Grenoble Alpes, CNRS, Grenoble INP, LJK, France(Inria,格勒诺布尔阿尔卑斯大学,法国国家科学研究中心,格勒诺布尔INP,LJK,法国)

专题命中 Agent评测 :planning(abstract)

AI总结 Teeth3DS+是一个扩展的牙科内窥镜3D扫描分析基准,提供高质量数据集和标准化评估协议,促进基于学习的3D牙科扫描分析发展。

Comments Draft

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 其他Agent 1 篇

2601.03181 2026-01-07 cs.NI cs.AI cs.CL cs.CV 62%

Multi-Modal Data-Enhanced Foundation Models for Prediction and Control in Wireless Networks: A Survey

多模态数据增强的基础模型用于无线网络中的预测与控制:综述

Han Zhang, Mohammad Farzanullah, Mohammad Ghassemi, Akram Bin Sediq, Ali Afana, Melike Erol-Kantarci

机构 * School of Electrical Engineering and Computer Science, University of Ottawa(Ottawa 大学电子工程与计算机科学学院) Ericsson(埃里克森公司)

专题命中 其他Agent :AI agent(abstract);分类 cs.AI、cs.CL

AI总结 本文综述了多模态数据增强的基础模型在无线网络预测与控制中的应用,探讨了其在无线网络管理中的关键任务和未来发展方向。

Comments 5 figures, 7 tables, IEEE COMST

详情

展开后加载摘要…

URL PDF HTML 收藏