arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-01-07 至 2026-01-07 共收录 16 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. Agent评测 16 篇

2509.10769 2026-01-07 cs.AI cs.CL cs.MA 88%

AgentArch: A Comprehensive Benchmark to Evaluate Agent Architectures in Enterprise

AgentArch: 一种全面的基准,用于评估企业中的代理架构

Tara Bogavelli, Roshnee Sharma, Hari Subramani

机构 * ServiceNow

专题命中 Agent评测 :agent(title,abstract);function calling(abstract);agentic(abstract);multi-agent(abstract)

AI总结 AgentArch提出一个企业特定的基准,评估代理架构在复杂任务中的性能,揭示模型特定的架构偏好及性能瓶颈。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.24045 2026-01-07 cs.DC cs.LG 86%

Agent.xpu: Efficient Scheduling of Agentic LLM Workloads on Heterogeneous SoC

Agent.xpu: 高效调度代理LLM工作负载于异构SoC

Xinming Wei, Jiahao Zhang, Haoran Li, Jiayu Chen, Haoning Guan, Rui Qu, Maoliang Li, Xiang Chen, Guojie Luo

机构 * School of Computer Science, Peking University(北京大学计算机科学学院) The University of Hong Kong(香港大学) National Key Laboratory for Multimedia Information Processing, Peking University(北京大学多媒体信息处理国家重点实验室)

专题命中 Agent评测 :agent(title,abstract);agentic(title);分类 cs.LG

AI总结 Agent.xpu通过异构执行图和流感知协调技术,高效调度代理LLM工作负载,提升主动吞吐量和反应性响应性能

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02941 2026-01-07 cs.CR cs.AI cs.CL 81%

SastBench: A Benchmark for Testing Agentic SAST Triage

SastBench: 一个用于测试代理SAST分拣的基准

Jake Feiglin, Guy Dar

机构 * Rival Labs(Rival实验室)

专题命中 Agent评测 :agentic(title);agent(abstract);分类 cs.AI、cs.CL

AI总结 SastBench是一个用于评估SAST分拣代理性能的基准,结合真实CVE和过滤后的SAST发现,提供性能比较和未来发展的讨论。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.15196 2026-01-07 math.OC cs.SY eess.SY 78%

AdGT: Decentralized Gradient Tracking with Tuning-free Per-Agent Stepsize

AdGT:具有无调优每代理步长的去中心化梯度追踪

Diyako Ghaderyan, Stefan Werner

专题命中 Agent评测 :agent(title,abstract)

AI总结 AdGT是一种自适应梯度追踪方法,通过根据局部目标的光滑度调整步长,实现去中心化优化的线性收敛。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03144 2026-01-07 cs.CL cs.AI 73%

Self-Verification is All You Need To Pass The Japanese Bar Examination

自我验证就是通过日本司法考试所需

Andrew Shin

机构 * Keio University(.keio大学)

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.AI、cs.CL

AI总结 本文提出了一种自我验证模型,通过忠实复制考试格式和评分尺度,首次实现了LLM通过日本司法考试,无需修改原始问题结构或评分规则。

Comments https://github.com/shinandrew/self_verification

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02750 2026-01-07 cs.IR 71%

Ahead of the Spread: Agent-Driven Virtual Propagation for Early Fake News Detection

提前传播:基于代理的虚拟传播用于早期虚假新闻检测

Bincheng Gu, Min Gao, Junliang Yu, Zongwei Wang, Zhiyi Liu, Kai Shu, Hongyu Zhang

专题命中 Agent评测 :agent(title)

AI总结 AVOID通过基于代理的虚拟传播方法,主动模拟早期虚假新闻的扩散行为,从而提升早期检测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03011 2026-01-07 cs.CV cs.MA 67%

ReCCur: A Recursive Corner-Case Curation Framework for Robust Vision-Language Understanding in Open and Edge Scenarios

ReCCur:一种递归角落案例校准框架,用于开放和边缘场景中的鲁棒视觉-语言理解

Yihan Wei, Shenghai Yuan, Tianchen Deng, Boyang Lou, Enwen Hu

机构 * Nanyang Technological University(南洋理工大学) Shanghai Jiao Tong University(上海交通大学) Beijing University of Posts and Telecommunications(北京邮电大学)

专题命中 Agent评测 :agent(abstract);multi-agent(abstract)

AI总结 ReCCur通过递归框架实现低计算量的角落案例校准,提升开放和边缘场景下的视觉-语言理解鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.03750 2026-01-07 cs.LG cs.AI cs.CL cs.CY 67%

The MASK Benchmark: Disentangling Honesty From Accuracy in AI Systems

MASK基准:在人工智能系统中区分诚实与准确性

Richard Ren, Arunim Agarwal, Mantas Mazeika, Cristina Menghini, Robert Vacareanu, Brad Kenstler, Mick Yang, Isabelle Barrass, Alice Gatti, Xuwang Yin, Eduardo Trevino, Matias Geralnik, Adam Khoja, Dean Lee, Summer Yue, Dan Hendrycks

机构 * Center for AI Safety(人工智能安全中心) Scale AI

专题命中 Agent评测 :agentic(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 本文提出MASK基准,通过大规模人工数据集区分LLM的准确性和诚实性,发现大模型虽更准确但不更诚实,简单干预可提升诚实度,强调需加强评估与干预以确保模型可信。

Comments Website: https://www.mask-benchmark.ai

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.09583 2026-01-07 cs.CL cs.CY cs.HC cs.LG cs.SI 62%

Personality-Enhanced Social Recommendations in SAMI: Exploring the Role of Personality Detection in Matchmaking

在SAMI中融入人格因素的社会推荐:探索人格检测在匹配中的作用

Brittany Harbison, Samuel Taubman, Travis Taylor, Ashok. K. Goel

专题命中 Agent评测 :agent(abstract);分类 cs.CL、cs.LG

AI总结 本文提出利用GPT零样本能力推断大五人格特质,整合至SAMI社交推荐系统,探索人格检测对社交匹配的影响。

Comments Preprint. Appears in INTED 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.06539 2026-01-07 cs.LG cs.AI 62%

Learning Optimal Defender Strategies for CAGE-2 using a POMDP Model

基于POMDP模型学习CAGE-2的最优防御策略

Duc Huy Le, Rolf Stadler

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG

AI总结 本文提出BF-PPO方法,基于POMDP模型高效学习CAGE-2的最优防御策略,优于现有最高排名方法CARDIFF。

Comments The paper is accepted for the 21st International Conference on Network and Service Management (CNSM-2025) and the official version is published in the conference proceedings

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12063 2026-01-07 cs.AI 57%

TextBO: Bayesian Optimization in Language Space for Eval-Efficient Self-Improving AI

TextBO: 在语言空间中基于贝叶斯优化的评估高效自改进AI

Enoch Hyunwook Kang, Hema Yoganarasimhan

机构 * University of Washington(华盛顿大学)

专题命中 Agent评测 :agentic(abstract);分类 cs.AI

AI总结 TextBO是一种在语言空间中基于贝叶斯优化的评估高效自改进AI算法,通过结合文本梯度与最佳N选择策略,实现高效自改进。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03182 2026-01-07 math.OC 50%

Subjective-Objective Median-based Importance Technique (SOMIT) to Aid Multi-Criteria Renewable Energy Evaluation

主观-客观中位数重要性技术(SOMIT)用于多准则可再生能源评估

Ding Ding, Yang Li, Poh Ling Neo, Zhiyuan Wang, Chongwu Xia

专题命中 Agent评测 :planning(abstract)

AI总结 SOMIT是一种结合主观和客观方法的新技术,用于确定多准则决策中的标准权重,以提升可再生能源评估的准确性和效率。

Journal ref Applied Energy, 402 (2025) 126872

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.18805 2026-01-07 cs.GT cs.MA econ.TH 50%

It's Not All Black and White: Degree of Truthfulness for Risk-Avoiding Agents

并非非黑即白:风险规避代理的诚实度

Eden Hartman, Erel Segal-Halevi, Biaoshuai Tao

专题命中 Agent评测 :agent(abstract)

AI总结 本文提出风险规避诚实性概念,定义机制的RAT度以衡量其安全操纵抵抗能力。

Comments Accepted to EC 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02372 2026-01-07 cs.IR 50%

Improving News Recommendations through Hybrid Sentiment Modelling and Reinforcement Learning

通过混合情感建模与强化学习改进新闻推荐

Eunice Kingenga, Mike Wa Nkongolo

专题命中 Agent评测 :agent(abstract)

AI总结 本文通过混合情感分析与强化学习方法,改进新闻推荐系统,提升个性化和情感匹配能力。

Comments Masters in information technology, University of Pretoria

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.24958 2026-01-07 cs.CY 50%

Adaptive Data Collection for Latin-American Community-sourced Evaluation of Stereotypes (LACES)

自适应数据收集用于拉美社区源的刻板印象评估(LACES)

Guido Ivetta, Pietro Palombini, Sofía Martinelli, Marcos J Gomez, M. María Echeveste, Sunipa Dev, Vinodkumar Prabhakaran, Luciana Benotti

专题命中 Agent评测 :workflow(abstract)

AI总结 本文提出LACES数据集和自适应数据收集方法,用于评估拉丁美洲地区的刻板印象,以弥补现有研究的地理文化缺口。

详情

展开后加载摘要…

URL PDF HTML 收藏
2210.06094 2026-01-07 cs.CV 50%

Teeth3DS+: An Extended Benchmark for Intraoral 3D Scans Analysis

Teeth3DS+: 用于牙科内窥镜3D扫描分析的扩展基准

Achraf Ben-Hamadou, Nour Neifar, Ahmed Rekik, Oussama Smaoui, Firas Bouzguenda, Sergi Pujades, Edmond Boyer, Edouard Ladroit

机构 * SMARTS Laboratory, Technopark of Sfax, Sakiet Ezzit 3021, Sfax, Tunisia(SMARTS实验室,Sfax技术园区,Sakiet Ezzit 3021,Sfax,突尼斯) Digital Research Center of Sfax, Technopark of Sfax, Sakiet Ezzit 3021, Sfax, Tunisia(Sfax数字研究中心,Sfax技术园区,Sakiet Ezzit 3021,Sfax,突尼斯) Inria, Univ. Grenoble Alpes, CNRS, Grenoble INP, LJK, France(Inria,格勒诺布尔阿尔卑斯大学,法国国家科学研究中心,格勒诺布尔INP,LJK,法国)

专题命中 Agent评测 :planning(abstract)

AI总结 Teeth3DS+是一个扩展的牙科内窥镜3D扫描分析基准,提供高质量数据集和标准化评估协议,促进基于学习的3D牙科扫描分析发展。

Comments Draft

详情

展开后加载摘要…

URL PDF HTML 收藏