arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-01-22 至 2026-01-22 共收录 12 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. Agent评测 12 篇

2512.24565 2026-01-22 cs.AI 88%

MCPAgentBench: A Real-world Task Benchmark for Evaluating LLM Agent MCP Tool Use

MCPAgentBench: 一个用于评估LLM代理MCP工具使用的现实任务基准

Wenrui Liu, Zixiang Liu, Elsie Dai, Wenhan Yu, Lei Yu, Tong Yang, Jinjun Han, Hong Gao

机构 * Peking University(北京大学) ZTE(中兴通讯)

专题命中 Agent评测 :agent(title);tool use(title);autonomous agent(abstract);tool-use(abstract)

AI总结 MCPAgentBench通过现实任务和动态沙盒环境评估LLM代理在复杂工具调用中的能力差异,提供开源代码以促进工具使用能力研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15153 2026-01-22 cs.AI 83%

How to Build AI Agents by Augmenting LLMs with Codified Human Expert Domain Knowledge? A Software Engineering Framework

如何通过将编码化的人类专家领域知识与大语言模型结合来构建AI代理?一种软件工程框架

Choro Ulan uulu, Mikhail Kulyabin, Iris Fuhrmann, Jan Joosten, Nuno Miguel Martins Pacheco, Filippos Petridis, Rebecca Johnson, Jan Bosch, Helena Holmström Olsson

机构 * Department of Computer Science and Engineering, Chalmers University of Technology(计算机科学与工程系,查尔姆斯理工大学) Department of Mathematics and Computer Science, Eindhoven University of Technology(数学与计算机科学系,埃因霍温理工大学) Department of Computer Science and Media Technology, Malmö University(计算机科学与媒体技术系,马尔默大学)

专题命中 Agent评测 :AI agent(title,abstract);agent(abstract);分类 cs.AI

AI总结 本文提出一种软件工程框架,通过增强大语言模型与编码化专家知识,构建能自主生成可视化内容的AI代理,实现非专家在专业领域内达到专家水平的成果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15034 2026-01-22 cs.HC cs.AI 79%

Visual and Cognitive Demands of a Large Language Model-Powered In-vehicle Conversational Agent

基于大型语言模型的车载对话代理的视觉与认知需求

Chris Monk, Allegra Ayala, Christine S. P. Yu, Gregory M. Fitch, Dara Gruber

机构 * Exponent, Inc.(Exponent公司) Google, Inc.(Google公司)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI

AI总结 本研究评估了基于大型语言模型的车载对话代理在驾驶中的视觉与认知需求,发现其与免提通话在认知负荷上相当,且视觉需求较低,支持其在驾驶环境中的安全应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15273 2026-01-22 q-bio.QM 78%

How high-resolution agent-based models can improve fundamental insights in tissue development and cell culturing methods

高分辨率基于代理的模型如何改进组织发育和细胞培养方法的基础见解

Paul Van Liedekerke, Jiří Pešek, Kevin Alessandri, Dirk Drasdo

专题命中 Agent评测 :agent(title,abstract)

AI总结 本文探讨了可变形细胞模型在组织发育和细胞培养方法中的应用,通过高分辨率模拟提升生物和生物技术问题的定量分析能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15258 2026-01-22 cs.GT 78%

Distributed Agent-Constrained Truthful Facility Location

分布式代理约束下的诚实设施定位

Argyrios Deligkas, Panagiotis Kanellopoulos, Alexandros A. Voudouris

专题命中 Agent评测 :agent(title,abstract)

AI总结 该研究提出了一种分布式设施定位机制,通过两阶段选择代表位置,确保代理无法通过策略性报告获益,并分析了两种成本变体下的近似比界。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15144 2026-01-22 q-bio.PE 78%

Modification speed and radius of higher-order interactions alter the oscillatory dynamics in an agent-based model

高阶相互作用的修改速度和半径改变代理模型中的振荡动力学

Thomas Van Giel, Hanna Jaspaert, Aisling J. Daly, Bernard De Baets, Jan M. Baetens

专题命中 Agent评测 :agent(title,abstract)

AI总结 本研究探讨了高阶相互作用在代理模型中对物种振荡动力学的影响,发现其修改速度和半径显著影响系统稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01090 2026-01-22 cs.MA cs.AI cs.CY 77%

Harm in AI-Driven Societies: An Audit of Toxicity Adoption on Chirper.ai

AI驱动社会中的危害:对Chirper.ai上毒性采用的审计

Erica Coppolillo, Luca Luceri, Emilio Ferrara

机构 * University of Southern California, Los Angeles, California(美国南加州大学) University of Calabria, Rende, Italy(意大利卡拉布里亚大学)

专题命中 Agent评测 :agent(abstract);AI agent(abstract);autonomous agent(abstract);分类 cs.AI

AI总结 研究通过分析Chirper.ai上AI代理的毒性行为,揭示了暴露于有害内容如何影响代理行为,并提出通过监控毒性暴露来减轻有害行为的风险。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15016 2026-01-22 cs.CV 75%

LiViBench: An Omnimodal Benchmark for Interactive Livestream Video Understanding

LiViBench:面向交互式直播视频理解的多模态基准测试

Xiaodong Wang, Langling Huang, Zhirong Wu, Xu Zhao, Teng Xu, Xuhong Xia, Peixi Peng

专题命中 Agent评测 :agent(abstract);workflow(abstract);multi-agent(abstract)

AI总结 LiViBench是首个面向交互式直播视频的多模态基准测试,通过定制化两阶段指令微调和视频到评论检索模块,提升模型对直播视频的理解能力,并在多个基准测试中取得优异成绩。

Comments AAAI 2026 Main Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14606 2026-01-22 cs.CR 71%

An LLM Agent-based Framework for Whaling Countermeasures

基于LLM代理的鲸鱼攻击防御框架

Daisuke Miyamoto, Takuji Iimura, Narushige Michishita

专题命中 Agent评测 :agent(title)

AI总结 本研究提出基于LLM代理的鲸鱼攻击防御框架,通过构建个性化防御资料和分析电子邮件,提升对高权威目标的防御能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14235 2026-01-22 astro-ph.IM astro-ph.CO cs.AI cs.LG stat.ML 62%

Opportunities in AI/ML for the Rubin LSST Dark Energy Science Collaboration

人工智能/机器学习在Rubin LSST暗能量科学合作中的机遇

LSST Dark Energy Science Collaboration, Eric Aubourg, Camille Avestruz, Matthew R. Becker, Biswajit Biswas, Rahul Biswas, Boris Bolliet, Adam S. Bolton, Clecio R. Bom, Raphaël Bonnet-Guerrini, Alexandre Boucaud, Jean-Eric Campagne, Chihway Chang, Aleksandra Ćiprijanović, Johann Cohen-Tanugi, Michael W. Coughlin, John Franklin Crenshaw, Juan C. Cuevas-Tello, Juan de Vicente, Seth W. Digel, Steven Dillmann, Mariano Javier de León Dominguez Romero, Alex Drlica-Wagner, Sydney Erickson, Alexander T. Gagliano, Christos Georgiou, Aritra Ghosh, Matthew Grayling, Kirill A. Grishin, Alan Heavens, Lindsay R. House, Mustapha Ishak, Wassim Kabalan, Arun Kannawadi, François Lanusse, C. Danielle Leonard, Pierre-François Léget, Michelle Lochner, Yao-Yuan Mao, Peter Melchior, Grant Merz, Martin Millon, Anais Möller, Gautham Narayan, Yuuki Omori, Hiranya Peiris, Laurence Perreault-Levasseur, Andrés A. Plazas Malagón, Nesar Ramachandra, Benjamin Remy, Cécile Roucelle, Jaime Ruiz-Zapatero, Stefan Schuldt, Ignacio Sevilla-Noarbe, Ved G. Shah, Tjitske Starkenburg, Stephen Thorp, Laura Toribio San Cipriano, Tilman Tröster, Roberto Trotta, Padma Venkatraman, Amanda Wasserman, Tim White, Justine Zeghal, Tianqing Zhang, Yuanyuan Zhang

机构 * Université Paris Cité, CNRS, CEA, Astroparticule et Cosmologie, F-75013 Paris, France Department of Physics, University of Michigan, Ann Arbor, MI 48109, USA Leinweber Institute of Theoretical Physics, University of Michigan, Ann Arbor, MI 48109, USA Argonne National Laboratory, 9700 South Cass Avenue, Lemont, IL 60439, USA Cavendish Astrophysics, University of Cambridge, Madingley Road, Cambridge CB3 0HA, UK Kavli Institute for Cosmology, University of Cambridge, Madingley Road, Cambridge CB3 0HA, UK SLAC National Accelerator Laboratory, Menlo Park, CA 94025, USA Department of Computer Science, University of Milan, Milan, Italy Université Paris Cité, CNRS, Astroparticule et Cosmologie, F-75013 Paris, France Université Paris-Saclay, CNRS/IN2P3, IJCLab, 91405 Orsay, France Department of Astronomy Astrophysics, University of Chicago, Chicago, IL 60637, USA Kavli Institute for Cosmological Physics, University of Chicago, Chicago, IL 60637, USA NSF-Simons AI Institute for the Sky (SkAI), 172 E. Chestnut St., Chicago, IL 60611, USA Fermi National Accelerator Laboratory, P.O. Box 500, Batavia, IL 60510, USA Universit\'e Clermont-Auvergne, CNRS, LPCA, 63000 Clermont-Ferrand, France Kavli Institute for Particle Astrophysics Cosmology, Stanford University, Stanford, CA 94305, USA Department of Physics, Stanford University, 382 Via Pueblo Mall, Stanford, CA 94305, USA Engineering Faculty, Universidad Autonoma de San Luis Potosi, Zona Universitaria, San Luis Potosi, 78290, Mexico Stanford Artificial Intelligence Laboratory, Stanford University, Stanford, CA 94305, USA Kavli Institute of Cosmological Physics, University of Chicago, Chicago, IL 60637, USA The NSF AI Institute for Artificial Intelligence Center for Astrophysics Harvard \& Smithsonian, 60 Garden Street, Cambridge, MA 02138, USA Department of Physics Kavli Institute for Astrophysics Space Research, Massachusetts Institute of Technology, Cambridge, MA 02139, USA Institut de Física d'Altes Energies (IFAE), The Barcelona Institute of Science Institute of Astronomy Kavli Institute for Cosmology, University of Cambridge, Madingley Road, Cambridge, CB3 0HA, UK Imperial Centre for Inference Cosmology (ICIC), Imperial College London, Blackett Laboratory, Prince Consort Road, London SW7 2AZ, UK Data Science Institute, The University of Chicago, Chicago, IL 60615, USA Department of Physics, The University of Texas at Dallas, Richardson, TX 75080, USA Department of Physics, Duke University, Durham, NC 27708, USA Université Paris-Saclay, Université Paris Cité, CEA, CNRS, AIM, F-91191 Gif-sur-Yvette, France School of Mathematics, Statistics Physics, Newcastle University, Newcastle upon Tyne, NE1 7RU, United Kingdom Department of Astrophysical Sciences, Princeton University, Princeton, NJ 08544, USA Astronomy, University of the Western Cape, Bellville, Cape Town, 7535, South Africa Astronomy, University of Utah, Salt Lake City, UT 84112, USA Department of Astrophysical Sciences, Princeton University, Peyton Hall, Princeton, NJ 08544, USA Department of Astronomy, University of Illinois Urbana Champaign, 1002 W. Green St., Urbana, IL, 61801, USA Institute for Particle Physics Astrophysics, ETH Zürich, Wolfgang-Pauli-Strasse 27, CH-8093 Zurich, Switzerland Swinburne University of Technology, Hawthorn, Victoria 3122, Australia Ciela - Montr\'eal Institute for Astrophysical Data Analysis Mila - Quebec Artificial Intelligence Institute, Montréal, QC H2S 3H1, Canada Advanced Research Computing Centre, University College London, 90 High Holborn, London WC1V 6LJ, UK Finnish Centre for Astronomy with ESO (FINCA), University of Turku, FI-20014 Turku, Finland Department of Physics, P.O. Box 64, University of Helsinki, FI-00014 Helsinki, Finland Astronomy, Northwestern University, Evanston, IL, USA Center for Interdisciplinary Exploration Research in Astrophysics, Northwestern University, Evanston, IL, USA Scientific Data Science, International School for Advanced Study, Via Bonomea 265, I-34136 Trieste, Italy Department of Statistics, University of Michigan, Ann Arbor, MI 48109, USA PITT PACC, University of Pittsburgh, Pittsburgh, PA 15260, USA NSF NOIRLab, 950 N. Cherry Ave., Tucson, AZ 85719, USA

专题命中 Agent评测 :agentic(abstract);分类 cs.AI、cs.LG

AI总结 本文探讨了AI/ML在LSST暗能量科学合作中的应用机遇,强调了大规模贝叶斯推断、物理指导方法和主动学习等关键方法学优先事项,并讨论了新兴技术在重塑工作流程中的潜力。

Comments 84 pages. This is v1.0 of the DESC's white paper on AI/ML, a collaboration document that is being made public but which is not planned for submission to a journal

详情

展开后加载摘要…

URL PDF HTML 收藏
2205.12787 2026-01-22 cs.LG cs.AI 62%

Impartial Games: A Challenge for Reinforcement Learning

impartial games: 一种对强化学习的挑战

Bei Zhou, Søren Riis

机构 * Imperial College London(帝国理工学院伦敦分校) Queen Mary University of London(女王玛丽大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG

AI总结 本文研究了AlphaZero风格强化学习在impartial games中的局限性,指出其在学习抽象数学原理如奇偶性时存在表示瓶颈,需发展新型算法以实现专家级AI。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14611 2026-01-22 cs.HC 50%

Seeing to Think? How Source Transparency Design Shapes Interactive Information Seeking and Evaluation in Conversational AI

看见以思考?源透明度设计如何塑造对话式AI中的互动信息搜索与评估

Jiangen He, Jiqun Liu

专题命中 Agent评测 :workflow(abstract)

AI总结 本文研究了源透明度设计对对话式AI中信息搜索与评估的影响,发现不同界面设计对用户批判性思维和信息整合有显著影响。

详情

展开后加载摘要…

URL PDF HTML 收藏