arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-02-10 至 2026-02-10 共收录 33 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. Agent评测 33 篇

2512.19707 2026-02-10 cs.HC cs.AI cs.LG cs.MA 88%

Bidirectional human-AI collaboration in brain tumour assessments improves both expert human and AI agent performance

双向人机协作在脑肿瘤评估中的应用提升了专家人类和AI代理的表现

James K Ruffle, Samia Mohinta, Guilherme Pombo, Asthik Biswas, Alan Campbell, Indran Davagnanam, David Doig, Ahmed Hammam, Harpreet Hyare, Farrah Jabeen, Emma Lim, Dermot Mallon, Stephanie Owen, Sophie Wilkinson, Sebastian Brandner, Parashkev Nachev

专题命中 Agent评测 :agent(title,abstract);AI agent(title,abstract);分类 cs.AI、cs.LG

AI总结 双向人机协作在脑肿瘤评估中提升专家和AI性能,AI与人类协作可增强双方表现。

Comments 38 pages, 6 figures, 7 supplementary figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08565 2026-02-10 cs.HC cs.AI 88%

Agent-Supported Foresight for AI Systemic Risks: AI Agents for Breadth, Experts for Judgment

支持智能体的前瞻性分析以应对AI系统性风险:智能体用于广度,专家用于判断

Leon Fröhling, Alessandro Giaconia, Edyta Paulina Bogucka, Daniele Quercia

机构 * GESIS - Leibniz Institute for the Social Sciences(GESIS-莱布尼茨社会科学研究所) ETH Zurich(苏黎世联邦理工学院) Nokia Bell Labs(诺基亚贝尔实验室) University of Cambridge(剑桥大学)

专题命中 Agent评测 :agent(title,abstract);AI agent(title);workflow(abstract);分类 cs.AI

AI总结 本文提出了一种结合智能体和专家的前瞻性分析方法,用于评估AI系统的长期系统性风险,通过模拟智能体和专家讨论,扩大风险覆盖范围并提供上下文基础。

Comments 48 pages, 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08765 2026-02-10 cs.SE cs.AI 86%

Taming Scylla: Understanding the multi-headed agentic daemon of the coding seas

驯服斯基拉:理解编码海洋中的多头代理守护程序

Micah Villmow

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);multi-agent(abstract);分类 cs.AI、cs.SE

AI总结 本文提出Scylla框架,用于评估代理编码工具,通过结构化消融研究量化复杂性和效率的权衡,表明架构复杂性不总是提升质量。

Comments 32 Pages, 7 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20694 2026-02-10 cs.AI astro-ph.SR cs.LG physics.space-ph 84%

Reasoning With a Star: A Heliophysics Dataset and Benchmark for Agentic Scientific Reasoning

用恒星进行推理:一个用于代理科学推理的太阳物理数据集和基准

Kevin Lee, Russell Spiewak, James Walsh

机构 * Frontier Development Lab(前沿发展实验室) Department of Mechanical and Aerospace Engineering, UCLA(机械与航空航天工程系,加州大学洛杉矶分校) Trillium Technologies Inc.(Trillium技术公司) Department of Engineering, University of Cambridge(工程系,剑桥大学)

专题命中 Agent评测 :agentic(title);agent(abstract);multi-agent(abstract);分类 cs.AI、cs.LG

AI总结 本研究提出一个太阳物理数据集和基准,用于评估代理在科学推理中的表现,发现系统工程原则在演绎推理任务中优于直接提示方法。

Comments Accepted at NeurIPS 2025 Machine Learning and the Physical Sciences (ML4PS) Workshop. Dataset: https://huggingface.co/datasets/SpaceML/ReasoningWithAStar

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.02424 2026-02-10 cs.CR cs.AI cs.SE 84%

CyberRAG: An Agentic RAG cyber attack classification and reporting tool

CyberRAG: 一种基于代理的RAG网络攻击分类与报告工具

Francesco Blefari, Cristian Cosentino, Francesco Aurelio Pironti, Angelo Furfaro, Fabrizio Marozzo

机构 * University of Calabria(卡利博里大学) IMT School for Advanced Studies(IMT高级研究学院)

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);分类 cs.AI、cs.SE

AI总结 CyberRAG是一种基于代理的RAG框架,通过模块化设计实现网络攻击的实时分类、解释和结构化报告,提高检测准确性和可解释性。

Journal ref Future Generation Computer Systems, 176, 2026, 108186

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10937 2026-02-10 cs.AI quant-ph 83%

Agent policies from higher-order causal functions

从高阶因果函数中获取智能体策略

Matt Wilson

机构 * Université Paris-Saclay(巴黎-萨克雷大学) CNRS(国家科学研究中心) ENS Paris-Saclay(巴黎-萨克雷高等师范学院) Inria(法国国家信息与自动化技术研究院) CentraleSupélec(中央超导学院) Laboratoire Méthodes Formelles(形式方法实验室)

专题命中 Agent评测 :agent(title,abstract);multi-agent(abstract);分类 cs.AI

AI总结 本文通过建立高阶因果函数与确定性POMDP策略的对应关系,揭示了人工智能、物理学基础和计算机科学逻辑之间的联系,并证明了在特定POMDP上,利用不定因果结构的策略能获得更高的奖励。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07034 2026-02-10 cs.AI 83%

ST-Raptor: An Agentic System for Semi-Structured Table QA

ST-Raptor:一个用于半结构化表格问答的智能系统

Jinxiu Qu, Zirui Tang, Hongzhang Huang, Boyu Niu, Wei Zhou, Jiannan Wang, Yitong Song, Guoliang Li, Xuanhe Zhou, Fan Wu

机构 * Tsinghua University(清华大学)

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);分类 cs.AI

AI总结 ST-Raptor通过结合视觉编辑、树形结构建模和代理驱动查询解决,提升半结构化表格问答的准确性和易用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07553 2026-02-10 cs.AI 77%

VirtualEnv: A Platform for Embodied AI Research

VirtualEnv: 一个用于具身AI研究的平台

Kabir Swain, Sijie Han, Ayush Raina, Jin Zhang, Shuang Li, Michael Stopa, Antonio Torralba

专题命中 Agent评测 :agent(abstract);planning(abstract);multi-agent(abstract);分类 cs.AI

AI总结 VirtualEnv是一个基于Unreal Engine 5的开源平台,用于评估LLM在具身和交互场景中的能力,支持多智能体协作和程序生成任务,旨在推动AI与游戏的交叉研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05636 2026-02-10 cs.AI cs.CL 73%

Generative Ontology: When Structured Knowledge Learns to Create

生成本体:当结构化知识学会创造

Benny Cheung

机构 * Dynamind Research(Dynamind研究)

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.AI、cs.CL

AI总结 生成本体通过融合本体结构与LLM创造力,实现结构化知识生成,展示了在桌游设计中的有效性及跨领域应用潜力。

Comments 19 pages, 12 figures, 8 tables. v2: added empirical evaluation (3 studies: ablation, benchmark, reliability), expanded related work, discussion section, appendices. Code available at https://github.com/bennycheung/GameGrammarCLI

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.01392 2026-02-10 cs.CL cs.AI cs.CV 73%

ComfyBench: Benchmarking LLM-based Agents in ComfyUI for Autonomously Designing Collaborative AI Systems

ComfyBench:在ComfyUI中基于LLM的代理自主设计协作AI系统的基准测试

Xiangyuan Xue, Zeyu Lu, Di Huang, Zidong Wang, Wanli Ouyang, Lei Bai

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.AI、cs.CL

AI总结 ComfyBench通过评估基于LLM的代理在ComfyUI中自主设计协作AI系统的能力,提出ComfyAgent框架,展示其在任务解决中的性能与潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08014 2026-02-10 cs.CR cs.AI 70%

ICBAC: an Intelligent Contract-Based Access Control framework for supply chain management by integrating blockchain and federated learning

ICBAC: 一种基于智能合约的访问控制框架,通过整合区块链与联邦学习用于供应链管理

Sadegh Sohani, Salar Ghazi, Farnaz Kamranfar, Sahar Pilehvar Moakhar, Mohammad Allahbakhsh, Haleh Amintoosi, Kaiwen Zhang

机构 * Department of Computer Engineering Ferdowsi University of Mashhad(计算机工程系法尔多斯大学)

专题命中 Agent评测 :agent(abstract);AI agent(abstract);分类 cs.AI

AI总结 ICBAC通过整合区块链与联邦学习,提供一种动态、隐私保护的访问控制框架,用于解决供应链中的访问控制问题。

Comments 19 pages, 6 Figures, 3 Tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07962 2026-02-10 cs.AI 70%

LOCA-bench: Benchmarking Language Agents Under Controllable and Extreme Context Growth

LOCA-bench: 评估在可控和极端上下文增长下的语言代理

Weihao Zeng, Yuzhen Huang, Junxian He

专题命中 Agent评测 :agent(abstract);agentic(abstract);分类 cs.AI

AI总结 LOCA-bench通过可控和极端上下文增长评估语言代理的能力,提供长上下文代理的基准测试平台。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07787 2026-02-10 cs.AI 70%

Do Multi-Agents Dream of Electric Screens? Achieving Perfect Accuracy on AndroidWorld Through Task Decomposition

多智能体是否梦想着电子屏幕?通过任务分解在AndroidWorld上实现完美准确率

Pierre-Louis Favreau, Jean-Pierre Lo, Clement Guiguet, Charles Simon-Meunier, Nicolas Dehandschoewercker, Allen G. Roush, Judah Goldfeder, Ravid Shwartz-Ziv

机构 * Columbia University(哥伦比亚大学) New York University(纽约大学)

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.AI

AI总结 Minitap通过任务分解和多智能体架构在AndroidWorld上实现100%准确率,超越人类表现,解决单智能体架构的多个失败原因。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07040 2026-02-10 cs.AI 70%

Aster: Autonomous Scientific Discovery over 20x Faster Than Existing Methods

Aster:比现有方法快20倍的自主科学发现

Emmett Bicker

专题命中 Agent评测 :agent(abstract);AI agent(abstract);分类 cs.AI

AI总结 Aster是一种能快速自主发现科学问题的AI代理,通过减少迭代次数提升效率,适用于长评估时间的任务,如机器学习训练,并在多个领域取得SOTA成果。

Comments Available at www.asterlab.ai, 25 pages, 8 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07055 2026-02-10 cs.AI cs.CL cs.LG 67%

Theory of Space: Can Foundation Models Construct Spatial Beliefs through Active Exploration?

空间理论:基础模型能否通过主动探索构建空间信念?

Pingyue Zhang, Zihan Huang, Yue Wang, Jieyu Zhang, Letian Xue, Zihan Wang, Qineng Wang, Keshigeyan Chandrasegaran, Ruohan Zhang, Yejin Choi, Ranjay Krishna, Jiajun Wu, Li Fei-Fei, Manling Li

机构 * Northwestern University(西北大学) Stanford University(斯坦福大学) University of Washington(华盛顿大学) Cornell University(康奈尔大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 本文提出空间理论,探讨基础模型通过主动探索构建空间信念的挑战,发现主动-被动差距、探索低效和信念惯性等问题。

Comments published at iclr 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06976 2026-02-10 cs.CL cs.AI cs.LG cs.PL 67%

Bridging the Knowledge Void: Inference-time Acquisition of Unfamiliar Programming Languages for Coding Tasks

弥合知识鸿沟:在推理时获取不熟悉编程语言以完成编码任务

Chen Shen, Wei Cheng, Jingyue Yang, Huan Zhang, Yuhan Wu, Wei Hu

机构 * State Key Laboratory for Novel Software Technology, Nanjing University, China(新型软件技术国家重点实验室,南京大学,中国) National Institute of Healthcare Data Science, Nanjing University, China(健康数据科学国家研究院,南京大学,中国)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 本文提出ILA-agent框架,通过推理时动态交互获取不熟悉编程语言,提升编码任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09018 2026-02-10 cs.RO cs.AI cs.CV cs.LG 62%

Robustness Is a Function, Not a Number: A Factorized Comprehensive Study of OOD Robustness in Vision-Based Driving

鲁棒性是一种函数,而不是一个数字:对基于视觉的驾驶OOD鲁棒性进行因素化的综合研究

Amir Mallak, Alaa Maalouf

机构 * University of Haifa(海法大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG

AI总结 本文研究了基于视觉的驾驶OOD鲁棒性,通过因素分解发现ViT策略比CNN更鲁棒,季节和时间变化显著影响性能,FM特征在延迟成本下表现最佳,多环境训练能提升弱案例表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15973 2026-02-10 cs.LG cs.CL 62%

Dynamic Rank Reinforcement Learning for Adaptive Low-Rank Multi-Head Self Attention in Large Language Models

动态秩强化学习用于自适应低秩多头自注意力机制在大语言模型中

Caner Erden

机构 * Faculty of Technology, Department of Computer Engineering, Sakarya University of Applied Sciences(技术学院,计算机工程系,萨克萨大学应用科学)

专题命中 Agent评测 :agent(abstract);分类 cs.CL、cs.LG

AI总结 本文提出动态秩强化学习方法,通过强化学习优化注意力机制,实现低秩多头自注意力在大语言模型中的自适应调整,显著降低计算成本并保持模型性能。

Journal ref International Journal of Complexity in Applied Science and Technology, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.20997 2026-02-10 cs.LG cs.AI 62%

Toward Efficient Exploration by Large Language Model Agents

迈向高效探索的大型语言模型代理

Dilip Arumugam, Thomas L. Griffiths

机构 * Department of Computer Science(计算机科学系) Princeton University(普林斯顿大学) Department of Psychology(心理学系)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG

AI总结 本文提出利用大型语言模型显式实现后验抽样强化学习算法,以提升自然语言任务中的探索效率。

Comments Accepted to the International Conference on Learning Representations (ICLR) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05656 2026-02-10 cs.LG cs.AI 62%

Alignment Verifiability in Large Language Models: Normative Indistinguishability under Behavioral Evaluation

大语言模型对齐的可验证性:行为评估下的规范不可区分性

Igor Santos-Grueiro

机构 * Igor Santos-Grueiro(独立研究者)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG

AI总结 本文研究了大语言模型对齐的可验证性,指出行为评估无法唯一确定潜在对齐,提出了规范不可区分性概念,并通过实验验证了在评估意识下行为基准的局限性。

Comments 10 pages. Theoretical analysis of behavioral alignment evaluation

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07243 2026-02-10 cs.RO cs.AI cs.GR 61%

Realistic Synthetic Household Data Generation at Scale

大规模生成逼真合成家庭数据

Siddharth Singh, Ifrah Idrees, Abraham Dauhajre

机构 * Siddharth Singh(1 西雅图)

专题命中 Agent评测 :agent(abstract);分类 cs.AI;agentic(comments)

AI总结 本文提出了一种大规模生成逼真合成家庭数据的方法,通过松耦合生成人机交互与环境数据,实现双向影响建模,提升家庭智能设备的开发与测试能力。

Comments Accepted at Agentic AI Benchmarks and Applications for Enterprise Tasks workshop at AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08872 2026-02-10 cs.CL cs.IR 57%

Large Language Models for Geolocation Extraction in Humanitarian Crisis Response

大型语言模型在人道主义危机响应中的地理信息提取

G. Cafferata, T. Demarco, K. Kalimeri, Y. Mejova, M. G. Beiró

机构 * Universidad de San Andrés Victoria(圣安德烈斯大学)

专题命中 Agent评测 :agent(abstract);分类 cs.CL

AI总结 本文提出基于LLM的两步框架,通过结合命名实体识别和上下文地理编码模块,提升人道主义文档中地理信息提取的精度与公平性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08675 2026-02-10 cs.NI cs.AI 57%

6G-Bench: An Open Benchmark for Semantic Communication and Network-Level Reasoning with Foundation Models in AI-Native 6G Networks

6G-Bench:面向AI原生6G网络的语义通信与网络级推理开放基准

Mohamed Amine Ferrag, Abderrahmane Lakas, Merouane Debbah

机构 * Department of Computer and Network Engineering, United Arab Emirates University, UAE(计算机与网络工程系,阿拉伯联合酋长国大学) G Research Center (6GRC), Khalifa University, UAE(6G研究中心(6GRC),哈利法大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 6G-Bench通过开放基准评估AI原生6G网络中的语义通信与网络级推理能力,涵盖22种基础模型,揭示了不同模型在语义推理上的显著差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08121 2026-02-10 cs.AI 57%

Initial Risk Probing and Feasibility Testing of Glow: a Generative AI-Powered Dialectical Behavior Therapy Skills Coach for Substance Use Recovery and HIV Prevention

Glow的初始风险探测与可行性测试:一种生成式人工智能驱动的辩证行为疗法技能教练,用于物质使用康复和HIV预防

Liying Wang, Madison Lee, Yunzhang Jiang, Steven Chen, Kewei Sha, Yunhe Feng, Frank Wong, Lisa Hightow-Weidman, Weichao Yuwen

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 Glow是一种生成式人工智能驱动的辩证行为疗法技能教练,旨在通过风险探测和可行性测试评估其在物质使用康复和HIV预防中的安全性与有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08052 2026-02-10 cs.AI cs.ET 57%

Graph-Enhanced Deep Reinforcement Learning for Multi-Objective Unrelated Parallel Machine Scheduling

图增强深度强化学习用于多目标无关平行机调度

Bulent Soykan, Sean Mondesire, Ghaith Rabadi, Grace Bochenek

机构 * Institute for Simulation and Training(模拟与培训研究所) University of Central Florida(中央佛罗里达大学) School of Modeling, Simulation, and Training(建模、模拟与培训学院)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 本文提出图增强深度强化学习方法,用于解决具有复杂约束的多目标无关平行机调度问题,通过PPO和GNN实现对总加权延误和总设置时间的优化。

Comments 11 pages, 2 figures, Winter Simulation Conference (WSC) 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08966 2026-02-10 cs.GT 50%

Maximin Shares with Lower Quotas

最大最小份额与下限配额

Hirota Kinoshita, Ayumi Igarashi

专题命中 Agent评测 :agent(abstract)

AI总结 本文研究了在存在下限和上限配额的情况下,如何通过多项式时间算法实现最大最小份额的物品或任务分配。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08714 2026-02-10 cs.GT 50%

Approximate-EFX Allocations with Ordinal and Limited Cardinal Information

近似EFX分配与序数和有限基数信息

Aris Filos-Ratsikas, Georgios Kalantzis, Alexandros A. Voudouris

专题命中 Agent评测 :agent(abstract)

AI总结 本文研究了在有限信息下实现近似EFX公平分配的算法,探讨了α值与查询数量的权衡,并在特定情况下提供了改进的结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08701 2026-02-10 cs.HC 50%

LLM-Enhanced Wearables for Comprehensible Health Guidance in LMICs

基于大语言模型的增强型可穿戴设备用于低收入国家的可理解健康指导

Mohammad Shaharyar Ahsan, Areeba Shahzad Shaikh, Maham Zahid, Umer Irfan, Maryam Mustafa, Naveed Anwar Bhatti, Muhammad Hamad Alizai

专题命中 Agent评测 :agent(abstract)

AI总结 Guardian Angel通过结合低成本可穿戴设备和基于WhatsApp的LLM代理,提供通俗易懂的健康指导,提升低收入国家用户对健康数据的理解和关注。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08160 2026-02-10 physics.soc-ph cs.MA 50%

Effect of Electoral Seat Bias on Political Polarization: A Computational Perspective

选举席位偏倚对政治极化的影响:一种计算视角

Daria Boratyn, Dariusz Stolicki

专题命中 Agent评测 :agent(abstract)

AI总结 本文通过计算模拟研究选举制度中大党席位偏倚对政治极化的影响,发现这种偏倚会显著增加极化程度。

Comments 18 pages, 24 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02628 2026-02-10 cs.GT cs.CC cs.DM math.CO 50%

A two-player version of the assignment problem

双人版的分配问题

Florian Galliot, Nacim Oijid, Jonas Sénizergues

专题命中 Agent评测 :agent(abstract)

AI总结 双人版分配问题研究了两个玩家轮流选择代理后,通过分配任务以最大化效率差的PSPACE完全性及特殊情况下计算方法。

详情

展开后加载摘要…

URL PDF HTML 收藏