arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

共收录 6955 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. Agent评测 1207 篇

2608.00018 2026-08-04 cs.DB cs.AI 新提交 57%

CITBench: A Comprehensive Benchmark for Interactive Tabular Data Processing with LLMs

CITBench:面向大语言模型的交互式表格数据处理综合基准

Zihan Nan, Yang Gu, Wei Liu, Xi Yan, Zhou Liu, Hao Liang, Wentao Zhang

专题命中 Agent评测 :planning(abstract);分类 cs.AI

AI总结 本文提出 CITBench 交互式表格数据处理基准,评估发现现有 LLM 在简单表格任务表现良好,但在复杂多轮交互场景下的理解、规划与表格结构感知仍存在显著挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29626 2026-08-03 cs.AI 新提交 57%

AgentHPOBench: A Benchmark For Evaluating LLM Agents as Sequential Hyperparameter Optimizers

AgentHPOBench:用于评估LLM智能体作为序列超参数优化器的基准

Tianyu Huai, Tingshuo Fan, Xinchi Chen, Yining Zheng, Yuxin Wang, Shuang Chen, Jie Zhou, Xuanjing Huang

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 AgentHPOBench是含30个任务的序列基准,用于评估LLM智能体的超参数优化能力,实验显示其在多领域有优化能力,但在迭代优化等方面存在局限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29559 2026-08-03 cs.AI cs.RO 新提交 57%

LEMUR: Learning to Align with Multi-Objective Reinforcement Learning from Preference Feedback

LEMUR:基于偏好反馈的多目标强化学习对齐学习

Manith Adikari, Bei Peng, Samuele Vinanzi, Angelo Cangelosi

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 本研究提出LEMUR框架,通过联合学习策略与多目标奖励模型,从人类偏好反馈中学习平衡多目标的最优策略,其在基准多目标任务上性能优于基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29218 2026-08-03 cs.AI 新提交 57%

MirrorCraft: Paired Evaluation under Hidden Rule Changes in Minecraft

MirrorCraft:Minecraft中隐藏规则变化下的配对评估

Jianxin Gao, Beini Hu, Runze Li, Wanli Peng, Ruohan Lei, Jinyuan Zhang, Linna Deng, Tianyi Yu, Zining Wang

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 MirrorCraft是用于Minecraft隐藏规则变化下评估智能体的配对基准,实验发现规则集对隐藏规则变化的影响差异显著,未提供规则描述时ReAct表现最优,提供规则可适度提升任务表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29090 2026-08-03 cs.LG 新提交 57%

What Is Missing in Surgical Risk Stratification and Outcome Prediction: A Scoping Review of End-to-End Machine Learning Approaches

手术风险分层与结局预测中缺失的内容:端到端机器学习方法的范围综述

Yizhi Dong, Yuhe Ke, Hairil Rizal Abdullah, Yucheng Xing, Kevan Kai Bing Teo, Ling Huang, Mengling Feng

专题命中 Agent评测 :workflow(abstract);分类 cs.LG

AI总结 本范围综述回顾190项研究,分析手术风险分层与结局预测的ML流程,发现数据、方法、评估等方面存在差距,为开发更严谨的围手术期ML工具提供参考。

Comments This work has been submitted to the IEEE JBHI for possible publication. Copyright may be transferred without notice, after which this version may no longer be accessible

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28858 2026-08-03 cs.CV cs.AI 新提交 57%

A Unified Benchmark of Deep Learning Models for Multi-task 3D Brain Tumor Segmentation from Magnetic Resonance Imaging

用于磁共振成像多任务3D脑肿瘤分割的深度学习模型统一基准

Diego J. Torrejón, Luna Y. Hernández, Javier Sánchez

机构 * Centro de Tecnologías de la Imagen (CTIM)(图像技术中心(CTIM)) Instituto Universitario de Cibernética, Empresas y Sociedad (IUCES)(网络、企业与社会大学研究所(IUCES)) University of Las Palmas de Gran Canaria(拉斯帕尔马斯大加那利大学)

专题命中 Agent评测 :planning(abstract);分类 cs.AI

AI总结 本研究构建统一基准,在相同条件下对比3D U-Net等5种深度学习模型在BraTS 2023、2024数据集上的脑肿瘤分割性能,明确了不同架构的准确率与效率权衡及适用场景。

Comments 27 pages, 16 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28777 2026-08-03 cs.CL 新提交 57%

Self-Supervised Skill Optimization

自监督技能优化

Siran Peng, Cuiyu Yang, Tianyu Fu, Tianshuo Zhang, Haoyuan Zhang, Weisong Zhao, Anyang Su, Minghui Wu, Huiying Li, Xiangyu Zhu, Chenxu Zhao, Zhen Lei

专题命中 Agent评测 :agent(abstract);分类 cs.CL

AI总结 该研究提出自监督技能优化(SSO)框架,仅用未标注任务实例学习可复用技能,在封闭、开放任务上优于无真实标注的提示优化器,部分场景表现接近最强的基于真实标注的技能优化器。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28651 2026-08-03 cs.HC cs.CL cs.CY 新提交 57%

Measuring Cognitive Engagement in Collaborative Discourse with an Extended ICAP Framework: Comparing Human Annotation, In-Context Learning, and Reflective LLM Agents

基于扩展ICAP框架的协作对话认知投入度测量:人类标注、上下文学习与反思型大语言模型智能体的比较

Lan Anh Do, Hanling Jiang, Shuchin Aeron, Ayanna K. Thomas

专题命中 Agent评测 :agent(abstract);分类 cs.CL

AI总结 本研究用扩展7点ICAP框架测量协作对话认知投入度,对比人类标注、ICL及反思型LLM智能体,发现人类标注信度更高,智能体方法具潜力,需强化人类标注与LLM方法的交互。

Comments Accepted as a full paper in the CogSci 2026 proceedings

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28636 2026-08-03 cs.CL cs.CY 新提交 57%

Chain-of-Models: Cross-Model Auditing for Bias-Robust LLM Judges

模型链:面向偏见鲁棒性大语言模型评判器的跨模型审计

Qian Wang, Zhanzhi Lou, Zhenheng Tang, Nuo Chen, Bingsheng He

专题命中 Agent评测 :agent(abstract);分类 cs.CL

AI总结 本研究针对LLM评判器的认知偏见问题,提出跨模型审计流程CoM,发现审计器身份的关键作用,制定偏见特异性审计器选择规则,在多模型多偏见实验中取得优于基线的准确率。

Comments WIP

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28568 2026-07-31 cs.CL 新提交 57%

Frontis-MA1: Training an AI4AI Model towards Recursive Self-Improvement in Machine Learning Engineering

Frontis-MA1:训练AI4AI模型以实现机器学习工程中的递归自我改进

Junlin Yang, Che Jiang, Yu Fu, Tianwei Luo, Can Ren, Weizhi Wang, Kaikai Zhao, Hongyi Liu, Yuxin Zuo, Yuru Wang, Yuchen Fan, Kai Tian, Zhenzhao Yuan, Xiaojian Lin, Li Sheng, Rushi Qiang, Guoli Jia, Xingtai Lv, Ermo Hua, Dianqiao Lei, Youbang Sun, Ning Ding, Bowen Zhou, Kaiyan Zhang

专题命中 Agent评测 :agent(abstract);分类 cs.CL

AI总结 该研究推出面向MLE中RSI研究的开源全栈系统OpenMLE,后训练Frontis-MA1(35B)作为元进化智能体,在多个基准测试中提升性能,相关模型与系统已开源。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28523 2026-07-31 cs.AI cs.LO 新提交 57%

Selective Credibility-Limited Belief Update

选择性可信度受限的信念更新

Theofanis Aravanis, Costas D. Koutras

机构 * University of the Peloponnese(伯罗奔尼撒大学) American University of the Middle East(中东美国大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 本文针对现有可信度受限信念更新无法处理复合认知输入部分可实现的问题,提出选择性可信度受限的信念更新,刻画其语义与公理,定义两类子类,证明框架通用性,提供统一且表达力更强的信念更新方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28497 2026-07-31 cs.LG cs.CY cs.GT 新提交 57%

The Role of Causality in Algorithmic Recourse

因果关系在算法追索中的作用

Srikanth Avasarala, Varun Gupta, Shahin Jabbari, Saber Salehkaleybar, Juba Ziani

机构 * Georgia Institute of Technology(佐治亚理工学院) Vector Institute(向量研究院) Drexel University(德雷塞尔大学) Leiden University(莱顿大学)

专题命中 Agent评测 :agent(abstract);分类 cs.LG

AI总结 本研究针对算法追索仅关注翻转模型预测的缺陷,提出因果表演框架建模追索行动的因果传播,实验显示其优于标准方法并减少模型重训需求。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28287 2026-07-31 cs.AI cs.CV cs.SC 新提交 57%

Tycho: Active Abstraction with Programmatic World Models for ARC-AGI-3

Tycho:面向ARC-AGI-3的基于可编程世界模型的主动抽象

Jens Lehmann, Andrei Aioanei, Sahar Vahdati

机构 * Dresden University of Technology(德累斯顿工业大学) Amazon(亚马逊) TIB – Leibniz Information Centre for Science and Technology(莱布尼茨科学与技术信息中心) Leibniz University of Hannover(汉诺威莱布尼茨大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 针对ARC-AGI-3的交互式抽象问题,提出编码智能体系统Tycho,通过结构化观测构建游戏模型,选定策略下GPT-5.6 Sol与Opus 5可达成100%相对人类行动效率并完成全部关卡。

Comments 52 pages, 18 figures, 17 tables. Open-source implementation: https://github.com/NIMI-research/Tycho

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28226 2026-07-31 cs.CR cs.AI 新提交 57%

Security of World-Model-Based Embodied AI: A Lifecycle of Threats, Defenses, and Evaluation

基于世界模型的具身智能安全性:威胁、防御与评估的生命周期

Fazhong Liu, Zhuoyan Chen, Haozhen Tan, Yan Meng, Guoxing Chen, Haojin Zhu

专题命中 Agent评测 :planning(abstract);分类 cs.AI

AI总结 本综述针对基于世界模型的具身智能,梳理其生命周期内的各类安全威胁,提出分类法与评估协议,并从多维度构建防御体系,同时指出世界模型兼具安全护盾与安全错觉的双重属性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28033 2026-07-31 cs.AI 新提交 57%

DataClawEval: A Benchmark for Data Engineering Agents in Real Industrial Harness

DataClawEval:面向真实工业场景的数据工程智能体基准测试

Debin Meng, Jiaming Yang, Zefang Zong, Tengyue Xu, Haining Xie, Yang Li, Peng Chen

机构 * Tencent(腾讯) Xidian University(西安电子科技大学) South China Normal University(华南师范大学)

专题命中 Agent评测 :autonomous agent(abstract);分类 cs.AI

AI总结 DataClawEval是首个针对真实工业数据工程场景的智能体基准,含100项跨5种引擎的任务,用确定性脚本评分,评估16个前沿智能体发现最强模型仅得74.9分,自主数据工程仍是挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27687 2026-07-31 cs.AI 新提交 57%

Rehearse: Stepping Back from the Confidence Cliff in Self-Improving Autoresearch

Rehearse:从自改进自动研究中的置信度悬崖后退

Jiazhen Ji, Shouhong Ding

机构 * Tencent(腾讯)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 该研究发现自动研究中存在置信度悬崖问题,提出Rehearse方法通过聚焦过往尝试结果记忆提升判断准确率,在三个任务的4000次训练运行预算下改善了终点性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27674 2026-07-31 cs.SE 新提交 57%

Can Large Language Models Resolve Real Java Merge Conflicts? An Evaluation with a Calibrated LLM-as-Judge

大语言模型能否解决真实的Java合并冲突?一项使用校准后的LLM作为评判者的评估

Bowen Shen

专题命中 Agent评测 :agent(abstract);分类 cs.SE

AI总结 该研究针对真实Java合并冲突,构建仅用推理信号的LLM求解器,经校准的LLM评判者评估发现,其解决冲突的覆盖和匹配开发者方案的表现优于传统工具AutoMerge,但结构正确性仍需确定性检查保障。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27597 2026-07-31 cs.RO cs.AI cs.SY eess.SY 新提交 57%

A Systems Engineering Framework for Vision-Language-Enabled UAV Triage and Disaster Response

面向视觉语言赋能的无人机分类与灾害响应的系统工程框架

Swapnil Saha, Bhuvan Rajanasiriyur Jagadeesha, Karishma Patnaik, Neelakshi Majumdar

机构 * University of Arkansas(阿肯色大学) University of Michigan-Dearborn(密歇根大学迪尔伯恩分校)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 该研究提出将视觉语言模型(VLMs)作为协同智能体嵌入人-无人机回路的系统工程框架,经评估可降低人因负担、提升AI信任度,推进了高风险灾害响应的人-自主系统协同。

Comments 10 pages, 8 figures. Author accepted manuscript of AIAA Paper 2026-4010, published in the AIAA AVIATION 2026 Forum

Journal ref AIAA AVIATION 2026 Forum, AIAA Paper 2026-4010, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27354 2026-07-31 cs.AI 新提交 57%

PAUSE: A User-Centric Benchmark for Personal AI Assistants in Unified Service Environments

PAUSE:统一服务环境中面向用户的个人AI助手基准测试

Haoyu Chen, Xirui Shi, Yuyao Wang, Jerry Chen, Di Niu

机构 * University of Alberta(阿尔伯塔大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 研究人员针对现有个人AI助手基准测试的缺陷,提出PAUSE基准测试,采用多机制评估框架,实验发现现有先进模型在相关场景任务完成率不足70%,还提出可扩展生成任务的合成流水线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27294 2026-07-31 cs.SE 新提交 57%

AgentS4D: Benchmarking Runtime Risks across the Execution Lifecycle of LLM-Based Workspace Agents

AgentS4D:基于大语言模型的工作空间智能体执行生命周期内运行时风险基准

Jiajun Zhou, Zhaoxuan Ke, Jihang Ye, Xuanze Chen, Shanqing Yu, Qi Xuan

专题命中 Agent评测 :agent(abstract);分类 cs.SE

AI总结 研究推出AgentS4D基准,评估20种智能体配置在328个风险案例中的表现,发现任务完成不代表安全,需跨风险条件完整评估智能体配置。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27267 2026-07-31 cs.CR cs.AI 新提交 57%

FAVA: Formal Authorization for Verified Agents with Evidence-Backed Permission Graphs

FAVA:基于证据支持的权限图的经验证智能体的形式化授权

Yifan Zhang, Xinkui Zhao, Sai Liu, Hengxuan Lou, Guanjie Cheng, Chang Liu

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 FAVA是一种用于智能体执行的带权限授权框架,通过LLM引导的权限IR、证据支持的权限图和SMT授权器保障安全,在多场景评估中达90.5%决策合规率,可拦截动态违规迹。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26710 2026-07-30 cs.LG 新提交 57%

PowerAtlas: Towards Electricity-Computing Co-Scheduling for Power Systems

PowerAtlas:面向电力系统的电-计算协同调度

Kaiwen Jiang, Siya Xu, Ziyue Zhu, Chao Yang, Anh Tuan Luu, Haoran Luo

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) State Grid Liaoning Electric Power Co., Ltd.(国网辽宁省电力有限公司) Nanyang Technological University(南洋理工大学)

专题命中 Agent评测 :agent(abstract);分类 cs.LG

AI总结 PowerAtlas是用于电-计算协同调度的LLM智能体框架,整合多类约束生成可行方案,构建含2000个实例的ECBench基准,在11种LLM上验证了有效性。

Comments 17 pages, 9 figures, 5 tables. Code: https://github.com/JAVA-Jiang/PowerAtlas

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26485 2026-07-30 cs.SI cs.LG 新提交 57%

Parameterized Fair Resource Allocation under Diversity Constraints

多样性约束下的参数化公平资源分配

Keke Huang, Yik Yu Ng, Laks V. S. Lakshmanan, Xiaokui Xiao

专题命中 Agent评测 :agent(abstract);分类 cs.LG

AI总结 本文提出PRA及自适应变体APRA框架,将多样性约束下的资源分配从硬性条件优化转为柔性参数调节,兼顾公平性与效率,在真实应用中性能优于现有基准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25620 2026-07-29 cs.AI cs.HC 新提交 57%

Beyond Epistemia: Epistemic Schizologia and Large Language Models as Techno-Semiotic Machines

超越认知:认知分裂症与作为技术符号机器的大语言模型

Federico Cabitza, Gianluca Colombo

机构 * Fondazione Bruno Kessler(布鲁诺·凯斯勒基金会)

专题命中 Agent评测 :autonomous agent(abstract);分类 cs.AI

AI总结 研究大语言模型输出致“认知症”现象,挑战其解释框架。借鉴相关哲学,将大语言模型视为技术符号机器,指出“认知症”是“认知分裂症”后果,强调相关单元是整个实践,为新设计方案奠定基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25045 2026-07-29 cs.AI eess.SP q-bio.NC 新提交 57%

CogEEGAgent: Toward Autonomous Cognitive EEG Analysis with Grounded Execution and Selection-Aware Verification

CogEEGAgent:通过基于执行和选择感知验证实现自主认知脑电图分析

Dengzhe Hou, Lingyu Jiang, Fangzhou Lin, Kazunori D Yamada

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 研究针对认知EEG分析需专业知识及选择多的问题,提出基于MNE-Python的CogEEGAgent代理,LLM解释意图,确定性组件验证控制,在基准测试等中表现良好,建立了有限自主性和可审计自动化框架。

Comments 16 pages, 5 figures, and 16 tables. The supplementary material is included in the same PDF

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24300 2026-07-28 cs.CL cs.MA 新提交 57%

Self-Authored Verification Is Unreliable in Heuristic Self-Improving Agents

在启发式自我改进智能体中自我编写的验证不可靠

Diandian Guo, Cong Cao, Fangfang Yuan, Yingqi Wang, Yueshan Wang, Dakui Wang

专题命中 Agent评测 :agent(abstract);分类 cs.CL

AI总结 研究启发式自我改进智能体中自我编写验证不可靠的问题,引入密封外部接受循环(SEAL)方法,通过实验发现该问题在启发式学习中常现,自我验证失败按能力分层,SEAL性能优于无保护基线。

Comments 9 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24275 2026-07-28 cs.LO cs.AI cs.CY 新提交 57%

A Computational Ethical Framework for Financial Digital Phenotyping for Mental Health

用于心理健康的金融数字表型分析的计算伦理框架

Oluwadara Adedeji, Michael Mayowa Farayola, Jeff Brozena, Irina Tal, Regina Connolly, Mark Matthews

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 针对人工智能驱动数字表型系统伦理治理难题,提出计算伦理框架,将伦理要求形式化为道义时态逻辑约束,通过金融数据和心理健康案例研究,用Z3求解器建模验证关键伦理属性,实现持续机器可验证伦理检查,支持相关系统发展。

Comments Accepted at the CIBB 2026 conference (https://cibb2026.teralab.ai/)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24273 2026-07-28 cs.CL 新提交 57%

INS-ActBench: A Comprehensive Benchmark for Assessing Professional Actuarial Capability of Large Language Models

INS-ActBench:一个用于评估大语言模型专业精算能力的综合基准

Changyu Chen, Chenwei Lin, Xian Xu

机构 * Fudan University(复旦大学)

专题命中 Agent评测 :tool use(abstract);分类 cs.CL

AI总结 介绍INS-ActBench这一综合基准评估大语言模型专业精算能力,含12050个问答对及三个子集,通过实验揭示前沿大语言模型在不同方面的能力表现,为精算大语言模型开发提供可重复基础。

Comments 18 pages, including appendices; 11 figures and 12 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23263 2026-07-28 cs.AI 新提交 57%

SeekJudge: A Practical Reward Framework for Reinforcement Learning in Computer-Use Agents

SeekJudge:计算机使用智能体强化学习的实用奖励框架

Yang Wan, Zhenhao Zhang, Jierui Wang, Linchao Zhu

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 针对计算机使用智能体强化学习中轨迹指令判断问题,提出SeekJudge框架,通过四个智能体循环裁决,用种子校准蒸馏管道训练共享主干模型,该框架在在线RL中匹配或超原生规则监督,还有诸多优势并改进奖励服务器,使模型奖励成实用替代品。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23024 2026-07-28 cs.CV cs.LG stat.AP 新提交 57%

When Less Is More: A Controlled Benchmark of Lightweight CNNs for Satellite Land-Cover Segmentation on DeepGlobe

少即是多:用于DeepGlobe卫星土地覆盖分割的轻量级卷积神经网络的受控基准测试

Atiq Ur Rehman, Joseph Michael Donovan

专题命中 Agent评测 :planning(abstract);分类 cs.LG

AI总结 研究在DeepGlobe数据集上比较VGG16等五种架构用于卫星土地覆盖分割,经三个迭代分离相关因素,采用相同预处理等协议。结果显示MobileNetV2_v1表现优,轻量级迁移学习模型在资源受限遥感环境中可匹配或超越更深模型,利于土地覆盖映射。

Comments 18 Figures, 8 Tables & 33 Pages

详情

展开后加载摘要…

URL PDF HTML 收藏