arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

共收录 6955 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. Agent评测 1207 篇

2607.25765 2026-07-29 cs.CL cs.DB 新提交 70%

WorkSurface-Bench: Benchmarking Enterprise Agents on Multi-Surface Knowledge Routing

WorkSurface-Bench:在多表面知识路由上对企业代理进行基准测试

Hao Liang, Meiyi Qiang, Sizhe Qiu, Linzhuang Sun, Wentao Zhang

机构 * Peking University(北京大学) Zhongguancun Academy(中关村科学城) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 Agent评测 :agent(abstract);tool use(abstract);分类 cs.CL

AI总结 针对企业代理整合异构知识源时表面路由能力评估不足的问题,提出WorkSurface-Bench基准测试,含多种任务且答案可审计,评估多个模型主干,揭示表面选择与任务完成关系及干预效果,并发布相关资源。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24588 2026-07-28 cs.AI 新提交 70%

SIREN: Towards End-to-End Extreme-Weather Early Warning with Experience-Grounded LLM Agents

SIREN:借助基于经验的大语言模型智能体实现端到端极端天气预警

Hang Ni, Weijia Zhang, Fan Liu, Mengqian Lu, Hao Liu

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) The Hong Kong University of Science and Technology(香港科技大学) The World Sustainable Development Institute(世界可持续发展研究所)

专题命中 Agent评测 :agent(abstract);agentic(abstract);分类 cs.AI

AI总结 研究借助大语言模型智能体实现端到端极端天气预警。开发了包含多任务问答实例的SIREN-Bench基准,发现现有框架差距后,构建基于经验的SIREN框架,结合多种技术,实验证明其在预警程序和预警链上优于基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20505 2026-07-24 cs.RO cs.LG 新提交 70%

HERMES: Heterogeneous Edge-Relational Multi-Head Embedded SSM Attention for Traffic Conflict Prediction at Signalized Intersections

HERMES:用于信号交叉口交通冲突预测的异构边缘关系多头嵌入式SSM注意力模型

Md Monzurul Islam, Subasish Das

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.LG

AI总结 研究针对交通冲突预测,提出HERMES异构边缘关系图神经网络,利用特定关系注意力等方法,在多指标上表现优异,优于基线模型,联合训练提升目标站点性能,为信号交叉口路边安全监测提供支持。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19436 2026-07-23 cs.CR cs.AI 新提交 70%

Building Trust in Autonomous Commerce: A Verifiable Global Event Timeline and AI-Ready Fraud Intelligence Layer

在自主商业中建立信任:可验证的全球事件时间线和支持人工智能的欺诈情报层

Rajat Srivastava

专题命中 Agent评测 :agent(abstract);agentic(abstract);分类 cs.AI

AI总结 研究为智能商业提出可验证全球事件时间线,由规范事件模式等四组件构成,还引入欺诈标记和数据集谱系模型。原型实现实证结果显示,其在处理事件速度、验证时间、证明大小及验证性能上有优势。

Comments 18 pages, 4 tables, 1 figure. Preprint also available on Zenodo: https://doi.org/10.5281/zenodo.19060285

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19400 2026-07-23 cs.LG q-bio.GN 新提交 70%

Predictive single cell foundation model for gene regulation and aging with privacy-preserving tabular learning

用于基因调控和衰老的具有隐私保护表格学习的预测性单细胞基础模型

Jiayuan Ding, Jianhui Lin, Ziyang Miao, Nils Mechtel, Shiyu Jiang, Yixin Wang, Zhaoyu Fang, Jorge D. Martin-Rufino, Chen Weng, Reuben Saunders, Weize Xu, Jonathan S. Weissman, Min Li, Jiliang Tang, Wei Ouyang, Yuancheng Ryan Lu, Xiaojie Qiu

专题命中 Agent评测 :agent(abstract);AI agent(abstract);分类 cs.LG

AI总结 研究针对单细胞数据独特表格结构及隐私问题,提出用联邦学习设计的Tabula模型,开发Chiron平台。该模型在下游基准测试表现出色,揭示调控逻辑,提名年轻化因子,推动单细胞基础建模发展,迈向隐私保护虚拟细胞。

Comments 98 pages, 4 main figures, and 15 supplementary figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18696 2026-07-22 cs.AI 新提交 70%

Do AI-Native Biotechs Need Departments? Benchmarking Company World Models for AI-Driven Drug Development

人工智能原生生物技术公司需要部门吗?人工智能驱动药物研发的公司世界模型基准测试

Yinan Wang

机构 * Noah AI Research(诺亚人工智能研究)

专题命中 Agent评测 :agent(abstract);planning(abstract);分类 cs.AI

AI总结 研究人工智能原生生物技术公司组织模式,提出公司世界模型,用含45个案例的虚拟实验室基准测试,比较多种架构,发现价值转换架构表现优,核心操作原语应是资产到价值状态而非静态组织结构图,不过研究仅限虚拟实验室。

Comments Working paper. Includes public no-label benchmark cases and dry-lab evaluation artifacts. No wet-lab, patient-level, clinical, regulatory, or investment validation is claimed

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18462 2026-07-22 cs.SE 新提交 70%

Beyond Resolved Rate: A Non-Functional Quality Study

超越解决率:非功能性质量研究

Xin Sun, Daniel Ståhl, Kristian Sandahl, Christoph Kessler

专题命中 Agent评测 :agent(abstract,abstract_cn);分类 cs.SE

AI总结 研究对比新旧模型在存储库级修复任务中生成补丁的非功能性质量,通过两个案例研究,用CodeQL等工具评估,发现新模型解决实例更多,但非功能性指标无一致改善,旨在推动对模型软件工程能力的全面评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18116 2026-07-21 cs.AI cs.CV cs.GR cs.MA cs.MM 新提交 70%

SGA: Plug&Play Geometric Verification for Educational Video Synthesis

SGA:用于教育视频合成的即插即用几何验证

Lopez Jhon, Hinojosa Carlos, Ghanem Bernard

机构 * Universidad Industrial de Santander(桑坦德工业大学) King Abdullah University of Science and Technology (KAUST)(阿卜杜拉国王科技大学)

专题命中 Agent评测 :agent(abstract);agentic(abstract);分类 cs.AI

AI总结 研究针对教育视频合成中空间正确性和视觉清晰度难题,提出符号几何智能体SGA,通过拦截代码、提取场景图及针对性优化提升质量,引入MVQS,实验显示其在多配置下有效提升了视觉质量分数。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17535 2026-07-21 cs.CR cs.CL 新提交 70%

Salience Induction against Multi-Hop RAG Agents: Threat and Defense

针对多跳检索增强生成智能体的显著性诱导:威胁与防御

Xingfu Zhou, Pengfei Wang, Yuan Zhou, Wei Xie, Xu Zhou

机构 * National University of Defense Technology(国防科技大学)

专题命中 Agent评测 :agent(abstract);agentic(abstract);分类 cs.CL

AI总结 研究多跳检索增强生成智能体面临的新攻击面——显著性通道,提出显著性诱导方法并定义操作符类,构建管道,引入基准。通过实验评估多种模型和架构,展示该方法有效性,强调智能体RAG需防御显著性 - 相关性解耦。

Comments 18 pages, 4 figures, 12 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16981 2026-07-21 cs.AI 新提交 70%

Expected Free Energy as Belief-Dependent Utility for rho-POMDPs

作为rho-POMDPs中信念依赖效用的期望自由能

Patrick Cooper, Alvaro Velasquez

机构 * University of Colorado Boulder(科罗拉多大学博尔德分校)

专题命中 Agent评测 :agent(abstract);planning(abstract);分类 cs.AI

AI总结 研究在部分可观测性下智能体信息收集决策问题,核心方法是用主动推理最小化期望自由能,此方法被证明等同于求解特定rho-POMDP,实验表明该方法在多种环境中表现良好,能提供基于信念的效用,避免过度探索。

Comments 41 pages, 12 figures. Paper accepted as a spotlight at the 2026 International Workshop on Active Inference (IWAI); the workshop version will appear in the Springer Communications in Computer and Information Science (CCIS) series. Code and experiment data at https://github.com/PatrickAllenCooper/rho_aif

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14386 2026-07-17 cs.AI 新提交 70%

CIPHER: A Decoupled Exploration-Selection Framework for Test-Time Scaling of Data Science Agents

CIPHER:用于数据科学智能体测试时扩展的解耦探索-选择框架

Maxime Heuillet, Sharadind Peddiraju

机构 * Amazon Web Services(亚马逊网络服务公司)

专题命中 Agent评测 :agent(abstract);AI agent(abstract);分类 cs.AI

AI总结 研究针对数据科学任务自动化挑战,提出CIPHER智能体,通过生成和选择多初始状态实现测试时扩展,解耦生成与选择过程。经实验验证其性能超越现有技术,刻画DES框架设计空间并给出设计建议。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10960 2026-07-14 cs.LG q-fin.CP stat.ML 新提交 70%

Reinforcement Learning for Execution under Dynamic Fees in a Closed-Loop DEX Simulator

在闭环去中心化交易所模拟器中基于动态费用的执行强化学习

Wen-Ting Wang

专题命中 Agent评测 :agent(abstract);planning(abstract);分类 cs.LG

AI总结 研究在闭环去中心化交易所模拟器中,针对动态费用下的执行问题,采用构建最小闭环模拟器及小深度Q网络的方法,得出该方法能减少执行缺口,且优势集中在动态费用环境中的结论。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10059 2026-07-14 cs.AI 新提交 70%

AgentAbstain: Do LLM Agents Know When Not to Act?

AgentAbstain:基于大语言模型的智能体知道何时不行动吗?

Xun Liu, Yi Evie Zhang, Vira Kasprova, Parisa Rabbani, Pardis Sadat Zahraei, Tianyu Zhang, Ali Ebrahimpour-Boroojeny, Varun Chandrasekaran

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 Agent评测 :agent(abstract);agentic(abstract);分类 cs.AI

AI总结 研究基于大语言模型的智能体何时应弃权的问题,提出AgentAbstain评估框架及AbstainGen全自动管道,通过配对任务基准测试多种前沿LLMs,发现弃权能力与任务解决能力无关,并识别出失败模式,代码和数据集开源。

Comments 56 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09789 2026-07-14 cs.AI cond-mat.mtrl-sci 新提交 70%

PHITSBench: an execution-scored benchmark for AI-assisted PHITS radiation-transport input generation using natural language

PHITSBench:用于使用自然语言生成人工智能辅助的PHITS辐射传输输入的执行评分基准

Xianglin Ji, Svetlana V. Boriskina

机构 * MIT(麻省理工学院)

专题命中 Agent评测 :workflow(abstract);agentic(abstract);分类 cs.AI

AI总结 介绍用于PHITS辐射传输输入生成的PHITSBench基准,涵盖三类任务。评估五种基于GPT - 5.4的配置,无特定知识时模型在编辑和修复任务表现好,Reproduce任务差。知识目录和智能体执行可提升成功率,结果显示建模进展依赖多方面因素。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05482 2026-07-08 cs.SE cs.RO 新提交 70%

TypeGo: An OS Runtime for Embodied Agents

TypeGo:一种用于具身智能体的操作系统运行时

Guojun Chen, Alex Schott, Lin Zhong

机构 * Yale University(耶鲁大学)

专题命中 Agent评测 :agent(abstract);planning(abstract);分类 cs.SE

AI总结 研究针对具身智能体大语言模型规划与实时控制等的矛盾,提出TypeGo运行时,将基于大语言模型的规划构建为异步循环,管理智能体物理身体,通过自然语言指令编程,能降低延迟并支持并发任务,提供了初步设计证据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05055 2026-07-07 cs.AI 新提交 70%

Toward Trustworthy Large Language Model Agents in Healthcare

迈向医疗保健领域值得信赖的大语言模型智能体

Hadi Hasan, Safaa Salman, Adam Tai Abou Dargham, Ammar Mohanna, Ali Chehab

专题命中 Agent评测 :agent(abstract);function calling(abstract);分类 cs.AI

AI总结 针对医疗预约调度瓶颈,提出CareConnect智能体,利用大语言模型函数调用等技术,协调工具支持预约操作,设安全护栏。经评估有高任务完成率、安全合规性及成本效益,能自动化复杂医疗工作流程。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03162 2026-07-07 cs.AI cs.HC 新提交 70%

APeB: Benchmarking Personalization Ability of Large Language Model Agents

APeB:大型语言模型智能体个性化能力基准测试

Garry Yang, Zizhe Chen, Xinru Chen, Yongqiang Chen, Jianxiang Wang, Deyu Zou, Linyi Ding, Jialiang Wu, Yunzhong He, Yu Gong, James Cheng, Huaixiao Tou

机构 * The Chinese University of Hong Kong(香港中文大学) ByteDance(字节跳动)

专题命中 Agent评测 :agent(abstract);agentic(abstract);分类 cs.AI

AI总结 研究大型语言模型智能体在处理原始、未明确查询时的个性化问题,通过引入个性化产品搜索测试平台构建基准测试,评估发现模型处理明确查询较好,但早期查询有困难,简单方法能提升性能。

Comments NA

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03025 2026-07-07 cs.AI cs.MA 新提交 70%

Human-Centric Reflective Architecture for Human-AI Collaborative Decision-Making

用于人类与人工智能协作决策的以人类为中心的反思架构

Andreas Kouridakis, Dimitrios Patiniotis Spyropoulos, George Vouros

机构 * University of Piraeus(比雷埃夫斯大学)

专题命中 Agent评测 :agent(abstract);AI agent(abstract);分类 cs.AI

AI总结 研究人类与人工智能协作决策问题,将其建模为随机博弈,提出以人类为中心的反思架构,整合人类校准模型与强化学习智能体,提升决策有效性并给出高质量建议。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24107 2026-07-07 cs.CV cs.AI 新提交 70%

DramaDirector: Geometry-Guided Short Drama Generation

DramaDirector: 几何引导的短剧生成

Hengji Zhou, Sijie Liu, Jianrun Chen, Xingchen Zou, Lianghao Xia, Liqiang Nie

机构 * South China University of Technology(华南理工大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳))

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.AI

AI总结 提出几何引导框架DramaDirector,通过检索真实短剧的深度-姿态参考,结合模式约束SFT和GRPO训练规划器,实现从情节到多镜头短剧的生成,在忠实度、一致性和可控性上优于基线。

Comments 20 pages, 17 figures, 6 tables. Code is available at https://github.com/iLearn-Lab/DramaDirector

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01813 2026-07-03 cs.CV cs.AI 新提交 70%

MMBench-Live: A Continuously Evolving Benchmark for Multimodal Models

MMBench-Live:一个持续演进的多模态模型基准

Yuanzhi Liu, Shousheng Zhao, Bo Zhou, Kongming Liang, Zhanyu Ma

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) PRIS-CV

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.AI

AI总结 提出MMBench-Live,一个通过多智能体自动化流水线构建的持续演进多模态基准,解决静态基准的时效性、数据污染和维护成本问题,采用分布一致性更新策略,每次更新成本约30美元。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00627 2026-07-02 cs.AI 新提交 70%

AGI Maze as a Benchmark Framework for World-Modeling Agents

AGI Maze:作为世界建模智能体的基准框架

Alexey Potapov

专题命中 Agent评测 :agent(abstract);agentic(abstract);分类 cs.AI

AI总结 提出AGI Maze框架,通过部分可观测网格迷宫任务评估LLM构建世界状态表示的能力,发现标准LLM在推理时无法内部表示迷宫,即使借助工作记忆也难以可靠求解。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30863 2026-07-02 cs.AI 新提交 70%

Beyond expert users: agents should help users construct preferences, not just elicit them

超越专家用户:智能体应帮助用户构建偏好,而不仅仅是引出偏好

Irena Saracay, Ludwig Schmidt, Carlos Guestrin

机构 * Stanford University(斯坦福大学)

专题命中 Agent评测 :agent(abstract);agentic(abstract);分类 cs.AI

AI总结 本文提出用户通常不具备完整偏好,智能体应通过示例或解释帮助用户学习领域知识以构建偏好,并基于信息经济学引入CoPref模型,在推荐系统中通过CoShop基准测试发现现有智能体表现不佳。

Comments Update URLs

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31639 2026-07-01 cs.CR cs.AI cs.GT cs.LO 新提交 70%

A Lifecycle and Application-Stack Survey of Large Language Model Vulnerabilities: Attacks, Risks, Defenses, and Open Problems

大语言模型漏洞的生命周期与应用栈调查:攻击、风险、防御与开放问题

Seyed Bagher Hashemi Natanzi, Bo Tang

机构 * Worcester Polytechnic Institute(伍斯特理工学院)

专题命中 Agent评测 :agent(abstract);autonomous agent(abstract);分类 cs.AI

AI总结 本文通过生命周期与应用栈视角系统化梳理大语言模型系统的漏洞,涵盖数据收集、预训练、对齐、供应链、检索、推理、工具执行和部署等阶段,分析攻击、风险与防御,并提出安全研究议程。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31551 2026-07-01 cs.CL 新提交 70%

AutoTrainess: Teaching Language Models to Improve Language Models Autonomously

AutoTrainess: 教语言模型自主改进语言模型

Zhaojian Yu, Penghao Yin, Shuzheng Gao, Shilin He, Kai Cai, Xiao-Ping Zhang

专题命中 Agent评测 :agent(abstract);planning(abstract);分类 cs.CL

AI总结 提出AutoTrainess智能体,通过外部化人类经验为工作流和约束,在PostTrainBench上超越CLI基线,平均得分从23.21提升至26.94。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31046 2026-07-01 cs.AI 新提交 70%

OpenLife: Toward Open-World Artificial Life with Autonomous LLM Agents

OpenLife:迈向基于自主LLM代理的开放世界人工生命

Atsushi Masumori, Itsuki Doi, Norihiro Maruyama, Ryosuke Takata, Takashi Ikegami

机构 * Alternative Machine Inc.(Alternative Machine公司) Their Inc.(Their公司) Atomi University(迹见学园女子大学) The University of Tokyo(东京大学)

专题命中 Agent评测 :agent(abstract);tool use(abstract);分类 cs.AI

AI总结 提出开放世界人工生命范式,通过将无状态LLM与异步进程(记忆、感知、评估、预算代谢)结合,使代理在开放世界中涌现自发活动、个体化、社会结构和自创收入。

Comments Accepted at ALIFE 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24515 2026-06-24 cs.AI cs.HC 新提交 70%

Reinforcement Learning for Computer-Use Agents with Autonomous Evaluation

基于自主评估的计算机使用智能体强化学习

Marta Sumyk, Oleksandr Kosovan

机构 * Ukrainian Catholic University(乌克兰天主教大学)

专题命中 Agent评测 :agent(abstract,abstract_cn);分类 cs.AI

AI总结 提出利用视觉语言模型自主评估任务完成度作为奖励信号,并引入噪声校正方法,在多个桌面环境上提升计算机使用智能体的成功率。

Comments Accepted to the 4th International Workshop on Generalizing from Limited Resources in the Open World (GLOW @ IJCAI 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24370 2026-06-24 cs.AI cs.CY 新提交 70%

When Helpfulness Overrides Causal Caution: Context-Dependent Suppression and Recovery in LLMs

当有用性凌驾于因果谨慎之上:LLM中的上下文依赖抑制与恢复

Hiroshi Okumura

机构 * Mitsubishi Research Institute, Inc.(三菱电机研究所) Kobe University(北九州市立大学)

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.AI

AI总结 研究LLM从学术到实践咨询语境中因果谨慎的系统性抑制,发现有用性导向响应模式导致因果谨慎表达大幅下降,而自纠正提示可有效恢复。

Comments 43 pages, 3 figures, 5 tables. SSRN Abstract ID: 6965680

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22000 2026-06-23 cs.AI cs.CL cs.LG cs.SE 新提交 70%

CFAgentBench: A Reproducible Environment and Benchmark for Autonomous Construction-Finance Agents

CFAgentBench:面向自主建筑金融智能体的可复现环境与基准测试

Rishi Srivastava

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 提出CFAgentBench,一个可复现的建筑金融智能体基准,包含1014个任务、35个模拟应用,通过功能正确性评分,强调资金流动防护,实验表明单次准确率高估了部署能力。

Comments 28 pages, 2 figures, 13 tables. Benchmark, environment spec, and app contract released. First open-weight three-model sweep (k=5) on a 40-task oracle-validated executable suite; frontier-model leaderboard committed in the roadmap

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21959 2026-06-23 cs.CL 新提交 70%

OpenBioRQ: Unsolved Biomedical Research Questions for Agents

OpenBioRQ: 未解决的生物医学研究问题

Minbyul Jeong

机构 * Upstage AI

专题命中 Agent评测 :agent(abstract);agentic(abstract);分类 cs.CL

AI总结 提出OpenBioRQ基准,包含12,553个无答案的未解决生物医学问题,用于评估智能体在检索、忠实性和工具使用方面的能力,发现当前模型存在工具使用崩溃问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19924 2026-06-19 cs.AI 新提交 70%

The Tao of Agency: Autotelic AI, Embedded Agency and Dissolution of the Self

主体之道:自生目标人工智能、嵌入主体与自我的消解

Aritra Sarkar

机构 * Aritra Sarkar

专题命中 Agent评测 :agent(abstract);agentic(abstract);分类 cs.AI

AI总结 本文探讨自生目标AI中主体生成自身目标的问题,通过内在动机、资源驱动先验、因果干预学习、稳态和嵌入性等概念,揭示嵌入性虽必要但不充分,并指出核心难题在于主体如何生成并相对化自我,最后提出量子表述、哲学解读和基于LLM的具体实现。

详情

展开后加载摘要…

URL PDF HTML 收藏