arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

共收录 1239 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. Agent评测 1239 篇

2606.19641 2026-06-23 cs.RO cs.CV 新提交 50%

Scaling Self-Play for End-to-End Driving

扩展端到端驾驶的自我对弈

Luke Rowe, Roger Girgis, Rodrigue de Schaetzen, Daphne Cornelisse, Alaap Grandhi, Felix Heide, Eugene Vinitsky, Christopher Pal, Liam Paull

机构 * Mila(米拉研究所) Université de Montréal(蒙特利尔大学) Polytechnique Montréal(蒙特利尔理工学院) Torc Robotics NYU Tandon School of Engineering(纽约大学坦登工程学院) McMaster University(麦克马斯特大学) Princeton University(普林斯顿大学)

专题命中 Agent评测 :agent(abstract)

AI总结 提出大规模自我对弈训练策略,通过高效模拟器Gigapixel实现像素级自我对弈,结合DAgger蒸馏和感知适应,提升端到端驾驶模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19358 2026-06-23 cs.RO 新提交 50%

WorkBenchMark: A LEGO-Based Assembly Benchmark with an Assembly-by-Disassembly Baseline for the Smart Manufacturing League

WorkBenchMark:面向智能制造联盟的基于乐高积木的装配基准与通过拆卸进行装配的基线方法

Wenbo Ma, Daniel Swoboda, Matteo Tschesche, Till Hofmann

机构 * Chair of Machine Learning and Reasoning (i6), RWTH Aachen University(亚琛工业大学机器学习与推理教席(i6)) MASCOR Institute, FH Aachen University of Applied Science(亚琛应用技术大学MASCOR研究所)

专题命中 Agent评测 :planning(abstract)

AI总结 提出一个基于乐高Duplo的机器人装配基准,包含400个任务和四个复杂度层级,并提供一个基于规划的基线方法,在所有层级上优于现代视觉-语言-动作方法。

Comments RoboCup Symposium 2026 accepted paper

Journal ref RoboCup 2026: Robot World Cup XXIX

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17385 2026-06-23 cs.RO 新提交 50%

EgoInfinity: A Web-Scale 4D Hand-Object Interaction Data Engine for Any-View Robot Retargeting and Video-to-Action Robot Learning

EgoInfinity: 一个面向任意视角机器人重定向与视频到动作机器人学习的网络规模4D手物交互数据引擎

Gaotian Wang, Kejia Ren, Andrew Morgan, Yiting Chen, Howard H. Qian, Podshara Chanrungmaneekul, Kaiyu Hang

机构 * Rice University(莱斯大学) Robotics and AI Institute(机器人与人工智能研究所)

专题命中 Agent评测 :agent(abstract)

AI总结 提出EgoInfinity引擎,从互联网视频自动生成4D手物交互数据,实现跨机器人形态的动作重定向与技能学习,无需人工标注。

Comments 24 pages. Project page: https://huggingface.co/spaces/Rice-RobotPI-Lab/EgoInfinity

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20223 2026-06-19 cs.CV q-bio.QM 新提交 50%

DeepForestVisionV2: Ecology-Driven Taxonomy Expansion for Camera-Trap Monitoring in African Tropical Forests

DeepForestVisionV2:面向非洲热带森林相机监测的生态驱动分类扩展

Hugo Magaldi, Theau d'Audiffret, Etienne Francois Akomo-Okoue, Bala Amarasekaran, Naomi Anderson, Claire Auger, Noemie Cappelle, Daniel Cornelis, Raphael Cornette, Tobias Deschner, Gabriel Dubus, Davy Fonteyn, Rosa M. Garriga, Jennifer Hatlauf, Innocent Kasekendi, Raymond Katumba, Aram Kazandjian, Alfred Ngomanda, Stephan Ntie, Simone Pika, Xavier Rufray, Harold Rugonge, John Justice Tibesigwa, Peter van Lunteren, Hadrien Vanthomme, Joeri A. Zwerts, Sabrina Krief

机构 * UMR7206 Eco-Anthropologie, MNHN(UMR7206 生态人类学,法国国家自然历史博物馆) One Forest Vision initiative(One Forest Vision 倡议) Sebitoli Chimpanzee Project(塞比托利黑猩猩项目) Centre National de la Recherche Scientifique et Technologique(国家科学技术研究中心) Institut de Recherche en Ecologie Tropicale(热带生态研究所) Tacugama Chimpanzee Sanctuary(塔库加马黑猩猩保护区) Biotope(Biotope 公司) CIRAD(法国农业发展国际合作研究中心) Max Planck Institute for Evolutionary Anthropology(马克斯·普朗克进化人类学研究所) BOKU University(维也纳自然资源与生命科学大学) Agence Nationale des Parcs Nationaux du Gabon(加蓬国家公园管理局) Uganda Wildlife Authority(乌干达野生动物管理局) Addax Data Science(Addax 数据科学公司) Utrecht University(乌得勒支大学)

专题命中 Agent评测 :workflow(abstract)

AI总结 针对非洲热带森林相机监测中生态梯度(垂直分层、场景开放度、人为界面)导致原35类分类过粗的问题,提出扩展至64类的DeepForestVisionV2,在保持离线工作流的同时提升野外实用性。

Comments Accepted at ICPR 2026 - Computer Vision for Biodiversity Monitoring and Conservation Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20143 2026-06-19 cs.CV 新提交 50%

HEad and neCK TumOR (HECKTOR) 2025: Benchmark of Segmentation, Diagnosis, and Prognosis in Multimodal PET/CT

头颈肿瘤 (HECKTOR) 2025 挑战赛:多模态 PET/CT 中的分割、诊断与预后基准

Numan Saeed, Salma Hassan, Shahad Hardan, Lishan Cai, Xinglong Liang, Moona Mazher, Abdul Qayyum, Yansong Bu, Mengye Lyu, Yue Lin, Mingyuan Meng, Chuanyi Huang, Lisheng Wang, Dalal Chamseddine, Shamimeh Ahrari, Beining Wu, Yifei Chen, Fuyou Mao, Hao Zhang, Baixiang Zhao, Surajit Ray, Muzi Guo, Lei Xiang, Jakob Dexl, Michael Ingrisch, Adrien Depeursinge, Arman Rahmim, Mathieu Hatt, Vincent Andrearczyk, Mohammad Yaqub

机构 * Mohamed bin Zayed University of Artificial Intelligence (MBZUAI)(穆罕默德·本·扎耶德人工智能大学) Amsterdam UMC(阿姆斯特丹大学医学中心) The Netherlands Cancer Institute(荷兰癌症研究所) Radboud University Medical Centre(拉德堡德大学医学中心) University College London(伦敦大学学院) Imperial College London(帝国理工学院) Shenzhen Technology University(深圳技术大学) Shenzhen University(深圳大学) Newland Digital Technology(新大陆数字技术) The University of Sydney(悉尼大学) Shanghai Jiao Tong University(上海交通大学) University Hospital, Nantes(南特大学医院) Nantes Université, Centrale Nantes, CNRS, LS2N(南特大学、南特中央理工学院、法国国家科学研究中心、LS2N实验室) Hangzhou Dianzi University(杭州电子科技大学) Tsinghua University(清华大学) Central South University(中南大学) University of Glasgow(格拉斯哥大学) China Mobile System Integration Co., Ltd.(中移系统集成有限公司) Subtle Medical Inc.(Subtle Medical公司) University Hospital, LMU Munich(慕尼黑大学医院) Munich Center for Machine Learning(慕尼黑机器学习中心) BC Cancer Research Institute(不列颠哥伦比亚癌症研究所) HES-SO Valais-Wallis University of Applied Sciences and Arts(HES-SO瓦莱州应用科学与艺术大学) Lausanne University Hospital (CHUV)(洛桑大学医院) LaTIM, INSERM, UMR 1101, Univ Brest(LaTIM实验室、法国国家健康与医学研究院、UMR 1101、布雷斯特大学)

专题命中 Agent评测 :planning(abstract)

AI总结 HECKTOR 2025 挑战赛利用多模态 PET/CT 和电子健康记录,建立了头颈癌自动分析的基准,涵盖肿瘤分割、复发预测和 HPV 分类三个任务,最佳算法分别达到 Dice 0.75、C-index 0.66 和平衡准确率 0.56。

Comments 17 pages, 4 figures, 4 tables. Overview paper for the HECKTOR 2025 challenge, held as a satellite event at MICCAI 2025. Challenge website: https://hecktor.grand-challenge.org/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19904 2026-06-19 cs.SI 新提交 50%

Toward Temporal Realism in City-Scale Crisis Response Simulation using LLM Agents

面向城市级危机响应模拟中时间真实性的LLM智能体方法

Anping Zhang, Yang Tan, Yuanbo Tang, Huaze Tang, Qiuhua Ye, Marta C. Gonzalez, Yang Li

专题命中 Agent评测 :agent(abstract)

AI总结 针对LLM社会模拟缺乏时间真实性的问题,基于深圳疫情志愿活动数据,提出数据校准的自激与危机激活机制,实现爆发性时间模式,使智能体时间分布接近真实。

Comments 11pages,7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19488 2026-06-19 physics.soc-ph cs.SI nlin.AO 新提交 50%

Networks of agglomeration: how population density rewires social networks and reshapes contagion dynamics

集聚网络:人口密度如何重塑社交网络并改变传染动态

Christopher K. Tokita

专题命中 Agent评测 :agent(abstract)

AI总结 通过最小主体模型,发现人口密度单独变化即可重构社交网络结构,稀疏人口形成局部集群,密集人口形成全局集成网络,并影响简单与复杂传染的传播速度与范围。

Comments Main text: 12 pages with 5 figures. Attached Supplemental Text: 3 pages with 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19175 2026-06-18 econ.TH 新提交 50%

To Gamble, Perchance to Grow

赌博,或许为了增长

Mark Whitmeyer

专题命中 Agent评测 :agent(abstract)

AI总结 研究增长最优(凯利)投资组合问题中的收益变换,刻画了产生更保守投资组合的变换条件,并推导了理性疏忽代理人的风险厌恶比较。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18665 2026-06-18 cs.GT 新提交 50%

EFX Allocations Exist on Multi-Graphs

多图上EFX分配的存在性

Mahyar Afshinmehr, Arash Ashuri, Pouria Mahmoudkhan, Kurt Mehlhorn, Amir Mohammad Shahrezaei

专题命中 Agent评测 :agent(abstract)

AI总结 研究不可分割物品的公平分配,证明在多图且可取消估值下EFX分配存在,并给出多项式时间算法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18422 2026-06-18 quant-ph 新提交 50%

Gatekeepers and Hallucinations: A Layered Evaluation Framework for LLM-Driven Quantum Circuit Generation

守门人与幻觉:LLM驱动的量子电路生成的分层评估框架

Christopher Coleman, Sharon Marfatia

专题命中 Agent评测 :agentic(abstract)

AI总结 提出分层评估框架,通过守门人筛选、电路保真度分析和设计熵指标,识别LLM在量子电路生成中的五种失败模式,并揭示评估基础设施本身可能引入错误。

Comments 7 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17925 2026-06-17 cs.GT 新提交 50%

Parasitic Masquerade: Societal Scale Human-Machine Interaction

寄生伪装:社会尺度的人机交互

Jiejun Hu-Bolz, James Stovold

专题命中 Agent评测 :agent(abstract)

AI总结 通过图论平均场博弈模型,研究人机交互中寄生行为伪装成生产性学习的现象,发现信息流不对称和环境噪声可引发系统相变。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17573 2026-06-17 cs.OS cs.CR 新提交 50%

Cordon: Semantic Transactions for Tool-Using LLM Agents

Cordon: 工具使用型LLM代理的语义事务

Zheng Chen, Hanqing Liu, Duling Xu, Dong Dong, Jialin Li, Bangzheng Pu, Jidong Zhai

专题命中 Agent评测 :agent(abstract)

AI总结 提出Cordon事务运行时系统,通过语义事务边界实现多步代理工作流的提交、回滚、恢复和审计,减少不可逆效应失败并暴露跨步违规。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16816 2026-06-16 cs.GT 新提交 50%

Verification of Stochastic Dominance Envy-Freeness in Time Proportional to Input Size

在输入规模成正比的时间内验证随机占优无嫉妒性

Kui-Wang Choi

专题命中 Agent评测 :agent(abstract)

AI总结 提出一种时间最优算法,通过单次前缀支配检查和惰性初始化,将随机占优无嫉妒性(SD-EF)及其松弛版本SD-EF1的验证复杂度从O(n²m)降至O(nm),达到输入规模下的渐近最优。

Comments 6 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16743 2026-06-16 cs.GT 新提交 50%

Fair Division by Contribution: A Shapley Value Perspective

按贡献公平分配:Shapley值视角

Xiaohui Bei, Pinyan Lu, Xiaowei Wu, Shengwei Zhou

专题命中 Agent评测 :agent(abstract)

AI总结 针对无货币转移的可分割资源分配,提出基于Shapley值的公平性概念(SVF),将代理权解释为对最优社会福利的期望边际贡献,并分析不同估值函数下Shapley近似比的最坏情况界。

Comments 26 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16493 2026-06-16 q-fin.MF 新提交 50%

Forward Hedging Reshapes Incentive Provision

远期套期保值重塑激励提供

René Aïd, Nizar Touzi, Stéphane Villeneuve

专题命中 Agent评测 :agent(abstract)

AI总结 研究在道德风险下,风险厌恶的委托人通过远期市场套期保值对代理人的激励影响,发现委托代理与外部套期保值部分替代,且委托代理下套期保值需求降低,推高均衡远期价格。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16380 2026-06-16 econ.TH 新提交 50%

Informative Consumption

信息性消费

Xuehan Jiang, Xi Zhi Lim

专题命中 Agent评测 :agent(abstract)

AI总结 本文公理化地刻画了风险消费中的消费-信息权衡,通过分离客观风险与主观风险,将确定性等价分解为标准风险溢价和信息溢价,并引入可参数化模型以捕捉风险厌恶与信息激励。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14887 2026-06-16 econ.EM econ.GN q-fin.EC 新提交 50%

Estimating Sloppy Directions via KDE: The Case of Kirman's Ants

通过KDE估计松散方向:以Kirman蚂蚁模型为例

Karl Naumann-Woleske

专题命中 Agent评测 :agent(abstract)

AI总结 本文使用核密度估计(KDE)从模拟数据中估计Fisher信息矩阵,以识别随机非线性模型中的松散方向,并以Kirman蚂蚁模型为例验证了KDE方法在有限模拟预算下的收敛性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14819 2026-06-16 cs.MA physics.soc-ph 新提交 50%

Selective Control under Noisy Perception: Governance Failures Hidden by Aggregate Metrics in Modular Networks

噪声感知下的选择性控制:模块化网络中聚合指标隐藏的治理失败

Igor Itkin

专题命中 Agent评测 :agent(abstract)

AI总结 通过智能体模型揭示,内容审核系统在标准准确率指标上表现良好,但错误集中在连接不同社区的桥梁用户上,导致治理损失倍增,而聚合指标无法反映这种伤害。

Comments 39 pages, 7 figures. Code and data: https://github.com/YehudaItkin/noisy-perception-governance

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14091 2026-06-15 eess.AS 新提交 50%

Who Spoke When in Multi-Conversation: Target Speaker Tagging Task and Benchmark

多对话中谁在何时发言:目标说话人标记任务与基准

Minjae Lee, Hee-Soo Heo, Youngki Kwon, Han-Gyu Kim, You Jin Kim, Bong-Jin Lee

专题命中 Agent评测 :workflow(abstract)

AI总结 提出目标说话人标记任务,整合说话人日志、验证和识别,构建大规模合成基准TST-Bench,实验表明该任务具有独特挑战,专用系统设计优于现有方案。

Comments 9 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14201 2026-06-15 cs.DB 新提交 50%

TACO: A Benchmark for Open-Domain Text-to-SQL with Ambiguous and Cross-Database Queries

TACO:面向开放域、含歧义和跨数据库查询的文本到SQL基准

Chao Deng, Ju Fan, Yuyu Luo, Qinliang Xue, Meihao Fan, Yuxin Zhang, Min Zhang, Xiaofeng Jia, Jing Zhang, Xiaoyong Du

专题命中 Agent评测 :planning(abstract)

AI总结 提出TACO基准,包含1500个真实和13000个合成示例,覆盖开放域、歧义和跨数据库查询,通过基线TACO-SQL揭示现有方法的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13980 2026-06-15 cs.GT cs.CC 新提交 50%

On Cutting Cakes and Crossing Curves

论切蛋糕与穿越曲线

Alexandros Hollender, Gilbert Maystre, Kilian Risse

专题命中 Agent评测 :agent(abstract)

AI总结 本文通过揭示蛋糕切割与Jordan曲线问题的新联系,证明了三名代理人情况下无嫉妒蛋糕切割问题的计算复杂性,并首次给出了Jordan曲线问题的查询下界和UEOPL难度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13640 2026-06-12 cs.SD 新提交 50%

The Moving Drone: Negotiating Agency Between the Voice and the Virtual

移动的无人机:在声音与虚拟之间协商能动性

Nithya Shikarpur, Victor Arul, Anna Huang

机构 * Massachusettes Institute of Technology(麻省理工学院) Harvard University(哈佛大学)

专题命中 Agent评测 :agent(abstract)

AI总结 基于印度斯坦音乐,通过Max/MSP循环器和生成式AI模型GaMaDHaNi,将传统静态无人机变为动态、主动的虚拟音乐代理,探讨人机协作中的能动性。

Comments Published in NIME music track 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13332 2026-06-12 cs.CV 新提交 50%

OR-Action: Multi-Role Video Understanding with Fine-Grained Actions

OR-Action: 细粒度动作的多角色视频理解

Felix Tristram, Ege Özsoy, Christian Benz, Marcel Walch, Ghazal Ghazaei, Nassir Navab

机构 * Technical University of Munich(慕尼黑工业大学) Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心) Carl Zeiss AG(卡尔蔡司股份公司)

专题命中 Agent评测 :workflow(abstract)

AI总结 针对手术室活动理解中场景图方法缺乏时间建模的问题,提出基于公开数据集的细粒度多角色动作基准,并引入纯视觉时序模型,显著优于图方法,同时提出多视角到单视角特征对齐策略提升单视角性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13057 2026-06-12 cs.GT 新提交 50%

Approximate Maximin Share with Subjective Divisibility: Beating the 1/2 Barrier

主观可分割性下的近似最大最小份额:突破1/2障碍

Xiaohui Bei, Ke Ding, Bo Li, Fangxiao Wang

专题命中 Agent评测 :agent(abstract)

AI总结 针对主观可分割性下的公平分配问题,本文证明一元估值下最优近似比为2/3,并设计算法将一般情形的近似保证从1/2提升至5/9,对至多四个智能体给出紧的2/3近似。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13431 2026-06-12 physics.soc-ph q-fin.RM 新提交 50%

Adaptive rerouting reshapes impacts of maritime chokepoint disruptions

自适应重新路由重塑海上咽喉点中断的影响

Mitja Devetak, Jasper Verschuur, Peter Klimek

专题命中 Agent评测 :agent(abstract)

AI总结 通过全球商船队基于主体的模型,量化自适应重新路由在咽喉点关闭下对到达损失的影响,揭示损失动态取决于路由、时间和区域暴露,而非静态网络拓扑。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12341 2026-06-11 cs.CR 新提交 50%

OCELOT: Inference-Leakage Budgets for Privacy-Preserving LLM Agents

OCELOT:面向隐私保护LLM代理的推理泄露预算

Jin Xie, Songze Li

专题命中 Agent评测 :agent(abstract)

AI总结 提出OCELOT运行时中介,通过后验风险控制和证人验证降级机制,在代理轨迹中预算对手信念更新,平衡任务效用与隐私泄露。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11980 2026-06-11 cs.HC 新提交 50%

Somewhere Over the Desktop: A Research Agenda for Ubiquitous Analytics

超越桌面:无处不在分析的研究议程

Niklas Elmqvist, Panagiotis D. Ritsos, Peter W. S. Butcher

专题命中 Agent评测 :agentic(abstract)

AI总结 空间计算、生成式AI与开放网络标准融合,催生无处不在分析(UA)新机遇,通过梳理认知、上下文、交互等七大领域交叉,提出42个未来研究挑战。

Comments 15 pages, 5 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11397 2026-06-11 cs.GT econ.TH 新提交 50%

Invariant Price of Anarchy and Multiplicative Smoothness

无政府价格不变性与乘法平滑性

Ilia Shilov, Heinrich H. Nax, Saverio Bolognani

专题命中 Agent评测 :agent(abstract)

AI总结 针对基数不可比框架,提出乘法平滑性条件,推导无政府价格的不变性界,并扩展到粗相关均衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11231 2026-06-11 cs.CV 新提交 50%

CFCamo: A Counterfactual Detect-or-Abstain Framework for Camouflaged Object Detection

CFCamo:一种用于伪装目标检测的反事实检测或放弃框架

Suhang Li, Osamu Yoshie, Yuya Ieiri

机构 * Graduate School of Information, Production and Systems, Waseda University(早稻田大学信息生产系统研究生院)

专题命中 Agent评测 :agent(abstract)

AI总结 提出CFCamo框架,通过反事实配对训练和策略优化,使COD模型在检测到目标时输出结果,在无目标时放弃检测,解决了正样本训练导致的过度检测偏差。

Comments 10 pages, 7 figures, 5 tables. Code and data: https://github.com/suhang2000/CFCamo

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11494 2026-06-11 math.OC econ.TH 新提交 50%

Epistemic fair division of independence structures

独立性结构的认知公平分配

Marcin Anholcer, Maciej Bartkowiak, Bartłomiej Bosek, Jarosław Grytczuk

专题命中 Agent评测 :agent(abstract)

AI总结 研究在独立性结构约束下(如网络中的无环边集)的公平分配问题,证明了当代理人数至少为图的树性时,存在至多一个物品嫉妒(EF1)的分配,并进一步对任意加性估值证明了认知EF1分配的存在性。

详情

展开后加载摘要…

URL PDF HTML 收藏