arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

共收录 584 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. Agent评测 584 篇

2606.01348 2026-07-07 cs.CV 版本更新 50%

ChartArena: Benchmarking Chart Parsing across Languages, Scenarios, and Formats

ChartArena: 跨语言、场景和格式的图表解析基准测试

Shangpin Peng, Gengluo Li, Xingyu Wan, Chengquan Zhang, Hao Feng, Binghong Wu, Huawen Shen, Weinong Wang, Ziyi Cai, Zhuotao Tian, Han Hu, Can Ma, Yu Zhou

机构 * Large Language Model Department, Tencent(腾讯大语言模型部门) Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) Shenzhen Loop Area Institute(深圳河套学院) Nankai University(南开大学)

专题命中 Agent评测 :agent(abstract)

AI总结 提出ChartArena,一个覆盖8种图表族、3种视觉场景的双语基准,通过人机协作标注和格式无关评估协议,系统评估26个多模态大模型的图表解析能力,揭示前沿模型差距与挑战。

Comments 23 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19822 2026-07-07 cs.CV 版本更新 50%

HUGE-Bench: A Benchmark for High-Level UAV Vision-Language-Action Tasks

HUGE-Bench: 面向高级无人机视觉-语言-动作任务的基准测试

Jingyu Guo, Ziye Chen, Ziwen Li, Zhengqing Gao, Jiaxin Huang, Hanlue Zhang, Fengming Huang, Yu Yao, Tongliang Liu, Mingming Gong

机构 * The University of Melbourne(墨尔本大学) Melsy Tech(Melsy科技) MBZUAI Navlyn The University of Sydney(悉尼大学)

专题命中 Agent评测 :agent(abstract)

AI总结 提出HUGE-Bench基准,通过4个数字孪生场景和8个高级任务,评估无人机在简洁语言指令下执行安全、过程导向的复杂轨迹能力,并引入过程导向和碰撞感知指标,揭示现有VLA模型在高级语义完成和安全执行上的显著差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.17496 2026-07-07 q-bio.QM 版本更新 50%

Moo-ving mountains: grazing agents drive terracette formation on steep hillslopes

移动山脉:食草动物驱动陡坡上的梯状地貌形成

Benjamin Seleb, Louis Gonzalez, Atanu Chatterjee, Saad Bhamla

专题命中 Agent评测 :agent(abstract)

AI总结 研究梯状地貌形成原因,用主动行走模型,将有蹄类动物视为在可侵蚀斜坡上移动的随机觅食者,揭示局部觅食规则和底物反馈可自组织成大规模地形模式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.14006 2026-07-07 physics.soc-ph cond-mat.stat-mech 版本更新 50%

Stochastic Thermodynamics of Social Imitation beyond Energetics

超越能量学的社会模仿随机热力学

Luis Irisarri, Lucas Trigal, Raúl Toral, Gonzalo Manzano

专题命中 Agent评测 :agent(abstract)

AI总结 研究旨在为社会系统推导‘第二定律’,通过建立框架约束主体属性变化及信息熵,以基于主体的社会模仿模型为例,展示相关定理自然出现,揭示权衡并提供参数推断工具。

Comments 16 pages + 10 pages of appendices, 9 figures; comments welcomed. v2: Improved presentation and framing, new section with generalizations of the framework discussed explicitly (accepted in Nat. Comm.)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.19098 2026-07-07 cs.GT cs.CY 版本更新 50%

Desirable Effort Fairness and Optimality Trade-offs in Strategic Learning

战略学习中理想的努力公平性与最优性权衡

Valia Efthymiou, Ekaterina Fedorova, Chara Podimata

专题命中 Agent评测 :agent(abstract)

AI总结 研究战略学习中决策规则与策略性适应特征的主体间的互动,将问题构建为约束优化问题,给出理论保证并通过实验展示准确性与理想努力公平性间的权衡。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.18133 2026-07-07 cs.CY 版本更新 50%

Aggregated Individual Reporting for Post-Deployment Evaluation

部署后评估的聚合个体报告

Jessica Dai, Inioluwa Deborah Raji, Benjamin Recht, Irene Y. Chen

专题命中 Agent评测 :workflow(abstract)

AI总结 针对部署后模型评估需求,提出聚合个体报告机制,依靠公众个体报告来评估系统,探讨个体经验在评估中的作用及实施流程等。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28208 2026-07-03 cs.AR cs.ET 版本更新 50%

FCDC: Nonvolatile Charge-Domain Attention with HZO Ferroelectric Capacitors

基于HZO铁电电容的非易失性电荷域注意力机制:从器件到系统的仿真评估

Fares Abouagor

专题命中 Agent评测 :agent(abstract)

AI总结 提出铁电电荷域计算单元(FCDC),利用HZO忆电容器实现非易失性模拟存储和电荷域向量矩阵乘法,用于Transformer注意力机制,通过器件到系统仿真评估两种部署模式,在多种大语言模型上验证了低功耗和精度保持。

Comments 28 pages, 7 figures. Code: https://github.com/faris-agour/FCDC

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20358 2026-07-03 cs.GT 版本更新 50%

Efficient Interview Scheduling for Stable Matching

高效面试调度实现稳定匹配

Moshe Babaioff, Rotem Gil, Assaf Romm

专题命中 Agent评测 :agent(abstract)

AI总结 针对偏好不确定且需通过面试揭示的市场,提出两种自适应算法(顺序和混合)以最小化面试次数和轮数,实现临时稳定匹配,并证明每代理平均2次面试的必要性。

Comments 55 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.11214 2026-07-02 cs.GT 版本更新 50%

Algorithmic Fair Contracts

算法公平合同

Matteo Castiglioni, Junjie Chen, Yingkai Li

专题命中 Agent评测 :agent(abstract)

AI总结 研究委托-代理中公平合同的设计,证明无嫉妒合同存在但优化收入是NP难的,并给出常数任务或常数代理下的可计算情形及公平代价分析。

Comments some improvements

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01897 2026-07-01 cs.SD eess.AS 版本更新 50%

FastTurn: Unifying Acoustic and Streaming Semantic Cues for Low-Latency and Robust Turn Detection

FastTurn:统一声学和流式语义线索以实现低延迟和鲁棒的轮换检测

Chengyou Wang, Hongfei Xue, Mingchen Shao, Chunjiang He, Jingbin Hu, Shuiyuan Wang, Bo Wu, Yuyu Ji, Jimeng Zheng, Ruofei Chen, Zhou Zhu, Lei Xie

机构 * Audio, Speech and Language Processing Group(语音与语言处理组) Shengwang(盛王) QualiaLabs

专题命中 Agent评测 :agent(abstract)

AI总结 FastTurn通过结合流式CTC解码与声学特征,实现低延迟和鲁棒的轮换检测,同时释放基于真实人类对话的测试集,提升实际全双工对话系统的性能。

Comments 5 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14647 2026-07-01 cs.LO math.LO 版本更新 50%

A Semantics for Belief in Simplicial Complexes

单纯复形中信念的语义

Adam Bjorndahl, Philip Sink

专题命中 Agent评测 :agent(abstract)

AI总结 提出一种基于单纯复形的信念语义,满足KD45公理和“知识蕴含信念”,并通过与关系模型的保真对应给出简单公理化。

Comments In Proceedings AiML 2026, arXiv:2606.29444

Journal ref EPTCS 447, 2026, pp. 173-188

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.02376 2026-07-01 cs.HC 版本更新 50%

Talking Surveys: How Photorealistic Embodied Conversational Agents Shape Response Quality, Engagement, and Satisfaction

对话式调查:逼真的具身对话代理如何影响回答质量、参与度和满意度

Matus Krajcovic, Peter Demcak, Eduard Kuric

专题命中 Agent评测 :agent(abstract)

AI总结 研究提出一种集成AI驱动视频生成、语音识别和大语言模型的虚拟化身对话调查工具,实验表明具身代理能显著提升回答信息量和详细度,提高参与效率,但对满意度无显著影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18879 2026-06-29 econ.TH 版本更新 50%

Motivating Innovation with a Misspecified Roadmap

用错误指定的路线图激励创新

Florian Mudekereza

专题命中 Agent评测 :agent(abstract)

AI总结 研究委托人用路线图指导代理人创新时,路线图错误指定导致代理人陷入突破陷阱,无法持续创新,并得到创新频率上界随错误程度增加而收紧的结论。

Comments Cleaner results and the static framework is now removed

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.09152 2026-06-26 econ.TH 版本更新 50%

Egalitarian-equivalent and strategy-proof mechanisms in homogeneous multi-object allocation problems

同质多物品分配问题中的平等等价与策略证明机制

Hinata Kurashita, Ryosuke Sakai

专题命中 Agent评测 :agent(abstract)

AI总结 研究带货币的同质不可分物品分配问题,刻画满足平等等价、策略证明、个体理性和无补贴的机制类,发现平等等价与效率存在冲突;用非明显可操纵性替代策略证明后,可设计同时满足平等等价和效率的机制,并识别出福利最优机制。

Comments This version generalizes the model and corrects errors in the previous version

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.00853 2026-06-26 math.OC cs.SY eess.SY q-fin.MF 版本更新 50%

Ranking Quantilized Mean-Field Games with an Application to Early-Stage Venture Investments

排序量化平均场博弈及其在早期风险投资中的应用

Rinel Foguen Tchuendom, Dena Firoozi, Michèle Breton

专题命中 Agent评测 :agent(abstract)

AI总结 研究一类基于总体α-分位数的排序量化平均场博弈,提出目标型和阈值型两种模型,并应用于早期风险投资中筛选顶尖初创企业。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.05353 2026-06-26 cs.GT 版本更新 50%

Weighted Envy-Freeness Revisited: Indivisible Resource and House Allocations

加权无嫉妒性再探讨:不可分资源与房屋分配

Yuxi Liu, Mingyu Xiao

专题命中 Agent评测 :agent(abstract)

AI总结 提出SumAvg-无嫉妒性概念,显著提高公平分配的存在性,并系统研究新旧加权公平概念在不可分资源分配和房屋分配中的计算复杂性。

Comments The article has been accepted by Frontiers of Computer Science (FCS), with the DOI: {10.1007/s11704-026-60679-7}

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20183 2026-06-25 cs.CV 版本更新 50%

MSAVBench: Towards Comprehensive and Reliable Evaluation of Multi-Shot Audio-Video Generation

MSAVBench:面向多镜头音频-视频生成的全面可靠评估

Yujie Wei, Yujin Han, Zhekai Chen, Yongming Li, Kaixun Jiang, Zhihang Liu, Quanhao Li, Zhiwu Qing, Xiang Wang, Zhen Xing, Ruihang Chu, Lingyi Hong, Yefei He, Junjie Zhou, Junqiu Yu, Yang Shi, Difan Zou, Kai Zhu, Shiwei Zhang, Yingya Zhang, Yu Liu, Xihui Liu, Hongming Shan

机构 * Fudan University(复旦大学) The University of Hong Kong(香港大学) Tongyi Lab, Alibaba Group(阿里集团通义实验室) Zhejiang University(浙江大学) Peking University(北京大学)

专题命中 Agent评测 :agentic(abstract)

AI总结 提出首个多镜头音频-视频生成基准MSAVBench,通过自适应混合评估框架在四个维度上系统评估19个模型,发现当前系统在导演级控制和细粒度音视频同步上仍存在挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22249 2026-06-24 cs.CV 版本更新 50%

D3Seg: Dependency-Aware Diffusion for Brain Tumor Segmentation with Missing Modalities

D3Seg: 依赖感知的扩散模型用于缺失模态的脑肿瘤分割

Danish Ali, Ajmal Mian, Naveed Akhtar, Ghulam Mubashar Hassan

机构 * The University of Western Australia(西澳大学) The University of Melbourne(墨尔本大学)

专题命中 Agent评测 :planning(abstract)

AI总结 本文提出D3Seg模型,通过多跳模态图融合、轻量扩散插补机制和概率空间决策细化,解决缺失MRI模态下的脑肿瘤分割问题,提升分割性能并保持计算效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00690 2026-06-23 eess.SY cs.SY 版本更新 50%

The Potential Welfare Gains from Curtailment Trading Under Non-Firm Interconnection

非固定互联下削减交易潜在福利收益

Richard Mahuze, Charlotte Gressel, Ali Amadeh, K. Max Zhang

专题命中 Agent评测 :agent(abstract)

AI总结 提出网络约束的削减信用市场(CCM),通过双边信用流机制实现最优削减分配,在三个测试系统中总服务负荷价值提升1.41至1.83倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14944 2026-06-23 cs.RO cs.CV 版本更新 50%

HRDexDB: A Paired Human-Robot Dataset for Cross-Embodiment Dexterous Grasping

HRDexDB:用于跨本体灵巧抓取的配对人机数据集

Jongbin Lim, Taeyun Ha, Mingi Choi, Jisoo Kim, Byungjun Kim, Subin Jeon, Hanbyul Joo

机构 * Seoul National University(首尔国立大学) RLWRLD(RLWRLD实验室)

专题命中 Agent评测 :agent(abstract)

AI总结 提出HRDexDB,一个包含人类和多种机器人手的高保真灵巧抓取轨迹配对数据集,涵盖100种物体,提供高精度时空3D真值,作为跨本体灵巧操作的基础基准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11061 2026-06-23 cs.CV 版本更新 50%

VDAWorld: World Modelling via VLM-Directed Abstraction and Simulation

VDAWorld: 通过VLM导向的抽象与模拟进行世界建模

Felix O'Mahony, Roberto Cipolla, Ayush Tewari

机构 * University of Cambridge(剑桥大学)

专题命中 Agent评测 :agent(abstract)

AI总结 提出VDAWorld框架,利用视觉语言模型自主构建场景表示并选择物理模拟器,通过抽象与自适应模拟实现高质量世界建模,在交互控制、反事实生成和物理逻辑推理任务上取得最优结果。

Comments Website: https://felixomahony.github.io/vdaworld/

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.10705 2026-06-23 eess.IV cs.CV 版本更新 50%

3D Vessel Reconstruction from Sparse-View Dynamic DSA Images via Vessel Probability Guided Attenuation Learning

基于血管概率引导衰减学习的稀疏视角动态DSA图像三维血管重建

Zhentao Liu, Huangxuan Zhao, Wenhui Qin, Zhenghong Zhou, Xinggang Wang, Wenping Wang, Xiaochun Lai, Chuansheng Zheng, Dinggang Shen, Zhiming Cui

机构 * School of Biomedical Engineering \& State Key Laboratory of Advanced Medical Materials Devices, ShanghaiTech University, Shanghai, China National Engineering Research Center for Multimedia Software, School of Computer Science, Wuhan University, Wuhan, China School of Electronic Information Communications, Huazhong University of Science Department of Computer Science \& Engineering, Texas A\&M University, USA

专题命中 Agent评测 :agent(abstract)

AI总结 提出血管概率引导衰减学习框架,通过静态与动态衰减场互补加权实现稀疏视角DSA重建,降低辐射剂量,并采用渐进训练和时间扰动损失提升质量。

Comments Accepted by Medical Image Analysis (MedIA), 2026; code: https://github.com/ShanghaiTech-IMPACT/VPAL

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.06754 2026-06-23 physics.med-ph 版本更新 50%

Fully three-dimensional sound speed-corrected multi-wavelength photoacoustic breast tomography

全三维声速校正多波长光声乳腺断层成像

M. Dantuma, F. Lucka, S. C. Kruitwagen, A. Javaherian, L. Alink, R. P. Pompe van Meerdervoort, M. Nanninga, T. J. P. M. Op 't Root, B. De Santi, J. Budisky, G. Bordovsky, E. Coffy, M. Wilm, T. Kasponas, S. H. Aarnink, L. F. de Geus-Oei, F. Brochin, T. Martinez, A. Michailovas, W. Muller Kobold, J. Jaros, J. Veltman, B. Cox, S. Manohar

专题命中 Agent评测 :agent(abstract)

AI总结 提出混合光声与超声传输断层成像系统PAM3,首次实现三维多波长光声成像并利用三维声速图校正不均匀性,达到48mm最深成像深度和各向同性空间分辨率。

Comments 33 pages Main Body, 9 pages Supplementary Material

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03709 2026-06-18 physics.chem-ph 版本更新 50%

Augmented Roothaan-Hall Hessian Applied to Spin-Restricted Open-Shell Density-Functional Theory

增强型Roothaan-Hall Hessian在自旋限制开壳层密度泛函理论中的应用

Yichi Zhang, Jun Yang

专题命中 Agent评测 :agent(abstract)

AI总结 将增强型Roothaan-Hall Hessian形式推广到自旋限制开壳层波函数的自洽场优化中,提出了一种高效优化算法,能快速找到精确的SCF最小值,并统一了不同DFT形式的数值实现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.23644 2026-06-18 cs.MA 版本更新 50%

Agents Trusting Agents? Restoring Lost Capabilities with Inclusive Healthcare

代理信任代理?通过包容性医疗恢复失去的能力

Alba Aguilera, Georgina Curto, Nardine Osman, Ahmed Al-Awah

专题命中 Agent评测 :agent(abstract)

AI总结 本文利用基于代理的模拟和贝叶斯逆强化学习,评估巴塞罗那改善无家可归者医疗公平的政策,通过建模信任关系来恢复其核心能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.12614 2026-06-18 physics.soc-ph cond-mat.stat-mech nlin.AO q-bio.PE 版本更新 50%

Modeling Epidemics on Multiplex Networks: Epidemic Threshold and Basic Reproduction Number

多重网络上的流行病建模:流行阈值与基本再生数

Eric Alejandro Rozan, Mario Ignacio Simoy, Sebastian Bouzat, Marcelo Nestor Kuperman

专题命中 Agent评测 :agent(abstract)

AI总结 针对多重网络提出基本再生数R0的解析表达式,基于度均值场SIR模型和下一代矩阵方法,并通过数值模拟和随机仿真验证其作为流行阈值的作用。

Comments 22 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23176 2026-06-17 cs.CV 版本更新 50%

DRIVESPATIAL: A Benchmark for Spatiotemporal Intelligence in VLMs for Autonomous Driving

DRIVESPATIAL:自动驾驶中视觉语言模型时空智能的基准

Hao Vo, Khoa Vo, Phu Loc Nguyen, Sieu Tran, Duc Minh Nguyen, Ngo Xuan Cuong, Gladys Gawugah, Sreevenkata Anjani Tishita Godavarthi, Chase Rainwater, Nghi D. Q. Bui, Anh Nguyen, Duy Minh Ho Nguyen, Ngan Le

机构 * University of Arkansas, USA(美国阿肯色大学) Google Research, Google(谷歌研究院) University of Liverpool, UK(英国利物浦大学) Max Planck Research School for Intelligent Systems(马克斯·普朗克智能系统研究学校)

专题命中 Agent评测 :agent(abstract)

AI总结 提出DriveSpatial基准,通过多视角、时空推理任务评估视觉语言模型在自动驾驶中的场景构建、关系理解、时序推理和泛化能力,发现人类与模型间存在显著差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26272 2026-06-17 stat.ME 版本更新 50%

TWICEBEE: A Two-stage Intra-patient Curve-free Bayesian Decision-Theoretic Dose Escalation Design

TWICEBEE: 一种两阶段患者内无曲线贝叶斯决策理论剂量递增设计

Dehua Bi, Katherine Ryan, Sabine Heitzeneder, Zina Good, John S. Tamaresis, Robert Lowsky, Michelle Monje, Crystal Mackall, Ying Lu

专题命中 Agent评测 :agent(abstract)

AI总结 针对多周期免疫治疗中毒性随周期递减的特点,提出两阶段患者内剂量递增设计,结合加速滴定与改进的无曲线贝叶斯决策理论框架,实现安全高效的剂量探索。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16791 2026-06-16 cs.DS cs.GT 版本更新 50%

Improved Parallel Algorithms for EF1 Allocations

改进的EF1分配并行算法

Kishen N Gowda, D Ellis Hershkowitz, Richard Z Huang, Gregory Kehne

专题命中 Agent评测 :agent(abstract)

AI总结 本文改进了EF1分配的并行算法,针对2个代理人的情况,将深度从O(log²m)改进到O(logm),并将工作量从O(m logm)减少到O(m)。同时,算法被推广到任意常数数量的代理人,并提出了随机算法,具有O(m/n)的深度和多项式工作量。此外,本文还展示了计算k≈√m的 envy-free up to k goods 分配在RNC中是可能的,或在子线性深度中对于任何常数ε>0,k=m^ε。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13599 2026-06-16 cs.GT econ.TH math.OC 版本更新 50%

Dynamic Wholesale Pricing under Censored-Demand Learning

基于删失需求学习的动态批发定价

Michalis Deligiannis, Marco Scarsini, Xavier Venel

专题命中 Agent评测 :agent(abstract)

AI总结 研究两级供应链中制造商与零售商在删失需求数据下的动态定价与订货博弈,利用维度缩减方法证明马尔可夫完美均衡存在性,并揭示公共学习引发的激励冲突。

详情

展开后加载摘要…

URL PDF HTML 收藏