arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

共收录 1239 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. Agent评测 1239 篇

2607.02835 2026-07-07 cs.GT 新提交 50%

A Tractable Continuous-Time Model for Designing Interventions for Time-Inconsistent Agents

一种用于为时间不一致代理设计干预措施的可处理连续时间模型

Yasunori Akagi, Hideaki Kim, Daichi Fushihara, Ryosuke Nakahama, Hiroyasu Miyazaki, Takeshi Kurashima

专题命中 Agent评测 :agent(abstract)

AI总结 研究为时间不一致代理在有期限约束的基于进度的任务中设计干预措施,提出可处理连续时间模型,分析代理行为并研究最优目标设定与奖励调度问题,给出结果及与离散时间模型的差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04308 2026-07-07 math.OC econ.TH 新提交 50%

Markov Information Processes

马尔可夫信息过程

Furkan Sezer

专题命中 Agent评测 :agent(abstract)

AI总结 研究有承诺的设计者塑造有策略互动、有远见的智能体信息的信息设计,引入马尔可夫贝叶斯相关均衡,给出设计者问题求解算法,通过例子和数值研究阐述理论。

Comments 18 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03167 2026-07-07 math.CO 新提交 50%

Euler Constraints and the Cubic Criticality of Complete Bipartite Preference Structures

欧拉约束与完全二分偏好结构的三次临界性

Yoshiteru Ishida

专题命中 Agent评测 :agent(abstract)

AI总结 研究完全二分偏好结构的多面体可实现性问题,通过碰撞强边要求、二分平面图边界和多面体图最小度约束证明欧拉型临界性定理,区分弱实现并指出欧拉区间未完全可实现,在立方体情形给出偏好理论表现。

Comments 8 pages; comments welcome

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04495 2026-07-07 physics.flu-dyn physics.geo-ph 新提交 50%

U3DWind: A Low Altitude Wind Field Dataset and Benchmark for Urban Air Mobility

U3DWind:用于城市空中交通的低空风场数据集及基准

Shixiong Zhou, Huanxia Wei, Chao Xia, Yingying Xing, Changmin Jiang, Hai Yang, Shuai Jia

专题命中 Agent评测 :planning(abstract)

AI总结 研究针对城市空中交通低空风害评估数据资源不足问题,用GPU加速框架生成U3DWind数据集,涵盖中国五座大城市,定义五项基线任务,为低空交通风影响评估及城市空域管理等提供基准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02784 2026-07-07 physics.chem-ph physics.bio-ph 新提交 50%

Auditing Haldane Consistency in Reversible Enzyme Kinetics: A Curated Two-Sided Backbone and a Labeled Fold-Error Benchmark

审核可逆酶动力学中的霍尔丹一致性:精心策划的双边主干和标记的折叠误差基准

Megan Simons, Jonathan Washburn

专题命中 Agent评测 :workflow(abstract)

AI总结 研究通过霍尔丹关系审核可逆酶动力学常数,用互易成本作为校准对称报告尺度,应用于示范集并构建双边主干,还通过半合成基准量化可检测性,贡献包括生化整理、可重复工作流程及折叠误差校准。

Comments 50 pages, 8 figures, supplementary material and reproducibility code/data included as ancillary files

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03151 2026-07-07 cond-mat.mes-hall cond-mat.mtrl-sci 新提交 50%

Comparative Evaluation of Encapsulation Methods for Endohedral Doping of Single-Wall Carbon Nanotubes

单壁碳纳米管内掺杂封装方法的比较评估

Cristian M. Borja-Peña, Martin Magg, Hussein Slim, Yamaldi M. Bakary, Cedric Desroches, Denys Kurylo, Kazuhiro Yanagi, Benjamin S. Flavel, Salomé Forel, Wim Wenseleers, Sofie Cambré

专题命中 Agent评测 :workflow(abstract)

AI总结 研究单壁碳纳米管内掺杂封装电荷转移分子的方法,比较熔体填充、溶液回流、真空相升华等填充方式;通过多种手段评估封装效率与电子改性,还介绍一种无需大量溶剂洗涤的真空相法提高封装系统清洁度。

Comments 53 pages, 19 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00874 2026-07-07 cs.RO cs.MA 新提交 50%

Beyond Line of Sight: Hybrid Validation of V2X Collective Perception in Complex Scenarios

超越视线:复杂场景中V2X集体感知的混合验证

Markos Antonopoulos, Anastasia Bolovinou, Bill Roungas, Elena Daskalaki, Angelos Amditis

机构 * European Union(欧盟)

专题命中 Agent评测 :agent(abstract)

AI总结 提出一种概率框架和混合验证方法,通过贝叶斯融合算法扩展感知范围,在环形交叉口场景中实现视场覆盖增加260%,占用单元召回率从0.82提升至0.94。

Comments 6 pages, 4 figures, to be presented in ITS World 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20723 2026-07-07 cs.CV 新提交 50%

Evaluation of Medical Vision Language Models HuluMed and MedGemma, and general purpose chatbots Gemma 3, ChatGPT Plus, and Claude Pro on real previously unseen wound images

医学视觉语言模型 HuluMed 和 MedGemma 以及通用聊天机器人 Gemma 3、ChatGPT Plus 和 Claude Pro 在真实未见伤口图像上的评估

Yunzhe Xue, Mohammed Saim Ahmed Quadri, Neal Panse, Justin W. Ady, Usman Roshan

机构 * Department of Computer Science, New Jersey Institute of Technology(新泽西理工学院计算机科学系) Vascular and Endovascular Surgery, Robert Wood Johnson Hospital(罗伯特·伍德·约翰逊医院血管外科) Department of Data Science, New Jersey Institute of Technology(新泽西理工学院数据科学系)

专题命中 Agent评测 :planning(abstract)

AI总结 本研究评估了六种视觉语言模型在慢性伤口分析任务上的表现,发现通用模型 ChatGPT 和 Claude 显著优于医学专用模型,表明广泛的多模态推理能力比领域知识更重要。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02330 2026-07-03 cs.GT 新提交 50%

Facility Location Game with Envy Ratio

带有嫉妒比率的设施选址博弈

Yuan Ding, Wenjing Liu, Xin Chen, Qizhi Fang, Qingqin Nong

专题命中 Agent评测 :agent(abstract)

AI总结 研究实数线上以嫉妒比率为目标的一设施选址博弈,提出策略证明或群体策略证明机制以最小化嫉妒比率,并在两种场景下获得最优解和最佳确定性机制。

Journal ref Computers & Industrial Engineering (2020) 106710

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02315 2026-07-03 cs.NE 新提交 50%

Hybridizing a Grouping Metaheuristic with Reinforcement Learning for the One-Dimensional Bin Packing Problem

结合分组元启发式与强化学习的一维装箱问题求解

Zitouni Rania, Mostefai Mounir Sofiane, Tati Youcef, Badaoui Ikram, Bousdjira Nadine, Hasnaoui Sarah

专题命中 Agent评测 :agent(abstract)

AI总结 提出RL-HGGA混合算法,将分组遗传算法与Q学习结合,通过动态选择八种宏动作,在标准测试集上达到0.95%平均最优性差距,计算时间从64.22秒降至1.29秒(50倍加速)。

Comments 10 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02314 2026-07-03 cs.GT 新提交 50%

Constrained Distributed Heterogeneous Two-Facility Location Problems with Max-Variant Cost

约束分布式异构双设施选址问题与最大变体成本

Xinru Xu, Wenjing Liu, Qizhi Fang, Alexandros A. Voudouris

专题命中 Agent评测 :agent(abstract)

AI总结 研究在最大变体成本模型下,受限于候选位置且每个位置最多设一个设施,设计策略证明的分布式机制,以近似四种社会目标,并给出常数下界与上界。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01556 2026-07-03 cs.CV 新提交 50%

Mind the Gap: Standard 3DGS Evaluation Primarily Measures Near-Trajectory Interpolation

注意差距:标准 3DGS 评估主要衡量近轨迹插值

Gaoxiang Jia, Vikram Appia

机构 * Advanced Micro Devices, Inc.(超威半导体公司)

专题命中 Agent评测 :planning(abstract)

AI总结 标准 3DGS 评估采用隔帧留出法,实际衡量近轨迹插值而非空间泛化。本文提出匹配计数协议,发现插值与外推之间存在 3~12dB 的稳定差距,该差距跨表示族存在,主要由几何代理分量主导,并建议采用空间留出基准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00483 2026-07-03 cs.RO 新提交 50%

VLM-AR3L: Vision-Language Models for Absolute and Relative Rewards in Reinforcement Learning

VLM-AR3L:用于强化学习中绝对和相对奖励的视觉-语言模型

Kuan-Chen Chen, Winston Chen, Wei-Fang Sun, Min-Chun Hu

机构 * National Tsing Hua University(国立清华大学) NVIDIA AI Technology Center (NVAITC)(英伟达AI技术中心)

专题命中 Agent评测 :agent(abstract)

AI总结 提出VLM-AR3L框架,利用视觉-语言模型从偏好标签中学习绝对和相对奖励,结合状态评估与比较监督,在多种基准任务中优于先前方法。

Comments Accepted at IJCAI 2026. Project website: https://vlm-ar3l.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26297 2026-07-03 cs.DC cs.CE 新提交 50%

A Distributed Quantum Approximate Optimization Algorithm Simulator for Engineering Design Optimization

面向工程设计优化的分布式量子近似优化算法模拟器

Ali Rajabi, Milad Hasanzadeh, Amin Kargarian

专题命中 Agent评测 :workflow(abstract)

AI总结 提出一个兼容Qiskit的分布式量子近似优化算法模拟器,用于解决工程设计中的QUBO问题,支持单QPU和分布式多QPU执行模式,并包含运行时优化和图形界面。

Comments 37 pages, 7 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17793 2026-07-03 cs.HC cs.DB 新提交 50%

Evaluating Social Engineering Risks in AI-based Interaction using Biometrics and a Gaming Setup

ARES: 一种用于人类-人工智能游戏中基于角色的社会工程风险自适应评估平台

Roberto Daza, Javier Irigoyen, Ivan Lopez, Raquel Rodriguez-Carvajal, Laura Gomez-Carbajo, Julian Fierrez, Ruben Tolosana, Aythami Morales

专题命中 Agent评测 :agent(abstract)

AI总结 提出ARES平台,通过可控社交游戏审计LLM中介的社会决策中的自适应社会工程风险,支持人-人、人-AI和AI-AI设置,并收集多模态数据集以评估风险。

Comments 6 pages, 2 figures. Accepted at the IEEE International Carnahan Conference on Security Technology (ICCST 2026), October 14, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01159 2026-07-02 cs.GT cs.DM cs.DS 新提交 50%

Online Fair Division Meets Reordering Buffers

在线公平分配遇上重排序缓冲区

Georgios Amanatidis, Giulio Giaconi, Evangelos Markakis, Nicos Protopapas

专题命中 Agent评测 :agent(abstract)

AI总结 研究在线公平分配不可分割混合物品问题,通过引入有限大小的缓冲区,在个性化k-值实例中实现每个时间步EF1且大多数时间步EF的分配。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00258 2026-07-02 cs.SI 新提交 50%

Joint Effects of Recommender Systems and Network Structure on the Visibility of Content and Creators

推荐系统与网络结构对内容和创作者可见性的联合影响

Virginia Morini, Valentina Pansanella, Luca Pappalardo, Dino Pedreschi, Giulio Rossetti

专题命中 Agent评测 :agent(abstract)

AI总结 通过基于代理的模拟,研究推荐逻辑(流行度与协同过滤)和网络拓扑如何共同塑造社交媒体中内容和创作者的可见性分布。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01059 2026-07-02 cs.GT cs.DS math.CO 新提交 50%

Fair Allocation under Conflict Constraints via Strong Colorability

冲突约束下的公平分配问题:基于强可着色性

Ishay Haviv

专题命中 Agent评测 :agent(abstract)

AI总结 研究冲突约束下公平分配问题,引入强色数层次结构,证明SD-EF1、EF1和EF[1,1]公平分配的存在性与算法条件,给出最大度相关的最优界限。

Comments 32 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31037 2026-07-02 cs.RO 新提交 50%

Labimus: A Simulation and Benchmark for Humanoid Dexterous Manipulation in Chemical Laboratory

Labimus: 化学实验室中类人灵巧操作的仿真与基准

Yuhan Wu, Zhao Jin, Tao Li, Yuheng Zhang, Zhichao Wang, Shuo Wang, Jun Jiang, Xiaobo Li, Yanyong Zhang, Jian Tang, Zhengping Che, Yan Xia

机构 * University of Science and Technology of China(中国科学技术大学) Beijing Innovation Center of Humanoid Robotics(北京人形机器人创新中心)

专题命中 Agent评测 :workflow(abstract)

AI总结 提出Labimus,首个针对有机化学实验室中类人灵巧操作的基准,通过真实到仿真建模重建30多个功能资产,定义原子操作和称重流程,揭示任务完成与实验精度之间的差距。

Comments Project page: https://labimus.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31875 2026-07-01 cs.CV 新提交 50%

SENSE-VAD: Sentient and Semantic Video Anomaly Detection for Autonomous Driving

SENSE-VAD:面向自动驾驶的情感和语义视频异常检测

Nghia T. Nguyen, Lokman Bekit, Yasin Yilmaz

机构 * University of South Florida(南佛罗里达大学)

专题命中 Agent评测 :agent(abstract)

AI总结 针对自动驾驶中社会关系导致的异常(如追逐、被抱等),提出首个合成视频异常检测基准SENSE-VAD,利用CARLA和UE生成多类别社交异常场景,并分离社交异常与运动异常,评估现有方法发现其难以解决该挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31858 2026-07-01 cs.LO cs.MA 新提交 50%

The Logic of Data Access and Data Exchanges

数据访问与数据交换的逻辑

Alexandru Baltag, Sonja Smets

专题命中 Agent评测 :agent(abstract)

AI总结 本文提出一种扩展动态认知逻辑的新逻辑,结合命题知识模态与数值条件非命题知识算子,并引入基于最小化算子的限定描述,用于数据交换场景的推理,给出了完全公理化并证明了可判定性与共表达性。

Comments In Proceedings AiML 2026, arXiv:2606.29444

Journal ref EPTCS 447, 2026, pp. 93-116

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31292 2026-07-01 cs.CE 新提交 50%

AtomiMed: Hierarchical Atomic Fact-Checking for Universal Clinical-Aware Medical Report Evaluation

AtomiMed:用于通用临床感知医学报告评估的分层原子事实核查

Yuan Wang, Wanxing Chang, Songtao Jiang, Shujian Gao, Xiaotian Zhang, Ruifeng Yuan, Weiwei Cao, Bowen Shi, Ling Zhang, Zuozhu Liu, Jianpeng Zhang

专题命中 Agent评测 :agentic(abstract)

AI总结 提出AtomiMed框架,将复杂医学叙述分解为分层原子临床事实,通过代理交叉验证循环模拟多放射科医生同行评审,实现诊断检测和描述准确性的解耦评估。

Comments 11 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30777 2026-07-01 cs.CV 新提交 50%

Unveiling Transferability in Trajectory Prediction via Latent Scene Embeddings

通过潜在场景嵌入揭示轨迹预测中的可迁移性

Theodor Westny, David Axelsson, Björn Olofsson, Erik Frisk

机构 * Linköping University(林雪平大学) Lund University(隆德大学)

专题命中 Agent评测 :agent(abstract)

AI总结 提出一个学习数据集潜在表示并用量化分布指标衡量相似性的框架,在24个数据集上验证迁移分数与跨数据集模型性能强相关,为数据集选择、预训练和基础模型提供指导。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30666 2026-07-01 cs.CY 新提交 50%

Reframing AGI Confrontation with Off Earth Autonomy

重构与地外自主性的AGI对抗

Alexey Potapov

专题命中 Agent评测 :agent(abstract)

AI总结 本文质疑AI安全叙事中关于强大智能体必然寻求权力并与人类对抗的结论,提出存在地外自主性路径时,早期合作可取代对抗,并通过决策理论模型分析激励转变及其治理启示。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31142 2026-07-01 math.OC 新提交 50%

Augmenting airline networks using airside-to-airside buses to strengthen system resilience under disruptions

利用空侧对空侧巴士增强航空网络以加强系统在中断下的韧性

Micah M. Borrero, Max Z. Li

专题命中 Agent评测 :agent(abstract)

AI总结 提出通过空侧对空侧巴士替代短途区域航班,重构航空网络拓扑以主动提升韧性,模拟显示在1000万美元预算下转换10条航线可减少8%中断日和6%正常日的旅客延误。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31228 2026-07-01 eess.SY cs.SY physics.app-ph physics.ins-det 新提交 50%

FPGA-based LQG controller and hardware-in-the-loop simulator implementation for nanomechanical systems

基于FPGA的纳米机械系统LQG控制器与硬件在环仿真器实现

Vojtěch Mlynář, Johannes Berndorfer, Andreas Kugi, Andreas Deutschmann-Olek

专题命中 Agent评测 :workflow(abstract)

AI总结 提出在低成本Red Pitaya STEMlab FPGA平台上实现实时LQG控制与硬件在环仿真,支持三自由度耦合振荡系统,并通过悬浮纳米粒子双势阱稳定实验验证。

Comments Submission to SciPost

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28025 2026-06-29 physics.soc-ph 新提交 50%

Indecision and accuracy under social information across groups sizes

群体规模下社会信息中的犹豫与准确性

Andrew M Bate, Charlie Pilgrim, Richard P. Mann

专题命中 Agent评测 :agent(abstract)

AI总结 研究社会信息下群体决策的犹豫与准确性,发现社会信息加速决策并提高准确性,但个体准确性在有限最优群体规模时最大,多数选择准确性随规模单调增加,且决策波常无法解决集体犹豫,未决定者后续决策偏差增大。

Comments 20 pages Main document, 18 pages Supplementary Material (together making 38 pages total). Main document has 9 Figures (20 Subfigures), Supplementary has 13 Figures (70 Subfigures), so total of 22 Figures (90 Subfigures)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27968 2026-06-29 physics.soc-ph 新提交 50%

SimPol: Simulating polarisation in political belief networks in European countries

SimPol: 模拟欧洲国家政治信念网络中的极化现象

Isabela Burattini Freire, Hongryol Cha, Irina Epure, Sara Filippini, Karan K. H. Manjunatha, Chethan Kavaraganahalli Prasanna, Ivan Samoylenko, Niels Van Santen, Adarsh Prabhakaran, Guillermo Romero Moreno

专题命中 Agent评测 :agent(abstract)

AI总结 结合实证网络分析与基于智能体的建模,研究信念系统结构如何影响极化驱动,并揭示欧洲信念系统多样性导致的不同极化轨迹。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24826 2026-06-29 cs.HC 新提交 50%

Virtual Simulation for Mental Health

心理健康虚拟仿真

Anna Fang

专题命中 Agent评测 :agent(abstract)

AI总结 本文探索利用虚拟仿真技术,通过基于智能体的建模评估社区层面结果,以及通过具身控制空间进行个体训练,为心理健康干预提供安全实验环境。

Comments Doctoral Dissertation, Carnegie Mellon University

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27128 2026-06-26 cs.CV cs.RO 新提交 50%

FlameVQA: A Physically-Grounded UAV Wildfire VQA Benchmark with Radiometric Thermal Supervision

FlameVQA: 一个基于辐射热监督的物理基础无人机野火VQA基准

Mobin Habibpour, John Spodnik, Niloufar Alipour Talemi, Fatemeh Afghah

机构 * National Science Foundation(国家科学基金会) NASA(美国国家航空航天局)

专题命中 Agent评测 :planning(abstract)

AI总结 提出FlameVQA,一个基于FLAME 3数据集的无人机野火多选视觉问答基准,利用配对的RGB和辐射热TIFF图像实现温度基础的推理,评估了多种MLLM在检测、定位、覆盖估计等任务上的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏