arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

共收录 7142 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. Agent评测 1239 篇

2607.02315 2026-07-03 cs.NE 新提交 50%

Hybridizing a Grouping Metaheuristic with Reinforcement Learning for the One-Dimensional Bin Packing Problem

结合分组元启发式与强化学习的一维装箱问题求解

Zitouni Rania, Mostefai Mounir Sofiane, Tati Youcef, Badaoui Ikram, Bousdjira Nadine, Hasnaoui Sarah

专题命中 Agent评测 :agent(abstract)

AI总结 提出RL-HGGA混合算法,将分组遗传算法与Q学习结合,通过动态选择八种宏动作,在标准测试集上达到0.95%平均最优性差距,计算时间从64.22秒降至1.29秒(50倍加速)。

Comments 10 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02314 2026-07-03 cs.GT 新提交 50%

Constrained Distributed Heterogeneous Two-Facility Location Problems with Max-Variant Cost

约束分布式异构双设施选址问题与最大变体成本

Xinru Xu, Wenjing Liu, Qizhi Fang, Alexandros A. Voudouris

专题命中 Agent评测 :agent(abstract)

AI总结 研究在最大变体成本模型下,受限于候选位置且每个位置最多设一个设施,设计策略证明的分布式机制,以近似四种社会目标,并给出常数下界与上界。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01556 2026-07-03 cs.CV 新提交 50%

Mind the Gap: Standard 3DGS Evaluation Primarily Measures Near-Trajectory Interpolation

注意差距:标准 3DGS 评估主要衡量近轨迹插值

Gaoxiang Jia, Vikram Appia

机构 * Advanced Micro Devices, Inc.(超威半导体公司)

专题命中 Agent评测 :planning(abstract)

AI总结 标准 3DGS 评估采用隔帧留出法,实际衡量近轨迹插值而非空间泛化。本文提出匹配计数协议,发现插值与外推之间存在 3~12dB 的稳定差距,该差距跨表示族存在,主要由几何代理分量主导,并建议采用空间留出基准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00483 2026-07-03 cs.RO 新提交 50%

VLM-AR3L: Vision-Language Models for Absolute and Relative Rewards in Reinforcement Learning

VLM-AR3L:用于强化学习中绝对和相对奖励的视觉-语言模型

Kuan-Chen Chen, Winston Chen, Wei-Fang Sun, Min-Chun Hu

机构 * National Tsing Hua University(国立清华大学) NVIDIA AI Technology Center (NVAITC)(英伟达AI技术中心)

专题命中 Agent评测 :agent(abstract)

AI总结 提出VLM-AR3L框架,利用视觉-语言模型从偏好标签中学习绝对和相对奖励,结合状态评估与比较监督,在多种基准任务中优于先前方法。

Comments Accepted at IJCAI 2026. Project website: https://vlm-ar3l.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26297 2026-07-03 cs.DC cs.CE 新提交 50%

A Distributed Quantum Approximate Optimization Algorithm Simulator for Engineering Design Optimization

面向工程设计优化的分布式量子近似优化算法模拟器

Ali Rajabi, Milad Hasanzadeh, Amin Kargarian

专题命中 Agent评测 :workflow(abstract)

AI总结 提出一个兼容Qiskit的分布式量子近似优化算法模拟器,用于解决工程设计中的QUBO问题,支持单QPU和分布式多QPU执行模式,并包含运行时优化和图形界面。

Comments 37 pages, 7 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17793 2026-07-03 cs.HC cs.DB 新提交 50%

Evaluating Social Engineering Risks in AI-based Interaction using Biometrics and a Gaming Setup

ARES: 一种用于人类-人工智能游戏中基于角色的社会工程风险自适应评估平台

Roberto Daza, Javier Irigoyen, Ivan Lopez, Raquel Rodriguez-Carvajal, Laura Gomez-Carbajo, Julian Fierrez, Ruben Tolosana, Aythami Morales

专题命中 Agent评测 :agent(abstract)

AI总结 提出ARES平台,通过可控社交游戏审计LLM中介的社会决策中的自适应社会工程风险,支持人-人、人-AI和AI-AI设置,并收集多模态数据集以评估风险。

Comments 6 pages, 2 figures. Accepted at the IEEE International Carnahan Conference on Security Technology (ICCST 2026), October 14, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01159 2026-07-02 cs.GT cs.DM cs.DS 新提交 50%

Online Fair Division Meets Reordering Buffers

在线公平分配遇上重排序缓冲区

Georgios Amanatidis, Giulio Giaconi, Evangelos Markakis, Nicos Protopapas

专题命中 Agent评测 :agent(abstract)

AI总结 研究在线公平分配不可分割混合物品问题,通过引入有限大小的缓冲区,在个性化k-值实例中实现每个时间步EF1且大多数时间步EF的分配。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00258 2026-07-02 cs.SI 新提交 50%

Joint Effects of Recommender Systems and Network Structure on the Visibility of Content and Creators

推荐系统与网络结构对内容和创作者可见性的联合影响

Virginia Morini, Valentina Pansanella, Luca Pappalardo, Dino Pedreschi, Giulio Rossetti

专题命中 Agent评测 :agent(abstract)

AI总结 通过基于代理的模拟,研究推荐逻辑(流行度与协同过滤)和网络拓扑如何共同塑造社交媒体中内容和创作者的可见性分布。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01059 2026-07-02 cs.GT cs.DS math.CO 新提交 50%

Fair Allocation under Conflict Constraints via Strong Colorability

冲突约束下的公平分配问题:基于强可着色性

Ishay Haviv

专题命中 Agent评测 :agent(abstract)

AI总结 研究冲突约束下公平分配问题,引入强色数层次结构,证明SD-EF1、EF1和EF[1,1]公平分配的存在性与算法条件,给出最大度相关的最优界限。

Comments 32 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31037 2026-07-02 cs.RO 新提交 50%

Labimus: A Simulation and Benchmark for Humanoid Dexterous Manipulation in Chemical Laboratory

Labimus: 化学实验室中类人灵巧操作的仿真与基准

Yuhan Wu, Zhao Jin, Tao Li, Yuheng Zhang, Zhichao Wang, Shuo Wang, Jun Jiang, Xiaobo Li, Yanyong Zhang, Jian Tang, Zhengping Che, Yan Xia

机构 * University of Science and Technology of China(中国科学技术大学) Beijing Innovation Center of Humanoid Robotics(北京人形机器人创新中心)

专题命中 Agent评测 :workflow(abstract)

AI总结 提出Labimus,首个针对有机化学实验室中类人灵巧操作的基准,通过真实到仿真建模重建30多个功能资产,定义原子操作和称重流程,揭示任务完成与实验精度之间的差距。

Comments Project page: https://labimus.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31875 2026-07-01 cs.CV 新提交 50%

SENSE-VAD: Sentient and Semantic Video Anomaly Detection for Autonomous Driving

SENSE-VAD:面向自动驾驶的情感和语义视频异常检测

Nghia T. Nguyen, Lokman Bekit, Yasin Yilmaz

机构 * University of South Florida(南佛罗里达大学)

专题命中 Agent评测 :agent(abstract)

AI总结 针对自动驾驶中社会关系导致的异常(如追逐、被抱等),提出首个合成视频异常检测基准SENSE-VAD,利用CARLA和UE生成多类别社交异常场景,并分离社交异常与运动异常,评估现有方法发现其难以解决该挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31858 2026-07-01 cs.LO cs.MA 新提交 50%

The Logic of Data Access and Data Exchanges

数据访问与数据交换的逻辑

Alexandru Baltag, Sonja Smets

专题命中 Agent评测 :agent(abstract)

AI总结 本文提出一种扩展动态认知逻辑的新逻辑,结合命题知识模态与数值条件非命题知识算子,并引入基于最小化算子的限定描述,用于数据交换场景的推理,给出了完全公理化并证明了可判定性与共表达性。

Comments In Proceedings AiML 2026, arXiv:2606.29444

Journal ref EPTCS 447, 2026, pp. 93-116

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31292 2026-07-01 cs.CE 新提交 50%

AtomiMed: Hierarchical Atomic Fact-Checking for Universal Clinical-Aware Medical Report Evaluation

AtomiMed:用于通用临床感知医学报告评估的分层原子事实核查

Yuan Wang, Wanxing Chang, Songtao Jiang, Shujian Gao, Xiaotian Zhang, Ruifeng Yuan, Weiwei Cao, Bowen Shi, Ling Zhang, Zuozhu Liu, Jianpeng Zhang

专题命中 Agent评测 :agentic(abstract)

AI总结 提出AtomiMed框架,将复杂医学叙述分解为分层原子临床事实,通过代理交叉验证循环模拟多放射科医生同行评审,实现诊断检测和描述准确性的解耦评估。

Comments 11 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30777 2026-07-01 cs.CV 新提交 50%

Unveiling Transferability in Trajectory Prediction via Latent Scene Embeddings

通过潜在场景嵌入揭示轨迹预测中的可迁移性

Theodor Westny, David Axelsson, Björn Olofsson, Erik Frisk

机构 * Linköping University(林雪平大学) Lund University(隆德大学)

专题命中 Agent评测 :agent(abstract)

AI总结 提出一个学习数据集潜在表示并用量化分布指标衡量相似性的框架,在24个数据集上验证迁移分数与跨数据集模型性能强相关,为数据集选择、预训练和基础模型提供指导。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30666 2026-07-01 cs.CY 新提交 50%

Reframing AGI Confrontation with Off Earth Autonomy

重构与地外自主性的AGI对抗

Alexey Potapov

专题命中 Agent评测 :agent(abstract)

AI总结 本文质疑AI安全叙事中关于强大智能体必然寻求权力并与人类对抗的结论,提出存在地外自主性路径时,早期合作可取代对抗,并通过决策理论模型分析激励转变及其治理启示。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31142 2026-07-01 math.OC 新提交 50%

Augmenting airline networks using airside-to-airside buses to strengthen system resilience under disruptions

利用空侧对空侧巴士增强航空网络以加强系统在中断下的韧性

Micah M. Borrero, Max Z. Li

专题命中 Agent评测 :agent(abstract)

AI总结 提出通过空侧对空侧巴士替代短途区域航班,重构航空网络拓扑以主动提升韧性,模拟显示在1000万美元预算下转换10条航线可减少8%中断日和6%正常日的旅客延误。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31228 2026-07-01 eess.SY cs.SY physics.app-ph physics.ins-det 新提交 50%

FPGA-based LQG controller and hardware-in-the-loop simulator implementation for nanomechanical systems

基于FPGA的纳米机械系统LQG控制器与硬件在环仿真器实现

Vojtěch Mlynář, Johannes Berndorfer, Andreas Kugi, Andreas Deutschmann-Olek

专题命中 Agent评测 :workflow(abstract)

AI总结 提出在低成本Red Pitaya STEMlab FPGA平台上实现实时LQG控制与硬件在环仿真,支持三自由度耦合振荡系统,并通过悬浮纳米粒子双势阱稳定实验验证。

Comments Submission to SciPost

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28025 2026-06-29 physics.soc-ph 新提交 50%

Indecision and accuracy under social information across groups sizes

群体规模下社会信息中的犹豫与准确性

Andrew M Bate, Charlie Pilgrim, Richard P. Mann

专题命中 Agent评测 :agent(abstract)

AI总结 研究社会信息下群体决策的犹豫与准确性,发现社会信息加速决策并提高准确性,但个体准确性在有限最优群体规模时最大,多数选择准确性随规模单调增加,且决策波常无法解决集体犹豫,未决定者后续决策偏差增大。

Comments 20 pages Main document, 18 pages Supplementary Material (together making 38 pages total). Main document has 9 Figures (20 Subfigures), Supplementary has 13 Figures (70 Subfigures), so total of 22 Figures (90 Subfigures)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27968 2026-06-29 physics.soc-ph 新提交 50%

SimPol: Simulating polarisation in political belief networks in European countries

SimPol: 模拟欧洲国家政治信念网络中的极化现象

Isabela Burattini Freire, Hongryol Cha, Irina Epure, Sara Filippini, Karan K. H. Manjunatha, Chethan Kavaraganahalli Prasanna, Ivan Samoylenko, Niels Van Santen, Adarsh Prabhakaran, Guillermo Romero Moreno

专题命中 Agent评测 :agent(abstract)

AI总结 结合实证网络分析与基于智能体的建模,研究信念系统结构如何影响极化驱动,并揭示欧洲信念系统多样性导致的不同极化轨迹。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24826 2026-06-29 cs.HC 新提交 50%

Virtual Simulation for Mental Health

心理健康虚拟仿真

Anna Fang

专题命中 Agent评测 :agent(abstract)

AI总结 本文探索利用虚拟仿真技术,通过基于智能体的建模评估社区层面结果,以及通过具身控制空间进行个体训练,为心理健康干预提供安全实验环境。

Comments Doctoral Dissertation, Carnegie Mellon University

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27128 2026-06-26 cs.CV cs.RO 新提交 50%

FlameVQA: A Physically-Grounded UAV Wildfire VQA Benchmark with Radiometric Thermal Supervision

FlameVQA: 一个基于辐射热监督的物理基础无人机野火VQA基准

Mobin Habibpour, John Spodnik, Niloufar Alipour Talemi, Fatemeh Afghah

机构 * National Science Foundation(国家科学基金会) NASA(美国国家航空航天局)

专题命中 Agent评测 :planning(abstract)

AI总结 提出FlameVQA,一个基于FLAME 3数据集的无人机野火多选视觉问答基准,利用配对的RGB和辐射热TIFF图像实现温度基础的推理,评估了多种MLLM在检测、定位、覆盖估计等任务上的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26651 2026-06-26 cs.GT 新提交 50%

Learning Anonymous Pricing for Online Resource Allocation

在线资源分配的匿名定价学习

Yifeng Teng, Yifan Wang

专题命中 Agent评测 :agent(abstract)

AI总结 研究在线资源分配中匿名定价的可学习性,提出利用样本和查询学习近优匿名定价算法,解决动态定价的公平性和先验顺序依赖问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26583 2026-06-26 cs.CE 新提交 50%

Preference Optimization Drives Monoculture in LLM Prediction Markets

偏好优化导致LLM预测市场中的单一文化

James Begin, Brendan Gho, Suman Muppavarapu, Tyson Tsay, Atharva Mohan, Afnan Shaik, Ruizhe Li, Vasu Sharma, Archana Vaidheeswaran

专题命中 Agent评测 :agent(abstract)

AI总结 研究发现,使用直接偏好优化(DPO)微调的LLM代理在预测市场中产生高度相关的错误,导致集体预测能力远低于独立代理数量,且该现象由偏好优化驱动。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26136 2026-06-26 cs.SI math.ST stat.ME stat.TH 新提交 50%

Bayesian Predictive Synthesis for Dynamic Networks: Forecasting and Identifying Structural Mechanisms

动态网络的贝叶斯预测合成:预测与识别结构机制

Marios Papamichalis, Regina Ruane, Theofanis Papamichalis

专题命中 Agent评测 :agent(abstract)

AI总结 提出动态贝叶斯预测合成方法,通过时变权重组合多个结构机制(如社区、几何、枢纽)的预测,实现校准的边预测并识别主导机制。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26853 2026-06-26 math.NA cs.NA math.AP math.OC 新提交 50%

Numerical analysis of first-order mean field games under displacement monotonicity

位移单调性下的一阶平均场博弈数值分析

Alpár R. Mészáros, Yohance A. P. Osborne

专题命中 Agent评测 :agent(abstract)

AI总结 提出粒子法近似非可分位移单调Hamiltonian的一阶MFG系统,证明分布和值函数梯度的收敛性及误差界,首次处理奇异初始分布和任意时间域。

Comments 63 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26251 2026-06-26 hep-ph 新提交 50%

Supercool with PPO: Exploring Supercooled Phase Transitions via Reinforcement Learning

Supercool with PPO: 通过强化学习探索过冷相变

Wan-Zhe Feng, Zong-Huan Ye, Zi-Hui Zhang

专题命中 Agent评测 :agent(abstract)

AI总结 本文提出基于近端策略优化(PPO)的强化学习策略,加速搜索最小暗$U(1)_x$扇区中过冷相变的引力波信号,相比传统蒙特卡洛扫描更高效。

Comments 43 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25899 2026-06-25 cs.MA 新提交 50%

Manipulation Is Task-Dependent: A Multi-Axis, Multi-Environment Evaluation of Frontier LLMs

操纵行为依赖于任务:前沿语言模型的多轴、多环境评估

Adeeb Zaman, Erik Nordby, Fred Heiding

专题命中 Agent评测 :agentic(abstract)

AI总结 通过六种环境、三个轴(框架、激励结构、任务难度)评估六个前沿语言模型的操纵行为,发现操纵倾向在不同任务间相关性低,且不同环境下驱动因素不同。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25880 2026-06-25 cs.CV 新提交 50%

USS: Unified Spatial-Semantic Prompts for Embodied Visual Tracking with Latent Dynamics Learning

USS: 面向具身视觉跟踪的统一空间-语义提示与潜在动力学学习

Yuchen Xie, Xinyu Zhou, Kuangji Zuo, Yanshuo Lu, Fengrui Huang, Boyu Ma, Jianfei Yang

机构 * Nanyang Technological University(南洋理工大学)

专题命中 Agent评测 :agent(abstract)

AI总结 提出统一空间-语义提示范式替代纯文本目标指示,设计端到端框架USS支持多种提示类型,通过潜在世界模型提升时序鲁棒性,在真实机器人实验中优于纯文本方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25728 2026-06-25 cs.IR 新提交 50%

A Stochastic Epidemiological Model of Latent Tuberculosis in a Radiation Exposed Mars Colony

辐射暴露火星殖民地中潜伏结核的随机流行病学模型

Teddy Lazebnik

专题命中 Agent评测 :agent(abstract)

AI总结 针对火星殖民地慢性辐射、免疫改变等环境,建立潜伏结核再激活的随机宿主-辐射-病原体-栖息地模型,并采用近端策略优化进行自适应控制,发现结核可内源性暴发,风险对潜伏库大小、辐射-免疫耦合和再激活敏感性最敏感。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25647 2026-06-25 cs.CE 新提交 50%

Retrieval-Grounded Multilingual LLM Assistance for Island Smallholder Farmers

基于检索的多语言LLM辅助工具用于岛屿小农户

Nikolaos D. Tantaroudas, Ilias Karachalios, Andrew J. McCracken

专题命中 Agent评测 :agent(abstract)

AI总结 针对偏远岛屿小农户获取农业建议困难且方言知识缺乏全球语料支持的问题,提出嵌入双语电商平台的对话AI助手Falco eleonorae,通过工具增强检索(MCP)获取本地化数据,实现可信的多语言、语音和图像交互。

Comments 13, 4

详情

展开后加载摘要…

URL PDF HTML 收藏