arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

共收录 6955 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. Agent评测 1207 篇

2608.20395 2026-08-24 physics.soc-ph 新提交 50%

The Effective Gravitational Field of the Ball in Association Football

足球运动中球的有效引力场

Oliver B. Wright

专题命中 Agent评测 :agent(abstract)

AI总结 该研究以足球追踪数据为基础,探究球员围绕球的集体运动是否可用类引力有效场描述,得出了球员径向漂移的经验定律及漂移场模式。

Comments 13 pages, 11 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19846 2026-08-21 econ.TH 新提交 50%

Random Cap: Optimal Informationally Robust Delegation

随机上限:最优的信息鲁棒授权机制

Zhiyuan Jia

专题命中 Agent评测 :agent(abstract)

AI总结 针对委托人知晓代理人私人信息均值但不知其分布的模糊性授权问题,提出随机上限机制,证明其优于确定性上限,采用鞍点方法构造解,结果可扩展至凸序模糊性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20033 2026-08-21 cs.GT 新提交 50%

Temporal Fair Division of Indivisible Mixed Manna: Tractable Settings

不可分割混合甘露的时间公平分配:易处理设置

Kui-Wang Choi, Minming Li, Nicholas Teh

专题命中 Agent评测 :agent(abstract)

AI总结 本文研究不可分割混合甘露的时间公平分配问题,确定了多个易处理设置,给出了对应规则或算法,同时证明了部分相关问题的NP难性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19235 2026-08-21 cs.DL 新提交 50%

Beyond Document Retrieval: Architectural Challenges When LLM Agents Query Structured Enterprise Data

超越文档检索:LLM智能体查询结构化企业数据时的架构挑战

Sheikh Nazib Ahmed

专题命中 Agent评测 :agent(abstract)

AI总结 该研究针对企业智能体查询结构化数据的架构挑战,划分七个维度提出设计框架,经实验验证其可消除授权违规,还给出评估协议与开放问题。

Comments 9 pages, 4 tables, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19474 2026-08-21 econ.TH math.OC 新提交 50%

Monotone Allocations without Single-Crossing: When to Bunch and When to Jump

无单交叉的单调分配:何时归并,何时跳跃

Aloisio Araujo, Carolina Parra, Sergei Vieira

专题命中 Agent评测 :agent(abstract)

AI总结 该论文针对存在最小有效规模代理人技术、斯彭斯-米尔利斯条件失效的筛选问题,研究了单调划分曲线与松弛解的相交方式,得出最优契约的三分法规则,并通过对偶方法证明了最优解的全局最优性。

Comments 85 pages, 10 figures. Replication code: https://doi.org/10.5281/zenodo.21854607

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18553 2026-08-20 eess.SY cs.SY 新提交 50%

Exact Robust Instability Analysis for Networked Dynamical Systems with Biological Application

面向网络化动力学系统的精确鲁棒不稳定性分析及生物学应用

Shinji Hara, Yutaka Hori, Tetsuya Iwasaki, Chung-Yao Kao, Sei Zhen Khong

专题命中 Agent评测 :agent(abstract)

AI总结 本文针对名义不稳定的不确定网络化动力学系统,确定三类可简化分析的网络结构,推导鲁棒不稳定性半径的充分条件,并将结果应用于遗传调控网络的振荡行为分析。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18317 2026-08-20 cs.CV cs.RO 新提交 50%

Reproducible Multimodal Affordance Prediction

可复现的多模态可供性预测

Tommaso Apicella, Alessio Xompero, Andrea Cavallaro

机构 * Istituto Italiano di Tecnologia(意大利技术研究院) EPFL(洛桑联邦理工学院)

专题命中 Agent评测 :agent(abstract)

AI总结 针对可供性预测方法评估难的问题,本文提出Affordance Sheet以规范任务表述等信息,实现可供性模型的可复现基准测试与现实场景可靠评估。

Comments Paper accepted to Workshop on Human-Centered Multimodal Intelligence in the Wild (HCMIW) in European Conference on Computer Vision (ECCV) 2026; 18 pages, 3 figures, 7 tables. Project webpage at https://apicis.github.io/aff-sheet

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19116 2026-08-20 cond-mat.mtrl-sci 新提交 50%

JANUS: A Multi-modal Foundation Neural Sampler for Disordered Materials

JANUS:面向无序材料的多模态基础神经采样器

Denis Blessing, Mouyang Cheng, Maximilian Schebek, Jutta Rogal, Mingda Li, Carles Domingo-Enrich, Yuanqi Du

专题命中 Agent评测 :agent(abstract)

AI总结 研究人员开发JANUS多模态神经采样器,用于无序材料的热力学采样,其以远少于传统方法的能量评估次数重现平衡性质,可用于合金逆设计及半导体缺陷探索,为相关研究提供了基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16964 2026-08-19 eess.IV 新提交 50%

Technically Plausible but Clinically Misleading? Expert Evaluation of Patient-Personalized Synthetic Prostate MRI

技术上可行但临床误导?患者个性化合成前列腺MRI的专家评估

Gabriel Paulo Maglalang Israel, Sol Gedde, Alvaro Fernandez-Quilez

专题命中 Agent评测 :workflow(abstract_cn)

AI总结 本研究用3D扩散模型合成患者个性化前列腺MRI,验证其技术可行性后开展专家研究,发现其虽技术可行但存在误导解读风险,提示需评估其临床应用安全性。

Comments To appear in SCAI 2026 proceedings

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17386 2026-08-19 cs.RO 新提交 50%

MANIGUARD: A Benchmark and Data Suite for Specification-Grounded Safety Evaluation and Improvement of Robotic Manipulation

MANIGUARD:用于基于规范的机器人操作安全评估与改进的基准及数据集套件

Yiyan Peng, Philip Wang, Simon Sinong Zhan, Yiqi Lyu, Zhenyang Ni, Jixin Yan, Fiorelli Wong, Ruochen Jiao, Hang Yin, Xinyu Cao, Huajie Shao, Manling Li, Ruohan Zhang, Qi Zhu

机构 * Northwestern University(西北大学) Stanford University(斯坦福大学) William & Mary(威廉玛丽学院)

专题命中 Agent评测 :planning(abstract)

AI总结 本研究提出ManiGuard基准与数据集套件,针对机器人操作基础模型策略,通过含23000余次滚动的实验证实安全需独立于任务成功评估,微调可提升安全表现但仍存差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17266 2026-08-19 cs.AR 新提交 50%

The Road Less Traveled: Congestion-Aware NoC Placement and Packet Routing for FPGAs

少有人走的路:面向FPGA的感知拥塞片上网络布局与分组路由

Soheil Gholami Shahrouz, Vaughn Betz

专题命中 Agent评测 :agent(abstract)

AI总结 本研究针对FPGA的片上网络拥塞问题,在开源CAD工具VPR中融入拥塞建模、转弯模型路由、SAT路由建模及强化学习智能体优化,显著降低了NoC拥塞并缩短了线长。

Comments 10 pages, 5 figures, 3 tables. Published at the 2024 34th International Conference on Field-Programmable Logic and Applications (FPL), Torino, Italy. Source code integrated into the VTR project: https://github.com/verilog-to-routing/vtr-verilog-to-routing

Journal ref 2024 34th International Conference on Field-Programmable Logic and Applications (FPL), Torino, Italy, 2024, pp. 33-42

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16922 2026-08-19 cs.IR cs.CY 新提交 50%

Towards welfare-oriented recommendations in activity-travel behavior

面向活动-出行行为的福利导向推荐系统研究

Ekin Ugurel, Takahiro Yabe

专题命中 Agent评测 :agent(abstract)

AI总结 该研究针对活动-出行行为领域推荐系统忽视用户福利的问题,提出福利导向推荐框架,通过正效用概率、遗憾最小化准则设计算法,经智能体模拟验证,为优化推荐系统提供了实用方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17582 2026-08-19 quant-ph cond-mat.dis-nn 新提交 50%

Automating Variational Quantum Sensing through Reinforcement-Learned Circuit Structures

通过强化学习优化电路结构实现变分量子传感自动化

Jie Liu, Xin Wang

专题命中 Agent评测 :agent(abstract)

AI总结 研究人员提出强化学习框架\textsc{AutoQSense},通过基于费舍尔信息的目标函数搜索量子传感电路架构,其性能优于固定拟设且适配噪声,为量子传感提供资源感知的硬件兼容方案。

Comments 17 pages, 13 figs

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16601 2026-08-18 cs.SI cs.CY cs.MA 新提交 50%

"If It Looks Like a User": Measuring Real-Time Moderation Effects via Social Media Simulation

“看起来像用户”:通过社交媒体模拟测量实时审核效果

Enrico Verdolotti, Gianluca Nogara, Luca Luceri, Silvia Giordano

专题命中 Agent评测 :agent(abstract)

AI总结 该研究开发了校准后的SimSoM社交媒体模拟器,通过实验验证后发现静态审核会高估用户封禁效果,实时审核时补偿性转发会削弱低质量内容减少效果,为内容审核政策评估提供了基于模拟的框架。

Comments 15 pages, 4 figures, 2 tables. Accepted for presentation at the Social Simulation Conference (SSC) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16550 2026-08-18 cs.GT 新提交 50%

Anchoring for Truthfulness: The Random-Anchor Volume Mechanism for Multi-Facility Location

锚定求真:多设施选址的随机锚点体积机制

Haris Aziz, Simon Mackenzie, Mashbat Suzuki

专题命中 Agent评测 :agent(abstract)

AI总结 该研究针对多设施选址问题,提出随机锚点体积机制,证明其在k=1、2、3时为期望防策略机制,k≥4时可被操纵,k=3时期望社会成本最多为8OPT₃。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16422 2026-08-18 cs.CR 新提交 50%

Proving the Utility of Large Language Models in Cybersecurity Simulations: A Comprehensive Examination

证明大型语言模型在网络安全模拟中的效用:一项综合研究

Stylianos Kampakis, Fabio Rovai, Marcos Charalambides, Theodosis Mourouzis, Chris Hicks

专题命中 Agent评测 :agent(abstract)

AI总结 该研究通过对比实验证明,大型语言模型(LLMs)驱动的网络安全模拟方法,相比经典强化学习方法,在网络攻击模拟中效率更高、适应性更强,且速度提升达25000至50000倍,为构建智能网络防御系统提供了新路径。

Comments 13 pages, 4 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16252 2026-08-18 cs.GT 新提交 50%

Group-Fair Metric Distortion of Facility Assignment Problems

设施分配问题的群体公平度量失真

Alexandros A. Voudouris

专题命中 Agent评测 :agent(abstract)

AI总结 本文研究受群体公平约束的设施分配问题的度量失真,提出全信息与有序信息算法,推导最大和、和最大社会目标的失真上下界,且下界与上界匹配,覆盖单向匹配与聚类问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16130 2026-08-18 cs.GT 新提交 50%

On the Incompatibility of Weighted PROPX and Pareto Optimality for Indivisible Chores

不可分割家务分配中加权PROPX与帕累托最优的不相容性

Haris Aziz, Bo Li

专题命中 Agent评测 :agent(abstract)

AI总结 研究不可分割家务分配中,加权PROPX与帕累托最优的不相容性,给出2主体4家务、n主体n+1家务的反例,且该不相容性在物品数不超主体数时不成立,与EF1的兼容性结果形成对比。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16019 2026-08-18 cs.GT 新提交 50%

Maximum-Cost Strategic Facility Location: The Limits of Randomization

Jabari Hastings, Misha Ivkov

专题命中 Agent评测 :agent(abstract)

Comments 15 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15822 2026-08-18 cs.GT cs.DS 新提交 50%

Exact MMS Allocations under Personalized Bivalued Valuations: Goods and Chores

个性化双值估值下的精确最大最小份额(MMS)分配:物品与劳务

Yuhao Zhang

专题命中 Agent评测 :agent(abstract)

AI总结 针对个性化双值估值下不可分物品与劳务的精确最大最小份额(MMS)分配这一开放问题,研究人员通过结合配额重新表述等方法,证明该分配始终存在且可在多项式时间内计算。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15709 2026-08-18 cs.DB 新提交 50%

Logos: Certified Order-Sensitive SQL Rewrites with Mechanized Semantics and LLM Guidance

Logos:结合机械化语义与LLM指导的可验证顺序敏感型SQL重写

Jingyu Ke, Jingyang Li, Guoqiang Li

专题命中 Agent评测 :agent(abstract)

AI总结 Logos是一款结合Rocq机械化语义与LLM指导的SQL重写验证工具,解决了现有工具的不足,在389个查询对的评估中解决率达86.9%,优于基线工具SQLSolver。

Comments 13 pages, 4 figures, and 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15631 2026-08-18 cs.GT econ.TH 新提交 50%

Non-obvious Manipulability with Groups in Shapley-Scarf Housing Markets

沙普利-斯卡夫住房市场中基于群体的非明显可操纵性

Louise Demoor, Martí Jané-Ballarín, Pierre Nunn, Subhajit Pramanik, Antoine Prévotat, Makoto Yokoo

专题命中 Agent评测 :agent(abstract)

AI总结 该研究在沙普利-斯卡夫住房市场中,将策略完备性替换为基于群体的非明显可操纵性,定义了超群体下的顶端交易循环机制类,并证明此类机制的结果具有一致性。

Comments 14 pages, no figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14967 2026-08-18 cs.DC cs.NI 新提交 50%

When Does Distributed AI Inference Need More Wide-Area Bandwidth? A Co-Design Evaluation of Optical, Packet, and Software Levers

分布式AI推理何时需要更多广域网带宽?光学、分组与软件杠杆的协同设计评估

Prasanna C

专题命中 Agent评测 :agentic(abstract)

AI总结 本文对比了分布式AI推理中,跨站点迁移推理状态与KV重计算等方案的优劣,推导了70B多头注意力模型的带宽交叉点,分析了敏感性因素及经济性,提出了测试计划。

Comments 10 pages, 4 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14753 2026-08-18 cs.CR stat.ME 新提交 50%

SynthGuard-ReleaseBench: Locked-Audit Evidence for Synthetic Tabular Data Releases

SynthGuard-ReleaseBench:合成表格数据发布的锁定审计证据

Jeffery Opoku, David Banahene

专题命中 Agent评测 :workflow(abstract)

AI总结 本文提出SynthGuard-ReleaseBench审计框架,通过锁定审计要素对比工作流,在多类数据上验证其可复现性与区分性,为合成表格数据发布提供特定用途的审计证据。

Comments 45 pages, 20 figures, 11 tables. Software and evidence archive with locked configurations, tests, and a fail-closed release-gate validator archived at Zenodo, DOI 10.5281/zenodo.21909680

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15515 2026-08-18 math.PR 新提交 50%

Weak-Type Bounds for Convolution on the Boolean Hypercube

Junwei Lu, Shengtao Guo, Ethan X. Fang

专题命中 Agent评测 :agent(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15010 2026-08-18 cond-mat.soft physics.bio-ph 新提交 50%

Shear effects in active models of normal and cancer cells

正常细胞与癌细胞主动模型中的剪切效应

Souvik Sadhukhan, Rajsekhar Das, Lin Zhao, Wolfgang Losert, D. Thirumalai

专题命中 Agent评测 :agent(abstract)

AI总结 本研究通过三维智能体模型结合GMM与平均场理论,探究正常及癌细胞组织在剪切下的力学响应,揭示刚度与活性异质性决定其非仿射运动的规律,与实验结果吻合。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14548 2026-08-17 cs.GT 新提交 50%

Forging Self-Funded Marketplaces among Strategic Agents

在策略智能体间构建自筹资金的市场

Yuan Deng, Vasilis Gkatzelis, Xizhi Tan, Grigoris Velegkas, Song Zuo

专题命中 Agent评测 :agent(abstract)

AI总结 该研究针对策略智能体,提出自筹资金市场的机制设计问题,证明现有 truthful auction 近似性能上限,给出序贯 auction 实现对数级近似,还设计 auction 实现最大最小份额基准的常数级近似。

Comments Extended Abstract accepted 27th ACM Conference on Economics and Computation (ACM EC 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14462 2026-08-17 cs.RO 新提交 50%

THRIVE: Therapeutic Humanoid Robot In Virtual Environment

THRIVE:虚拟环境中的治疗性人形机器人

Jin Xu, Yu-Ping Chen, Ayanna Howard

专题命中 Agent评测 :agent(abstract)

AI总结 本文提出了家用康复平台THRIVE,集成VR上肢康复游戏、摄像头运动追踪与机器人治疗师,采用模块化设计,为上肢运动障碍儿童提供持续且具吸引力的上肢治疗。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14134 2026-08-17 quant-ph q-fin.PM 新提交 50%

Photonic Quantum Computing vs. Classical Solvers in Constrained Factor Portfolio Optimization

受限因子投资组合优化中的光子量子计算与经典求解器对比

Nirvik Sahoo, Chyng Wen Tee, Paul Robert Griffin

专题命中 Agent评测 :agent(abstract)

AI总结 该研究对比光子量子计算、Gurobi、SAC三种优化范式在因子投资组合优化中的表现,发现光子硬件在窄范围有优势,经典混合整数规划在严格尾部风险控制场景更优,还揭示了强化学习分配器的失效模式并给出应用指南。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14101 2026-08-17 astro-ph.GA 新提交 50%

A Reproducible Two-Boundary Kinematic Correction for Baryonic Rotation-Curve Reconstruction in an 84-Galaxy SPARC Benchmark

84个星系SPARC基准中重子旋转曲线重建的可复现双边界运动学校正

David C. Flynn

专题命中 Agent评测 :workflow(abstract)

AI总结 本研究针对Flynn等人提出的omega运动学校正,基于84星系SPARC基准开展可复现验证,通过双边界系数校正将平均偏差降至30.15 km/s,明确了算法流程与结果,为天文数据变换提供可复现基准。

Comments 22 Pages 7 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏