arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

共收录 1239 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. Agent评测 1239 篇

2608.16252 2026-08-18 cs.GT 新提交 50%

Group-Fair Metric Distortion of Facility Assignment Problems

设施分配问题的群体公平度量失真

Alexandros A. Voudouris

专题命中 Agent评测 :agent(abstract)

AI总结 本文研究受群体公平约束的设施分配问题的度量失真,提出全信息与有序信息算法,推导最大和、和最大社会目标的失真上下界,且下界与上界匹配,覆盖单向匹配与聚类问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16130 2026-08-18 cs.GT 新提交 50%

On the Incompatibility of Weighted PROPX and Pareto Optimality for Indivisible Chores

不可分割家务分配中加权PROPX与帕累托最优的不相容性

Haris Aziz, Bo Li

专题命中 Agent评测 :agent(abstract)

AI总结 研究不可分割家务分配中,加权PROPX与帕累托最优的不相容性,给出2主体4家务、n主体n+1家务的反例,且该不相容性在物品数不超主体数时不成立,与EF1的兼容性结果形成对比。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16019 2026-08-18 cs.GT 新提交 50%

Maximum-Cost Strategic Facility Location: The Limits of Randomization

Jabari Hastings, Misha Ivkov

专题命中 Agent评测 :agent(abstract)

Comments 15 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15822 2026-08-18 cs.GT cs.DS 新提交 50%

Exact MMS Allocations under Personalized Bivalued Valuations: Goods and Chores

个性化双值估值下的精确最大最小份额(MMS)分配:物品与劳务

Yuhao Zhang

专题命中 Agent评测 :agent(abstract)

AI总结 针对个性化双值估值下不可分物品与劳务的精确最大最小份额(MMS)分配这一开放问题,研究人员通过结合配额重新表述等方法,证明该分配始终存在且可在多项式时间内计算。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15709 2026-08-18 cs.DB 新提交 50%

Logos: Certified Order-Sensitive SQL Rewrites with Mechanized Semantics and LLM Guidance

Logos:结合机械化语义与LLM指导的可验证顺序敏感型SQL重写

Jingyu Ke, Jingyang Li, Guoqiang Li

专题命中 Agent评测 :agent(abstract)

AI总结 Logos是一款结合Rocq机械化语义与LLM指导的SQL重写验证工具,解决了现有工具的不足,在389个查询对的评估中解决率达86.9%,优于基线工具SQLSolver。

Comments 13 pages, 4 figures, and 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15631 2026-08-18 cs.GT econ.TH 新提交 50%

Non-obvious Manipulability with Groups in Shapley-Scarf Housing Markets

沙普利-斯卡夫住房市场中基于群体的非明显可操纵性

Louise Demoor, Martí Jané-Ballarín, Pierre Nunn, Subhajit Pramanik, Antoine Prévotat, Makoto Yokoo

专题命中 Agent评测 :agent(abstract)

AI总结 该研究在沙普利-斯卡夫住房市场中,将策略完备性替换为基于群体的非明显可操纵性,定义了超群体下的顶端交易循环机制类,并证明此类机制的结果具有一致性。

Comments 14 pages, no figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14967 2026-08-18 cs.DC cs.NI 新提交 50%

When Does Distributed AI Inference Need More Wide-Area Bandwidth? A Co-Design Evaluation of Optical, Packet, and Software Levers

分布式AI推理何时需要更多广域网带宽?光学、分组与软件杠杆的协同设计评估

Prasanna C

专题命中 Agent评测 :agentic(abstract)

AI总结 本文对比了分布式AI推理中,跨站点迁移推理状态与KV重计算等方案的优劣,推导了70B多头注意力模型的带宽交叉点,分析了敏感性因素及经济性,提出了测试计划。

Comments 10 pages, 4 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14753 2026-08-18 cs.CR stat.ME 新提交 50%

SynthGuard-ReleaseBench: Locked-Audit Evidence for Synthetic Tabular Data Releases

SynthGuard-ReleaseBench:合成表格数据发布的锁定审计证据

Jeffery Opoku, David Banahene

专题命中 Agent评测 :workflow(abstract)

AI总结 本文提出SynthGuard-ReleaseBench审计框架,通过锁定审计要素对比工作流,在多类数据上验证其可复现性与区分性,为合成表格数据发布提供特定用途的审计证据。

Comments 45 pages, 20 figures, 11 tables. Software and evidence archive with locked configurations, tests, and a fail-closed release-gate validator archived at Zenodo, DOI 10.5281/zenodo.21909680

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15515 2026-08-18 math.PR 新提交 50%

Weak-Type Bounds for Convolution on the Boolean Hypercube

Junwei Lu, Shengtao Guo, Ethan X. Fang

专题命中 Agent评测 :agent(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15010 2026-08-18 cond-mat.soft physics.bio-ph 新提交 50%

Shear effects in active models of normal and cancer cells

正常细胞与癌细胞主动模型中的剪切效应

Souvik Sadhukhan, Rajsekhar Das, Lin Zhao, Wolfgang Losert, D. Thirumalai

专题命中 Agent评测 :agent(abstract)

AI总结 本研究通过三维智能体模型结合GMM与平均场理论,探究正常及癌细胞组织在剪切下的力学响应,揭示刚度与活性异质性决定其非仿射运动的规律,与实验结果吻合。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14548 2026-08-17 cs.GT 新提交 50%

Forging Self-Funded Marketplaces among Strategic Agents

在策略智能体间构建自筹资金的市场

Yuan Deng, Vasilis Gkatzelis, Xizhi Tan, Grigoris Velegkas, Song Zuo

专题命中 Agent评测 :agent(abstract)

AI总结 该研究针对策略智能体,提出自筹资金市场的机制设计问题,证明现有 truthful auction 近似性能上限,给出序贯 auction 实现对数级近似,还设计 auction 实现最大最小份额基准的常数级近似。

Comments Extended Abstract accepted 27th ACM Conference on Economics and Computation (ACM EC 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14462 2026-08-17 cs.RO 新提交 50%

THRIVE: Therapeutic Humanoid Robot In Virtual Environment

THRIVE:虚拟环境中的治疗性人形机器人

Jin Xu, Yu-Ping Chen, Ayanna Howard

专题命中 Agent评测 :agent(abstract)

AI总结 本文提出了家用康复平台THRIVE,集成VR上肢康复游戏、摄像头运动追踪与机器人治疗师,采用模块化设计,为上肢运动障碍儿童提供持续且具吸引力的上肢治疗。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14134 2026-08-17 quant-ph q-fin.PM 新提交 50%

Photonic Quantum Computing vs. Classical Solvers in Constrained Factor Portfolio Optimization

受限因子投资组合优化中的光子量子计算与经典求解器对比

Nirvik Sahoo, Chyng Wen Tee, Paul Robert Griffin

专题命中 Agent评测 :agent(abstract)

AI总结 该研究对比光子量子计算、Gurobi、SAC三种优化范式在因子投资组合优化中的表现,发现光子硬件在窄范围有优势,经典混合整数规划在严格尾部风险控制场景更优,还揭示了强化学习分配器的失效模式并给出应用指南。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14101 2026-08-17 astro-ph.GA 新提交 50%

A Reproducible Two-Boundary Kinematic Correction for Baryonic Rotation-Curve Reconstruction in an 84-Galaxy SPARC Benchmark

84个星系SPARC基准中重子旋转曲线重建的可复现双边界运动学校正

David C. Flynn

专题命中 Agent评测 :workflow(abstract)

AI总结 本研究针对Flynn等人提出的omega运动学校正,基于84星系SPARC基准开展可复现验证,通过双边界系数校正将平均偏差降至30.15 km/s,明确了算法流程与结果,为天文数据变换提供可复现基准。

Comments 22 Pages 7 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13085 2026-08-14 cs.GT 新提交 50%

Representation in Peer Selection: A Liquid Democracy Perspective

同行选择中的代表性:一种液体民主视角

Davide Grossi, Grzegorz Lisowski, Georgios Papasotiropoulos

专题命中 Agent评测 :agent(abstract)

AI总结 该研究从液体民主视角研究同行选择问题,引入液体概貌,分析比例公理在该域的表现及相关投票规则,发现可实现强比例保障,具现实应用潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12996 2026-08-14 cs.CR 新提交 50%

ATOBench: Tracing How Autonomous Penetration-Testing Agents Verify Vulnerabilities When Target Evidence Lies

ATOBench:当目标证据存在时,追踪自主渗透测试代理如何验证漏洞

Qiyang Chen, Yixi Li, Fengwei Zhang, Junlin Liu

专题命中 Agent评测 :agent(abstract)

AI总结 研究人员提出ATOBench框架,通过注入响应转换实现自主渗透测试代理验证过程的可观测性,经450回合评估发现,活动增加会掩盖断裂的验证链,成功恢复依赖于找到并保留可用证据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12683 2026-08-14 cs.RO cs.CV 新提交 50%

FUSE: Active Functional Affordance Grounding through Adaptive Semantic-Geometric Evidence Acquisition

FUSE:通过自适应语义-几何证据获取实现主动功能可供性接地

Zhou Chen, Sathyanarayanan N. Aakur

专题命中 Agent评测 :agent(abstract)

AI总结 该研究提出主动功能可供性接地任务,构建FUSE框架结合不确定性驱动探索与摊销规划器,基于Habitat基准验证其在非神示接地中性能最优且计算量降低1.33倍。

Comments Under review. 15 Pages. 9 tables, 3 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12635 2026-08-14 cs.AR 新提交 50%

GateTruth: Auditing the Rigor of RTL Design Benchmarks via Mutation Testing

GateTruth:通过变异测试审计RTL设计基准的严谨性

Meet Bhadra

专题命中 Agent评测 :agentic(abstract)

AI总结 GateTruth是用于审计RTL基准测试平台严谨性的变异测试引擎,实验显示多数RTLLM v2.0基准测试平台未达95%变异体杀伤阈值,4096-token输出上限会影响模型排名,其成果推动将变异体杀伤认证设为RTL基准的标准要求。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12292 2026-08-13 cs.CY 新提交 50%

Teaching a Large Language Model Tutor to Withhold the Answer: A Supervisor Architecture and an Evidence-Driven Method for Tuning Socratic Behavior

训练大型语言模型助教以保留答案:一种用于调整苏格拉底式行为的监督架构与证据驱动方法

Yusuf Pisan

专题命中 Agent评测 :agent(abstract)

AI总结 本研究提出一种监督架构与证据驱动方法,训练LLM助教执行答案保留,通过自动评估调整苏格拉底式行为,使其在全部四个接受标准上达到完全合规。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10478 2026-08-12 econ.TH 新提交 50%

Optimal Sequential Assignment with Capacity Constrained Verification

带容量约束验证的最优序贯分配

Vilok Taori

专题命中 Agent评测 :agent(abstract)

AI总结 本文研究带容量约束验证的最优序贯分配问题,刻画了最优机制类别,发现剩余物品数超可用验证次数时最优机制可含概率性验证。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10711 2026-08-12 q-fin.PR 新提交 50%

Optimal Pricing and Hedging of SOFR Derivatives

SOFR衍生品的最优定价与对冲

Teemu Pennanen, Waleed Taoum

专题命中 Agent评测 :agent(abstract)

AI总结 本文针对流动性不足且不完备的SOFR衍生品市场,构建了与多类因素一致的无差异定价模型,通过CME衍生品数值验证,可快速为场外SOFR衍生品定价对冲,最优组合稀疏且对冲效果良好。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10796 2026-08-12 cs.CV 新提交 50%

E$^3$mo-Bench: A Scalable Benchmark for Multimodal Evoked and Expressed Emotion Understanding via Bayesian Pairwise Alignment

E³mo-Bench:基于贝叶斯成对对齐的可扩展多模态诱发与表达情感理解基准

Lancheng Gao, Ziheng Jia, Shengyan Li, Zixuan Xing, Jiarui Wang, Huiyu Duan, Xiongkuo Min

专题命中 Agent评测 :agent(abstract)

AI总结 该研究针对现有多模态情感理解基准的不足,推出E³mo-Bench基准,提出贝叶斯成对对齐方法与E³mo-Score智能体,验证了框架有效性并指出MLLMs在情感任务中的缺陷,为多模态情感智能发展指明方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10572 2026-08-12 cs.GT 新提交 50%

Non-Existence of EFX Chore Allocations for Monotone Cost Functions with Binary Marginals

具有二元边际的单调成本函数下,EFX chore分配不存在性

Zehan Lin, Shengxin Liu, Biaoshuai Tao, Shengwei Zhou

专题命中 Agent评测 :agent(abstract)

AI总结 本文针对具有二元边际的单调成本函数,构造18智能体、53个chore的反例,证实不可分割chore的EFX分配不存在,并在Lean 4中形式化验证结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10397 2026-08-12 cs.GT 新提交 50%

To EFX OR to MMS, That is the Question

是选择EFX还是MMS,这是个问题

Hadi Hosseini, Payas Khurana, Shraddha Pathak, Rohit Vaish

专题命中 Agent评测 :agent(abstract)

AI总结 该研究探讨了不可分割物品的EFX与MMS公平性概念的智能体层面析取,构造了相关不可能性反例,证明了特定条件下的存在性结果并明确了其与组成部分的区分。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09981 2026-08-12 cs.CE 新提交 50%

Optimizing Parameterized Physics-Informed Neural Networks to Solve Multilayered Static Linear Elastic PDEs

优化参数化物理信息神经网络以求解多层静态线性弹性偏微分方程

Joseph Lim, Hanbo Song, Zhen Zhang

专题命中 Agent评测 :workflow(abstract)

AI总结 该研究针对传统FEM计算成本高的问题,提出P2INNs框架求解多层静态线性弹性PDE,其误差满足设计需求,可替代传统FEM并加速防护结构层状架构的逆向优化。

Comments * These authors contributed equally to this work

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10844 2026-08-12 physics.bio-ph 新提交 50%

Impact of Higher-Order Interactions on Collective Motion

高阶相互作用对集体运动的影响

Maryam Masoumi, Amir Kargaran, Reza Jafari

专题命中 Agent评测 :agent(abstract)

AI总结 该研究提出含高阶对齐相互作用的广义Vicsek模型,发现其会引发不连续相变,需更高粒子密度维持集体有序,为理解活性物质相变及生物、合成系统集体行为提供了新参数。

Comments 6 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09987 2026-08-12 physics.soc-ph 新提交 50%

The Impact of Cut-ins on Mixed-Autonomy Traffic Flow: Bridging Microscopic Game-Theoretic Model and Macroscopic Flow Analysis

切入行为对混合自动驾驶交通流的影响:弥合微观博弈论模型与宏观流量分析

Yu Song

专题命中 Agent评测 :agent(abstract)

AI总结 本研究将博弈论摩擦项整合入宏观运动波框架,建模切入为斯塔克尔伯格博弈,发现中等CAV渗透率(约45%)时交通流稳定性最差,早期防御性CAV会降低混合交通流稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09409 2026-08-11 econ.TH 新提交 50%

Information for nothing and authority for free

无成本信息与免费权威

Deniz Kattwinkel, Alexander Winter

专题命中 Agent评测 :agent(abstract)

AI总结 针对无货币转移、代理人未完全内化成本的委托代理项目决策问题,研究提出委托人最优机制无需代理人报告,可选择忽略代理人或赋予其免费信息与完全决策权威。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07635 2026-08-11 stat.AP 新提交 50%

SurroPilot: An LLM-Assisted Platform for Heterogeneous Surrogate Endpoint Evaluation in Clinical Trials

SurroPilot:用于临床试验中异质性替代终点评估的大语言模型辅助平台

Xingyu Li, Peng Wei

专题命中 Agent评测 :workflow(abstract)

AI总结 SurroPilot是集成LLM与异质性中介框架的辅助平台,可通过自然语言交互完成临床试验异质性替代终点评估全流程,降低了相关方法的应用技术门槛。

Comments Submitted for journal

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09842 2026-08-11 cs.CV 新提交 50%

From Diagnosis to Correction: Benchmarking and Improving Real-World Table Parsing

从诊断到修正:真实世界表格解析的基准测试与改进

Jutao Xiao, Yuan Qu, Dongsheng Ma, Fan Wu, Tianyao He, Weihong Li, Jie Yang, Yu Qiao, Bin Wang, Conghui He

机构 * Zhejiang University(浙江大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Peking University(北京大学)

专题命中 Agent评测 :agentic(abstract)

AI总结 本文针对真实世界表格解析的缺陷,构建诊断基准TableParseMap,提出DEC框架,无需重训即可提升冻结解析器性能,在TableParseMap上TEDS获显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏