arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-08-19 至 2026-08-19 共收录 194 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. Agent评测 34 篇

2608.17800 2026-08-19 cs.AI 新提交 57%

StartupBench: Benchmarking General-Purpose Agents on Market-Validated End-to-End Workflows

StartupBench:基于市场验证的端到端工作流程的通用智能体基准测试

Liya Zhu, Xin Ma, Tao Liu, Haodong Wang, Ge Zhang, Jingzhe Ding, Qingshui Gu, Yongjie Zhong, Jinxiang Meng, Yuan Gao, Yunqiu Zhou, Hao Zhu, Jifeng He, Yongzhi Liao, Xinyi Zhang, Chaoxin Li, Yi Zhu, Xi Lin, Duju Zeng, Xiang Gao, Wen Zhang, Yunyang Wang, Duo Wang, Huan Zhou, Zuo Wang, Jin Chen, Kaiyuan Zhang, Chuqian Yu, Tianhao Yu, Longxiang Liu, Jianbo Xue, Huimin Che, Jiahao Wang, Yujia Qin, Jiaheng Liu, Shen Yan, Xiaolong Chang, Wenhao Huang

机构 * ByteDance Seed(字节跳动 Seed) Nanjing University(南京大学) M-A-P

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 本文提出StartupBench基准测试,基于市场验证的AI初创产品工作流程评估通用智能体,发现当前最强模型仅完成约30%任务,该基准可衡量智能体完成现实用户任务的进展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17524 2026-08-19 cs.LG 新提交 57%

Evaluating RL Explainability Methods by How Much They Help Fix Bugs in Agents

通过可解释强化学习(XRL)方法对修复智能体Bug的帮助程度来评估XRL方法

Ram Rachum, Yotam Amitai, Bálint Gyevnár, Reuth Mirsky, Cameron Allen

机构 * University of California, Berkeley(加州大学伯克利分校) Tufts University(塔夫茨大学) Carnegie Mellon University(卡内基梅隆大学)

专题命中 Agent评测 :agent(abstract);分类 cs.LG

AI总结 本文提出EvalXRL基准,通过大型语言模型编码智能体结合XRL方法诊断修复RL智能体故障的效果,实现对多种XRL方法的首次闭环直接对比评估。

Journal ref Proceedings of the Workshop on Explainable Artificial Intelligence (XAI) at IJCAI-ECAI 2026, Bremen, Germany

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17433 2026-08-19 cs.AI cs.MA 新提交 57%

Task-Aware Harness Provisioning for LLM Agents in Mission-Critical Infrastructure Operations

面向关键任务基础设施操作中LLM智能体的任务感知工具链配置

Liangtao Lin, Qingang Zhang, Zhaomeng Zhu, Tianwei Zhang, Yonggang Wen

机构 * Nanyang Technological University(南洋理工大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 该研究针对LLM智能体的工具链配置问题,提出映射引导的升级算法,在液体冷却任务中提升了准确率并减少token使用,在电网任务中提供低成本替代方案,揭示工具链配置遵循领域依赖的帕累托前沿。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17271 2026-08-19 cs.AI 新提交 57%

ASI-Bench: At the Dawn of Artificial Superintelligence

ASI-Bench:人工智能超级智能的黎明

Junwei Zhou, Zhen Sun, Binyu Li, Jiangyu Zhou, Yuexi Pan, Hengyu Wang, Honghe Ren, Xiaohan Jia, Xueyang Zhou, Xiaoyu Cao, Yongchao Chen, Yuanning Feng, Junhao Wu, Cheng Zhang, Sijia Chen, Haoyu Xue, Chengsong You, Huan Wang, Koutian Wu, Peigan Gao, Jiakun Wu, Wenzhe Li, Ergan Shang, Qingyuan Zheng, Jingjing Zhou, Ruixuan Jia, Yan Xu, Hongrui Zhang, Xiao-Han Ma, Zhengxiang Cheng, Yuexing Hao, Liting Mai, Xianglin Ji, Wenjun Zhang, Zhuofan Chen, Yixiao Huang, Chi Wang, Wenyue Hua, Yilun Hao, Yuantao Zhai, Ziyan Zhao, Jingyan Xie

机构 * Tsinghua University(清华大学) Massachusetts Institute of Technology(麻省理工学院) Harvard University(哈佛大学) Carnegie Mellon University(卡内基梅隆大学) University of Michigan(密歇根大学) University of Illinois Urbana–Champaign(伊利诺伊大学厄巴纳-香槟分校) Boston University(波士顿大学) University of Queensland(昆士兰大学) University of Science and Technology of China(中国科学技术大学) Flatiron Institute(弗拉蒂伦研究所) Microsoft Research(微软研究院) AG2 AI(AG2 AI公司)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 研究人员推出首个联合评估AI创新探索与自主科学执行能力的基准ASI-Bench,逐步减少人类方法指导测试AI自主科研能力,发现当前AI仍严重依赖人类指导,该基准面向全球开放邀请贡献。

Comments 16 pages, 5 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17167 2026-08-19 cs.IT cs.AI cs.SY eess.SY math.IT stat.ML 新提交 57%

Expected free energy as an information constraint on the Bethe Lagrangian

期望自由能作为Bethe拉格朗日量的信息约束

Wouter M. Kouw

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 该研究提出受信息约束的Bethe拉格朗日量,可恢复主动推理的期望自由能解,经实验验证其在三个任务上的性能可与EFE和Q-MDP相媲美。

Comments 17 pages, 4 figures, table 2. International Workshop on Active Inference

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16964 2026-08-19 eess.IV 新提交 50%

Technically Plausible but Clinically Misleading? Expert Evaluation of Patient-Personalized Synthetic Prostate MRI

技术上可行但临床误导?患者个性化合成前列腺MRI的专家评估

Gabriel Paulo Maglalang Israel, Sol Gedde, Alvaro Fernandez-Quilez

专题命中 Agent评测 :workflow(abstract_cn)

AI总结 本研究用3D扩散模型合成患者个性化前列腺MRI,验证其技术可行性后开展专家研究,发现其虽技术可行但存在误导解读风险,提示需评估其临床应用安全性。

Comments To appear in SCAI 2026 proceedings

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17386 2026-08-19 cs.RO 新提交 50%

MANIGUARD: A Benchmark and Data Suite for Specification-Grounded Safety Evaluation and Improvement of Robotic Manipulation

MANIGUARD:用于基于规范的机器人操作安全评估与改进的基准及数据集套件

Yiyan Peng, Philip Wang, Simon Sinong Zhan, Yiqi Lyu, Zhenyang Ni, Jixin Yan, Fiorelli Wong, Ruochen Jiao, Hang Yin, Xinyu Cao, Huajie Shao, Manling Li, Ruohan Zhang, Qi Zhu

机构 * Northwestern University(西北大学) Stanford University(斯坦福大学) William & Mary(威廉玛丽学院)

专题命中 Agent评测 :planning(abstract)

AI总结 本研究提出ManiGuard基准与数据集套件,针对机器人操作基础模型策略,通过含23000余次滚动的实验证实安全需独立于任务成功评估,微调可提升安全表现但仍存差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17266 2026-08-19 cs.AR 新提交 50%

The Road Less Traveled: Congestion-Aware NoC Placement and Packet Routing for FPGAs

少有人走的路:面向FPGA的感知拥塞片上网络布局与分组路由

Soheil Gholami Shahrouz, Vaughn Betz

专题命中 Agent评测 :agent(abstract)

AI总结 本研究针对FPGA的片上网络拥塞问题,在开源CAD工具VPR中融入拥塞建模、转弯模型路由、SAT路由建模及强化学习智能体优化,显著降低了NoC拥塞并缩短了线长。

Comments 10 pages, 5 figures, 3 tables. Published at the 2024 34th International Conference on Field-Programmable Logic and Applications (FPL), Torino, Italy. Source code integrated into the VTR project: https://github.com/verilog-to-routing/vtr-verilog-to-routing

Journal ref 2024 34th International Conference on Field-Programmable Logic and Applications (FPL), Torino, Italy, 2024, pp. 33-42

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16922 2026-08-19 cs.IR cs.CY 新提交 50%

Towards welfare-oriented recommendations in activity-travel behavior

面向活动-出行行为的福利导向推荐系统研究

Ekin Ugurel, Takahiro Yabe

专题命中 Agent评测 :agent(abstract)

AI总结 该研究针对活动-出行行为领域推荐系统忽视用户福利的问题,提出福利导向推荐框架,通过正效用概率、遗憾最小化准则设计算法,经智能体模拟验证,为优化推荐系统提供了实用方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17582 2026-08-19 quant-ph cond-mat.dis-nn 新提交 50%

Automating Variational Quantum Sensing through Reinforcement-Learned Circuit Structures

通过强化学习优化电路结构实现变分量子传感自动化

Jie Liu, Xin Wang

专题命中 Agent评测 :agent(abstract)

AI总结 研究人员提出强化学习框架\textsc{AutoQSense},通过基于费舍尔信息的目标函数搜索量子传感电路架构,其性能优于固定拟设且适配噪声,为量子传感提供资源感知的硬件兼容方案。

Comments 17 pages, 13 figs

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03646 2026-08-19 cs.CE econ.GN q-fin.EC 版本更新 50%

Crypto-Microeconomics: The Distribution of Bitcoin Wealth Among Diverse Economic Agents

加密微观经济学:比特币财富在不同经济主体间的分布

Syed Azhar Hussain, Kashif Ahmad, Mubashir Husain Rehmani

专题命中 Agent评测 :agent(abstract)

AI总结 提出“加密微观经济可观测性框架”,通过描述性、不平等和纵向集中度指标,研究五个标签主体类别的比特币财富微观差异,揭示财富高度集中及各主体内不平等情况。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.05678 2026-08-19 econ.TH 50%

Equity in obviously strategy-proof exchange

Peng Liu, Huaxia Zeng

专题命中 Agent评测 :agent(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.12825 2026-08-19 econ.EM 版本更新 50%

Nonseparable Dyadic Regression

不可分二进回归

Brice Romuald Gueyap Kounga

专题命中 Agent评测 :agent(abstract)

AI总结 本文针对不可分二进结果模型,推导了两制度中心极限定理,提出主体级自助法,发现独立性置信区间覆盖率不足,自助法可恢复覆盖率。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 其他Agent 1 篇

2602.23088 2026-08-19 cs.CV 版本更新 50%

Cytoarchitecture in Words: Weakly Supervised Vision-Language Modeling for Human Brain Microscopy

词中结构:用于人类大脑显微镜的弱监督视觉-语言建模

Matthew Sutton, Katrin Amunts, Timo Dickscheid, Christian Schiffer

机构 * Institute of Neuroscience and Medicine (INM-1), Research Centre Jülich(神经科学与医学研究所(INM-1),焦耳研究中心) Helmholtz AI, Research Centre Jülich(海德堡人工智能研究所,焦耳研究中心) Institute for Brain Research, University Hospital Düsseldorf(脑研究所在杜塞尔多夫大学医院) Computer Vision, Institute for Computational Visualistics, University of Koblenz(计算机视觉,计算视觉研究所,科布伦茨大学)

专题命中 其他Agent :agentic(abstract)

AI总结 本研究提出了一种弱监督视觉-语言建模方法,通过标签介导生成人类大脑显微镜的区域描述,实现了在缺乏配对标注情况下的自然语言生成。

Comments 13 pages, 5 figures, accepted for inclusion at GCPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏