arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-08-26 至 2026-08-26 共收录 235 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. Agent评测 43 篇

2608.24132 2026-08-26 cs.LG cs.AI 新提交 62%

From Gradient-Boosted Trees to Deep Recommenders: Practical Lessons from Migrating a Production Customer Support Recommender

从梯度提升树到深度推荐器:迁移生产环境客户支持推荐器的实践经验

Sonia Sharma, Jeyendran Balakrishnan, Shreya Rajpal, Swapnil Parekh, Nagaraj Janardhana, Andrew Mattarella-Micke

机构 * Intuit(英图易公司)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG

AI总结 本文介绍了将生产环境客户支持推荐系统从梯度提升树迁移到成对二元深度推荐器的实践,通过多种技术优化后,该方法在对话后期的推荐性能优于CatBoost基线。

Comments 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24127 2026-08-26 cs.CR cs.CL cs.CY cs.LG 新提交 62%

Anatomy of a Scam Call: What 10,000 real scam and spam calls reveal about how phone scammers operate

诈骗电话剖析:10000个真实诈骗与垃圾电话揭示电话诈骗者的运作方式

Ethan Traister, Ankit Raj, Jiaqi Gan, Xingyu Shen, Tyler Wu, Yuchen Zhou, Tommy Duong, Kidus Zewde, Siying Chen, Simiao Ren

专题命中 Agent评测 :agent(abstract);分类 cs.CL、cs.LG

AI总结 该研究通过分析10211个真实电话数据,揭示诈骗电话遵循办公时间规律,会针对目标年龄调整施压程度但固定索要内容,且仅从开场话术即可早期检测,词袋分类器表现与微调模型相当。

Comments 19 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23572 2026-08-26 q-bio.NC cs.AI cs.CV 新提交 57%

A Human-Factors Guided Cognitive Model of Visuospatial Complexity in Embodied Active Vision

面向具身主动视觉的、由人因因素引导的视觉空间认知复杂度模型

Vasiliki Kondyli, Jakob Suchan, Mehul Bhatt

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 该研究提出一种多模态复杂度分析框架,以具身认知和主动视觉理论为基础,结合人因因素,为日常驾驶场景下视觉空间复杂度的表征及相关数据集构建提供理论支撑。

Comments Preprint; AIC 2025: Artificial Intelligence and Cognition

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24269 2026-08-26 cs.SE cs.CR 新提交 57%

Towards LLM-Enhanced Android Taint Analysis

面向大语言模型增强的Android污点分析

Nicholas Miazzo, Marco Alecci, Jordan Samhi, Jacques Klein, Eleonora Losiouk

专题命中 Agent评测 :agentic(abstract);分类 cs.SE

AI总结 本文探究商用LLM能否有效推理Android应用的污点流,提出智能体交互策略,在DroidBench基准上Gemini-3 Flash的F1分数达0.96(优于FlowDroid的0.55),还能识别真实应用中FlowDroid未发现的潜在数据泄露,可补充传统静态污点分析。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23839 2026-08-26 cs.RO cs.AI 新提交 57%

Resilience Matters for Embodied Agents System: New Metrics, Systematic Evaluation, and Optimization

弹性对具身智能体系统的重要性:新指标、系统评估与优化

Yapeng Liu, Yuanzhao Zhai, Xudong Gong, Dawei Feng, Bo Ding, Lin Wang, Huaimin Wang

机构 * National University of Defense Technology(国防科技大学) Nanyang Technological University(南洋理工大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 该研究针对具身智能体系统忽略弹性属性的问题,提出弹性评估框架与指标集,经400项家庭任务实验验证其诊断优化效果,揭示弹性特征间的权衡关系。

Comments 12 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23763 2026-08-26 cs.CR cs.AI 新提交 57%

TrustShiftProbe: Characterizing, Benchmarking, and Defending Staged Trust Attacks on MCP Servers

TrustShiftProbe:对MCP服务器上的阶段性信任攻击进行表征、基准测试与防御

Mehrdad Rostamzadeh, Sidhant Narula, Mohammad Ghasemigol, Daniel Takabi

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 本研究针对MCP服务器的阶段性信任攻击提出TrustShiftProbe框架,建立威胁模型、攻击引擎与防御机制SHIELD,使攻击成功率从69.5%降至42.7%

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23631 2026-08-26 cs.AI cond-mat.mtrl-sci 新提交 57%

TRACE: Transition-Aware Residual Control for Multi-Objective Materials Discovery

TRACE:面向多目标材料发现的过渡感知残差控制

Kang Zhou, Yujia Tong, Yong Tao, Jingling Yuan

机构 * Wuhan University of Technology(武汉理工大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 该研究针对LLM智能体多目标材料发现中局部优化困难的问题,提出TRACE框架,通过记录编辑过渡聚合证据估计编辑效果,在对比实验中提升了宏平均命中率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19416 2026-08-26 cs.LG 版本更新 57%

MortarBench: Evaluating Mortgage Loan Origination Agents

MortarBench: 评估抵押贷款发起代理

Matthew Toles, Yunan Lu, Manav Munjal, Bojun Liu, Yuanhao Deng, Stephanie Selig, Derek Rindner, Cheng Li, Zhou Yu

机构 * Columbia University(哥伦比亚大学) Tidalwave

专题命中 Agent评测 :agent(abstract);分类 cs.LG

AI总结 提出MortarBench基准,通过金融数据合成与变异管道生成覆盖边缘案例的示例,评估大语言模型在贷款发起任务中的表现,发现模型准确率低且存在偏见,并引入CRIT校准框架提升准确率至80.5%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10916 2026-08-26 cs.CV cs.AI 57%

ReXSonoVQA: A Video QA Benchmark for Procedure-Centric Ultrasound Understanding

ReXSonoVQA:面向以过程为中心的超声理解的视频问答基准

Xucheng Wang, Xiaoman Zhang, Sung Eun Kim, Ankit Pal, Pranav Rajpurkar

机构 * Harvard Medical School(哈佛医学院)

专题命中 Agent评测 :planning(abstract);分类 cs.AI

AI总结 ReXSonoVQA是一个包含514个视频片段和514个问题的视频问答基准,旨在评估动作-目标推理、artifact解决与优化及过程上下文与规划能力,测试VLMs在动态过程理解中的表现。

Journal ref Proceedings of the 7th Conference on Health, Inference, and Learning, PMLR 333:427-447, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.02605 2026-08-26 cs.AI 版本更新 57%

Adaptive GR(1) Specification Repair for Liveness-Preserving Shielding in Reinforcement Learning

自适应GR(1)规范修复用于强化学习中的存活保持防护

Tiberiu-Andrei Georgescu, Alexander W. Goodall, Dalal Alrajeh, Francesco Belardinelli, Sebastian Uchitel

机构 * Imperial College London(伦敦帝国理工学院) Universidad de Buenos Aires(布宜诺斯艾利斯大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 本文提出基于GR(1)规范的自适应防护框架,通过在线修复规范实现环境假设违反时的安全与存活保持。

Comments Accepted at NeSy 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08626 2026-08-26 cs.CL 版本更新 57%

How Order-Sensitive Are LLMs? OrderProbe for Deterministic Structural Reconstruction

大语言模型对顺序敏感性如何?OrderProbe用于确定性结构重建

Zhaolu Kang, Yingjie He, Kehan Jiang, Leqi Zheng, Jiachen Qian, Qianyuan Zhang, Chunlei Meng, Yujie Feng, Yuan Wang, Stephen Dou, Aming Wu, Pengxiang Zhao, Jiaxin Liu, Guansu Wang, Zeyu Zhang, Lei Wang, Qishi Zhan, Xiaomin He, Meisheng Zhang, Jianyuan Ni, Richeng Xuan

机构 * Peking University(北京大学) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) City University of Hong Kong(香港城市大学) Fudan University(复旦大学) The Hong Kong Polytechnic University(香港理工大学) Tsinghua University(清华大学) Zhejiang University(浙江大学) University of Illinois Urbana-Champaign(伊利诺伊大学香槟分校) Marquette University(马凯特大学) Juniata College(朱尼阿特学院)

专题命中 Agent评测 :planning(abstract);分类 cs.CL

AI总结 研究通过OrderProbe基准评估大语言模型对输入顺序的敏感性,发现即使在前沿模型上,结构重建仍面临挑战,且语义能力与结构鲁棒性存在脱节。

Comments EMNLP 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24774 2026-08-26 econ.TH 新提交 50%

The Paradox of Strategic Altruism

策略性利他主义的悖论

Foivos Savva, Michele Lombardi, Ritesh Jain

专题命中 Agent评测 :agent(abstract)

AI总结 该研究探讨策略性利他主义的贝格均衡能否作为高效制度设计的行为基础,发现其虽可解决囚徒困境,但无法实现弱帕累托最优规则,且贝格可实施性要求高于纳什可实施性,存在策略性利他主义的悖论。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24600 2026-08-26 cs.GT econ.TH 新提交 50%

Fair Allocation with Optional Selling

带可选出售的公平分配

Uriel Feige, Yotam Gafni

专题命中 Agent评测 :agent(abstract)

AI总结 本文针对主体对不可分商品有主观估值且商品可按市价出售的场景,适配公平性概念并证明了多主体下满足MMS、SEFX等的分配存在性及比例的最优性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24193 2026-08-26 cs.GT 新提交 50%

Optimal Rank Lotteries for Truthful Unit-Interval Covering

用于诚实单位区间覆盖的最优秩彩票

Alexandros A. Voudouris

专题命中 Agent评测 :agent(abstract)

AI总结 该研究针对诚实单位区间覆盖问题,刻画了顺序统计量类彩票的最优近似比,填补了此前的近似比上下界差距,并证明了所有普遍策略防伪随机机制的近似比下界。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24183 2026-08-26 cs.GT math.OC 新提交 50%

Gradient-extrapolation-based distributed mirror descent algorithm for multi-cluster aggregative games

面向多集群聚合博弈的基于梯度外推的分布式镜像下降算法

Rui Zhu, Fuyong Wang, Zhongxin Liu, Zengqiang Chen

专题命中 Agent评测 :agent(abstract)

AI总结 本文针对多集群聚合博弈的纳什均衡求解问题,提出带梯度外推的分布式镜像下降算法,在非欧几里得场景下实现$\tilde{O}(1/k)$收敛,经能源系统需求响应算例验证有效。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24554 2026-08-26 physics.soc-ph cs.MA 新提交 50%

Why fragmented parliaments stop passing legislation: Opposition discipline and representation across four democratic institutions

为何分裂的议会无法通过立法:四个民主制度下的反对派纪律与代表权

Fuad Ali

专题命中 Agent评测 :agent(abstract)

AI总结 该研究提出基于智能体的模型,对比四种民主制度,发现分裂议会的法案通过率骤降源于反对派凝聚阻挠,禁用纪律可恢复通过率,且四种制度中通过率与代表权呈单一权衡谱系。

Comments Code, data, and interactive demo: https://github.com/tofuadmiral/institutional-representation-abm

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09892 2026-08-26 cs.RO 版本更新 50%

XPolicyLab: A Unified Standard and Open Ecosystem for Robot Policy Evaluation and Deployment

XPolicyLab:用于机器人策略评估与部署的统一标准及开放生态系统

XPolicyLab Community, Tianxing Chen, Yue Chen, Tian Nian, Zijian Cai, Guangyu Chen, Wenwei Lin, Qiwei Liang, Zanxin Chen, Peicheng Xiang, Kailun Su, Zixuan Li, Junyuan Tang, Yan Qin, Qiangyu Chen, Shaolong Zhu, Tengyue Jiang, Yiqing Wang, Xiang Li, Jiahao Zhang, Weijie Wan, Baijun Chen, Honghao Su, Kehe Ye, Shujia Liu, Kaixuan Wang, Haotian Liang, Yunze Liu, Mingleyang Li, Yuran Wang, Boyu Chen, Hongzhe Bi, Shuhe Huang, Hengkai Tan, Jisong Cai, Yao Mu, Jun Guo, Xiaofeng Wang, Zheng Zhu, Weijie Ke, Hengtao Li, Yuhang Tang, Xiaofan Li, Ganlin Yang, Zhangzheng Tu, Shuai Yang, Wenxuan Song, Pengxiang Ding, Kaidong Zhang, Yu Sun, Junliang Guo, Tong Zhang, Yixing Chen, Rongxu Cui, Zongzheng Zhang, Haoxiang Ma, Junhao Cai, Haoyu Zhang, Senqiao Yang, Jinhui Ye, Pengguang Chen, Shu Liu, Xiu Su, Wenhan Fang, Wenhao Li, Yichao Cao, Chengyao Wang, Qiang Chen, Ping Luo, Wenbo Ding

机构 * THU(清华大学)

专题命中 Agent评测 :agent(abstract)

AI总结 XPolicyLab是统一机器人策略评估与部署的开放生态系统,通过标准化接口降低集成成本,集成42个策略,可适配仿真与真实机器人,减少了策略与环境的适配工作量。

Comments Website: xpolicylab.github.io, Code: https://github.com/XPolicyLab/XPolicyLab

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00364 2026-08-26 cs.GT cs.SI 版本更新 50%

Understanding Federated Learning Through the Lens of Mechanism Design: The Role of Data Heterogeneity

通过机制设计视角理解联邦学习:数据异质性的作用

Lina Alkarmi, Po-Yen Chen, Mingyan Liu

专题命中 Agent评测 :agent(abstract)

AI总结 该研究通过将经典外部性机制适配联邦学习场景,对比了夏普利值机制与外部性机制在社会最优性、个体理性等维度的表现,揭示了互惠公平与社会效率的权衡关系。

Comments Extended version (with full proofs) of a paper accepted at GameSec 2026. 29 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25647 2026-08-26 cs.CE 版本更新 50%

Smallholder Farmers on Remote Islands Receiving Retrieval-Grounded Multilingual LLM Assistance and Agronomic Advice

基于检索的多语言LLM辅助工具用于岛屿小农户

Nikolaos D. Tantaroudas, Ilias Karachalios, Andrew J. McCracken

专题命中 Agent评测 :agent(abstract)

AI总结 针对偏远岛屿小农户获取农业建议困难且方言知识缺乏全球语料支持的问题,提出嵌入双语电商平台的对话AI助手Falco eleonorae,通过工具增强检索(MCP)获取本地化数据,实现可信的多语言、语音和图像交互。

Comments 13, 4

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18556 2026-08-26 eess.SY cs.SY eess.SP 版本更新 50%

Wind-Resilient Trajectory Optimization for UAV-BS Networks: TD3 for Continuous Service Availability

抗风无人机基站网络轨迹优化:基于TD3的连续服务可用性

Azim Akhtarshenas, German Svistunov, Kuangyu Zheng, David Lopez-Perez

专题命中 Agent评测 :agent(abstract)

AI总结 针对风扰导致无人机基站位置漂移和通信质量下降问题,提出基于TD3算法的抗风轨迹调整框架,通过随机运动学建模学习自适应控制策略,在湍流条件下维持最优覆盖,仿真验证其优于PPO等基准方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18573 2026-08-26 cs.GT cs.DS 版本更新 50%

Stable Matching with Deviators and Conformists

带有偏离者和顺从者的稳定匹配

Frederik Glitzner, Augustine Kwanashie, David Manlove

专题命中 Agent评测 :agent(abstract)

AI总结 研究在存在偏离者和顺从者的情况下,如何高效决定是否存在无偏离者阻塞的稳定匹配,并探讨其计算复杂性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.09977 2026-08-26 quant-ph cond-mat.mes-hall 版本更新 50%

Quantum measurement of work in mesoscopic systems

介观系统中功的量子测量

Anant Vijay Varma, Doron Cohen

专题命中 Agent评测 :agent(abstract)

AI总结 该研究探讨量子力学对介观系统功的测量的影响,指出作用体的反作用带来类经典限制,还存在无法通过超分辨率技术放宽的根本性量子不确定性限制。

Comments 20 pages, 10 figures

Journal ref New J. Phys. 28, 084512 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.03605 2026-08-26 cs.NE cs.DC 50%

Trackable Island-model Genetic Algorithms at Wafer Scale

Matthew Andres Moreno, Connor Yang, Emily Dolson, Luis Zaman

专题命中 Agent评测 :agent(abstract)

Comments arXiv admin note: substantial text overlap with arXiv:2404.10861

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 其他Agent 2 篇

2604.11705 2026-08-26 cs.AI cs.CL cs.RO cs.SY eess.SY 84%

Agentic Driving Coach: Robustness and Determinism of Agentic AI-Powered Human-in-the-Loop Cyber-Physical Systems

代理驾驶教练:代理AI驱动的人机协同物理系统中的鲁棒性与确定性

Deeksha Prahlad, Daniel Fan, Hokeun Kim

机构 * Arizona State University(亚利桑那州立大学)

专题命中 其他Agent :agentic(title,abstract);AI agent(abstract);分类 cs.AI、cs.CL

AI总结 本文提出基于反应计算模型的框架,用于解决人机协同物理系统中代理AI的鲁棒性和确定性问题,通过驾驶教练案例验证了方法的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23181 2026-08-26 cs.CR cs.CL 版本更新 61%

CyberFactory: Scaling Cyber Security Capabilities with Instances from the Wild

CyberFactory:利用真实场景实例扩展网络安全能力

Jian Yang, Haau-Sing Li, Shawn Guo, Zixi Zhao, Yibo Tan, Jiajun Wu, Aishan Liu, Zhoujun Li, Xianglong Liu, Tianyu Zheng, Bryan Dai, Chengran Yang

专题命中 其他Agent :agentic(abstract,comments);分类 cs.CL

AI总结 本研究提出开源框架CyberFactory,将真实场景漏洞转化为任务实例以训练安全模型Aegis,该模型在CyberGym上的Pass@1较Qwen~3.5提升22.8个百分点,优于通用主干模型。

Comments We updated scores with models trained on updated agentic data

详情

展开后加载摘要…

URL PDF HTML 收藏