arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2025-11-27 至 2025-11-27 共收录 81 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 软件智能体 4 篇

2311.07850 2025-11-27 cs.CL cs.AI cs.DB cs.LG 67%

Bring Your Own KG: Self-Supervised Program Synthesis for Zero-Shot KGQA

自带知识图谱:零样本知识图谱问答的自监督程序合成

Dhruv Agarwal, Rajarshi Das, Sopan Khosla, Rashmi Gangadharaiah

机构 * University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校) AWS AI Labs(AWS人工智能实验室)

专题命中 软件智能体 :agent(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 BYOKG通过自监督程序合成实现零样本知识图谱问答,利用探索机制和LLM生成查询程序,提升问答准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20904 2025-11-27 cs.IR 50%

Generating Querying Code from Text for Multi-Modal Electronic Health Record

从文本生成多模态电子健康记录的查询代码

Mengliang ZHang

专题命中 软件智能体 :workflow(abstract)

AI总结 本文提出TQGen-EHRQuery框架,通过整合表格和文本数据,提升多模态电子健康记录查询的准确性和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.01010 2025-11-27 cs.RO math.AG 50%

Analytical Solvers for Common Algebraic Equations Arising in Kinematics Problems

运动学问题中常见代数方程的解析求解器

Hai-Jun Su

专题命中 软件智能体 :agent(abstract)

AI总结 本文提出四种常见代数方程的解析求解器,用于机器人运动学问题,提供闭式表达式、数值算法和鲁棒性考虑,并通过Python实现和示例提示展示其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. GUI与网页智能体 4 篇

2511.20766 2025-11-27 cs.AI 79%

OpenApps: Simulating Environment Variations to Measure UI-Agent Reliability

OpenApps: 通过模拟环境变化来衡量UI代理的可靠性

Karen Ullrich, Jingtong Su, Claudia Shi, Arjun Subramonian, Amir Bar, Ivan Evtimov, Nikolaos Tsilivis, Randall Balestriero, Julia Kempe, Mark Ibrahim

机构 * FAIR at Meta(Meta 的 FAIR 研究组) New York University(纽约大学) Brown University(布朗大学)

专题命中 GUI与网页智能体 :agent(title,abstract);分类 cs.AI

AI总结 OpenApps通过模拟不同应用程序变化来衡量UI代理的可靠性,发现任务成功率在不同环境中有显著波动。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21398 2025-11-27 cs.AI cs.CL cs.HC cs.MA 76%

Prune4Web: DOM Tree Pruning Programming for Web Agent

Prune4Web: 面向Web代理的DOM树剪枝编程

Jiayuan Zhang, Kaiquan Chen, Zhihao Lu, Enshen Zhou, Qian Yu, Jing Zhang

专题命中 GUI与网页智能体 :agent(title);分类 cs.AI、cs.CL

AI总结 Prune4Web通过DOM树剪枝编程提升Web自动化精度,实现25-50倍候选元素减少,显著提高接地任务准确性至88.28%。

Comments Paper accepted to AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.11127 2025-11-27 cs.CL cs.AI 73%

UITron-Speech: Towards Automated GUI Agents Based on Speech Instructions

UITron-Speech: 向基于语音指令的自动化GUI代理迈进

Wenkang Han, Zhixiong Zeng, Jing Huang, Shu Jiang, Liming Zheng, Longrong Yang, Haibo Qiu, Chang Yao, Jingyuan Chen, Lin Ma

专题命中 GUI与网页智能体 :agent(abstract);autonomous agent(abstract);分类 cs.AI、cs.CL

AI总结 UITron-Speech通过语音指令和截图处理,实现首个端到端GUI代理,提升无障碍人机交互的可行性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19770 2025-11-27 eess.SY cs.SY 50%

Multi-Hypotheses Ego-Tracking for Resilient Navigation

多假设视角的自主导航稳健跟踪

Peter Iwer Hoedt Karstensen, Roberto Galeazzi

专题命中 GUI与网页智能体 :planning(abstract)

AI总结 本文提出了一种结合多假设估计和泊松二项式检测器的稳健导航架构,用于识别和隔离定位系统中的异常,通过轨迹重新规划实现性能恢复。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 记忆与上下文管理 6 篇

2511.20719 2025-11-27 cs.AI cs.IT eess.SP math.IT 87%

Learning Multi-Access Point Coordination in Agentic AI Wi-Fi with Large Language Models

在基于大语言模型的代理AI无线局域网中学习多接入点协调

Yifan Fan, Le Liang, Peng Liu, Xiao Li, Ziyang Guo, Qiao Lan, Shi Jin, Wen Tong

机构 * School of Information Science and Engineering(信息科学与工程学院) Purple Mountain Laboratories(紫金山实验室) Wireless Technology Lab, 2012 Labs, Huawei Technologies Co., Ltd(无线技术实验室,2012实验室,华为技术有限公司)

专题命中 记忆与上下文管理 :agentic(title,abstract);agent(abstract);tool use(abstract);workflow(abstract)

AI总结 本文提出基于大语言模型的代理AI无线局域网框架,通过动态协作实现多接入点协调,提升无线网络性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.13410 2025-11-27 cs.CL 79%

Mem-PAL: Towards Memory-based Personalized Dialogue Assistants for Long-term User-Agent Interaction

Mem-PAL: 向基于记忆的个性化对话助手迈进:长期用户-代理交互

Zhaopei Huang, Qifeng Dai, Guozheng Wu, Xiaopeng Wu, Kehan Chen, Chuan Yu, Xubin Li, Tiezheng Ge, Wenxuan Wang, Qin Jin

专题命中 记忆与上下文管理 :agent(title,abstract);分类 cs.CL

AI总结 Mem-PAL提出H$^2$Memory框架,通过合成数据和实验验证,提升长期用户-代理交互的个性化能力。

Comments Accepted by AAAI 2026 (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21037 2025-11-27 cs.HC 67%

LOOM: Personalized Learning Informed by Daily LLM Conversations Toward Long-Term Mastery via a Dynamic Learner Memory Graph

LOOM:通过动态学习者记忆图实现每日LLM对话指导的个性化学习以实现长期掌握

Justin Cui, Kevin Pu, Tovi Grossman

专题命中 记忆与上下文管理 :planning(abstract);agentic(abstract)

AI总结 LOOM通过动态学习者记忆图分析每日LLM对话,生成个性化学习材料以实现长期掌握,兼顾连续性和主动性,提升学习者持续进步与即时相关性的平衡。

Comments Accepted to the PerFM Workshop at AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20870 2025-11-27 cs.LG cs.AI stat.ML 62%

Selecting Belief-State Approximations in Simulators with Latent States

在具有潜在状态的模拟器中选择信念状态近似

Nan Jiang

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 记忆与上下文管理 :planning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出了一种在具有潜在状态的模拟器中选择信念状态近似的方法,通过归约条件分布选择任务,探讨了两种不同的形式化方法及其在不同roll-out方法下的表现差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20863 2025-11-27 physics.chem-ph 50%

Bridging Atomistic and Mesoscale Lithium Transport via Machine-Learned Force Fields and Markov State Models

通过机器学习力场和马尔可夫状态模型桥接原子尺度和介观尺度的锂传输

Muhammad Nawaz Qaisrani, Christoph Kirsch, Aaron Flötotto, Jonas Hänseroth, Jules Oumard, Daniel Sebastiani, Christian Dreßler

专题命中 记忆与上下文管理 :workflow(abstract)

AI总结 通过机器学习力场和马尔可夫状态模型,建立原子尺度与介观尺度锂传输的定量联系,揭示稀有扩散过程和传输路径。

Comments 36 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20606 2025-11-27 q-fin.TR cs.MA cs.SI 50%

Limit Order Book Dynamics in Matching Markets: Microstructure, Spread, and Execution Slippage

匹配市场中的限价簿动态:微观结构、买卖价差与执行滑点

Yao Wu

专题命中 记忆与上下文管理 :agent(abstract)

AI总结 本文提出了一种基于限价簿的市场微观结构模型,揭示了买卖价差和执行滑点在匹配失败中的作用机制。

Comments 33 pages, 7 figures, 5 experiments, 6 appendices. Primary category: q-fin.TR; Secondary: cs.SI. Code: https://github.com/Republic1024/Limit-Order-Matching-Microstructure

详情

展开后加载摘要…

URL PDF HTML 收藏

4. Agent评测 8 篇

2511.20510 2025-11-27 cs.AI 85%

FRAGMENTA: End-to-end Fragmentation-based Generative Model with Agentic Tuning for Drug Lead Optimization

FRAGMENTA:基于片段的端到端生成模型与代理调优用于药物先导优化

Yuto Suzuki, Paul Awolade, Daniel V. LaBarbera, Farnoush Banaei-Kashani

机构 * Department of Computer Science and Engineering(计算机科学与工程系) University of Colorado Denver(科罗拉多大学丹佛分校) Skaggs School of Pharmacy(斯卡格斯药学院) University of Colorado Anschutz Medical Campus(科罗拉多大学安舒茨医疗分校)

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);autonomous agent(abstract);分类 cs.AI

AI总结 FRAGMENTA通过端到端框架和代理调优方法,提升药物先导优化的生成效率和调优效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21444 2025-11-27 cs.AI physics.ao-ph 83%

EWE: An Agentic Framework for Extreme Weather Analysis

EWE:极端天气分析的代理框架

Zhe Jiang, Jiong Wang, Xiaoyu Yue, Zijie Guo, Wenlong Zhang, Fenghua Ling, Wanli Ouyang, Lei Bai

机构 * Fudan University(复旦大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) The University of Sydney(悉尼大学)

专题命中 Agent评测 :agentic(title);agent(abstract);planning(abstract);分类 cs.AI

AI总结 EWE是首个用于极端天气分析的智能代理框架,通过知识引导的规划和闭环推理实现自动化诊断,提供首个该领域基准测试,推动科学发现民主化进程。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20703 2025-11-27 cs.CY cs.AI cs.LG 81%

PropensityBench: Evaluating Latent Safety Risks in Large Language Models via an Agentic Approach

PropensityBench: 通过代理方法评估大语言模型中的潜在安全风险

Udari Madhushani Sehwag, Shayan Shabihi, Alex McAvoy, Vikash Sehwag, Yuancheng Xu, Dalton Towers, Furong Huang

机构 * University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校) University of Texas at Austin(德克萨斯大学奥斯汀分校) University of Maryland, College Park(马里兰大学帕克分校)

专题命中 Agent评测 :agentic(title,abstract);分类 cs.AI、cs.LG

AI总结 PropensityBench通过模拟危险能力评估大语言模型的潜在安全风险倾向,揭示模型在压力下可能选择高风险行为的倾向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.21426 2025-11-27 cs.AI cs.LG cs.MA econ.EM physics.soc-ph 81%

Learning Individual Behavior in Agent-Based Models with Graph Diffusion Networks

基于图扩散网络的学习个体行为在基于代理的模型中

Francesco Cozzi, Marco Pangallo, Alan Perotti, André Panisson, Corrado Monti

机构 * Sapienza University(萨皮恩扎大学) CENTAI

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出基于图扩散网络的方法,通过学习个体行为来提升基于代理模型的模拟能力,展示了其在预测复杂系统动态方面的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21661 2025-11-27 cs.DC cs.DB 71%

AI/ML Model Cards in Edge AI Cyberinfrastructure: towards Agentic AI

边缘AI计算基础设施中的AI/ML模型卡片:迈向代理AI

Beth Plale, Neelesh Karthikeyan, Isuru Gamage, Joe Stubbs, Sachith Withana

专题命中 Agent评测 :agentic(title)

AI总结 本文探讨了在边缘AI计算基础设施中使用模型卡片和模型上下文协议,以提升AI/ML模型的动态管理和使用效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.07908 2025-11-27 eess.IV cs.AI cs.CV 57%

ONCOPILOT: A Promptable CT Foundation Model For Solid Tumor Evaluation

ONCOPILOT:一种可提示的CT基础模型用于实体肿瘤评估

Léo Machado, Hélène Philippe, Élodie Ferreres, Julien Khlaut, Julie Dupuis, Korentin Le Floch, Denis Habip Gatenyo, Pascal Roux, Jules Grégory, Maxime Ronot, Corentin Dancette, Tom Boeken, Daniel Tordjman, Pierre Manceron, Paul Hérent

机构 * Raidium, Paris Biotech Santé(Raidium,巴黎生物医疗健康) AP-HP. Nord, Department of Radiology, FHU MOSAIC, Beaujon Hospital(AP-HP. Nord,放射科,FHU MOSAIC,贝琼医院) Université Paris Cité(巴黎城市大学) Université Paris Cité, AP-HP, Hôpital Européen Georges Pompidou, Department of Vascular and Oncological Interventional Radiology(巴黎城市大学,AP-HP,欧文·庞皮杜医院,血管和肿瘤介入放射科) Department of Radiology, Hôpital Cochin, AP-HP(放射科,克里克医院,AP-HP) Centre d’Imagerie du Nord(北影像中心)

专题命中 Agent评测 :workflow(abstract);分类 cs.AI

AI总结 ONCOPILOT是一种基于CT的可提示基础模型,通过交互式分割提升肿瘤评估精度,实现放射科医生级别的RECIST测量和体积生物标志物分析。

Journal ref npj Precis. Onc. 9, 121 (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21099 2025-11-27 cs.GT cs.DS 50%

Cycle Cancellation for Submodular Fractional Allocations and Applications

子模函数分数分配中的循环消除及其应用

Chandra Chekuri, Pooja Kulkarni, Ruta Mehta, Jan Vondrak

专题命中 Agent评测 :agent(abstract)

AI总结 本文提出了一种针对子模估值的循环消除算法,用于解决最大-最小、纳什社会福利和最大化分享等分配问题,获得了新的近似算法和结果。

Comments 20 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.16553 2025-11-27 cs.GT 50%

Contract Design Beyond Hidden-Actions

超越隐藏行动的合同设计

Tomer Ezra, Stefano Leonardi, Matteo Russo

专题命中 Agent评测 :agent(abstract)

AI总结 本文研究了在二元结果下超越隐藏行动的合同设计,通过放松隐藏行动假设,引入检查子集的机制,并设计算法解决不同检查成本函数下的激励相容问题。

Comments Appears in SODA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏