arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2025-12-09 至 2025-12-09 共收录 149 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. GUI与网页智能体 7 篇

2512.06390 2025-12-09 cs.CR cs.AI cs.LG cs.NI cs.PF 73%

Web Technologies Security in the AI Era: A Survey of CDN-Enhanced Defenses

人工智能时代网络技术安全:CDN增强防御的综述

Mehrab Hosain, Sabbir Alom Shuvo, Matthew Ogbe, Md Shah Jalal Mazumder, Yead Rahman, Md Azizul Hakim, Anukul Pandey

机构 * Louisiana Tech University(路易斯安那科技大学) Delhi Technological University(德里技术大学)

专题命中 GUI与网页智能体 :agent(abstract);multi-agent(abstract);分类 cs.AI、cs.LG

AI总结 本文综述了人工智能时代CDN增强防御的现状,探讨了边缘计算中基于AI的Web安全防护技术,包括Web应用防火墙、DDoS缓解、机器人管理及API安全模型,提出了研究方向和治理挑战。

Comments Accepted at 2025 IEEE Asia Pacific Conference on Wireless and Mobile (APWiMob). 7 pages, 5 figures

Journal ref 2025 IEEE Asia Pacific Conference on Wireless and Mobile (APWiMob), Bali, Indonesia, 2025, pp. 180-186

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.05731 2025-12-09 cs.AI cs.CL 62%

InfiGUI-G1: Advancing GUI Grounding with Adaptive Exploration Policy Optimization

InfiGUI-G1: 通过自适应探索策略优化推进GUI接地

Yuhang Liu, Zeyu Liu, Shuanghe Zhu, Pengxiang Li, Congkai Xie, Jiasheng Wang, Xavier Hu, Xiaotian Han, Jianbo Yuan, Xinyao Wang, Shengyu Zhang, Hongxia Yang, Fei Wu

机构 * Amazon(亚马逊)

专题命中 GUI与网页智能体 :autonomous agent(abstract);分类 cs.AI、cs.CL

AI总结 InfiGUI-G1通过自适应探索策略优化改进GUI接地,实现显著的语义对齐和性能提升。

Comments Accepted to AAAI 2026 (Oral Presentation)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06490 2025-12-09 cs.LG 57%

Optimizing LLMs Using Quantization for Mobile Execution

用量化优化LLMs在移动执行中的应用

Agatsya Yadav, Renta Chintala Bhargavi

机构 * School of Computer Science(计算机科学学院) Engineering(工程学院) Vellore Institute of Technology(韦洛雷理工学院) Chennai, India(印度钦奈)

专题命中 GUI与网页智能体 :workflow(abstract);分类 cs.LG

AI总结 本文通过4位后训练量化和GGUF格式优化,实现Llama 3.2 3B模型在移动设备上的高效部署。

Comments 11 pages, 1 equation, 2 tables. Author Accepted Manuscript (AAM) of a paper published in Springer LNNS, ICT4SD 2025. DOI: 10.1007/978-3-032-06697-8_33

Journal ref Fong, S., Dey, N., Joshi, A. (eds) ICT Analysis and Applications. ICT4SD 2025. Lecture Notes in Networks and Systems, vol 1654. Springer, Cham

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07725 2025-12-09 cs.CR 50%

Privacy Practices of Browser Agents

浏览器代理的隐私实践

Alisha Ukani, Hamed Haddadi, Ali Shahin Shamsabadi, Peter Snyder

专题命中 GUI与网页智能体 :agent(abstract)

AI总结 本文评估了八种浏览器代理的隐私风险,通过五个因素框架识别出30种漏洞,包括禁用隐私功能和自动补全敏感信息。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07303 2025-12-09 cs.RO 50%

Efficient Computation of a Continuous Topological Model of the Configuration Space of Tethered Mobile Robots

tethered移动机器人类配置空间的连续拓扑模型高效计算

Gianpietro Battocletti, Dimitris Boskos, Bart De Schutter

机构 * Delft Center for Systems and Control(代尔夫特系统与控制中心)

专题命中 GUI与网页智能体 :planning(abstract)

AI总结 本文提出一种高效计算 tethered机器人配置空间连续拓扑模型的方法,通过构建拓扑模型提升路径规划性能。

Comments 7 pages, 3 figures, submitted to IFAC World Congress 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07032 2025-12-09 cs.RO 50%

A Hetero-Associative Sequential Memory Model Utilizing Neuromorphic Signals: Validated on a Mobile Manipulator

一种利用神经形态信号的异关联序列记忆模型:在移动机械臂上的验证

Runcong Wang, Fengyi Wang, Gordon Cheng

机构 * Institute for Cognitive Systems, Technical University of Munich(认知系统研究所,慕尼黑技术大学)

专题命中 GUI与网页智能体 :planning(abstract)

AI总结 本文提出一种利用神经形态信号的异关联序列记忆模型,用于移动机械臂的触觉与动作决策,实现低计算成本的伪柔顺控制与多关节抓取序列检索。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06095 2025-12-09 cond-mat.str-el 50%

Comparative Analysis of Autonomous and Systematic Control Strategies for Hole-Doped Hubbard Clusters: Reinforcement Learning versus Physics-Guided Design

自适应与系统化控制策略在掺空Hubbard簇中的比较分析:强化学习与物理引导设计

Shivanshu Dwivedi, Kalum Palandage

专题命中 GUI与网页智能体 :agent(abstract)

AI总结 本文比较了自主强化学习与物理引导设计在掺空Hubbard簇中的表现,证明自主RL在优化和策略发现中具有高效性和竞争力。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 记忆与上下文管理 6 篇

2512.06688 2025-12-09 cs.CL 79%

PersonaMem-v2: Towards Personalized Intelligence via Learning Implicit User Personas and Agentic Memory

PersonaMem-v2:通过学习隐式用户人设和代理记忆实现个性化智能

Bowen Jiang, Yuan Yuan, Maohao Shen, Zhuoqun Hao, Zhangchen Xu, Zichen Chen, Ziyi Liu, Anvesh Rao Vijjini, Jiashu He, Hanchao Yu, Radha Poovendran, Gregory Wornell, Lyle Ungar, Dan Roth, Sihao Chen, Camillo Jose Taylor

机构 * University of Pennsylvania(宾夕法尼亚大学) Massachusetts Institute of Technology(麻省理工学院) University of Washington(华盛顿大学) University of California Santa Barbara(加州大学圣巴巴拉分校) Meta University of Southern California(南加州大学) University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校) Microsoft Corporation(微软公司)

专题命中 记忆与上下文管理 :agentic(title,abstract);分类 cs.CL

AI总结 PersonaMem-v2通过学习隐式用户人设和代理记忆提升LLM个性化能力,实验显示强化微调使模型在隐式个性化任务中准确率达53%。

Comments Data is available at https://huggingface.co/datasets/bowen-upenn/PersonaMem-v2

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06590 2025-12-09 cs.IR cs.AI cs.MA 79%

Towards Efficient Hypergraph and Multi-LLM Agent Recommender Systems

迈向高效超图和多LLM代理推荐系统

Tendai Mukande, Esraa Ali, Annalina Caputo, Ruihai Dong, Noel OConnor

机构 * Research Ireland ML-LABS Dublin City University(都柏林城市大学) ADAPT Centre(ADAPT中心) School of Computing(计算学院) Insight Research Ireland Centre for Data Analytics(Insight Research Ireland 数据分析中心) University College Dublin(都柏林大学)

专题命中 记忆与上下文管理 :agent(title,abstract);分类 cs.AI

AI总结 HGLMRec通过超图编码器和多LLM代理机制,提升推荐系统在计算效率和推荐质量上的表现。

Comments 8 Pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06917 2025-12-09 cs.LG 57%

Know your Trajectory -- Trustworthy Reinforcement Learning deployment through Importance-Based Trajectory Analysis

了解你的轨迹 -- 通过基于重要性的轨迹分析实现可信的强化学习部署

Clifford F, Devika Jay, Abhishek Sarkar, Satheesh K Perepu, Santhosh G S, Kaushik Dey, Balaraman Ravindran

机构 * Clifford F(未知) Devika Jay(未知) Abhishek Sarkar(未知) Satheesh K Perepu(未知) Santhosh G S(未知) Kaushik Dey(未知) Balaraman Ravindran(未知)

专题命中 记忆与上下文管理 :agent(abstract);分类 cs.LG

AI总结 本文提出基于重要性的轨迹分析框架,通过评估轨迹级状态重要性,提升强化学习部署的可信度和可解释性。

Comments Accepted at 4th Deployable AI Workshop at AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.12069 2025-12-09 cs.CV cs.AI 57%

U-Mamba2: Scaling State Space Models for Dental Anatomy Segmentation in CBCT

U-Mamba2:用于CBCT中牙科解剖分割的State Space模型扩展

Zhi Qin Tan, Xiatian Zhu, Owen Addison, Yunpeng Li

机构 * Centre for Oral, Clinical & Translational Sciences, King’s College London, United Kingdom(口腔、临床与转化科学中心,伦敦国王学院,英国) Surrey Institute for People-Centred AI, University of Surrey, United Kingdom(以人为本的人工智能研究院,萨里大学,英国)

专题命中 记忆与上下文管理 :planning(abstract);分类 cs.AI

AI总结 U-Mamba2通过整合Mamba2状态空间模型和牙科领域知识,实现了高效准确的CBCT牙科解剖分割。

Comments First place solution for both tasks of the ToothFairy3 challenge, MICCAI 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.23730 2025-12-09 cs.CL 57%

Evaluating Long-Term Memory for Long-Context Question Answering

评估长期记忆以实现长上下文问答

Alessandra Terranova, Björn Ross, Alexandra Birch

机构 * School of Informatics, The University of Edinburgh(信息学院,爱丁堡大学)

专题命中 记忆与上下文管理 :agentic(abstract);分类 cs.CL

AI总结 本文评估了增强记忆方法在长上下文问答任务中的效果,发现通过RAG和事件记忆可显著减少令牌使用并保持准确性。

Comments Accepted as a poster at Metacognition in Generative AI EurIPS workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.03115 2025-12-09 quant-ph 50%

Efficient QAOA Architecture for Solving Multi-Constrained Optimization Problems

高效的QAOA架构用于解决多约束优化问题

David Bucher, Daniel Porawski, Maximilian Janetschek, Jonas Stein, Corey O'Meara, Giorgio Cortiana, Claudia Linnhoff-Popien

专题命中 记忆与上下文管理 :workflow(abstract)

AI总结 本文提出了一种高效的QAOA架构,通过直接编码约束到电路中,提升多约束优化问题的求解效率和质量。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. Agent评测 15 篇

2512.06710 2025-12-09 cs.AI 83%

Stochasticity in Agentic Evaluations: Quantifying Inconsistency with Intraclass Correlation

代理评估中的随机性:通过组内相关系数量化不一致性

Zairah Mustahsan, Abel Lim, Megna Anand, Saahil Jain, Bryan McCann

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);分类 cs.AI

AI总结 本文提出通过组内相关系数量化代理评估中的不一致性,以提高评估可靠性,建议在基准测试中报告ICC和查询内方差。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.26153 2025-12-09 cs.AI 79%

A Field Guide to Deploying AI Agents in Clinical Practice

人工智能代理在临床实践中的部署指南

Jack Gallifant, Katherine C. Kellogg, Matt Butler, Amanda Centi, Shan Chen, Patrick F. Doyle, Sayon Dutta, Joyce Guo, Matthew J. Hadfield, Esther H. Kim, David E. Kozono, Hugo JWL Aerts, Adam B. Landman, Raymond H. Mak, Rebecca G. Mishuris, Tanna L. Nelson, Guergana K. Savova, Elad Sharon, Benjamin C. Silverman, Umit Topaloglu, Jeremy L. Warner, Danielle S. Bitterman

专题命中 Agent评测 :AI agent(title);agent(abstract);分类 cs.AI

AI总结 本文提出了一本面向实践者的指南,旨在解决生成式AI在临床实践中部署的挑战,强调数据整合、模型验证和治理等关键实施工作。

Comments Under review. 7 Tables, 2 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06233 2025-12-09 cond-mat.soft physics.bio-ph physics.comp-ph physics.flu-dyn 78%

Protocol to evaluate the viscoelastic response of a polymer suspension to an active agent via oscillatory shear rheometry

一种通过振荡剪切流变仪评估聚合物悬浮液对活性剂黏弹性响应的协议

Kai Qi, Qingzhi Zou, Ignacio Pagonabarraga

专题命中 Agent评测 :agent(title,abstract)

AI总结 本文提出了一种通过振荡剪切流变仪评估活性剂对聚合物悬浮液黏弹性响应的协议,利用游泳行为与振荡板的对应关系,实现对黏弹性特性的量化分析。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04002 2025-12-09 cs.CL 70%

AgriGPT-VL: Agricultural Vision-Language Understanding Suite

AgriGPT-VL:农业视觉-语言理解套件

Bo Yang, Yunkui Chen, Lanfei Feng, Yu Zhang, Xiao Xu, Jianyu Zhang, Nueraili Aierken, Runhe Huang, Hongjian Lin, Yibin Ying, Shijian Li

机构 * Zhejiang University(浙江大学)

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.CL

AI总结 AgriGPT-VL通过构建农业专用的视觉-语言模型和评估套件,提升了农业领域的多模态理解和推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06759 2025-12-09 cs.CV cs.AI 70%

VisChainBench: A Benchmark for Multi-Turn, Multi-Image Visual Reasoning Beyond Language Priors

VisChainBench: 一个多轮多图视觉推理基准,超越语言先验

Wenbo Lyu, Yingjun Du, Jinglin Zhao, Xianton Zhen, Ling Shao

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.AI

AI总结 VisChainBench是一个多轮多图视觉推理基准,通过多代理生成流水线构建,旨在评估LVLM在连续、相互依赖任务中进行多步骤视觉推理的能力。

Comments 12 pages,13figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07079 2025-12-09 cs.LG cs.AI 62%

Procrustean Bed for AI-Driven Retrosynthesis: A Unified Framework for Reproducible Evaluation

AI驱动的逆合成回溯的普罗克鲁斯床:可重复评估的统一框架

Anton Morgunov, Victor S. Batista

机构 * Yale University(耶鲁大学)

专题命中 Agent评测 :planning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出RetroCast框架,通过标准化评估基础设施,揭示了基于搜索和序列的方法在可解性与路线质量上的差异,并释放了标准化数据库以促进可重复发展。

Comments 11 pages + 7 pages of SI. RetroCast is available on GitHub, see https://github.com/ischemist/project-procrustes. SynthArena is publicly available, see https://syntharena.ischemist.com/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07827 2025-12-09 cs.CR cs.DC cs.LG 57%

An Adaptive Multi-Layered Honeynet Architecture for Threat Behavior Analysis via Deep Learning

一种基于深度学习的自适应多层蜜罐架构用于威胁行为分析

Lukas Johannes Möller

机构 * Georgia Institute of Technology Atlanta, United States of America(佐治亚理工学院亚特兰大分校,美国)

专题命中 Agent评测 :agent(abstract);分类 cs.LG

AI总结 本文提出了一种基于深度学习的自适应多层蜜罐架构,通过强化学习实现威胁行为分析,旨在提高威胁情报质量并降低运营成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07261 2025-12-09 cs.SE 57%

Automatic Syntax Error Repair for Discrete Controller Synthesis using Large Language Model

利用大语言模型实现离散控制器综合的自动语法错误修复

Yusei Ishimizu, Takuto Yamauchi, Sinan Chen, Jinyu Cai, Jialong Li, Kenji Tei

专题命中 Agent评测 :workflow(abstract);分类 cs.SE

AI总结 本文提出利用大语言模型自动修复离散控制器综合模型中的语法错误,通过设计提示策略提高修复准确性和效率,实验显示其比人类开发者快3.46倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18229 2025-12-09 cs.RO cs.AI 57%

BEDI: A Comprehensive Benchmark for Evaluating Embodied Agents on UAVs

BEDI:一种用于无人机上具身智能体评估的综合基准

Mingning Guo, Mengwei Wu, Jiarun He, Shaoxian Li, Haifeng Li, Chao Tao

专题命中 Agent评测 :planning(abstract);分类 cs.AI

AI总结 BEDI提出了一种标准化的无人机具身智能体评估基准,通过动态任务范式和混合测试平台,全面评估UAV-EAs的六个核心技能,并揭示现有VLMs在具身任务中的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.18991 2025-12-09 cs.CL 57%

Surveying the MLLM Landscape: A Meta-Review of Current Surveys

测绘MLLM景观:当前调研的元综述

Ming Li, Keyu Chen, Ziqian Bi, Ming Liu, Xinyuan Song, Zekun Jiang, Tianyang Wang, Benji Peng, Qian Niu, Junyu Liu, Jinlang Wang, Sen Zhang, Xuanhe Pan, Jiawei Xu, Pohsun Feng

机构 * Georgia Institute of Technology(佐治亚理工学院) Indiana University(印第安纳大学) Purdue University(普渡大学) Emory University(埃默里大学) Sichuan University(四川大学) Xi’an Jiaotong-Liverpool University(西安交通大学利物浦大学) AppCubic Kyoto University(京都大学) University of Wisconsin-Madison(威斯康星大学麦迪逊分校) Rutgers University(罗格斯大学) National Taiwan Normal University(台湾师范大学)

专题命中 Agent评测 :autonomous agent(abstract);分类 cs.CL

AI总结 本文通过系统回顾现有调研,全面分析MLLMs的评估方法、挑战与趋势,为研究者提供当前评估现状的深入理解。

Comments The article consists of 22 pages, including 2 figures and 108 references. The paper provides a meta-review of surveys on Multimodal Large Language Models (MLLMs), categorizing findings into key areas such as evaluation, applications, security, and future directions

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.21699 2025-12-09 cs.MM cs.AI cs.CV cs.SD eess.AS 57%

MAVERIX: Multimodal Audio-Visual Evaluation and Recognition IndeX

MAVERIX:多模态音频视觉评估与识别指数

Liuyue Xie, Avik Kuthiala, George Z. Wei, Ce Zheng, Ananya Bal, Mosam Dabhi, Liting Wen, Taru Rustagi, Ethan Lai, Sushil Khyalia, Rohan Choudhury, Morteza Ziyadi, Xu Zhang, Hao Yang, László A. Jeni

专题命中 Agent评测 :agentic(abstract);分类 cs.AI

AI总结 MAVERIX是一个用于评估多模态模型音频视觉整合能力的统一基准,通过精心设计的问题展示模型在跨模态理解上的性能,揭示了与人类水平的显著差距。

Journal ref AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06583 2025-12-09 econ.GN q-fin.EC 56%

Tournament-Based Performance Evaluation and Systematic Misallocation: Why Forced Ranking Systems Produce Random Outcomes

基于竞赛的绩效评估与系统性误分配:为什么强制排名系统产生随机结果

Jeremy McEntire

专题命中 Agent评测 :agent(abstract,comments)

AI总结 本文揭示强制排名系统因系统性误分配导致随机结果,指出其无法有效解决委托-代理问题,反而加剧了分配误差。

Comments 31 pages, 6 tables. Agent-based simulation demonstrating structural allocation failures in tournament-based forced distribution evaluation mechanisms. Includes sensitivity analyses across team bias levels, alternative distributions, and cutoff percentages

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07639 2025-12-09 math.AP 50%

Kružkov-type uniqueness theorem for a non-monotone flow function case with application to Riemann problem solutions

非单调流函数情况下的Kružkov型唯一性定理及其在瑞利问题解中的应用

Yulia Petrova, Nikita Rastegaev

专题命中 Agent评测 :agent(abstract)

AI总结 本文提出了一种非单调流函数下的Kružkov型唯一性定理,用于分析具有S型流函数的瑞利问题解的结构分类。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20415 2025-12-09 cs.CV 50%

MajutsuCity: Language-driven Aesthetic-adaptive City Generation with Controllable 3D Assets and Layouts

魔法城:基于语言的美学自适应城市生成与可控3D资产和布局

Zilong Huang, Jun He, Xiaobin Huang, Ziyi Xiong, Yang Luo, Junyan Ye, Weijia Li, Yiping Chen, Ting Han

机构 * Sun Yat-sen University(中山大学)

专题命中 Agent评测 :agent(abstract)

AI总结 MajutsuCity通过可控3D资产和布局生成逼真城市,结合语言驱动和美学自适应,实现高保真度和风格多样性。

Comments 13 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2011.10090 2025-12-09 econ.TH 50%

Screening for breakthroughs

突破性成果的筛选

Gregorio Curello, Ludvig Sinander

专题命中 Agent评测 :agent(abstract)

AI总结 本文研究了如何通过实物分配激励技术突破的及时披露,并应用于失业保险计划的设计。

Journal ref Theoretical Economics (2025), 20(4), 1323-1365

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 其他Agent 1 篇

2512.06923 2025-12-09 physics.ed-ph 50%

"Be Better Than You Need to Be": A-Level Physics Students' Rants, Resilience and Peer Pedagogy on TikTok

比你所需要的更好

Wonyong Park

专题命中 其他Agent :agentic(abstract)

AI总结 本研究通过分析TikTok上学生创作的A-level物理内容,探讨了学生如何通过同伴教学和分享经验来应对学科挑战,强调了战略资源和持续练习的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏