arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2025-12-01 至 2025-12-01 共收录 124 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 软件智能体 5 篇

2511.22380 2025-12-01 cs.DC 50%

Optimality of Simultaneous Consensus with Limited Information Exchange (Extended Abstract)

有限信息交换下的同时共识最优性(扩展摘要)

Kaya Alpturer, Ron van der Meyden, Sushmita Ruj, Godfrey Wong

专题命中 软件智能体 :agent(abstract)

AI总结 本文研究了在崩溃故障模型下的同时共识问题,通过有限信息交换方式提出最优协议,降低计算和空间成本。

Comments In Proceedings TARK 2025, arXiv:2511.20540

Journal ref EPTCS 437, 2025, pp. 175-189

详情

展开后加载摘要…

URL PDF HTML 收藏

2. GUI与网页智能体 4 篇

2511.21432 2025-12-01 eess.SY cs.SY 67%

Multi-Hypotheses Navigation in Collaborative Localization subject to Cyber Attacks

协同定位中的多假设导航受网络攻击影响

Peter Iwer Hoedt Karstensen, Roberto Galeazzi

专题命中 GUI与网页智能体 :agent(abstract);multi-agent(abstract)

AI总结 本文提出了一种在多智能体系统中应对网络攻击的鲁棒协同定位方法,通过多假设管理和几何缩减实现鲁棒性,提升导航可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22043 2025-12-01 cs.RO cs.SY eess.SY 56%

SwordRiding: A Unified Navigation Framework for Quadrotors in Unknown Complex Environments via Online Guiding Vector Fields

SwordRiding:一种基于在线引导矢量场的四旋翼无人机在未知复杂环境中的统一导航框架

Xuchen Liu, Ruocheng Li, Bin Xin, Weijia Yao, Qigeng Duan, Jinqiang Cui, Ben M. Chen, Jie Chen

机构 * Pengcheng Laboratory, Shenzhen, Guangdong, China(鹏城实验室,深圳,广东,中国) School of Automation, Beijing Institute of Technology, Beijing, China(自动化学院,北京理工大学,北京,中国) School of Artificial Intelligence and Robotics, Hunan University(人工智能与机器人学院,湖南大学) Department of Control Science and Engineering, Harbin Institute of Technology(控制科学与工程学院,哈尔滨工业大学) National Key Laboratory of Autonomous Intelligent Unmanned Systems(自主智能无人系统国家重点实验室) Department of Mechanical and Automation Engineering, the Chinese University of Hong Kong, Hong Kong, China(机械与自动化工程系,香港中文大学,香港,中国)

专题命中 GUI与网页智能体 :planning(abstract,comments)

AI总结 SwordRiding提出了一种基于在线引导矢量场的四旋翼无人机统一导航框架,通过闭环导航提升在未知复杂环境中的实时适应性和鲁棒性。

Comments For an experimental demo, see https://www.youtube.com/watch?v=tKYCg266c4o. For the lemma proof, see https://github.com/SmartGroupSystems/GVF_close_loop_planning/blob/main/proofs.md

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.02549 2025-12-01 cs.CV cs.RO 50%

MonoDream: Monocular Vision-Language Navigation with Panoramic Dreaming

MonoDream:基于全景梦境的单目视觉-语言导航

Shuo Wang, Yongcai Wang, Zhaoxin Fan, Yucheng Wang, Maiyue Chen, Kaihui Wang, Zhizhong Su, Wanting Li, Xudong Cai, Yeying Jin, Deying Li

机构 * Horizon Robotics

专题命中 GUI与网页智能体 :planning(abstract)

AI总结 MonoDream通过轻量级VLA框架和潜在全景梦境任务,提升单目视觉-语言导航的性能,缩小与全景方法的差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.11553 2025-12-01 cs.RO cond-mat.mtrl-sci cs.SY eess.SY physics.app-ph physics.bio-ph physics.med-ph 50%

Clinically Ready Magnetic Microrobots for Targeted Therapies

临床级磁性微机器人用于靶向治疗

Fabian C. Landers, Lukas Hertle, Vitaly Pustovalov, Derick Sivakumaran, Oliver Brinkmann, Kirstin Meiners, Pascal Theiler, Valentin Gantenbein, Andrea Veciana, Michael Mattmann, Silas Riss, Simone Gervasoni, Christophe Chautems, Hao Ye, Semih Sevim, Andreas D. Flouris, Josep Puigmartí-Luis, Tiago Sotto Mayor, Pedro Alves, Tessa Lühmann, Xiangzhong Chen, Nicole Ochsenbein, Ueli Moehrlen, Philipp Gruber, Miriam Weisskopf, Quentin Boehler, Salvador Pané, Bradley J. Nelson

专题命中 GUI与网页智能体 :agent(abstract)

AI总结 本研究提出一种临床级磁性微机器人系统,通过整合电磁导航、释放导管和可溶解胶囊,实现精准靶向药物输送,提高治疗效果。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 记忆与上下文管理 8 篇

2511.11772 2025-12-01 cs.CY cs.AI 70%

Scaling Equitable Reflection Assessment in Education via Large Language Models and Role-Based Feedback Agents

通过大型语言模型和基于角色的反馈代理实现教育中的公平性评估扩展

Chenyu Zhang, Xiaohang Luo

专题命中 记忆与上下文管理 :agent(abstract);multi-agent(abstract);分类 cs.AI

AI总结 本文提出利用多代理LLM系统实现公平、高质量的形成性反馈,通过角色化代理生成公平、简洁的反馈,提升教育公平性与教学效率。

Comments Accepted to AAAI-26 AISI Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22609 2025-12-01 cs.CV cs.RO 67%

MG-Nav: Dual-Scale Visual Navigation via Sparse Spatial Memory

MG-Nav:基于稀疏空间记忆的双尺度视觉导航

Bo Wang, Jiehong Lin, Chenzhi Liu, Xinting Hu, Yifei Yu, Tianjia Liu, Zhongrui Wang, Xiaojuan Qi

机构 * The University of Hong Kong(香港大学) Southern University of Science and Technology(南方科技大学)

专题命中 记忆与上下文管理 :agent(abstract);planning(abstract)

AI总结 MG-Nav通过稀疏空间记忆图和VGGT-adapter模块实现双尺度视觉导航,结合全局规划与局部控制,实现零样本导航的高鲁棒性与高性能。

Comments 10pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22311 2025-12-01 cs.AI cond-mat.mes-hall cond-mat.soft cs.CL cs.LG 67%

Swarms of Large Language Model Agents for Protein Sequence Design with Experimental Validation

大规模语言模型代理群组用于蛋白质序列设计的实验验证

Fiona Y. Wang, Di Sheng Lee, David L. Kaplan, Markus J. Buehler

机构 * Laboratory for Atomistic and Molecular Mechanics (LAMM), Department of Biological Engineering, Massachusetts Institute of Technology(原子分子力学实验室(LAMM),生物工程系,麻省理工学院) Department of Biomedical Engineering, Tufts University(生物医学工程系,塔夫茨大学) Laboratory for Atomistic and Molecular Mechanics (LAMM), Department of Civil and Environmental Engineering, Department of Mechanical Engineering, Center for Computational Science and Engineering, Schwarzman College of Computing, Massachusetts Institute of Technology(原子分子力学实验室(LAMM),土木与环境工程系,机械工程系,计算科学与工程中心,计算机科学学院,麻省理工学院)

专题命中 记忆与上下文管理 :agent(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 本文提出了一种基于大规模语言模型代理群组的蛋白质序列设计方法,通过去中心化协调实现高效目标导向设计,无需微调或特定训练,且在实验中验证了其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21730 2025-12-01 cs.CL cs.AI cs.LG 67%

A Benchmark for Procedural Memory Retrieval in Language Agents

一种用于语言代理中程序记忆检索的基准测试

Ishant Kohar, Aswanth Krishnan

机构 * Qpi AI

专题命中 记忆与上下文管理 :AI agent(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 本文提出了一种用于评估语言代理程序记忆检索能力的基准测试,通过构建双语料库和系统分层查询,揭示了基于嵌入的方法在新上下文中的泛化问题,并展示了LLM生成的程序抽象在跨上下文转移中的优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21726 2025-12-01 cs.CL cs.AI cs.LG 67%

Goal-Directed Search Outperforms Goal-Agnostic Memory Compression in Long-Context Memory Tasks

目标导向搜索在长上下文记忆任务中优于目标无关的记忆压缩

Yicong Zheng, Kevin L. McKee, Thomas Miconi, Zacharie Bugaud, Mick van Gelderen, Jed McCaleb

机构 * Astera Institute(Astera研究所)

专题命中 记忆与上下文管理 :agent(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 SUMER通过目标导向搜索在长上下文记忆任务中超越传统记忆压缩方法,达到SOTA性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.23436 2025-12-01 cs.AI 57%

Towards Continuous Intelligence Growth: Self-Training, Continual Learning, and Dual-Scale Memory in SuperIntelliAgent

迈向持续智能增长:在SuperIntelliAgent中实现自我训练、持续学习和双尺度记忆

Jianzhe Lin, Zeyu Pan, Yun Zhu, Ruiqi Song, Jining Yang

专题命中 记忆与上下文管理 :agentic(abstract);分类 cs.AI

AI总结 SuperIntelliAgent通过自我训练和双尺度记忆实现持续智能增长,利用可训练学习者与推理验证者配对,提升偏好对齐和学习效果。

Comments 15 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21882 2025-12-01 cs.LG cs.CV 57%

Closed-Loop Transformers: Autoregressive Modeling as Iterative Latent Equilibrium

闭环变换器:将自回归建模作为迭代潜在均衡

Akbar Anbar Jafari, Gholamreza Anbarjafari

机构 * University of Tartu(塔尔图大学) S Holding OÜ(3S控股公司)

专题命中 记忆与上下文管理 :planning(abstract);分类 cs.LG

AI总结 本文提出均衡变换器(EqT),通过迭代细化潜在表示实现自洽均衡,解决自回归模型中错误传播问题,提升长序列推理和多步规划能力。

Comments 22 pages, 1 figure, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21768 2025-12-01 cs.CR math.CT quant-ph 50%

Categorical Framework for Quantum-Resistant Zero-Trust AI Security

量子抗性零信任AI安全的范畴框架

I. Cherkaoui, C. Clarke, J. Horgan, I. Dey

专题命中 记忆与上下文管理 :agent(abstract)

AI总结 本文提出基于范畴论的量子抗性零信任AI安全框架,通过建模加密流程为态射和信任策略为函子,实现细粒度信任管理和微分割,提升对抗性AI威胁防护,并在ESP32上验证了加密敏捷过渡的性能和安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. Agent评测 21 篇

2510.16499 2025-12-01 cs.CL cs.AI cs.LG 87%

Automated Composition of Agents: A Knapsack Approach for Agentic Component Selection

代理自动组合:一种背包方法用于代理组件选择

Michelle Yuan, Khushbu Pahwa, Shuaichen Chang, Mustafa Kaba, Jiarong Jiang, Xiaofei Ma, Yi Zhang, Monica Sunkara

机构 * AWS Agentic AI(AWS 代理人工智能)

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);multi-agent(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 本文提出基于背包问题的代理组件自动组合框架,通过动态评估组件性能与成本,提升代理系统在不同场景下的成功率和资源利用效率。

Comments Accepted to NeurIPS 2025 Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22138 2025-12-01 cs.LG 85%

TinyLLM: Evaluation and Optimization of Small Language Models for Agentic Tasks on Edge Devices

TinyLLM: 小型语言模型在边缘设备上用于代理任务的评估与优化

Mohd Ariful Haque, Fahad Rahman, Kishor Datta Gupta, Khalil Shujaee, Roy George

机构 * Department of Cyber-Physical Systems, Clark Atlanta University, USA(计算机物理系统系,Clark Atlanta大学,美国) Department of Computer Science and Engineering, United International University, Bangladesh(计算机科学与工程系,联合国际大学,孟加拉国)

专题命中 Agent评测 :agentic(title,abstract);autonomous agent(abstract);function calling(abstract);分类 cs.LG

AI总结 TinyLLM研究小型语言模型在边缘设备上执行代理任务的优化方法,通过混合策略提升准确性与效率,验证了中等规模模型在多轮任务中的优势。

Comments 8 pages, 3 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.05408 2025-12-01 cs.CR cs.AI cs.CY 81%

Frontier AI's Impact on the Cybersecurity Landscape

前沿人工智能对网络安全领域的冲击

Yujin Potter, Wenbo Guo, Zhun Wang, Tianneng Shi, Hongwei Li, Andy Zhang, Patrick Gage Kelley, Kurt Thomas, Dawn Song

机构 * UC Berkeley(加州大学伯克利分校) UC Santa Barbara(加州大学圣芭芭拉分校) Google(谷歌)

专题命中 Agent评测 :agent(abstract);AI agent(abstract);planning(abstract);workflow(abstract)

AI总结 本文研究了前沿人工智能在网络安全中的影响,指出人工智能在攻击中的能力已超过防御,呼吁构建新基准、开发防御代理等以缓解风险。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.23397 2025-12-01 cs.CL cs.AI cs.MA 79%

MegaChat: A Synthetic Persian Q&A Dataset for High-Quality Sales Chatbot Evaluation

MegaChat: 一个用于高质量销售聊天机器人评估的合成波斯语问答数据集

Mahdi Rahmani, AmirHossein Saffari, Reyhane Rahmani

专题命中 Agent评测 :agent(abstract);agentic(abstract);multi-agent(abstract);分类 cs.AI、cs.CL

AI总结 MegaChat通过自动化多代理架构生成高质量波斯语问答数据,用于评估销售聊天机器人,优于传统RAG模型。

Comments 6 pages, 11 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21935 2025-12-01 cs.LG cs.GT 70%

Breaking Algorithmic Collusion in Human-AI Ecosystems

打破人类-人工智能生态系统中的算法合谋

Natalie Collina, Eshwar Ram Arunachaleswaran, Meena Jagadeesan

机构 * University of Pennsylvania(宾夕法尼亚大学) Stanford University(斯坦福大学)

专题命中 Agent评测 :agent(abstract);AI agent(abstract);分类 cs.LG

AI总结 本文研究了人类-人工智能生态系统中算法合谋的稳定性,发现单个或多个人类的背叛行为能破坏合谋并降低价格,揭示了合谋在混合生态系统中的脆弱性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.05559 2025-12-01 cs.AI 70%

SciSciGPT: Advancing Human-AI Collaboration in the Science of Science

SciSciGPT:推动科学之科学中的人机协作

Erzhuo Shao, Yifang Wang, Yifan Qian, Zhenyu Pan, Han Liu, Dashun Wang

专题命中 Agent评测 :agent(abstract);AI agent(abstract);分类 cs.AI

AI总结 SciSciGPT通过LLM驱动的研究工具促进人机协作,提升科研效率与可重复性,同时提出能力成熟度模型以指导未来框架发展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.10674 2025-12-01 cs.CL cs.AI cs.DB 62%

Continual Learning of Domain Knowledge from Human Feedback in Text-to-SQL

从人类反馈中持续学习领域知识的文本到SQL

Thomas Cook, Kelly Patel, Sivapriya Vellaichamy, Udari Madhushani Sehwag, Saba Rahimi, Zhen Zeng, Sumitra Ganesh

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL

AI总结 本文提出一种通过人类反馈持续学习领域知识的文本到SQL框架,通过记忆增强的代理提升查询准确性与错误减少。

Comments 34 pages, 6 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21742 2025-12-01 cs.CL cs.AI 62%

EduMod-LLM: A Modular Approach for Designing Flexible and Transparent Educational Assistants

EduMod-LLM: 一种用于设计灵活且透明教育助手的模块化方法

Meenakshi Mittal, Rishi Khare, Mihran Miroyan, Chancharik Mitra, Narges Norouzi

专题命中 Agent评测 :function calling(abstract);分类 cs.AI、cs.CL

AI总结 EduMod-LLM通过模块化方法评估教育问答系统各组件性能,揭示失败模式,提升透明度和教学对齐效果。

Comments Proceedings of the AAAI Conference on Artificial Intelligence

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.10157 2025-12-01 cs.AI cs.CL 62%

One Patient, Many Contexts: Scaling Medical AI with Contextual Intelligence

一个患者,许多情境:通过情境智能扩展医疗AI

Michelle M. Li, Ben Y. Reis, Adam Rodman, Tianxi Cai, Noa Dagan, Ran D. Balicer, Joseph Loscalzo, Isaac S. Kohane, Marinka Zitnik

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL

AI总结 本文提出情境切换技术,通过调整模型推理而非重新训练,使医疗AI能适应不同专科、人群和地理环境,提升其在现实护理中的可靠性和扩展性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22598 2025-12-01 cs.LG 57%

LLM-Cave: A benchmark and light environment for large language models reasoning and decision-making system

LLM-Cave: 一个用于大型语言模型推理和决策系统的基准和轻量环境

Huanyu Li, Zongyuan Li, Wei Huang, Xian Guo

机构 * College of Artificial Intelligence Nankai University(人工智能学院 南开大学)

专题命中 Agent评测 :agent(abstract);分类 cs.LG

AI总结 LLM-Cave提出了一种轻量环境和基准,用于评估大型语言模型的推理和决策能力,展示了不同模型在复杂任务中的表现及改进方法。

Comments 8 pages, 5 figures, ICICN 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19957 2025-12-01 cs.CL 57%

AppSelectBench: Application-Level Tool Selection Benchmark

AppSelectBench: 应用级工具选择基准

Tianyi Chen, Michael Solodko, Sen Wang, Jongwoo Ko, Junheng Hao, Colby Banbury, Sara Abdali, Saeed Amizadeh, Qing Xiao, Yinheng Li, Tianyu Ding, Kamran Ghasedi Dizaji, Suzhen Zheng, Hao Fan, Justin Wagle, Pashmina Cameron, Kazuhito Koishida

机构 * Microsoft(微软)

专题命中 Agent评测 :agent(abstract);分类 cs.CL

AI总结 AppSelectBench通过评估CUAs的应用选择能力,揭示了模型在跨应用推理中的系统性优劣,为智能代理的研究提供了新基准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.23424 2025-12-01 econ.TH math.OC 50%

Contracting with discretionary bonuses

带有酌情奖金的合同

Guillermo Alonso Alvarez, Ibrahim Ekren, Liwei Huang

专题命中 Agent评测 :agent(abstract)

AI总结 本文研究了雇主如何通过提供入职奖金来优化激励结构,探讨了急躁程度和奖金支付次数对合同价值的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.23061 2025-12-01 physics.soc-ph cs.SI 50%

The impact of anticonformity on the diffusion of innovation -- insights from the q-voter model

反从众对创新扩散的影响——来自q-投票模型的洞察

Angelika Abramiuk-Szurlej

专题命中 Agent评测 :agent(abstract)

AI总结 本文通过扩展q-投票模型引入反从众行为,研究其对创新扩散的影响,发现反从众能加速早期采用并促进成功扩散,具有实际应用价值。

Comments 7 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22933 2025-12-01 eess.SP 50%

RAG-Empowered LLM-Driven Dynamic Radio Resource Management in Open 6G RAN

基于RAG的LLM驱动的开放6G RAN动态无线电资源管理

Onur Salan, Burak Çırağ, Onur Sever, İbrahim Hökelek, Ali Görçin, Hakan Ali Çırpan

专题命中 Agent评测 :agent(abstract)

AI总结 本文提出基于RAG的LLM驱动的O-RAN动态资源管理框架,通过双代理机制实现网络切片的自适应控制,提升计算效率和SLA合规性。

Comments Submitted to possible IEEE conferences

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.13278 2025-12-01 math.PR econ.GN math.OC q-fin.EC 50%

Randomisation with moral hazard: a path to existence of optimal contracts

随机性与道德风险:最优合同存在的路径

Daniel Kršek, Dylan Possamaï

专题命中 Agent评测 :agent(abstract)

AI总结 本文提出了一种在连续时间内处理道德风险问题的方法,通过测度值控制和反向随机微分方程,证明了在约束条件下最优合同存在的可能性。

Comments 48 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22683 2025-12-01 cs.IT math.IT 50%

On Information Theoretic Fairness With A Bounded Point-Wise Statistical Parity Constraint: An Information Geometric Approach

在有信息论公平性与有界点对点统计平等等约束下的信息几何方法:一种设计公平表示的问题

Amirreza Zamani, Ayfer Özgür, Mikael Skoglund

专题命中 Agent评测 :agent(abstract)

AI总结 本文提出了一种基于信息几何的方法,通过设计满足有界点对点统计平等等约束的表示Y,以最大化任务的互信息并满足压缩率约束。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22466 2025-12-01 cs.CV 50%

RoadSceneBench: A Lightweight Benchmark for Mid-Level Road Scene Understanding

RoadSceneBench: 一个轻量级的中层道路场景理解基准

Xiyan Liu, Han Wang, Yuhu Wang, Junjie Cai, Zhe Cao, Jianzhong Yang, Zhen Lu

机构 * Baidu Inc(百度公司)

专题命中 Agent评测 :planning(abstract)

AI总结 RoadSceneBench提出一种轻量级基准,通过HRRP-T框架提升道路场景的视觉推理能力,实现结构一致性和时间一致性,推动自动驾驶感知发展。

详情

展开后加载摘要…

URL PDF HTML 收藏