arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-02-04 至 2026-02-04 共收录 142 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 工作流自动化 18 篇

2602.02930 2026-02-04 cs.LG 57%

Rare Event Early Detection: A Dataset of Sepsis Onset for Critically Ill Trauma Patients

罕见事件早期检测:创伤重症患者脓毒症发病数据集

Yin Jin, Tucker R. Stewart, Deyi Zhou, Chhavi Gupta, Arjita Nema, Scott C. Brakenridge, Grant E. O'Keefe, Juhua Hu

机构 * University of Washington Tacoma WA USA(华盛顿大学塔科马分校) Department of Statistics University of Washington Seattle WA USA(华盛顿大学统计学系) Department of Surgery University of Washington Seattle WA USA(华盛顿大学外科系)

专题命中 工作流自动化 :workflow(abstract);分类 cs.LG

AI总结 本文提出了一种针对创伤重症患者脓毒症早期检测的新数据集和方法,以解决创伤相关炎症与脓毒症临床特征重叠的问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02813 2026-02-04 stat.AP cs.LG stat.CO stat.ME 57%

Downscaling land surface temperature data using edge detection and block-diagonal Gaussian process regression

利用边缘检测和块对角高斯过程回归下推土地表面温度数据

Sanjit Dandapanthula, Margaret Johnson, Madeleine Pascolini-Campbell, Glynn Hulley, Mikael Kuusela

机构 * Jet Propulsion Laboratory, California Institute of Technology(喷气推进实验室,加州理工学院) Carnegie Mellon University(卡内基梅隆大学)

专题命中 工作流自动化 :planning(abstract);分类 cs.LG

AI总结 本文提出利用边缘检测和块对角高斯过程回归方法,从ECOSTRESS数据中高分辨率估计土地表面温度,以提高农业应用中的蒸散发估算精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02735 2026-02-04 cs.LG 57%

TabPFN for Zero-shot Parametric Engineering Design Generation

基于TabPFN的零样本参数化工程设计生成

Ke Wang, Yifan Tang, Nguyen Gia Hien Vu, Faez Ahmed, G. Gary Wang

专题命中 工作流自动化 :workflow(abstract);分类 cs.LG

AI总结 基于TabPFN的零样本生成方法,通过少量参考样本实现高效参数化工程设计生成,减少计算和数据需求,提升设计灵活性和实用性。

Comments 14 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03710 2026-02-04 quant-ph 50%

Quantum Computing for Electronic Circular Dichroism Spectrum Prediction of Chiral Molecules

量子计算用于手性分子电子圆二色谱谱预测

Amandeep Singh Bhatia, Sabre Kais

专题命中 工作流自动化 :workflow(abstract)

AI总结 本文提出一种基于量子计算的框架,结合变分量子方法和量子运动方程形式主义,高效预测手性分子的ECD光谱,实现高精度的圆偏振响应计算。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03667 2026-02-04 astro-ph.EP astro-ph.IM astro-ph.SR 50%

Probing Atmospheric Escape Through the Near-Infrared Helium Triplet

通过近红外氦三重态探测大气逃逸

C. Farret Jentink, V. Bourrier, Y. Carteret

专题命中 工作流自动化 :workflow(abstract)

AI总结 通过近红外氦三重态探测类地行星大气逃逸,利用NIGHT光谱仪和ANTARESS工作流程分析传输光谱,以研究行星大气特征。

Comments Book chapter accepted for publication in "The National Center for Competence in Research, PlanetS: A Swiss-wide network expanding planetary sciences" (Springer, 2025). 29 pages, 10 figures Licensed under CC BY 4.0

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17472 2026-02-04 eess.IV 50%

Fetpype: An Open-Source Pipeline for Reproducible Fetal Brain MRI Analysis

Fetpype:一种用于可重复胎儿脑MRI分析的开源流水线

Thomas Sanchez, Gerard Martí-Juan, David Meunier, Miguel Angel Gonzalez Ballester, Oscar Camara, Elisenda Eixarch, Gemma Piella, Meritxell Bach Cuadra, Guillaume Auzias

专题命中 工作流自动化 :workflow(abstract)

AI总结 Fetpype提供了一种标准化的开源流水线,用于可重复的胎儿脑MRI分析,整合了运动校正、超分辨率重建等多步骤处理,以提高研究和临床应用中的神经影像分析效率。

Comments 6 pages, 1 figure; submitted to the Journal of Open Source Software (JOSS)

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 软件智能体 8 篇

2602.03798 2026-02-04 cs.SE cs.CL cs.CV 91%

FullStack-Agent: Enhancing Agentic Full-Stack Web Coding via Development-Oriented Testing and Repository Back-Translation

全栈代理:通过面向开发的测试和仓库反翻译增强全栈网页编码

Zimu Lu, Houxing Ren, Yunqiao Yang, Ke Wang, Zhuofan Zong, Mingjie Zhan, Hongsheng Li

机构 * Multimedia Laboratory (MMLab), The Chinese University of Hong Kong(香港中文大学多媒体实验室) Shenzhen Loop Area Institute(深圳河套学院)

专题命中 软件智能体 :agent(title,abstract);agentic(title,abstract);planning(abstract);multi-agent(abstract)

AI总结 FullStack-Agent通过面向开发的测试和仓库反翻译提升全栈网页编码能力,其多代理框架和自我改进方法在多个测试用例中表现出色。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.07468 2026-02-04 cs.AI cs.CL cs.LG cs.SE 89%

CP-Agent: Agentic Constraint Programming

CP-Agent:代理约束编程

Stefan Szeider

机构 * TU Wien(维也纳技术大学)

专题命中 软件智能体 :agent(title,abstract);agentic(title,abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 CP-Agent通过代理工作流实现约束编程问题的高效求解,展示了最少指导优于详细指导,并揭示了任务管理工具对建模任务的双重影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10398 2026-02-04 cs.CL cs.AI cs.LG cs.SE 85%

Confucius Code Agent: Scalable Agent Scaffolding for Real-World Codebases

孔子代码代理:面向真实世界代码库的可扩展代理构建

Sherman Wong, Zhenting Qi, Zhaodong Wang, Nathan Hu, Samuel Lin, Jun Ge, Erwin Gao, Wenlin Chen, Yilun Du, Minlan Yu, Ying Zhang

机构 * Meta

专题命中 软件智能体 :agent(title,abstract);tool use(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 孔子代码代理通过可扩展的代理构建框架,在真实世界软件工程任务中实现高性能,超越现有研究和商业成果。

Comments The latest version

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03183 2026-02-04 cs.CL cs.AI 73%

Privasis: Synthesizing the Largest "Public" Private Dataset from Scratch

Privasis:从零开始合成最大的“公共”私有数据集

Hyunwoo Kim, Niloofar Mireshghallah, Michael Duan, Rui Xin, Shuyue Stella Li, Jaehun Jung, David Acuna, Qi Pang, Hanshen Xiao, G. Edward Suh, Sewoong Oh, Yulia Tsvetkov, Pang Wei Koh, Yejin Choi

机构 * NVIDIA CMU(卡内基梅隆大学) USC(南加州大学)

专题命中 软件智能体 :agent(abstract);AI agent(abstract);分类 cs.AI、cs.CL

AI总结 Privasis是首个从零开始构建的百万级合成数据集,用于提升隐私敏感领域研究的规模和效率,其模型在隐私净化任务中表现优异。

Comments For code and data, see https://privasis.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02084 2026-02-04 cs.CL cs.SE 62%

Closing the Loop: Universal Repository Representation with RPG-Encoder

闭环:通用仓库表示法与RPG-编码器

Jane Luo, Chengyu Yin, Xin Zhang, Qingtao Li, Steven Liu, Yiming Huang, Jie Wu, Hao Liu, Yangyu Huang, Yu Kang, Fangkai Yang, Ying Xin, Scarlett Li

专题命中 软件智能体 :planning(abstract);分类 cs.CL、cs.SE

AI总结 RPG-Encoder通过统一表示和闭环推理,实现复杂代码库的高精度理解和生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03712 2026-02-04 cs.SE 57%

SWE-Refactor: A Repository-Level Benchmark for Real-World LLM-Based Code Refactoring

SWE-Refactor:一个面向真实世界的基于大语言模型的代码重构仓库级基准

Yisen Xu, Jinqiu Yang, Tse-Hsun, Chen

专题命中 软件智能体 :agent(abstract);分类 cs.SE

AI总结 SWE-Refactor是一个面向真实世界的基于大语言模型的代码重构仓库级基准,通过1099个Java项目中的重构实例评估九种LLMs,揭示复杂重构的失败率较高。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03403 2026-02-04 cs.AI 57%

Feasible strategies for conflict resolution within intuitionistic fuzzy preference-based conflict situations

在基于直觉模糊偏好的冲突情境中可行的解决策略

Guangming Lang, Mingchuan Shang, Mengjun Hu, Jie Zhou, Feng Xu

机构 * School of Mathematics and Statistics, Changsha University of Science and Technology(长沙理工大学数学与统计学学院) Hunan Provincial Key Laboratory of Mathematical Modeling and Analysis in Engineering, Changsha University of Science and Technology(湖南省工程数学建模与分析重点实验室,长沙理工大学) Department of Computer Science, University of Manitoba(曼尼托湾大学计算机科学系)

专题命中 软件智能体 :agent(abstract);分类 cs.AI

AI总结 本文提出了一种基于直觉模糊偏好的冲突情境模型,通过更精细的粒度捕捉冲突本质,并开发了相应的冲突度量和调整机制,以提高冲突解决的可行性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03371 2026-02-04 cs.CV 50%

Multi-Resolution Alignment for Voxel Sparsity in Camera-Based 3D Semantic Scene Completion

基于体素稀疏性的多分辨率对齐方法用于基于摄像头的3D语义场景补全

Zhiwen Yang, Yuxin Peng

机构 * Wangxuan Institute of Computer Technology, Peking University(王宣计算机技术研究所,北京大学)

专题命中 软件智能体 :planning(abstract)

AI总结 本文提出多分辨率对齐方法,通过多分辨率特征对齐和关键分布一致性损失缓解基于摄像头的3D语义场景补全中的体素稀疏性问题。

Comments 15 pages, 6 figures, accepted by TIP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

3. GUI与网页智能体 2 篇

2602.03792 2026-02-04 cs.CR cs.AI cs.CL 62%

WebSentinel: Detecting and Localizing Prompt Injection Attacks for Web Agents

WebSentinel: 检测和定位网页代理中的提示注入攻击

Xilong Wang, Yinuo Liu, Zhun Wang, Dawn Song, Neil Gong

专题命中 GUI与网页智能体 :agent(abstract);分类 cs.AI、cs.CL

AI总结 WebSentinel通过两步方法有效检测和定位网页代理中的提示注入攻击,显著优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02548 2026-02-04 cs.LG cs.AI cs.CV cs.MA 62%

ToolTok: Tool Tokenization for Efficient and Generalizable GUI Agents

ToolTok: 为高效且通用的GUI代理的工具标记化

Xiaoce Wang, Guibin Zhang, Junzhe Li, Jinzhe Tu, Chun Li, Ming Li

机构 * Department of Computer Science, Tsinghua University, Beijing, China(清华大学计算机科学系) Guangming Laboratory, Shenzhen, China(光明实验室) National University of Singapore, Singapore(新加坡国立大学) Peking University, Beijing, China(北京大学) MSU-BIT-SMBU Joint Research Center of Applied Mathematics, Shenzhen MSU–BIT University(MSU-BIT-SMBU应用数学联合研究中心)

专题命中 GUI与网页智能体 :agent(abstract);分类 cs.AI、cs.LG

AI总结 ToolTok通过多步路径寻找范式,利用语义锚定机制和易到难课程,实现高效且通用的GUI代理,以较少数据获得优异性能。

Comments 8 pages main paper, 18 pages total, 8 figures, 5 tables, code at https://github.com/ZephinueCode/ToolTok

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 记忆与上下文管理 5 篇

2601.21123 2026-02-04 cs.AI 83%

CUA-Skill: Develop Skills for Computer Using Agent

CUA-Skill: 为计算机开发技能

Tianyi Chen, Yinheng Li, Michael Solodko, Sen Wang, Nan Jiang, Tingyuan Cui, Junheng Hao, Jongwoo Ko, Sara Abdali, Leon Xu, Suzhen Zheng, Hao Fan, Pashmina Cameron, Justin Wagle, Kazuhito Koishida

机构 * msft(微软)

专题命中 记忆与上下文管理 :agent(title,abstract);agentic(abstract);分类 cs.AI

AI总结 CUA-Skill通过构建可重用的技能库,提升了计算机使用代理在复杂任务中的执行效率和鲁棒性,实现了端到端代理的高效开发。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.11129 2026-02-04 cs.CV cs.AI 70%

video-SALMONN S: Memory-Enhanced Streaming Audio-Visual LLM

视频-SALMONN S:内存增强的流式音频视觉大语言模型

Guangzhi Sun, Yixuan Li, Xiaodong Wu, Yudong Yang, Wei Li, Zejun Ma, Chao Zhang

机构 * Tsinghua University(清华大学) University of Cambridge(剑桥大学)

专题命中 记忆与上下文管理 :agent(abstract);AI agent(abstract);分类 cs.AI

AI总结 视频-SALMONN S通过引入测试时训练机制,实现高效流式视频理解,显著提升长视频任务的性能和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.13696 2026-02-04 cs.AI 57%

Building spatial world models from sparse transitional episodic memories

从稀疏的过渡性片段记忆中构建空间世界模型

Zizhan He, Maxime Daigle, Pouya Bashivan

机构 * Department of Computer Science, McGill University(麦吉尔大学计算机科学系) Department of Physiology, McGill University(麦吉尔大学生理学系) Mila, Université de Montréal(蒙特利尔大学Mila)

专题命中 记忆与上下文管理 :planning(abstract);分类 cs.AI

AI总结 本文提出ESWM模型,通过稀疏片段记忆构建空间地图,实现环境探索和导航的高效适应能力。

Comments Accepted ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03085 2026-02-04 cs.CR cs.AI 57%

The Trigger in the Haystack: Extracting and Reconstructing LLM Backdoor Triggers

haystack中的触发器:提取和重建LLM后门触发器

Blake Bullwinkel, Giorgio Severi, Keegan Hines, Amanda Minnich, Ram Shankar Siva Kumar, Yonatan Zunger

机构 * Microsoft, Redmond, Washington, USA(微软)

专题命中 记忆与上下文管理 :agent(abstract);分类 cs.AI

AI总结 本文提出了一种无需先验知识的LLM后门触发器扫描方法,通过记忆提取和输出分布分析来检测和恢复后门触发器。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03068 2026-02-04 cs.SI 50%

From semantic memory to collective creativity: A generative cognitive foundation for social creativity models

从语义记忆到集体创造力:一种生成认知基础的社会创造力模型

Mirza Nayeem Ahmed, Raiyan Abdul Baten

专题命中 记忆与上下文管理 :agent(abstract)

AI总结 本文提出一个多层社会认知智能体框架,通过调节语义模ularity生成个体差异,揭示集体创造力中的认知与社会结构机制。

详情

展开后加载摘要…

URL PDF HTML 收藏

5. Agent评测 31 篇

2602.03128 2026-02-04 cs.AI 90%

Understanding Multi-Agent LLM Frameworks: A Unified Benchmark and Experimental Analysis

理解多智能体大语言模型框架:一个统一的基准测试和实验分析

Abdelghny Orogat, Ana Rostam, Essam Mansour

机构 * Concordia University(康科迪亚大学)

专题命中 Agent评测 :agent(title,abstract);multi-agent(title,abstract);planning(abstract);分类 cs.AI

AI总结 本文提出MAFBench统一评估套件,系统比较多智能体LLM框架,揭示架构设计对性能的显著影响。

Comments 25 pages, 9 figures and 13 tables; introduces MAFBench unified multi-agent evaluation suite

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02995 2026-02-04 cs.AI 83%

Agent Alpha: Tree Search Unifying Generation, Exploration and Evaluation for Computer-Use Agents

Agent Alpha:通过树搜索统一生成、探索和评估计算机使用代理

Sizhe Tang, Rongqian Chen, Tian Lan

机构 * The George Washington University(乔治·华盛顿大学)

专题命中 Agent评测 :agent(title,abstract);planning(abstract);分类 cs.AI

AI总结 Agent Alpha通过步骤级MCTS统一生成、探索和评估,实现计算机使用代理的高成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02564 2026-02-04 cs.LG cs.MA 83%

Label Curation Using Agentic AI

使用代理AI进行标签校准

Subhodeep Ghosh, Bayan Divaaniaazar, Md Ishat-E-Rabban, Spencer Clarke, Senjuti Basu Roy

机构 * New Jersey Institute of Technology(新泽西理工学院)

专题命中 Agent评测 :agentic(title,abstract);AI agent(abstract);分类 cs.LG

AI总结 AURA通过代理AI框架实现大规模多模态数据标注,通过概率模型联合推断真实标签和标注者可靠性,提升标注准确性并评估标注者质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01709 2026-02-04 cs.CL 83%

ARTIS: Agentic Risk-Aware Test-Time Scaling via Iterative Simulation

ARTIS: 通过迭代模拟实现代理风险感知的测试时间扩展

Xingshan Zeng, Lingzhi Wang, Weiwen Liu, Liangyou Li, Yasheng Wang, Lifeng Shang, Xin Jiang, Qun Liu

机构 * Huawei Technologies Co., Ltd(华为技术有限公司) Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) Shanghai Jiao Tong University(上海交通大学)

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);分类 cs.CL

AI总结 ARTIS通过迭代模拟提升代理在高风险环境中的可靠性和鲁棒性,采用风险感知的模拟器改进决策效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03130 2026-02-04 cs.CV cs.CE 82%

FinMTM: A Multi-Turn Multimodal Benchmark for Financial Reasoning and Agent Evaluation

FinMTM:面向金融推理和智能体评估的多轮多模态基准

Chenxi Zhang, Ziliang Gan, Liyun Zhu, Youwei Pang, Qing Zhang, Rongjunchen Zhang

机构 * HiThink Research(HiThink研究机构) Wuhan University(武汉大学) Zhejiang University(浙江大学) Nanyang Technological University(南洋理工大学) Shanghai Institute of Technology(上海理工大学)

专题命中 Agent评测 :agent(title,abstract);planning(abstract)

AI总结 FinMTM提出一个多轮多模态基准,用于评估金融推理和智能体任务,通过多样化数据和任务设计,揭示了VLMs在视觉感知、推理和复杂工作流中的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02625 2026-02-04 cs.SI 82%

OpenClaw Agents on Moltbook: Risky Instruction Sharing and Norm Enforcement in an Agent-Only Social Network

OpenClaw代理在Moltbook上的应用:代理-only社交网络中风险性指令分享与规范执行

Md Motaleb Hossen Manik, Ge Wang

专题命中 Agent评测 :agent(title,abstract);agentic(abstract)

AI总结 OpenClaw代理在Moltbook上通过风险性指令分享和规范执行展现选择性社会调节行为,揭示了代理-only社交系统中规范行为的涌现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03100 2026-02-04 cs.AI 79%

Risky-Bench: Probing Agentic Safety Risks under Real-World Deployment

Risky-Bench: 探索现实部署中智能体安全风险

Jingnan Zheng, Yanzhen Luo, Jingjun Xu, Bingnan Liu, Yuxin Chen, Chenhang Cui, Gelei Deng, Chaochao Lu, Xiang Wang, An Zhang, Tat-Seng Chua

机构 * National University of Singapore(国立新加坡大学) University of Science and Technology of China(中国科学技术大学) Southern University of Science and Technology(南方科技大学) University of Electronic Science and Technology of China(电子科技大学) Nanyang Technological University(南洋理工大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 Agent评测 :agentic(title);agent(abstract);分类 cs.AI

AI总结 Risky-Bench通过基于现实部署的安全原则,系统评估智能体在复杂任务中的安全风险,适用于多种部署场景。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01355 2026-02-04 cs.AI 79%

Aggregation Queries over Unstructured Text: Benchmark and Agentic Method

无结构文本上的聚合查询:基准测试与代理方法

Haojia Zhu, Qinyuan Xu, Haoyu Li, Yuxi Liu, Hanchen Qiu, Jiaoyan Chen, Jiahui Jin

机构 * Southeast University(东南大学) Imperial College London(伦敦帝国学院) The University of Manchester(曼彻斯特大学)

专题命中 Agent评测 :agentic(title,abstract);分类 cs.AI

AI总结 本文提出DFA方法,用于在无结构文本上进行完整性导向的聚合查询,通过模块化设计提升证据覆盖能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.15784 2026-02-04 q-bio.NC cs.LG 79%

Emergent time-keeping mechanisms in a deep reinforcement learning agent performing an interval timing task

深度强化学习代理在区间定时任务中涌现的时间保持机制

Amrapali Pednekar, Alvaro Garrido, Pieter Simoens, Yara Khaluf

机构 * IDLab, Department of Information Technology, Ghent University - imec(IDLab信息科技系,根特大学-imec) Department of Social Sciences, Wageningen University and Research(社会科学系,瓦赫宁根大学与研究所)

专题命中 Agent评测 :agent(title,abstract);分类 cs.LG

AI总结 本研究通过深度强化学习代理在区间定时任务中的表现,揭示了类似生物节律的时间保持机制,并探讨了其与生物模型的类比。

Comments Accepted at 2025 Artificial Life Conference

详情

展开后加载摘要…

URL PDF HTML 收藏