arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-01-08 至 2026-01-08 共收录 102 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 工作流自动化 15 篇

2601.03702 2026-01-08 cs.MA 75%

A Chromatographic Process Design and Optimization Platform Powered by Large Language Models: A Case Application on Extract of Ginkgo Biloba Leaf

基于大语言模型的色谱过程设计与优化平台:以银杏叶提取物为例

Zhilong Tang, Shaohua Wu, Xinyan Zhao, Yu Wang, Xingchu Gong

专题命中 工作流自动化 :agent(abstract);workflow(abstract);multi-agent(abstract)

AI总结 本文提出基于大语言模型的色谱过程设计与优化平台ChromR,通过自动化流程显著缩短开发时间,应用于银杏叶提取物纯化案例。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03315 2026-01-08 cs.LG cs.AI 62%

Why LLMs Aren't Scientists Yet: Lessons from Four Autonomous Research Attempts

为何大语言模型尚未成为科学家:来自四个自主研究尝试的教训

Dhruv Trehan, Paras Chopra

专题命中 工作流自动化 :workflow(abstract);分类 cs.AI、cs.LG

AI总结 本文探讨了四个自主生成科研论文的尝试,揭示了大语言模型在科学工作流程中面临的六个常见失败模式,并提出了改进AI科学家系统的设计原则。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.20382 2026-01-08 cs.RO cs.AI cs.LG cs.SY eess.SY 62%

Physics-Driven Data Generation for Contact-Rich Manipulation via Trajectory Optimization

通过轨迹优化实现接触密集操作的物理驱动数据生成

Lujie Yang, H. J. Terry Suh, Tong Zhao, Bernhard Paus Graesdal, Tarik Kelestemur, Jiuguang Wang, Tao Pang, Russ Tedrake

机构 * Computer Science and Artificial Intelligence Laboratory (CSAIL), Massachusetts Institute of Technology(计算机科学与人工智能实验室(CSAIL),麻省理工学院) Robotics and AI Institute(机器人与人工智能研究院)

专题命中 工作流自动化 :planning(abstract);分类 cs.AI、cs.LG

AI总结 本研究提出了一种结合物理仿真和轨迹优化的方法,通过生成多样化高质量数据集,提升接触密集操作任务的机器人性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.15451 2026-01-08 cs.CV cs.AI cs.LG 62%

Deep Vision-Based Framework for Coastal Flood Prediction Under Climate Change Impacts and Shoreline Adaptations

基于深度视觉的沿海洪水预测框架:在气候变化影响和海岸适应下的应用

Areg Karapetyan, Aaron Chung Hin Chow, Samer Madanat

机构 * Division of Engineering New York University(工程学院纽约大学)

专题命中 工作流自动化 :workflow(abstract);分类 cs.AI、cs.LG

AI总结 本文提出了一种基于深度视觉的框架,用于在气候变化和海岸适应背景下预测沿海洪水,通过低数据集训练和高保真度模型设计提升了预测精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03748 2026-01-08 cs.IR cs.AI 57%

Bridging OLAP and RAG: A Multidimensional Approach to the Design of Corpus Partitioning

连接OLAP与RAG:一种多维方法用于语料库划分设计

Dario Maio, Stefano Rizzi

机构 * DISI - University of Bologna, Viale Risorgimento, 2, Bologna, 40136 Italy(博洛尼亚大学DISI学院)

专题命中 工作流自动化 :workflow(abstract);分类 cs.AI

AI总结 本文提出维度事实模型(DFM)以指导RAG语料库的多维划分设计,结合语义聚类和多维划分策略,提升检索的可控性和确定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22298 2026-01-08 cs.CV cs.HC cs.LG eess.IV 57%

Real-Time In-Cabin Driver Behavior Recognition on Low-Cost Edge Hardware

低成本边缘硬件上的实时车内驾驶员行为识别

Vesal Ahsani, Babak Hossein Khalaj, Hamed Shah-Mansouri

机构 * Department of Electrical Engineering, Sharif University of Technology(电气工程系,谢里夫理工大学)

专题命中 工作流自动化 :agentic(abstract);分类 cs.LG

AI总结 本文提出了一种基于低成本边缘硬件的实时车内驾驶员行为识别系统,通过紧凑模型、混淆标签体系和时间决策头实现高效准确的行为检测与警报生成。

Comments 27 pages, 6 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04186 2026-01-08 cond-mat.mtrl-sci physics.chem-ph 50%

A Comprehensive Computational Framework for Materials Design, Ab Initio Modeling, and Molecular Docking

一种用于材料设计、从头计算建模和分子对接的综合计算框架

Md Rakibul Karim Akanda, Michael P. Richard

专题命中 工作流自动化 :workflow(abstract)

AI总结 本文提出一种整合随机模拟、从头计算和分子对接的计算框架,用于加速分子和材料设计,降低实验风险。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04089 2026-01-08 cs.NI 50%

Tutorial on Flow-Based Network Traffic Classification Using Machine Learning

流量基网络流量分类的机器学习教程

Adrian Pekar, Richard Plny, Karel Hynek

专题命中 工作流自动化 :workflow(abstract)

AI总结 本教程介绍如何利用机器学习进行加密环境下网络流量分类,提供从数据收集到模型部署的全流程指导。

Comments under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03976 2026-01-08 cs.ET cs.SY eess.SY 50%

On-Device Deep Reinforcement Learning for Decentralized Task Offloading Performance trade-offs in the training process

设备端深度强化学习用于训练过程中去中心化任务卸载性能权衡

Gorka Nieto, Idoia de la Iglesia, Cristina Perfecto, Unai Lopez-Novoa

专题命中 工作流自动化 :agent(abstract)

AI总结 本文提出一种去中心化深度强化学习智能体,用于在设备端优化任务卸载的性能权衡,通过现实测试床评估本地与远程训练的延迟和能耗差异。

Comments Submitted to IEEE Transactions on Cognitive Communications and Networking

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19382 2026-01-08 cond-mat.supr-con cond-mat.str-el 50%

Superconductivity in Electron Liquids: Precision Many-Body Treatment of Coulomb Interaction

电子液中的超导性:Coulomb相互作用的精确多体处理

Xiansheng Cai, Tao Wang, Shuai Zhang, Tiantian Zhang, Andrew Millis, Boris V. Svistunov, Nikolay V. Prokof'ev, Kun Chen

专题命中 工作流自动化 :workflow(abstract)

AI总结 本文提出了一种有效场论方法,用于精确处理电子-声子超导中的Coulomb相互作用,通过微观流程改进伪势能估计并预测Al在高压下的超导-非超导相变。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 软件智能体 4 篇

2601.03556 2026-01-08 cs.SE 88%

Do Autonomous Agents Contribute Test Code? A Study of Tests in Agentic Pull Requests

自主代理是否贡献测试代码?对代理拉取请求中测试的调查

Sabrina Haque, Sarvesh Ingale, Christoph Csallner

专题命中 软件智能体 :agentic(title,abstract);autonomous agent(title);agent(abstract);分类 cs.SE

AI总结 研究分析了代理拉取请求中测试代码的出现频率及影响因素,揭示了测试代码对PR规模和处理时间的影响,为自主软件开发研究提供实证依据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04171 2026-01-08 cs.LG 83%

Agentic Rubrics as Contextual Verifiers for SWE Agents

代理 rubrics 作为 SWE 代理的上下文验证器

Mohit Raghavendra, Anisha Gunjal, Bing Liu, Yunzhong He

专题命中 软件智能体 :agentic(title,abstract);agent(abstract);分类 cs.LG

AI总结 代理 rubrics 通过上下文感知的检查清单提升 SWE 代理的验证效率与准确性。

Comments 31 pages, 11 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03335 2026-01-08 cs.AI cs.NE 70%

Digital Red Queen: Adversarial Program Evolution in Core War with LLMs

数字红皇后:基于大语言模型的Core War中的对抗程序进化

Akarsh Kumar, Ryan Bahlous-Boldi, Prafull Sharma, Phillip Isola, Sebastian Risi, Yujin Tang, David Ha

机构 * MIT(麻省理工学院) Sakana AI

专题命中 软件智能体 :agent(abstract);multi-agent(abstract);分类 cs.AI

AI总结 本文提出DRQ算法,利用大语言模型在Core War游戏中通过持续适应变化的目标进化出通用且高效的战士,揭示了动态对抗进化在人工智能系统中的潜力。

Comments 14 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03878 2026-01-08 cs.SE 57%

Understanding Specification-Driven Code Generation with LLMs: An Empirical Study Design

通过LLM理解基于规范的代码生成:一项实证研究设计

Giovanni Rosa, David Moreno-Lumbreras, Gregorio Robles, Jesús M. González-Barahona

专题命中 软件智能体 :workflow(abstract);分类 cs.SE

AI总结 本文通过实证研究设计,探讨人类干预在基于规范的LLM代码生成过程中对代码质量和动态的影响。

Comments This paper is a Stage 1 Registered Report. The study protocol and analysis plan were peer reviewed and accepted at SANER 2026 with a Continuity Acceptance (CA) score for Stage 2

详情

展开后加载摘要…

URL PDF HTML 收藏

3. GUI与网页智能体 4 篇

2601.04035 2026-01-08 cs.AI 79%

MobileDreamer: Generative Sketch World Model for GUI Agent

MobileDreamer: 用于GUI代理的生成式草图世界模型

Yilin Cao, Yufeng Zhong, Zhixiong Zeng, Liming Zheng, Jing Huang, Haibo Qiu, Peng Shi, Wenji Mao, Wan Guanglu

机构 * State Key Laboratory of Multimodal Artificial Intelligence Systems, Institute of Automation, Chinese Academy of Sciences(多模态人工智能系统国家重点实验室,自动化研究所,中国科学院) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) Meituan(美团)

专题命中 GUI与网页智能体 :agent(title,abstract);分类 cs.AI

AI总结 MobileDreamer通过生成式草图世界模型和rollout想象策略,提升GUI代理在长周期任务中的决策能力,任务成功率提升5.25%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21799 2026-01-08 cs.AI 57%

D-Artemis: A Deliberative Cognitive Framework for Mobile GUI Multi-Agents

D-Artemis:一种用于移动GUI多智能体的 deliberative 认知框架

Hongze Mi, Yibo Feng, Wenjie Lu, Yuqi Wang, Jinyuan Li, Song Cao, He Cui, Tengfei Tian, Xuelin Zhang, Haotian Luo, Di Sun, Jun Fang, Hua Chai, Naiqiang Tan, Gang Pan

专题命中 GUI与网页智能体 :agent(abstract);分类 cs.AI

AI总结 D-Artemis通过引入细粒度提示检索和主动对齐机制,提升移动GUI多智能体任务的执行成功率和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04111 2026-01-08 q-bio.NC cs.SY eess.SY nlin.AO 50%

Stigmergic optimal transport

群体最优运输的协同机制

Vishaal Krishnan, L. Mahadevan

专题命中 GUI与网页智能体 :agent(abstract)

AI总结 本文提出了一种基于随机最优控制的协同运输理论框架,通过局部交互在异质环境中生成测地线轨迹,无需集中协调。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25687 2026-01-08 cs.RO 50%

OmniNav: A Unified Framework for Prospective Exploration and Visual-Language Navigation

OmniNav:一个统一的框架,用于前瞻性探索和视觉-语言导航

Xinda Xue, Junjun Hu, Minghua Luo, Shichao Xie, Jintao Chen, Zixun Xie, Kuichen Quan, Wei Guo, Mu Xu, Zedong Chu

机构 * Alibaba Group(阿里巴巴集团) Peking University(北京大学)

专题命中 GUI与网页智能体 :planning(abstract)

AI总结 OmniNav通过统一框架实现多导航任务和前沿探索,提升机器人自主导航的精度与泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 记忆与上下文管理 5 篇

2601.03655 2026-01-08 cs.CV 75%

VideoMemory: Toward Consistent Video Generation via Memory Integration

VideoMemory: 通过记忆整合实现一致的视频生成

Jinsong Zhou, Yihua Du, Xinli Xu, Luozhou Wang, Zijie Zhuang, Yehang Zhang, Shuaibo Li, Xiaojun Hu, Bolan Su, Ying-cong Chen

机构 * HKUST(GZ)(香港科技大学(广州)) HKUST(香港科技大学) ByteDance(字节跳动)

专题命中 记忆与上下文管理 :agent(abstract);planning(abstract);multi-agent(abstract)

AI总结 VideoMemory通过动态记忆库整合叙事规划与视觉生成,实现多镜头中角色、道具和环境的一致性生成。

Comments Project page: https://hit-perfect.github.io/VideoMemory/

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03875 2026-01-08 eess.IV cs.CV 67%

Staged Voxel-Level Deep Reinforcement Learning for 3D Medical Image Segmentation with Noisy Annotations

分阶段体素级深度强化学习用于带有噪声标注的3D医学图像分割

Yuyang Fu, Xiuzhen Guo, Ji Shi

机构 * the Academy for Multidisciplinary Studies, Beijing National Center for Applied Mathematic(多学科研究学院,北京应用数学中心) Capital Normal University(首都师范大学)

专题命中 记忆与上下文管理 :agent(abstract);autonomous agent(abstract)

AI总结 本文提出分阶段体素级深度强化学习框架,通过动态迭代更新策略和新颖的强化学习方法,在噪声标注条件下提升医学图像分割的准确性和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.15190 2026-01-08 cs.LG 57%

Learning Topology Actions for Power Grid Control: A Graph-Based Soft-Label Imitation Learning Approach

学习电力网络控制的拓扑动作:一种基于图的软标签模仿学习方法

Mohamed Hassouna, Clara Holzhüter, Malte Lehna, Matthijs de Jong, Jan Viebahn, Bernhard Sick, Christoph Scholz

机构 * Fraunhofer Institute for Energy Economics and Energy System Technology (IEE)(弗劳恩霍夫能源经济与能源系统技术研究所) Intelligent Embedded Systems, University of Kassel(卡塞尔大学智能嵌入式系统系) TenneT TSO B.V.(TenneT TSO公司)

专题命中 记忆与上下文管理 :agent(abstract);分类 cs.LG

AI总结 本文提出一种基于图的软标签模仿学习方法,用于电力网络控制,通过软标签捕捉多个可行动作,提升电网拥堵管理的决策性能。

Comments Accepted at European Conference on Machine Learning and Principles and Practice of Knowledge Discovery in Databases (ECML) - Applied Data Science Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03898 2026-01-08 cs.LO cs.MA 50%

Introducing The Maximum Common Bigraph Problem

引入最大公共大图问题

Kyle Burns, Michele Sevegnani, Ciaran McCreesh, James Trimble

专题命中 记忆与上下文管理 :agent(abstract)

AI总结 本文提出最大公共大图问题,并采用McSplit算法计算两个大图状态的最大公共大图,为支持大图工具中的双射检查提供了新路径。

Comments In Proceedings GCM 2025, arXiv:2601.03249

Journal ref EPTCS 440, 2026, pp. 13-35

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03618 2026-01-08 cs.DB 50%

The Pneuma Project: Reifying Information Needs as Relational Schemas to Automate Discovery, Guide Preparation, and Align Data with Intent

Pneuma项目:将信息需求作为关系模式来自动化发现、指导准备并使数据与意图一致

Muhammad Imam Luthfi Balaka, Raul Castro Fernandez

专题命中 记忆与上下文管理 :agentic(abstract)

AI总结 Pneuma项目通过将信息需求转化为关系模式,利用语言模型实现自动化发现与文档生成,提升数据与意图的一致性。

Comments CIDR 2026 Paper

详情

展开后加载摘要…

URL PDF HTML 收藏

5. Agent评测 19 篇

2601.03513 2026-01-08 cs.SE cs.AI 86%

Deploy-Master: Automating the Deployment of 50,000+ Agent-Ready Scientific Tools in One Day

Deploy-Master:在一天内自动化部署50,000多个准备就绪的科学工具

Yi Wang, Zhenting Huang, Zhaohan Ding, Ruoxue Liao, Yuan Huang, Xinzijian Liu, Jiajun Xie, Siheng Chen, Linfeng Zhang

机构 * DP Technology Beijing China(DP技术北京中国) AI for Science Institute Beijing China(AI for Science研究院北京中国) Shanghai Jiao Tong University Shanghai China(上海交通大学上海中国)

专题命中 Agent评测 :agent(title,abstract);workflow(abstract);agentic(abstract);分类 cs.AI、cs.SE

AI总结 Deploy-Master通过自动化部署50,000多个科学工具,提升AI4S和代理工作流的可重复性和实用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03605 2026-01-08 cs.CL 79%

DiVA: Fine-grained Factuality Verification with Agentic-Discriminative Verifier

DiVA: 基于代理-判别验证器的细粒度事实性验证

Hui Huang, Muyun Yang, Yuki Arase

机构 * Harbin Institute of Technology(哈尔滨工业大学) Institute of Science Tokyo(东京科学研究所)

专题命中 Agent评测 :agentic(title,abstract);分类 cs.CL

AI总结 DiVA通过结合生成模型和判别模型的能力,提出了一种细粒度事实性验证方法,并构建了FGVeriBench基准,有效提升了事实性验证的精度和适用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03281 2026-01-08 eess.SY cs.AI cs.SY 77%

$α^3$-Bench: A Unified Benchmark of Safety, Robustness, and Efficiency for LLM-Based UAV Agents over 6G Networks

$α^3$-Bench:一种统一的安全性、鲁棒性和效率评估基准,用于基于大语言模型的无人机代理在6G网络中的自主性

Mohamed Amine Ferrag, Abderrahmane Lakas, Merouane Debbah

机构 * Department of Computer and Network Engineering, College of Information Technology, United Arab Emirates University(计算机与网络工程系,信息科技学院,阿联酋大学) Khalifa University of Science and Technology(科技大学)

专题命中 Agent评测 :agent(abstract);tool use(abstract);agentic(abstract);分类 cs.AI

AI总结 本文提出$α^3$-Bench,用于评估基于LLM的无人机代理在6G网络中的安全性、鲁棒性和效率,通过多轮对话推理和控制问题测试其性能。

Comments 20 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03286 2026-01-08 cs.CV cs.AI cs.CL cs.LG 75%

HyperCLOVA X 32B Think

NAVER Cloud HyperCLOVA X Team

机构 * NAVER Cloud HyperCLOVA X Team(NAVER云HyperCLOVA X团队)

专题命中 Agent评测 :agent(abstract);agentic(abstract);分类 cs.AI、cs.CL、cs.LG

Comments Technical Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20118 2026-01-08 cs.CL cs.CR 74%

TrojanStego: Your Language Model Can Secretly Be A Steganographic Privacy Leaking Agent

TrojanStego: 你的语言模型可能 secretly 成为一个隐写术隐私泄露代理

Dominik Meier, Jan Philip Wahle, Paul Röttger, Terry Ruas, Bela Gipp

机构 * University of Göttingen(哥廷根大学) LKA NRW(北莱茵-威斯特法伦州检察署) Bocconi University(博科尼大学)

专题命中 Agent评测 :agent(title);分类 cs.CL

AI总结 TrojanStego通过语言隐写术在LLM输出中隐秘泄露敏感信息,展示了一种新型被动且危险的LLM数据外泄攻击方式。

Comments 9 pages, 5 figures To be presented in the Conference on Empirical Methods in Natural Language Processing, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03540 2026-01-08 cs.CL 70%

DeepSynth-Eval: Objectively Evaluating Information Consolidation in Deep Survey Writing

DeepSynth-Eval: 从客观角度评估深度调研写作中的信息整合

Hongzhi Zhang, Yuanze Hu, Tinghai Zhang, Jia Fu, Tao Wang, Junwei Jing, Zhaoxin Fan, Qi Wang, Ruiming Tang, Han Li, Guorui Zhou, Kun Gai

机构 * Kuaishou Technology(快手科技) Beijing Advanced Innovation Center for Future Blockchain and Privacy Computing(北京未来区块链与隐私计算先进创新中心)

专题命中 Agent评测 :autonomous agent(abstract);agentic(abstract);分类 cs.CL

AI总结 DeepSynth-Eval通过客观评估信息整合能力,揭示了深度调研写作中整合碎片信息的挑战,并证明代理计划与写作流程在提升报告质量方面优于单一生成方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03023 2026-01-08 cs.CL cs.HC 70%

MedDialogRubrics: A Comprehensive Benchmark and Evaluation Framework for Multi-turn Medical Consultations in Large Language Models

MedDialogRubrics: 一种用于大型语言模型多轮医疗咨询的综合基准和评估框架

Lecheng Gong, Weimin Fang, Ting Yang, Dongjie Tao, Chunxiao Guo, Peng Wei, Bo Xie, Jinqun Guan, Zixiao Chen, Fang Shi, Jinjie Gu, Junwei Liu

机构 * Ant Group(蚂蚁集团)

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.CL

AI总结 MedDialogRubrics提出了一种用于评估大型语言模型多轮医疗对话能力的综合基准和评估框架,通过合成患者案例和细粒度评估 rubrics,揭示了当前模型在医疗对话管理方面的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏