arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2025-11-26 至 2025-11-26 共收录 95 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 工作流自动化 14 篇

2511.18915 2025-11-26 cond-mat.mtrl-sci 50%

Device-Scale Atomistic Simulations of Heat Transport in Advanced Field-Effect Transistors

器件级原子模拟用于先进场效应晶体管中热量传输

Ke Xu, Gang Wang, Ting Liang, Yang Xiao, Dongliang Ding, Haichang Guo, Xiang Gao, Lei Tong, Xi Wan, Gang Zhang, Jianbin Xu

专题命中 工作流自动化 :workflow(abstract)

AI总结 NEP-FET通过结合近量子力学精度与高吞吐量,实现先进场效应晶体管中热量传输的高保真度模拟。

Comments 10 pages, 4 figures, 46 conferences

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.11879 2025-11-26 physics.gen-ph 50%

Classical timing noise in gravity-mediated entanglement tests: LOCC structure, metrological bounds, and visibility thresholds

重力介导纠缠测试中的经典时间噪声:LOCC结构、计量界限与可见性阈值

Yaghmorassene Hebib

专题命中 工作流自动化 :workflow(abstract)

AI总结 本文研究了重力介导纠缠测试中的经典时间噪声,推导了共同模式去相位率与钟交叉谱的关系,并分析了LOCC结构对纠缠生成的影响,同时提出了可见性与Bell-CHSH阈值的校准方法。

Comments 13 pages, 3 figures. Includes Supplemental Material

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.20614 2025-11-26 physics.flu-dyn 50%

Performance of an open-source image-based history matching framework for CO$_2$ storage

开源图像基历史匹配框架在二氧化碳储存中的性能

David Landa-Marbán, Tor Harald Sandve, Jakub Wiktor Both, Jan Martin Nordbotten, Sarah Eileen Gasda

专题命中 工作流自动化 :workflow(abstract)

AI总结 本研究评估了开源图像基历史匹配框架在二氧化碳储存模拟中的性能,利用高分辨率图像和Wasserstein距离提升多相流模拟的准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.23150 2025-11-26 cs.CV 50%

AlignCVC: Aligning Cross-View Consistency for Single-Image-to-3D Generation

AlignCVC: 为单图像到3D生成对齐跨视图一致性

Xinyue Liang, Zhiyuan Ma, Lingchen Sun, Yanjun Guo, Lei Zhang

专题命中 工作流自动化 :workflow(abstract)

AI总结 AlignCVC通过分布对齐而非回归损失,提升单图像到3D生成的跨视图一致性与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19467 2025-11-26 astro-ph.IM astro-ph.EP astro-ph.SR 50%

Measuring Cometary Nuclei Behind Bright Comae: PSF Delta Decomposition with Bicubic Resampling and an Application to Interstellar Comet 3I/ATLAS C/2025 N1

测量彗核背后明亮彗云:通过双三次重采样和PSF Delta分解方法,应用于星际彗星3I/ATLAS C/2025 N1

Toni Scarmato

专题命中 工作流自动化 :workflow(abstract)

AI总结 本文提出一种通过双三次重采样和PSF Delta分解方法测量彗核尺寸的技术,应用于星际彗星3I/ATLAS,获得核半径范围并符合HST上限。

Comments 4 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 软件智能体 2 篇

2511.19635 2025-11-26 cs.SE cs.LG 82%

Agint: Agentic Graph Compilation for Software Engineering Agents

Agint:软件工程代理的代理图编译

Abhi Chivukula, Jay Somasundaram, Vijay Somasundaram

专题命中 软件智能体 :agentic(title,abstract);分类 cs.LG、cs.SE

AI总结 Agint通过代理图编译器和运行时实现高效、可靠的软件工程代理,支持自然语言到代码的自动化转换与协作开发。

Comments 18 pages, 5 figures, NeurIPS 2025: Deep Learning for Code in the Agentic Era

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.16786 2025-11-26 cs.SE cs.AI cs.LG 67%

More with Less: An Empirical Study of Turn-Control Strategies for Efficient Coding Agents

更多但更少:一种关于高效编码代理的实证研究:回合控制策略

Pengfei Gao, Chao Peng

机构 * ByteDance(字节跳动)

专题命中 软件智能体 :agent(abstract);分类 cs.AI、cs.LG、cs.SE

AI总结 本文通过实证研究分析了编码代理的回合控制策略,发现动态资源分配在成本和效率之间取得平衡,优于固定回合限制方法。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. GUI与网页智能体 7 篇

2511.19663 2025-11-26 cs.AI cs.CL cs.CV 81%

Fara-7B: An Efficient Agentic Model for Computer Use

Fara-7B:一种高效的计算机使用代理模型

Ahmed Awadallah, Yash Lara, Raghav Magazine, Hussein Mozannar, Akshay Nambi, Yash Pandya, Aravind Rajeswaran, Corby Rosset, Alexey Taymanov, Vibhav Vineet, Spencer Whitehead, Andrew Zhao

专题命中 GUI与网页智能体 :agentic(title,abstract);分类 cs.AI、cs.CL

AI总结 Fara-7B通过合成数据生成系统训练出高效计算机使用代理模型,优于现有模型并在新基准测试中表现突出。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19947 2025-11-26 cs.IT eess.SP math.IT 78%

Towards Edge General Intelligence: Knowledge Distillation for Mobile Agentic AI

迈向边缘泛智能:面向移动代理AI的知识蒸馏

Yuxuan Wu, Linghan Ma, Ruichen Zhang, Yinqiu Liu, Dusit Niyato, Shunpu Tang, Zehui Xiong, Zhu Han, Zhaohui Yang, Kaibin Huang, Zhaoyang Zhang, Kai-Kit Wong

专题命中 GUI与网页智能体 :agentic(title,abstract)

AI总结 本文探讨了将知识蒸馏整合到边缘泛智能中的方法,旨在提升移动边缘计算中智能代理的效率与可扩展性。

Comments 21 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17532 2025-11-26 cs.NI cs.AI 57%

Denoising Refinement Diffusion Models for Simultaneous Generation of Multi-scale Mobile Network Traffic

去噪细化扩散模型用于多尺度移动网络流量的同时生成

Xiaoqian Qi, Haoye Chai, Sichang Liu, Lei Yue, Raoyuan Pan, Yue Wang, Yong Li

机构 * Department of Electronic Engineering, BNRist, Tsinghua University(电子工程系,北京理工大学,清华大学) State Key Laboratory of Networking and Switching Technology, Beijing University of Posts and Telecommunications(网络与交换技术国家重点实验室,北京邮电大学) China Mobile Communications Group Guangxi Co., Ltd.(中国移动通信集团广西有限公司)

专题命中 GUI与网页智能体 :planning(abstract);分类 cs.AI

AI总结 ZoomDiff通过多阶段去噪细化扩散模型实现多尺度移动网络流量的同时生成,提升了流量预测的准确性和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19477 2025-11-26 cs.SE 57%

Building Browser Agents: Architecture, Security, and Practical Solutions

构建浏览器代理:架构、安全与实用解决方案

Aram Vardanyan

专题命中 GUI与网页智能体 :agent(abstract);分类 cs.SE

AI总结 本文提出通过专用工具和编程约束构建安全浏览器代理,实现85%的成功率。

Comments 30 pages, 22 figures. Production architecture and benchmark evaluation of browser agents

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12937 2025-11-26 cs.AI cs.CV 57%

Yanyun-3: Enabling Cross-Platform Strategy Game Operation with Vision-Language Models

Yanyun-3: 通过视觉-语言模型实现跨平台战略游戏操作

Guoyan Wang, Yanyan Huang, Chunlin Chen, Lifeng Wang, Yuxiang Sun

专题命中 GUI与网页智能体 :agent(abstract);分类 cs.AI

AI总结 Yanyun-3通过整合视觉-语言模型和结构化多模态数据组织,实现了跨平台战略游戏操作的自动化,提升了任务执行效率和泛化能力。

Comments 32 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19880 2025-11-26 cs.DC cs.DS cs.MA cs.RO 50%

Improved Linear-Time Construction of Minimal Dominating Set via Mobile Agents

通过移动代理实现最小支配集的线性时间构造改进

Prabhat Kumar Chand, Anisur Rahaman Molla

机构 * Indian Statistical Institute(印度统计研究院)

专题命中 GUI与网页智能体 :agent(abstract)

AI总结 本文提出通过移动代理在同步环境下以线性时间构造最小支配集,并在此过程中构建生成树和选举领导者。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19451 2025-11-26 eess.SY cs.RO cs.SY 50%

Strong Duality and Dual Ascent Approach to Continuous-Time Chance-Constrained Stochastic Optimal Control

强对偶性与双上升方法在连续时间机会约束随机最优控制中的应用

Apurva Patil, Alfredo Duarte, Fabrizio Bisetti, Takashi Tanaka

机构 * Walker Department of Mechanical Engineering, University of Texas at Austin(德克萨斯大学奥斯汀分校机械工程系)

专题命中 GUI与网页智能体 :planning(abstract)

AI总结 本文提出了一种基于强对偶性的方法,用于求解连续时间机会约束随机最优控制问题,通过路径积分方法和梯度上升解决对偶问题,并验证了其在移动机器人导航中的有效性。

Comments arXiv admin note: substantial text overlap with arXiv:2504.17154

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 记忆与上下文管理 4 篇

2511.20066 2025-11-26 cs.LG 57%

SOMBRL: Scalable and Optimistic Model-Based RL

SOMBRL: 可扩展且乐观的基于模型的强化学习

Bhavya Sukhija, Lenart Treven, Carmelo Sferrazza, Florian Dörfler, Pieter Abbeel, Andreas Krause

专题命中 记忆与上下文管理 :agent(abstract);分类 cs.LG

AI总结 SOMBRL通过结合乐观性原则和不确定性建模,实现了在非线性动力学中具有亚线性遗憾的可扩展基于模型的强化学习方法,并在多个环境中展示了优越的探索性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20552 2025-11-26 eess.SY cs.SY 50%

From Features to States: Data-Driven Selection of Measured State Variables via RFE-DMDc

从特征到状态:通过RFE-DMDc进行数据驱动的测量状态变量选择

Haoyu Wang, Andrea Alfonsi, Roberto Ponciroli, Richard Vilim

专题命中 记忆与上下文管理 :workflow(abstract)

AI总结 本文提出RFE-DMDc方法,通过递归特征消除和动态模式分解,实现数据驱动的状态变量选择,提高模型预测精度和计算效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18664 2025-11-26 econ.GN q-fin.EC 50%

Clarifying Trinko as Precedent in EHR and AI Memory Duty to Deal Cases: A New Institutional Economics Approach

澄清Trinko在电子健康记录和AI记忆义务案件中的先例地位:一种新的制度经济学方法

Lawrence W. Abrams

专题命中 记忆与上下文管理 :agentic(abstract)

AI总结 本文通过制度经济学方法澄清Trinko案在电子健康记录和AI记忆义务案件中的先例地位,旨在减少引用错误并提高法律适用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19520 2025-11-26 physics.bio-ph cs.NE q-bio.NC 50%

Modeling Bioelectric State Transitions in Glial Cells: An ASAL-Inspired Computational Approach to Glioblastoma Initiation

胶质细胞生物电状态转换建模:一种受ASAL启发的计算方法用于胶母瘤发生

Wiktoria Agata Pawlak

专题命中 记忆与上下文管理 :agent(abstract)

AI总结 本文提出了一种基于代理的计算方法,通过模拟胶质细胞生物电状态转换,揭示线粒体功能障碍和生物电信号破坏在胶母瘤发生中的作用。

Comments Thesis preprint. arXiv category: cs.NE

详情

展开后加载摘要…

URL PDF HTML 收藏

5. Agent评测 16 篇

2511.19930 2025-11-26 cs.GT cs.CY cs.LG 88%

Designing Reputation Systems for Manufacturing Data Trading Markets: A Multi-Agent Evaluation with Q-Learning and IRL-Estimated Utilities

为制造数据交易市场设计声誉系统:基于Q学习和IRL估计效用的多智能体评估

Kenta Yamamoto, Teruaki Hayashi

机构 * Department of Systems Innovation, Graduate School of Engineering, The University of Tokyo Tokyo, Japan(系统创新部门,工学研究生院,东京大学东京,日本)

专题命中 Agent评测 :agent(title,abstract);multi-agent(title,abstract);分类 cs.LG

AI总结 本研究通过多智能体模拟器评估了五种声誉系统,发现PeerTrust在数据价格与质量一致性及防止垄断方面表现最佳,并提出混合声誉机制提升市场稳定性。

Comments 10 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19874 2025-11-26 cs.CR cs.AI cs.LG 87%

Cross-LLM Generalization of Behavioral Backdoor Detection in AI Agent Supply Chains

人工智能代理供应链中行为后门检测的跨LLM泛化

Arun Chowdary Sanna

机构 * Arun Chowdary Sanna(独立研究者)

专题命中 Agent评测 :AI agent(title,abstract);agent(title);分类 cs.AI、cs.LG

AI总结 本研究首次系统探讨了跨LLM行为后门检测的泛化问题,发现模型特定特征导致泛化差距,并提出模型感知检测方法提升检测准确率。

Comments 10 pages, 2 figures, 8 tables. Evaluation across 6 production LLMs with 1,198 traces

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15097 2025-11-26 cs.CR cs.AI 83%

MAIF: Enforcing AI Trust and Provenance with an Artifact-Centric Agentic Paradigm

MAIF:基于 artifacts 的代理范式强化 AI 可信度与溯源

Vineeth Sai Narajala, Manish Bhatt, Idan Habler, Ronald F. Del Rosario, Ads Dawson

机构 * Security Researcher Cisco(安全研究员 希思科) Researcher OWASP/Project Kuiper Security(研究员 OWASP/项目 Kuiper 安全) Adversarial AI Security Research Cisco(对抗性AI安全研究 希思科)

专题命中 Agent评测 :agentic(title);agent(abstract);AI agent(abstract);分类 cs.AI

AI总结 MAIF 通过以 artifacts 为中心的代理范式,解决 AI 的可信度、安全性和问责问题,实现数据的主动信任执行和高效处理。

Comments 7 Pages, 2 Figures, 6 Tables, Repo: https://github.com/vineethsai/maifscratch-1, Added additional Author and fixed Citations

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20490 2025-11-26 cs.LG cs.AI 82%

MTBBench: A Multimodal Sequential Clinical Decision-Making Benchmark in Oncology

MTBBench: 一个用于肿瘤学的多模态序列临床决策制定基准

Kiril Vasilev, Alexandre Misrahi, Eeshaan Jain, Phil F Cheng, Petros Liakopoulos, Olivier Michielin, Michael Moor, Charlotte Bunne

机构 * ETH Zürich(苏黎世联邦理工学院) EPFL(洛桑联邦理工学院) HUG

专题命中 Agent评测 :agent(abstract);tool-use(abstract);agentic(abstract);multi-agent(abstract)

AI总结 MTBBench通过模拟分子肿瘤委员会的决策流程,提出一个多模态、纵向的肿瘤学基准测试,评估LLMs在复杂临床任务中的表现并提升其推理与可靠性。

Comments Accepted to NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.11979 2025-11-26 cs.CL cs.MA 79%

Value-Based Large Language Model Agent Simulation for Mutual Evaluation of Trust and Interpersonal Closeness

基于价值的大型语言模型代理模拟用于信任和人际亲密的相互评估

Yuki Sakamoto, Takahisa Uchida, Hiroshi Ishiguro

机构 * The University of Osaka, Graduate School of Engineering Science(大阪大学工学科学研究院)

专题命中 Agent评测 :agent(title,abstract);分类 cs.CL

AI总结 本研究通过模拟LLM代理,探讨价值相似性对信任和人际亲密的影响,验证了人工社会中价值观对关系建立的作用。

Journal ref Scientific Reports volume 15, Article number: 41653 (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19536 2025-11-26 cs.CR cs.AI 77%

AttackPilot: Autonomous Inference Attacks Against ML Services With LLM-Based Agents

AttackPilot: 基于大语言模型的自主推断攻击对抗ML服务

Yixin Wu, Rui Wen, Chi Cui, Michael Backes, Yang Zhang

机构 * CISPA Helmholtz Center for Information Security(CISPA 欧洲信息安全中心) Institute of Science Tokyo(东京科学研究所)

专题命中 Agent评测 :agent(abstract);autonomous agent(abstract);multi-agent(abstract);分类 cs.AI

AI总结 AttackPilot利用大语言模型开发自主代理,实现无需人工干预的推断攻击,展现高任务完成率和低成本,有效提升非专家对ML服务风险评估的能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.26536 2025-11-26 cs.CL cs.AI cs.CV cs.LG cs.RO 75%

OceanGym: A Benchmark Environment for Underwater Embodied Agents

OceanGym: 一个用于水下具身智能体的基准环境

Yida Xue, Mingjun Mao, Xiangyuan Ru, Yuqi Zhu, Baochang Ren, Shuofei Qiao, Mengru Wang, Shumin Deng, Xinyu An, Ningyu Zhang, Ying Chen, Huajun Chen

专题命中 Agent评测 :agent(abstract);planning(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 OceanGym通过多模态大语言模型构建首个水下具身智能体基准,揭示水下环境感知与规划的挑战,推动水下自主系统发展。

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19489 2025-11-26 cs.SE cs.AI 73%

Evolution without an Oracle: Driving Effective Evolution with LLM Judges

无Oracle的进化:通过LLM裁判驱动有效进化

Zhe Zhao, Yuheng Yang, Haibin Wen, Xiaojie Qiu, Zaixi Zhang, Qingfu Zhang

机构 * Stanford University(斯坦福大学) City University of Hong Kong(香港城市大学) Princeton University(普林斯顿大学)

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.AI、cs.SE

AI总结 本文提出MADE框架,通过问题规范减少LLM反馈噪声,实现无Oracle的进化优化,在软件需求满足和复杂指令跟随任务中取得显著成效。

Comments 14 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19492 2025-11-26 cs.CY cs.AI 70%

Forecasting AI Time Horizon Under Compute Slowdowns

在计算放缓下预测AI时间跨度

Parker Whitfill, Ben Snodin, Joel Becker

专题命中 Agent评测 :agent(abstract);AI agent(abstract);分类 cs.AI

AI总结 本文提出一个模型,预测在计算放缓情况下AI时间跨度的增长,发现时间跨度与计算能力成正比,并通过实验验证了这一理论。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18958 2025-11-26 cs.LG cs.AI 62%

Learning to Compress Graphs via Dual Agents for Consistent Topological Robustness Evaluation

通过双智能体学习压缩图以实现一致的拓扑鲁棒性评估

Qisen Chai, Yansong Wang, Junjie Huang, Tao Jia

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG

AI总结 Cutter通过双智能体强化学习框架,实现图压缩以保持拓扑结构和鲁棒性,提升评估效率和保真度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20614 2025-11-26 cs.CV 50%

The Consistency Critic: Correcting Inconsistencies in Generated Images via Reference-Guided Attentive Alignment

一致性批评者:通过参考引导的注意对齐纠正生成图像中的不一致

Ziheng Ouyang, Yiren Song, Yaoli Liu, Shihao Zhu, Qibin Hou, Ming-Ming Cheng, Mike Zheng Shou

机构 * VCIP, Nankai University Show Lab, National University of Singapore State Key Laboratory of CAD\&CG, Zhejiang University

专题命中 Agent评测 :agent(abstract)

AI总结 本文提出ImageCritic,通过参考引导的注意力对齐方法纠正生成图像中的不一致问题,提升细粒度细节的一致性。

Comments Project page: https://ouyangziheng.github.io/ImageCritic-Page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20573 2025-11-26 cs.CV 50%

VQ-VA World: Towards High-Quality Visual Question-Visual Answering

VQ-VA世界:迈向高质量的视觉问题-视觉回答

Chenhui Gou, Zilong Chen, Zeyu Wang, Feng Li, Deyao Zhu, Zicheng Duan, Kunchang Li, Chaorui Deng, Hongyi Yuan, Haoqi Fan, Cihang Xie, Jianfei Cai, Hamid Rezatofighi

专题命中 Agent评测 :agentic(abstract)

AI总结 VQ-VA World通过大规模数据构建框架提升开源模型的视觉问题-视觉回答能力,实现性能超越现有开源基线并接近专有系统水平。

详情

展开后加载摘要…

URL PDF HTML 收藏