arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2025-12-30 至 2025-12-30 共收录 26 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. Agent评测 26 篇

2512.22529 2025-12-30 cs.AI cond-mat.mtrl-sci 86%

Multi-AI Agent Framework Reveals the "Oxide Gatekeeper" in Aluminum Nanoparticle Oxidation

多AI代理框架揭示铝纳米颗粒氧化的'氧化守门人'

Yiming Lu, Tingyu Lu, Di Zhang, Lili Ye, Hao Li

专题命中 Agent评测 :AI agent(title,abstract);agent(title);分类 cs.AI

AI总结 本文提出多AI代理框架,揭示铝纳米颗粒氧化的'氧化守门人'机制,解决氧化过程中的质量传输问题,建立统一的原子尺度设计框架。

Comments 21 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22200 2025-12-30 cs.LG 79%

Emotion-Inspired Learning Signals (EILS): A Homeostatic Framework for Adaptive Autonomous Agents

情感启发学习信号(EILS):一种适应性自主代理的稳态框架

Dhruv Tiwari

机构 * Department of Computer Science(计算机科学系) Lovely Professional University(洛丽专业大学)

专题命中 Agent评测 :autonomous agent(title);agent(abstract);分类 cs.LG

AI总结 EILS通过引入生物启发的情感信号,提升智能体在非平稳环境中的适应性和样本效率。

Comments 7 pages, 3 figures. arXiv preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.00592 2025-12-30 cs.PL cs.DC cs.LG cs.PF 79%

Agentic Auto-Scheduling: An Experimental Study of LLM-Guided Loop Optimization

代理自调度:LLM引导循环优化的实验研究

Massinissa Merouani, Islem Kara Bernou, Riyadh Baghdadi

机构 * New York University Abu Dhabi(纽约大学阿布扎比分校)

专题命中 Agent评测 :agentic(title,abstract);分类 cs.LG

AI总结 本文提出ComPilot框架,利用LLM与编译器闭环交互实现代码优化,实验表明其在循环优化中效果优于现有方法。

Comments Accepted at the 34th International Conference on Parallel Architectures and Compilation Techniques (PACT 2025). 12 pages, plus appendix

Journal ref 2025 34th International Conference on Parallel Architectures and Compilation Techniques (PACT)

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.00336 2025-12-30 cs.RO cs.AI 79%

Never-Ending Behavior-Cloning Agent for Robotic Manipulation

永不终止的行为克隆代理用于机器人操作

Wenqi Liang, Gan Sun, Yao He, Yu Ren, Jiahua Dong, Yang Cong

机构 * State Key Laboratory of Robotics, Shenyang Institute of Automation, Chinese Academy of Sciences(机器人国家重点实验室,沈阳自动化研究所,中国科学院) University of Chinese Academy of Sciences(中国科学院大学) School of Automation Science and Engineering, South China University of Technology(自动化科学与工程学院,华南理工大学) Mohamed bin Zayed University of Artificial Intelligence(马斯达尔大学人工智能学院)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI

AI总结 本文提出NBAgent,通过持续学习技能共享和特定属性,解决具身机器人中3D场景表示和人类水平任务学习的挑战。

Comments 17 pages, 6 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.09602 2025-12-30 physics.flu-dyn cs.AI cs.CL 73%

Fine-tuning a Large Language Model for Automating Computational Fluid Dynamics Simulations

针对计算流体力学模拟的大型语言模型微调

Zhehao Dong, Zhen Lu, Yue Yang

机构 * State Key Laboratory for Turbulence and Complex Systems, College of Engineering, Peking University, Beijing 100871, China(湍流与复杂系统国家重点实验室,工程学院,北京大学,北京100871,中国) HEDPS-CAPT, Peking University, Beijing 100871, China(HEDPS-CAPT,北京大学,北京100871,中国)

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.AI、cs.CL

AI总结 通过微调领域特定LLM,实现从自然语言到CFD模拟配置的自动化,提升复杂工程流程的效率和准确性。

Journal ref Theor. Appl. Mech. Lett. 15, 100594 (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23508 2025-12-30 cs.AI cs.GT 70%

Why AI Safety Requires Uncertainty, Incomplete Preferences, and Non-Archimedean Utilities

为何人工智能安全需要不确定性、不完全偏好和非阿基米德效用

Alessio Benavoli, Alessandro Facchini, Marco Zaffalon

机构 * School of Computer Science and Statistics, Trinity College Dublin(特里尼蒂大学计算机科学与统计学学院) Trinity Quantum Alliance, Trinity College Dublin(特里尼蒂量子联盟) Management in Networked and Digital Societies (MINDS) Department, Kozminski University(科津斯基大学网络化与数字化社会管理系)

专题命中 Agent评测 :agent(abstract);AI agent(abstract);分类 cs.AI

AI总结 本文探讨了人工智能安全需通过不确定性推理、不完全偏好处理和非阿基米德效用机制来实现

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22860 2025-12-30 cs.CR cs.LG cs.MA 70%

Adaptive Trust Consensus for Blockchain IoT: Comparing RL, DRL, and MARL Against Naive, Collusive, Adaptive, Byzantine, and Sleeper Attacks

区块链物联网中的自适应信任共识:比较强化学习、深度强化学习和多智能体强化学习与 naive、collusive、adaptive、Byzantine 和 sleeper 攻击

Soham Padia, Dhananjay Vaidya, Ramchandra Mangrulkar

机构 * Artificial Intelligence Northeastern University(人工智能东北大学) Information Technology Dwarkadas J. Sanghvi College of Engineering(信息技术达沃拉吉·桑格维工程学院)

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.LG

AI总结 本文通过比较RL、DRL和MARL在区块链物联网中对抗不同攻击的效果,发现MARL在对抗攻击中表现最佳,而所有智能体均能抵御Byzantine攻击,但时间延迟污染攻击对所有智能体均造成严重威胁。

Comments 34 pages, 19 figures, 10 tables. Code available at https://github.com/soham-padia/blockchain-iot-trust

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22404 2025-12-30 cs.HC cs.SE 70%

Mining the Gold: Student-AI Chat Logs as Rich Sources for Automated Knowledge Gap Detection

挖掘黄金:学生与AI聊天记录作为自动识别知识缺口的丰富来源

Quanzhi Fu, Qiyu Wu, Dan Williams

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.SE

AI总结 QueryQuilt通过分析学生与AI的聊天记录,自动检测大规模讲座中的知识缺口,提升教学效率。

Comments 6 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22154 2025-12-30 cs.CR cs.AI cs.MA 70%

Practical challenges of control monitoring in frontier AI deployments

前沿AI部署中的控制监控实际挑战

David Lindner, Charlie Griffin, Tomek Korbak, Roland S. Zimmermann, Geoffrey Irving, Sebastian Farquhar, Alan Cooney

专题命中 Agent评测 :agent(abstract);AI agent(abstract);分类 cs.AI

AI总结 本文探讨了前沿AI部署中控制监控面临的实际挑战,分析了同步、半同步和异步监控方案,并通过案例研究探讨了监督、延迟和恢复等关键问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.15044 2025-12-30 eess.SP 67%

Signal Whisperers: Enhancing Wireless Reception Using DRL-Guided Reflector Arrays

信号窃听者:利用DRL引导的反射阵列增强无线接收

Hieu Le, Oguz Bedir, Mostafa Ibrahim, Jian Tao, Sabit Ekin

专题命中 Agent评测 :agent(abstract);multi-agent(abstract)

AI总结 本文提出基于DRL的反射阵列控制方法,通过多智能体强化学习提升非视线场景下的无线信号接收性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22721 2025-12-30 cs.NI cs.GT 67%

Cyber Resilience in Next-Generation Networks: Threat Landscape, Theoretical Foundations, and Design Paradigms

下一代网络中的网络韧性:威胁图景、理论基础与设计范式

Junaid Farooq, Quanyan Zhu

专题命中 Agent评测 :agent(abstract);multi-agent(abstract)

AI总结 本书探讨下一代网络中网络韧性的重新概念化与工程化,通过零信任架构、博弈论威胁建模和AI技术,应对复杂威胁挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22218 2025-12-30 cs.CV cs.MM 67%

Towards Signboard-Oriented Visual Question Answering: ViSignVQA Dataset, Method and Benchmark

面向路牌的视觉问答:ViSignVQA数据集、方法与基准

Hieu Minh Nguyen, Tam Le-Thanh Dang, Kiet Van Nguyen

机构 * University of Information Technology, Ho Chi Minh City, Vietnam(胡志明市信息技术大学) Vietnam National University(越南国家大学)

专题命中 Agent评测 :agent(abstract);multi-agent(abstract)

AI总结 ViSignVQA首次提出大规模越南语路牌多模态数据集,结合OCR与预训练语言模型,提升低资源语言VQA性能。

Comments Dataset paper; code and data will be released

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.05407 2025-12-30 cs.LG cs.AI stat.ML 62%

Dictionary Learning: The Complexity of Learning Sparse Superposed Features with Feedback

字典学习:通过反馈学习稀疏叠加特征的复杂性

Akash Kumar

机构 * Department of Computer Science \& Engineering, University of California, San Diego, USA

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG

AI总结 通过反馈机制,研究在稀疏设置下学习字典特征的复杂性,并验证了理论结果在特征恢复和字典提取中的有效性。

Comments ICML'25, 35 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23440 2025-12-30 cs.CL 57%

ClinDEF: A Dynamic Evaluation Framework for Large Language Models in Clinical Reasoning

ClinDEF: 一种用于大语言模型临床推理的动态评估框架

Yuqi Tang, Jing Yu, Zichang Su, Kehua Feng, Zhihui Zhu, Libin Wang, Lei Liang, Qiang Zhang, Keyan Ding, Huajun Chen

机构 * ZJU-Hangzhou Global Scientific and Technological Innovation Center, Zhejiang University(浙江大学杭州全球科技创新中心) ZJU-UIUC Institute, Zhejiang University(浙江大学UIUC研究院) College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院) The Polytechnic Institute, Zhejiang University(浙江大学 polytechnic 院) AntGroup(蚂蚁集团)

专题命中 Agent评测 :agent(abstract);分类 cs.CL

AI总结 ClinDEF通过模拟诊断对话评估大语言模型的临床推理能力,利用疾病知识图谱生成病例并进行多轮交互,提供细粒度效率分析和诊断质量评估,揭示LLM在临床推理中的关键不足。

Comments 23 pages, 4 figures, under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23312 2025-12-30 cs.RO cs.AI 57%

Explainable Neural Inverse Kinematics for Obstacle-Aware Robotic Manipulation: A Comparative Analysis of IKNet Variants

可解释的神经逆向运动学用于障碍物感知的机器人操作:对IKNet变体的比较分析

Sheng-Kai Chen, Yi-Ling Tsai, Chun-Chih Chang, Yan-Chen Chen, Po-Chiang Lin

专题命中 Agent评测 :workflow(abstract);分类 cs.AI

AI总结 本研究提出了一种可解释性工作流程,通过Shapley值归因和物理障碍规避评估,改进IKNet变体以提升机器人操作的透明性和安全性。

Comments 27 pages, 16 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23217 2025-12-30 cs.AI 57%

TCEval: Using Thermal Comfort to Assess Cognitive and Perceptual Abilities of AI

TCEval:利用热舒适性评估人工智能的认知与感知能力

Jingming Li

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 TCEval通过热舒适性场景评估AI的跨模态推理、因果关联和适应性决策能力,揭示当前LLM在热舒适性领域存在基础推理能力但缺乏精确因果理解。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21420 2025-12-30 cs.AI 57%

Feasible strategies in three-way conflict analysis with three-valued ratings

三值评分下的三方面冲突分析可行策略

Jing Liu, Mengjun Hu, Guangming Lang

机构 * School of Mathematics and Statistics, Changsha University of Science and Technology(数学与统计学学院,长沙理工大学) Hunan Provincial Key Laboratory of Mathematical Modeling and Analysis in Engineering(湖南省工程数学建模与分析重点实验室)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 本文提出基于一致性和不一致性度量的三值评分冲突分析方法,通过计算代理团评分和加权度量,系统识别可行策略和最优解,优于现有方法。

Journal ref International Journal of Approximate Reasoning 185, 109516, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23702 2025-12-30 quant-ph gr-qc 50%

The operational no-signalling constraints and their implications

可操作的无信号约束及其影响

Michał Eckstein, Tomasz Miller, Ryszard Horodecki, Ravishankar Ramanathan, Paweł Horodecki

专题命中 Agent评测 :agent(abstract)

AI总结 本文提出了一种统一框架,研究相对论时空中的非局部和时间相关性,探讨了无信号约束的违反及其对因果循环和超光速信号的反驳。

Comments Comments are welcome!

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23373 2025-12-30 cs.CY 50%

Identifying Barriers Hindering the Acceptance of Generative AI as a Work Associate, measured with the new AGAWA scale

识别阻碍生成式人工智能作为工作同事接受度的障碍,使用新的AGAWA量表

Łukasz Sikorski, Albert Łukasik, Jacek Matulewski, Arkadiusz Gut

专题命中 Agent评测 :agent(abstract)

AI总结 本文提出AGAWA量表,用于测量学生对生成式人工智能作为工作同事的态度,发现积极态度与三个因素呈负相关,且因素间呈正相关,揭示了信任与职场AI态度的关系。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23219 2025-12-30 cs.CV 50%

MM-UAVBench: How Well Do Multimodal Large Language Models See, Think, and Plan in Low-Altitude UAV Scenarios?

MM-UAVBench: 多模态大语言模型在低空无人机场景中的感知、推理与规划能力如何?

Shiqi Dai, Zizhi Ma, Zhicong Luo, Xuesong Yang, Yibin Huang, Wanyue Zhang, Chi Chen, Zonghao Guo, Wang Xu, Yufei Sun, Maosong Sun

机构 * Tsinghua University(清华大学) Nankai University(南开大学) Northwest Polytechnical University(西北工业大学) Chinese Academy of Sciences(中国科学院) Harbin Institute of Technology(哈尔滨工业大学)

专题命中 Agent评测 :planning(abstract)

AI总结 MM-UAVBench通过系统评估多模态大语言模型在低空无人机场景中的感知、推理与规划能力,揭示其在复杂任务中的性能瓶颈与改进方向。

Comments 25 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23115 2025-12-30 math.OC 50%

The Design of Optimal Dependency and Rewards

最优依赖与报酬的设计

Eilon Solan, Avraham Tabbach, Chang Zhao

专题命中 Agent评测 :agent(abstract)

AI总结 本文研究了在两期委托-代理模型中,预算约束下通过最优报酬方案和成本相关结构设计提升代理表现的机制,发现低预算时应采用充分表现目标,高预算时应采用持续表现目标,负成本相关性在两者中均有益。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22873 2025-12-30 cs.GT 50%

Facility Location Games for Multi-Location Agents with Satisfaction

多地点代理的设施选址游戏

Huanjun Wang, Qizhi Fang, Wenjing Liu

专题命中 Agent评测 :agent(abstract)

AI总结 本文研究了多地点代理的设施选址游戏,设计了群体策略证明机制以最大化满足度总和或最小值,同时保证代理真实报告位置。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.03318 2025-12-30 math.OC math.PR 50%

Linear-quadratic optimal control for non-exchangeable mean-field SDEs and applications to systemic risk

线性二次最优控制用于非交换型均场随机微分方程及其在系统风险中的应用

Anna de Crescenzo, Filippo de Feo, Huyên Pham

专题命中 Agent评测 :agent(abstract)

AI总结 本文提出了一种用于非交换型均场随机微分方程的线性二次最优控制方法,并应用于系统风险模型,探讨了代理人异质性对风险缓解策略的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22475 2025-12-30 cs.DS cs.GT 50%

Beyond Exact Fairness: Envy-Free Incomplete Connected Fair Division

超越精确公平:无嫉妒不完全连通公平分配

Ajaykrishnan E S, Daniel Lokshtanov

专题命中 Agent评测 :agent(abstract)

AI总结 本文提出了一种高效参数化近似方案,解决无嫉妒不完全连通公平分配问题,在容忍轻微嫉妒的情况下实现高效计算。

Comments Published at FSTTCS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22269 2025-12-30 cond-mat.mtrl-sci physics.app-ph physics.chem-ph 50%

Toward reducing the formation temperature of diopside via wet-chemical synthesis routes using chloride precursors

通过使用氯化前驱体的湿化学合成路线降低斜方辉石的形成温度

N. Namvar, E. Salahinejad, A. Saberi, M. J. Baghjeghaz, L. Tayebi, D. Vashaee

专题命中 Agent评测 :agent(abstract)

AI总结 本研究通过使用氯化前驱体的湿化学合成路线,探索了降低斜方辉石形成温度的方法,比较了不同合成工艺对晶体结构和均匀性的影响,发现共沉淀法能有效在低温下制备纳米斜方辉石。

Journal ref Ceramics International, 43 (2017) 13781-13785

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04279 2025-12-30 cs.RO 50%

Driving Beyond Privilege: Distilling Dense-Reward Knowledge into Sparse-Reward Policies

超越特权:将密集奖励知识蒸馏到稀疏奖励策略中

Feeza Khan Khanzada, Jaerock Kwon

机构 * Department of Electrical and Computer Engineering, University of Michigan-Dearborn(电气与计算机工程系,密歇根大学迪尔伯恩分校)

专题命中 Agent评测 :agent(abstract)

AI总结 本文提出通过密集奖励蒸馏学习稀疏奖励策略,提升自动驾驶在稀疏目标上的泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏