arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

共收录 15756 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. Agent评测 15756 篇

2512.17066 2025-12-22 cs.AI 74%

Realistic threat perception drives intergroup conflict: A causal, dynamic analysis using generative-agent simulations

现实威胁感知驱动群体冲突:基于生成代理模拟的因果动态分析

Suhaib Abdurahman, Farzan Karimi-Malekabadi, Chenxiao Yu, Nour S. Kteily, Morteza Dehghani

专题命中 Agent评测 :agent(title);分类 cs.AI

AI总结 本文通过生成代理模拟研究现实威胁与象征威胁对群体冲突的因果影响,发现现实威胁直接提升敌意,而象征威胁的影响需通过群体内偏见中介,非敌对接触可缓解冲突升级。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.00591 2025-12-05 cs.CL 74%

Probe-Rewrite-Evaluate: A Workflow for Reliable Benchmarks and Quantifying Evaluation Awareness

探测-重写-评估:一种用于可靠基准和量化评估意识的工作流程

Lang Xiong, Nishant Bhargava, Jianhang Hong, Jeremy Chang, Haihao Liu, Vasu Sharma, Kevin Zhu

专题命中 Agent评测 :workflow(title);分类 cs.CL

AI总结 本研究提出探测-重写-评估工作流程,通过量化LLM在不同上下文中的行为变化,揭示评估意识对模型安全性和诚实性的影响,并展示更真实的评估框架的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.03138 2025-11-18 cs.AI 74%

DeepKnown-Guard: A Proprietary Model-Based Safety Response Framework for AI Agents

Qi Li, Jianjun Xu, Pingtao Wei, Jiu Li, Peiqiang Zhao, Jiwei Shi, Xuan Zhang, Yanhui Yang, Xiaodong Hui, Peng Xu, Wenqin Shao

机构 * Beijing Caizhi Tech(北京彩智科技)

专题命中 Agent评测 :AI agent(title);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.21244 2025-11-17 cs.AI 74%

VoiceAgentEval: A Dual-Dimensional Benchmark for Expert-Level Intelligent Voice-Agent Evaluation of Xbench's Professional-Aligned Series

Pengyu Xu, Shijia Li, Ao Sun, Feng Zhang, Yahan Li, Bo Wu, Zhanyu Ma, Jiguo Li, Jun Xu, Jiuchong Gao, Jinghua Hao, Renqing He, Rui Wang, Yang Liu, Xiaobo Hu, Fan Yang, Jia Zheng, Guanghua Yao

机构 * Meituan(美团) Xbench Agora Beijing Jiaotong University(北京交通大学) BUPT(北京邮电大学) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Jilin University(吉林大学) Peking University(北京大学)

专题命中 Agent评测 :agent(title);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.20930 2025-10-21 quant-ph cs.LG q-fin.CP 74%

Quantum Reinforcement Learning Trading Agent for Sector Rotation in the Taiwan Stock Market

Chi-Sheng Chen, Xinyu Zhang, Ya-Chuan Chen

机构 * Neuro Industry Research(神经产业研究) Neuro Industry, Inc.(神经产业公司) Department of Computer Science(计算机科学系) The University of Alabama(阿拉巴马大学) Industrial Technology Research Institute(工业技术研究 institutes)

专题命中 Agent评测 :agent(title);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.12033 2025-10-15 cs.AI 74%

CausalTrace: A Neurosymbolic Causal Analysis Agent for Smart Manufacturing

Chathurangi Shyalika, Aryaman Sharma, Fadi El Kalach, Utkarshani Jaimini, Cory Henson, Ramy Harik, Amit Sheth

机构 * University of South Carolina(南卡罗来纳大学)

专题命中 Agent评测 :agent(title);分类 cs.AI

Comments 8 pages, 4 figures, 3 tables, Accepted at AAAI 2026: IAAI - Innovative Applications of AI Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.18405 2025-09-24 cs.CV cs.AI 74%

Check Field Detection Agent (CFD-Agent) using Multimodal Large Language and Vision Language Models

Sourav Halder, Jinjun Tong, Xinyu Wu

机构 * U.S. Bank(美国银行)

专题命中 Agent评测 :agent(title);分类 cs.AI

Comments 12 pages, 5 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.09321 2025-09-12 cs.AI 74%

Towards Adaptive ML Benchmarks: Web-Agent-Driven Construction, Domain Expansion, and Metric Optimization

Hangyi Jia, Yuxi Qian, Hanwen Tong, Xinhui Wu, Lin Chen, Feng Wei

专题命中 Agent评测 :agent(title);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.16609 2025-08-26 physics.soc-ph cs.AI cs.CY cs.HC cs.RO 74%

Social Identity in Human-Agent Interaction: A Primer

Katie Seaborn

机构 * Institute of Science Tokyo(东京科学研究所) University of Cambridge(剑桥大学)

专题命中 Agent评测 :agent(title);分类 cs.AI

Comments 28 pages

Journal ref ACM Transactions on Human-Robot Interaction (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.12472 2025-08-19 cs.AI 74%

GALA: Can Graph-Augmented Large Language Model Agentic Workflows Elevate Root Cause Analysis?

Yifang Tian, Yaming Liu, Zichun Chong, Zihang Huang, Hans-Arno Jacobsen

机构 * University of Toronto(多伦多大学)

专题命中 Agent评测 :agentic(title);分类 cs.AI

Comments 12 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.11286 2025-08-18 cs.RO cs.AI cs.CV 74%

Scene Graph-Guided Proactive Replanning for Failure-Resilient Embodied Agent

Che Rin Yu, Daewon Chae, Dabin Seo, Sangwon Lee, Hyeongwoo Im, Jinkyu Kim

机构 * Korea University(韩国大学) KT (Korea Telecom) R&D Center(KT(韩国电信)研发中心)

专题命中 Agent评测 :agent(title);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.22326 2025-07-31 cs.AI 74%

An Explainable Emotion Alignment Framework for LLM-Empowered Agent in Metaverse Service Ecosystem

Qun Ma, Xiao Xue, Ming Zhang, Yifan Shen, Zihan Zhao

机构 * College of Intelligence and Computing(智能与计算学院) Tianjin University(天津大学) Tianjin Key Laboratory of Healhy Habitat and Smart Technology(天津健康人居环境与智能技术重点实验室) Laboratory of Computation and Analytics of Complex Management Systems(复杂管理系统计算与分析实验室) Faculty of Environment, Science and Economy(环境、科学与经济学院)

专题命中 Agent评测 :agent(title);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.18190 2025-07-29 cs.CL 74%

TN-AutoRCA: Benchmark Construction and Agentic Framework for Self-Improving Alarm-Based Root Cause Analysis in Telecommunication Networks

Keyu Wu, Qianjin Yu, Manlin Mei, Ruiting Liu, Jun Wang, Kailai Zhang, Yelun Bao

专题命中 Agent评测 :agentic(title);分类 cs.CL

Comments 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.16412 2025-07-10 cs.CL 74%

InfoTech Assistant: A Multimodal Conversational Agent for InfoTechnology Web Portal Queries

Sai Surya Gadiraju, Duoduo Liao, Akhila Kudupudi, Santosh Kasula, Charitha Chalasani

机构 * School of Computing(计算学院) George Mason University(乔治·马歇尔大学)

专题命中 Agent评测 :agent(title);分类 cs.CL

Comments Accepted by IEEE Big Data 2024

Journal ref IEEE BigData, Year: 2024, Pages: 3264-3272

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.05321 2025-07-09 cs.CY cs.AI 74%

AGACCI : Affiliated Grading Agents for Criteria-Centric Interface in Educational Coding Contexts

Kwangsuk Park, Jiwoong Yang

机构 * AA LAB, MODULABS(AA实验室,MODULABS) Aiffel, MODULABS(Aiffel,MODULABS) Department of Statistics, Inha university(统计系,Inha大学)

专题命中 Agent评测 :agent(abstract,comments);multi-agent(abstract,comments);分类 cs.AI

Comments Accepted at ICML 2025 Workshop on Multi-Agent Systems in the Era of Foundation Models: Opportunities, Challenges and Futures (MAS)

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.04889 2025-07-08 cs.LG 74%

Fine-tuning on simulated data outperforms prompting for agent tone of voice

Ingo Marquardt, Philippe Brule

机构 * Restack

专题命中 Agent评测 :agent(title);分类 cs.LG

Comments 22 pages, 5 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.18867 2025-06-27 cs.CV cs.AI 74%

UP-VLA: A Unified Understanding and Prediction Model for Embodied Agent

Jianke Zhang, Yanjiang Guo, Yucheng Hu, Xiaoyu Chen, Xiang Zhu, Jianyu Chen

机构 * Institute for Interdisciplinary Information Sciences, Tsinghua University,Beijing, China(信息科学交叉研究所,清华大学,北京,中国) Shanghai Qi Zhi Institute, Shanghai, China(上海启智研究院,上海,中国)

专题命中 Agent评测 :agent(title);分类 cs.AI

Comments Accepted to ICML2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.15699 2025-06-23 cs.AI 74%

Advancing Embodied Agent Security: From Safety Benchmarks to Input Moderation

Ning Wang, Zihan Yan, Weiyang Li, Chuan Ma, He Chen, Tao Xiang

机构 * College of computer science, Chongqing University(重庆大学计算机学院) Department of Information Engineering, The Chinese University of Hong Kong(香港中文大学信息工程系)

专题命中 Agent评测 :agent(title);分类 cs.AI

Comments 9 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.14302 2025-06-18 cs.CL 74%

Expectation Confirmation Preference Optimization for Multi-Turn Conversational Recommendation Agent

Xueyang Feng, Jingsen Zhang, Jiakai Tang, Wei Li, Guohao Cai, Xu Chen, Quanyu Dai, Yue Zhu, Zhenhua Dong

机构 * Gaoling School of Artificial Intelligence, Renmin University of China, Beijing, China(中国人民大学北京校区人工智能学院) Beijing Key Laboratory of Research on Large Models and Intelligent Governance(北京大型模型与智能治理研究重点实验室) Engineering Research Center of Next-Generation Intelligent Search and Recommendation, MOE(下一代智能搜索与推荐工程研究中心,教育部) Huawei Noah’s Ark Lab, China(华为诺亚方舟实验室)

专题命中 Agent评测 :agent(title);分类 cs.CL

Comments Accepted to Findings of ACL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.02306 2025-05-20 cs.AI 74%

SafeMate: A Modular RAG-Based Agent for Context-Aware Emergency Guidance

Junfeng Jiao, Jihyung Park, Yiming Xu, Kristen Sussman, Lucy Atkinson

机构 * Urban Information Lab, University of Texas at Austin(德克萨斯大学奥斯汀分校城市信息实验室) Department of Computer Science, University of Texas at Austin(德克萨斯大学奥斯汀分校计算机科学系) Department of Advertising, Texas State University(德克萨斯州立大学广告系) Department of Advertising and Public Relations, University of Texas at Austin(德克萨斯大学奥斯汀分校广告与公共关系系)

专题命中 Agent评测 :agent(title);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.14112 2025-04-22 cs.HC cs.AI cs.CY 74%

Longitudinal Study on Social and Emotional Use of AI Conversational Agent

Mohit Chandra, Javier Hernandez, Gonzalo Ramos, Mahsa Ershadi, Ananya Bhattacharjee, Judith Amores, Ebele Okoli, Ann Paradiso, Shahed Warreth, Jina Suh

机构 * Georgia Institute of Technology USA(佐治亚理工学院) Microsoft Research USA(微软研究院(美国)) Microsoft USA(微软(美国)) University of Toronto Canada(多伦多大学)

专题命中 Agent评测 :agent(title);分类 cs.AI

Comments 16 pages, 5 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.13364 2025-04-15 cs.CY cs.AI 74%

Reconciling Different Theories of Learning with an Agent-based Model of Procedural Learning

Sina Rismanchian, Shayan Doroudi

专题命中 Agent评测 :agent(title);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.04698 2025-04-08 cs.CL 74%

scAgent: Universal Single-Cell Annotation via a LLM Agent

Yuren Mao, Yu Mi, Peigen Liu, Mengfei Zhang, Hanqing Liu, Yunjun Gao

专题命中 Agent评测 :agent(title);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.18308 2025-02-26 cs.CL 74%

RefuteBench 2.0 -- Agentic Benchmark for Dynamic Evaluation of LLM Responses to Refutation Instruction

Jianhao Yan, Yun Luo, Yue Zhang

专题命中 Agent评测 :agentic(title);分类 cs.CL

Comments Work on progess

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.05898 2024-11-12 cs.CV cs.AI cs.RO 74%

Integrating Object Detection Modality into Visual Language Model for Enhanced Autonomous Driving Agent

Linfeng He, Yiming Sun, Sihao Wu, Jiaxu Liu, Xiaowei Huang

专题命中 Agent评测 :agent(title);分类 cs.AI

Comments accepted by SafeGenAI workshop of NeurIPS 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.17860 2024-11-05 cs.CL 74%

Illuminating Blind Spots of Language Models with Targeted Agent-in-the-Loop Synthetic Data

Philip Lippmann, Matthijs T. J. Spaan, Jie Yang

专题命中 Agent评测 :agent(title);分类 cs.CL

Comments Preprint. Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.18792 2024-10-28 cs.CY cs.CL 74%

An LLM Agent for Automatic Geospatial Data Analysis

Yuxing Chen, Weijie Wang, Sylvain Lobry, Camille Kurtz

专题命中 Agent评测 :agent(title);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.10278 2024-10-15 cs.CL 74%

Machine Translation Evaluation Benchmark for Wu Chinese: Workflow and Analysis

Hongjian Yu, Yiming Shi, Zherui Zhou, Christopher Haberland

专题命中 Agent评测 :workflow(title);分类 cs.CL

Comments EMNLP WMT 24 Open Language Data Initiative Shared Task

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.20267 2024-10-08 cs.CL 74%

Auto-Arena: Automating LLM Evaluations with Agent Peer Battles and Committee Discussions

Ruochen Zhao, Wenxuan Zhang, Yew Ken Chia, Weiwen Xu, Deli Zhao, Lidong Bing

专题命中 Agent评测 :agent(title);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.13803 2024-10-08 cs.HC cs.CL 74%

"I Like Sunnie More Than I Expected!": Exploring User Expectation and Perception of an Anthropomorphic LLM-based Conversational Agent for Well-Being Support

Siyi Wu, Julie Y. A. Cachia, Feixue Han, Bingsheng Yao, Tianyi Xie, Xuan Zhao, Dakuo Wang

专题命中 Agent评测 :agent(title);分类 cs.CL

Comments In Submission

详情

展开后加载摘要…

URL PDF HTML 收藏