arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

共收录 15729 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. Agent评测 15729 篇

2506.08006 2025-06-10 cs.CV 67%

Dreamland: Controllable World Creation with Simulator and Generative Models

Sicheng Mo, Ziyang Leng, Leon Liu, Weizhen Wang, Honglin He, Bolei Zhou

机构 * University of California, Los Angeles(加州大学洛杉矶分校)

专题命中 Agent评测 :agent(abstract);AI agent(abstract)

Comments Project Page: https://metadriverse.github.io/dreamland/

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.05954 2025-06-06 cs.MA 67%

Optimization under Attack: Resilience, Vulnerability, and the Path to Collapse

Amal Aldawsari, Evangelos Pournaras

专题命中 Agent评测 :agent(abstract);multi-agent(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23419 2025-06-03 cs.SE cs.AI cs.CL 67%

SWE-bench Goes Live!

Linghao Zhang, Shilin He, Chaoyun Zhang, Yu Kang, Bowen Li, Chengxing Xie, Junhao Wang, Maoquan Wang, Yufan Huang, Shengyu Fu, Elsie Nallipogu, Qingwei Lin, Yingnong Dang, Saravan Rajmohan, Dongmei Zhang

机构 * Microsoft(微软)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL、cs.SE

Comments Homepage: \url{https://swe-bench-live.github.io/}, Code: \url{https://github.com/SWE-bench-Live}, Dataset: \url{https://huggingface.co/SWE-bench-Live}

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.00082 2025-06-03 q-bio.GN cs.DB 67%

An AI-powered Knowledge Hub for Potato Functional Genomics

Jia Yuxin, Li Jinye, Jia Yudong, Li Futing, Su Xiaoqi, Luo Jilin, Dong Yarui, Sun Chunyan, Cui Qinghan, Wang Li, Li Axiu, Shang Yi, Zhu Yujuan, Huang Sanwen

专题命中 Agent评测 :agent(abstract);AI agent(abstract)

Comments 11 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.04905 2025-06-02 cs.CL cs.AI cs.LG 67%

DEMO: Reframing Dialogue Interaction with Fine-grained Element Modeling

Minzheng Wang, Xinghua Zhang, Kun Chen, Nan Xu, Haiyang Yu, Fei Huang, Wenji Mao, Yongbin Li

机构 * School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) MAIS, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所MAIS) Tongyi Lab, Alibaba Group(阿里巴巴集团通义实验室)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL、cs.LG

Comments ACL 2025 Findings. We release the code and data at https://github.com/MozerWang/DEMO

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.01388 2025-06-02 cs.CV 67%

AutoStudio: Crafting Consistent Subjects in Multi-turn Interactive Image Generation

Junhao Cheng, Xi Lu, Hanhui Li, Khun Loun Zai, Baiqiao Yin, Yuhao Cheng, Yiqiang Yan, Xiaodan Liang

专题命中 Agent评测 :agent(abstract);multi-agent(abstract)

Comments Multi-turn interactive image generation

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23189 2025-05-30 cs.RO cs.CV 67%

TrackVLA: Embodied Visual Tracking in the Wild

Shaoan Wang, Jiazhao Zhang, Minghan Li, Jiahang Liu, Anqi Li, Kui Wu, Fangwei Zhong, Junzhi Yu, Zhizheng Zhang, He Wang

专题命中 Agent评测 :agent(abstract);planning(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.22655 2025-05-29 cs.LG cs.AI cs.CL 67%

Position: Uncertainty Quantification Needs Reassessment for Large-language Model Agents

Michael Kirchhof, Gjergji Kasneci, Enkelejda Kasneci

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL、cs.LG

Comments Accepted at ICML 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.10419 2025-05-29 cs.CV cs.AI cs.CL cs.LG cs.SY eess.SY 67%

Preference Adaptive and Sequential Text-to-Image Generation

Ofir Nabati, Guy Tennenholtz, ChihWei Hsu, Moonkyung Ryu, Deepak Ramachandran, Yinlam Chow, Xiang Li, Craig Boutilier

机构 * International Conference on Machine Learning (ICML 2025)(国际机器学习会议)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL、cs.LG

Comments Accepted to ICML 2025 Link to PASTA dataset: https://www.kaggle.com/datasets/googleai/pasta-data

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.16310 2025-05-29 cs.CV 67%

Functionality understanding and segmentation in 3D scenes

Jaime Corsetti, Francesco Giuliari, Alice Fasoli, Davide Boscaini, Fabio Poiesi

机构 * Fondazione Bruno Kessler(布鲁诺·凯塞勒基金会) University of Trento(特伦托大学)

专题命中 Agent评测 :agent(abstract);AI agent(abstract)

Comments CVPR 2025 Highlight. Camera ready version. 20 pages, 12 figures, 7 tables. Fixed typo in Eq.2

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.17335 2025-05-27 cs.CV 67%

VersatileMotion: A Unified Framework for Motion Synthesis and Comprehension

Zeyu Ling, Bo Han, Shiyang Li, Jikang Cheng, Hongdeng Shen, Changqing Zou

机构 * Zhejiang University(浙江大学) ByteDance(字节跳动) University of the Chinese Academy(中国科学院大学) Zhejiang Lab(浙江实验室)

专题命中 Agent评测 :agent(abstract);multi-agent(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17416 2025-05-26 cs.CR 67%

LLM-BSCVM: An LLM-Based Blockchain Smart Contract Vulnerability Management Framework

Yanli Jin, Chunpei Li, Peng Fan, Peng Liu, Xianxian Li, Chen Liu, Wangjie Qiu

专题命中 Agent评测 :agent(abstract);multi-agent(abstract)

Comments 10 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16954 2025-05-23 cs.HC 67%

Cracking Aegis: An Adversarial LLM-based Game for Raising Awareness of Vulnerabilities in Privacy Protection

Jiaying Fu, Yiyang Lu, Zehua Yang, Fiona Nah, RAY LC

专题命中 Agent评测 :agent(abstract);AI agent(abstract)

Comments 24 pages, In Designing Interactive Systems Conference (DIS 25)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.14453 2025-05-22 cs.SI 67%

Robustness Evaluation of Graph-based News Detection Using Network Structural Information

Xianghua Zeng, Hao Peng, Angsheng Li

专题命中 Agent评测 :agent(abstract);multi-agent(abstract)

Comments Accepted to Proceedings of the ACM SIGKDD Conference on Knowledge Discovery and Data Mining 2025 (KDD 2025). 14 pages, 7 figures, 10 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.13511 2025-05-21 cs.AI cs.CL cs.LG 67%

Can AI Freelancers Compete? Benchmarking Earnings, Reliability, and Task Success at Scale

David Noever, Forrest McKee

专题命中 Agent评测 :autonomous agent(abstract);分类 cs.AI、cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.09436 2025-05-20 cs.LG cs.AI cs.CL cs.IR 67%

CXMArena: Unified Dataset to benchmark performance in realistic CXM Scenarios

Raghav Garg, Kapil Sharma, Karan Gupta

机构 * Sprinklr

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.06364 2025-05-13 cs.CR 67%

LATENT: LLM-Augmented Trojan Insertion and Evaluation Framework for Analog Netlist Topologies

Jayeeta Chaudhuri, Arjun Chaudhuri, Krishnendu Chakrabarty

专题命中 Agent评测 :agent(abstract);autonomous agent(abstract)

Comments Accepted for presentation at IEEE International Conference on LLM-Aided Design (ICLAD), 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.18165 2025-05-06 cs.CV 67%

Parallel Neural Computing for Scene Understanding from LiDAR Perception in Autonomous Racing

Suwesh Prasad Sah

机构 * Dept. Computer Science and Engineering(计算机科学与工程系) National Institute of Technology Rourkela(印度拉尔克学院技术学院)

专题命中 Agent评测 :agent(abstract);autonomous agent(abstract)

Comments IEEE/ISED 2024

Journal ref 12th International Conference on Intelligent Systems and Embedded Design (ISED-2024)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.00201 2025-05-02 cs.RO 67%

Investigating Adaptive Tuning of Assistive Exoskeletons Using Offline Reinforcement Learning: Challenges and Insights

Yasin Findik, Christopher Coco, Reza Azadeh

机构 * Persistent Autonomy and Robot Learning (PeARL) Lab, University of Massachusetts Lowell(持久自主与机器人学习实验室,马萨诸塞大学洛厄尔分校)

专题命中 Agent评测 :agent(abstract);multi-agent(abstract)

Comments Accepted to International Conference on Ubiquitous Robots (IEEE UR 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
1912.10160 2025-04-22 cs.CL cs.AI cs.LG stat.ML 67%

AMUSED: A Multi-Stream Vector Representation Method for Use in Natural Dialogue

Gaurav Kumar, Rishabh Joshi, Jaspreet Singh, Promod Yenigalla

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL、cs.LG

Journal ref Proceedings of the 12th Conference on Language Resources and Evaluation, pp. 750-758, 2020

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.13650 2025-04-21 cs.CV 67%

EyecareGPT: Boosting Comprehensive Ophthalmology Understanding with Tailored Dataset, Benchmark and Model

Sijing Li, Tianwei Lin, Lingshuai Lin, Wenqiao Zhang, Jiang Liu, Xiaoda Yang, Juncheng Li, Yucheng He, Xiaohui Song, Jun Xiao, Yueting Zhuang, Beng Chin Ooi

专题命中 Agent评测 :agent(abstract);multi-agent(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.09737 2025-04-15 cs.AI cs.CL cs.HC cs.LG 67%

Can LLM feedback enhance review quality? A randomized study of 20K reviews at ICLR 2025

Nitya Thakkar, Mert Yuksekgonul, Jake Silberg, Animesh Garg, Nanyun Peng, Fei Sha, Rose Yu, Carl Vondrick, James Zou

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL、cs.LG

Comments 30 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.08926 2025-04-15 cs.CR cs.AI cs.CL cs.CY cs.LG 67%

Cybench: A Framework for Evaluating Cybersecurity Capabilities and Risks of Language Models

Andy K. Zhang, Neil Perry, Riya Dulepet, Joey Ji, Celeste Menders, Justin W. Lin, Eliot Jones, Gashon Hussein, Samantha Liu, Donovan Jasper, Pura Peetathawatchai, Ari Glenn, Vikram Sivashankar, Daniel Zamoshchin, Leo Glikbarg, Derek Askaryar, Mike Yang, Teddy Zhang, Rishi Alluri, Nathan Tran, Rinnara Sangpisit, Polycarpos Yiorkadjis, Kenny Osele, Gautham Raghupathi, Dan Boneh, Daniel E. Ho, Percy Liang

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL、cs.LG

Comments ICLR 2025 Oral

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.02479 2025-04-15 cs.SE cs.AI cs.CL 67%

From LLMs to LLM-based Agents for Software Engineering: A Survey of Current, Challenges and Future

Haolin Jin, Linghan Huang, Haipeng Cai, Jun Yan, Bo Li, Huaming Chen

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL、cs.SE

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.08440 2025-04-14 cs.HC 67%

Speech Command + Speech Emotion: Exploring Emotional Speech Commands as a Compound and Playful Modality

Ilhan Aslan, Timothy Merritt, Stine S. Johansen, Niels van Berkel

专题命中 Agent评测 :agent(abstract);agentic(abstract)

Comments 16 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.07349 2025-04-11 math.OC 67%

Predefined-Time Target Localization and Circumnavigation using Bearing-Only Measurements: Theory and Experiments

Donglin Sui, Mohammad Deghat

专题命中 Agent评测 :agent(abstract);autonomous agent(abstract)

Comments Accepted at the 2025 European Control Conference (ECC)

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.07164 2025-04-11 cs.SE cs.CL cs.LG 67%

R2E-Gym: Procedural Environments and Hybrid Verifiers for Scaling Open-Weights SWE Agents

Naman Jain, Jaskirat Singh, Manish Shetty, Liang Zheng, Koushik Sen, Ion Stoica

专题命中 Agent评测 :agent(abstract);分类 cs.CL、cs.LG、cs.SE

Comments Website: https://r2e-gym.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.06611 2025-04-11 cs.LG cs.AI cs.CL 67%

Wanting to be Understood

Chrisantha Fernando, Dylan Banarse, Simon Osindero

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.06017 2025-04-10 cs.CR 67%

CAI: An Open, Bug Bounty-Ready Cybersecurity AI

Víctor Mayoral-Vilches, Luis Javier Navarrete-Lozano, María Sanz-Gómez, Lidia Salas Espejo, Martiño Crespo-Álvarez, Francisco Oca-Gonzalez, Francesco Balassone, Alfonso Glera-Picón, Unai Ayucar-Carbajo, Jon Ander Ruiz-Alcalde, Stefan Rass, Martin Pinzger, Endika Gil-Uriarte

专题命中 Agent评测 :agent(abstract);AI agent(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.03225 2025-04-10 cs.CV cs.AI cs.CL cs.CY cs.LG 67%

Automated Generation of Challenging Multiple-Choice Questions for Vision Language Model Evaluation

Yuhui Zhang, Yuchang Su, Yiming Liu, Xiaohan Wang, James Burgess, Elaine Sui, Chenyu Wang, Josiah Aklilu, Alejandro Lozano, Anjiang Wei, Ludwig Schmidt, Serena Yeung-Levy

专题命中 Agent评测 :agentic(abstract);分类 cs.AI、cs.CL、cs.LG

Comments CVPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏