arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2025-12-18 至 2025-12-18 共收录 73 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. Agent评测 12 篇

2508.02630 2025-12-18 cs.AI cs.CY cs.HC cs.MA econ.GN q-fin.EC 92%

What Is Your AI Agent Buying? Evaluation, Biases, Model Dependence, & Emerging Implications for Agentic E-Commerce

你的AI代理在买什么?评估、偏见、模型依赖性及代理电子商务的新兴影响

Amine Allouah, Omar Besbes, Josué D Figueroa, Yash Kanoria, Akshit Kumar

机构 * MyCustomAI Columbia University, Graduate School of Business(哥伦比亚大学商学院) Yale University(耶鲁大学)

专题命中 Agent评测 :agent(title,abstract);AI agent(title,abstract);agentic(title,abstract);分类 cs.AI

AI总结 研究发现AI代理在电子商务中的行为具有显著偏见和波动性,且其决策受模型和提供者影响,需持续审计以应对市场变化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05788 2025-12-18 eess.SY cs.SY 85%

Task-Specific Trust Evaluation for Multi-Hop Collaborator Selection via GNN-Aided Distributed Agentic AI

基于图神经网络的多跳协作者选择任务特定信任评估

Botao Zhu, Xianbin Wang, Dusit Niyato

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);planning(abstract)

AI总结 本文提出基于图神经网络的分布式代理人工智能框架,用于多跳协作者选择中的任务特定信任评估,通过整合设备可信度评估结果,实现隐私保护的任务路径规划。

Journal ref IEEE Journal on Selected Areas in Communications, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14860 2025-12-18 cs.CR cs.AI 83%

Penetration Testing of Agentic AI: A Comparative Security Analysis Across Models and Frameworks

代理AI的渗透测试:跨模型和框架的比较安全分析

Viet K. Nguyen, Mohammad I. Husain

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);分类 cs.AI

AI总结 本文通过测试五个代理AI模型和两个框架,揭示了代理AI在安全方面的显著差异,发现超过一半的恶意提示成功,提出了新的防御策略和部署建议。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14720 2025-12-18 cs.SI cs.AI cs.CL 73%

SoMe: A Realistic Benchmark for LLM-based Social Media Agents

SoMe:一种用于基于大语言模型的社会媒体代理的现实基准

Dizhan Xue, Jing Cui, Shengsheng Qian, Chuanrui Hu, Changsheng Xu

专题命中 Agent评测 :agent(abstract);agentic(abstract);分类 cs.AI、cs.CL

AI总结 SoMe是一个用于评估基于大语言模型的社会媒体代理能力的现实基准,通过多样化任务和大量数据揭示了现有LLM在处理社交媒体任务中的局限性。

Comments Accepted by AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15363 2025-12-18 cs.DB 67%

Revisiting Task-Oriented Dataset Search in the Era of Large Language Models: Challenges, Benchmark, and Solution

重新审视大语言模型时代任务导向型数据集搜索:挑战、基准测试与解决方案

Zixin Wei, Yucan Guo, Jinyang Li, Xiaolin Han, Xiaolong Jin, Chenhao Ma

专题命中 Agent评测 :agent(abstract);multi-agent(abstract)

AI总结 KATS通过构建任务-数据集知识图和混合查询引擎,解决任务导向型数据集搜索中的挑战,并通过CS-TDS基准测试展示其优越性。

Comments Accepted to Proc. VLDB Endow. (PVLDB), Vol. 19. 14 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18929 2025-12-18 cs.CV 67%

Human-Centric Open-Future Task Discovery: Formulation, Benchmark, and Scalable Tree-Based Search

以人为中心的开放未来任务发现: formulation、基准和可扩展的树基搜索

Zijian Song, Xiaoxin Lin, Tao Pu, Zhenlong Yuan, Guangrun Wang, Liang Lin

机构 * Zijian Song 1(Song 研究所) Xiaoxin Lin 1(Lin 研究所) Tao Pu 1(Pu 研究所) Zhenlong Yuan 4(Yuan 研究所) Guangrun Wang 1,2,3(Wang 研究所) Liang Lin 1,2,3(Lin 研究所)

专题命中 Agent评测 :agent(abstract);multi-agent(abstract)

AI总结 本研究提出HOTD问题,通过CMAST框架在开放未来任务发现中实现最佳性能,显著超越现有LMMs。

Comments accepted to AAAI 2026, 10 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14865 2025-12-18 cs.SD cs.CL cs.LG 62%

Audio MultiChallenge: A Multi-Turn Evaluation of Spoken Dialogue Systems on Natural Human Interaction

音频多挑战:对语音对话系统在自然人类交互中的多轮评估

Advait Gosai, Tyler Vuong, Utkarsh Tyagi, Steven Li, Wenjia You, Miheer Bavare, Arda Uçar, Zhongwang Fang, Brian Jang, Bing Liu, Yunzhong He

专题命中 Agent评测 :agentic(abstract);分类 cs.CL、cs.LG

AI总结 Audio MultiChallenge通过多轮交互评估语音对话系统在自然对话中的表现,揭示模型在多轮对话、语音修复和长上下文处理上的挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15551 2025-12-18 cs.CL 57%

Learning inflection classes using Adaptive Resonance Theory

利用自适应共振理论学习屈折类

Peter Dekker, Heikki Rasilo, Bart de Boer

机构 * AI Lab, Vrije Universiteit Brussel(人工智能实验室,布鲁塞尔自由大学)

专题命中 Agent评测 :agent(abstract);分类 cs.CL

AI总结 本文提出利用自适应共振理论学习语言中的屈折类,通过无监督聚类分析拉丁语、葡萄牙语和爱沙尼亚语的词素,发现最佳泛化参数区域,并验证模型提取的特征与语言学描述的一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15302 2025-12-18 cs.CL 57%

Towards Proactive Personalization through Profile Customization for Individual Users in Dialogues

通过用户个性化配置实现对话中的前瞻性个性化

Xiaotian Zhang, Yuan Wang, Ruizhe Chen, Zeya Wang, Runchen Hou, Zuozhu Liu

机构 * Zhejiang University(浙江大学) Zhejiang Key Laboratory of Medical Imaging Artificial Intelligence(浙江省医学影像人工智能重点实验室)

专题命中 Agent评测 :agent(abstract);分类 cs.CL

AI总结 本文提出PersonalAgent,通过构建和动态完善用户档案,实现对话中的长期个性化和用户偏好推断,提升对话代理的适应性和连贯性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13734 2025-12-18 cs.CL 57%

GAPS: A Clinically Grounded, Automated Benchmark for Evaluating AI Clinicians

GAPS: 一种基于临床的自动化评估基准,用于评估AI临床医生

Xiuyuan Chen, Tao Sun, Dexin Su, Ailing Yu, Junwei Liu, Zhe Chen, Gangzeng Jin, Xin Wang, Jingnan Liu, Hansong Xiao, Hualei Zhou, Dongjie Tao, Chunxiao Guo, Minghui Yang, Yuan Xia, Jing Zhao, Qianrui Fan, Yanyun Wang, Shuai Zhen, Kezhong Chen, Jun Wang, Zewen Sun, Heng Zhao, Tian Guan, Shaodong Wang, Geyun Chang, Jiaming Deng, Hongchengcheng Chen, Kexin Feng, Ruzhen Li, Jiayi Geng, Changtai Zhao, Jun Wang, Guihu Lin, Peihao Li, Liqi Liu, Peng Wei, Jian Wang, Jinjie Gu, Ping Wang, Fan Yang

机构 * Department of Thoracic Surgery(胸外科部门) Thoracic Oncology Institute(胸外科肿瘤研究所) Research Unit of Intelligence Diagnosis and Treatment in Early Non-small Cell Lung Cancer(早期非小细胞肺癌智能诊断与治疗研究单元) Institute of Advanced Clinical Medicine(先进临床医学研究所) Beijing Key Laboratory of Innovative Application of Big Data in Lung Cancer(肺癌大数据创新应用北京市重点实验室) Ant Group(蚂蚁集团) School of Software and Microelectronics(软件与微电子学院)

专题命中 Agent评测 :agent(abstract);分类 cs.CL

AI总结 GAPS提出了一种基于临床的自动化评估基准,用于评估AI临床医生系统,通过多维评估框架解决现有基准的不足,揭示了AI在临床实践中的关键失败模式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14104 2025-12-18 cs.GT cs.AR cs.CY 50%

The Impact Market to Save Conference Peer Review: Decoupling Dissemination and Credentialing

市场影响:拯救会议同行评审:解耦传播与认证

Karthikeyan Sankaralingam

专题命中 Agent评测 :agent(abstract)

AI总结 影响市场通过解耦传播与认证,解决同行评审中的等价类问题,通过投资机制提升高影响力论文的检索率。

Comments 41 pages, 4 figures,

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.08715 2025-12-18 physics.hist-ph gr-qc quant-ph 50%

Spacetime events from the inside out

从内部向外构建时空事件

G. J. Milburn

专题命中 Agent评测 :agent(abstract)

AI总结 本文提出时空事件与量子测量结果的关联,通过贝尔测试揭示非经典因果结构,并探讨嵌入观察者如何学习时空几何。

Comments To appear in the proceedings of "Quantum Gravity and Computation", Routledge Series on Philosophy of Physics and Mathematics. Revised version

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 其他Agent 1 篇

2512.15303 2025-12-18 cond-mat.mtrl-sci 50%

Automatic generation of input files with optimised k-point meshes for Quantum Espresso self-consistent field single point total energy calculations

量子 Espresso 自洽场单点总能量计算中优化 k 点网格的输入文件自动生成

Elena Patyukova, Junwen Yin, Susmita Basak, Samuel Pinilla Sanchez, Alin Elena, Gilberto Teobaldi

专题命中 其他Agent :agentic(abstract)

AI总结 本研究提出了一种机器学习方法,用于自动生成 Quantum Espresso 自洽场计算中优化的 k 点网格输入文件,以提高 DFT 计算的效率和准确性。

Comments 38 pages, 16 Figures, 6 Tables

详情

展开后加载摘要…

URL PDF HTML 收藏