arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2025-12-01 至 2025-12-01 共收录 21 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. Agent评测 21 篇

2510.16499 2025-12-01 cs.CL cs.AI cs.LG 87%

Automated Composition of Agents: A Knapsack Approach for Agentic Component Selection

代理自动组合:一种背包方法用于代理组件选择

Michelle Yuan, Khushbu Pahwa, Shuaichen Chang, Mustafa Kaba, Jiarong Jiang, Xiaofei Ma, Yi Zhang, Monica Sunkara

机构 * AWS Agentic AI(AWS 代理人工智能)

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);multi-agent(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 本文提出基于背包问题的代理组件自动组合框架,通过动态评估组件性能与成本,提升代理系统在不同场景下的成功率和资源利用效率。

Comments Accepted to NeurIPS 2025 Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22138 2025-12-01 cs.LG 85%

TinyLLM: Evaluation and Optimization of Small Language Models for Agentic Tasks on Edge Devices

TinyLLM: 小型语言模型在边缘设备上用于代理任务的评估与优化

Mohd Ariful Haque, Fahad Rahman, Kishor Datta Gupta, Khalil Shujaee, Roy George

机构 * Department of Cyber-Physical Systems, Clark Atlanta University, USA(计算机物理系统系,Clark Atlanta大学,美国) Department of Computer Science and Engineering, United International University, Bangladesh(计算机科学与工程系,联合国际大学,孟加拉国)

专题命中 Agent评测 :agentic(title,abstract);autonomous agent(abstract);function calling(abstract);分类 cs.LG

AI总结 TinyLLM研究小型语言模型在边缘设备上执行代理任务的优化方法,通过混合策略提升准确性与效率,验证了中等规模模型在多轮任务中的优势。

Comments 8 pages, 3 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.05408 2025-12-01 cs.CR cs.AI cs.CY 81%

Frontier AI's Impact on the Cybersecurity Landscape

前沿人工智能对网络安全领域的冲击

Yujin Potter, Wenbo Guo, Zhun Wang, Tianneng Shi, Hongwei Li, Andy Zhang, Patrick Gage Kelley, Kurt Thomas, Dawn Song

机构 * UC Berkeley(加州大学伯克利分校) UC Santa Barbara(加州大学圣芭芭拉分校) Google(谷歌)

专题命中 Agent评测 :agent(abstract);AI agent(abstract);planning(abstract);workflow(abstract)

AI总结 本文研究了前沿人工智能在网络安全中的影响,指出人工智能在攻击中的能力已超过防御,呼吁构建新基准、开发防御代理等以缓解风险。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.23397 2025-12-01 cs.CL cs.AI cs.MA 79%

MegaChat: A Synthetic Persian Q&A Dataset for High-Quality Sales Chatbot Evaluation

MegaChat: 一个用于高质量销售聊天机器人评估的合成波斯语问答数据集

Mahdi Rahmani, AmirHossein Saffari, Reyhane Rahmani

专题命中 Agent评测 :agent(abstract);agentic(abstract);multi-agent(abstract);分类 cs.AI、cs.CL

AI总结 MegaChat通过自动化多代理架构生成高质量波斯语问答数据,用于评估销售聊天机器人,优于传统RAG模型。

Comments 6 pages, 11 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21935 2025-12-01 cs.LG cs.GT 70%

Breaking Algorithmic Collusion in Human-AI Ecosystems

打破人类-人工智能生态系统中的算法合谋

Natalie Collina, Eshwar Ram Arunachaleswaran, Meena Jagadeesan

机构 * University of Pennsylvania(宾夕法尼亚大学) Stanford University(斯坦福大学)

专题命中 Agent评测 :agent(abstract);AI agent(abstract);分类 cs.LG

AI总结 本文研究了人类-人工智能生态系统中算法合谋的稳定性,发现单个或多个人类的背叛行为能破坏合谋并降低价格,揭示了合谋在混合生态系统中的脆弱性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.05559 2025-12-01 cs.AI 70%

SciSciGPT: Advancing Human-AI Collaboration in the Science of Science

SciSciGPT:推动科学之科学中的人机协作

Erzhuo Shao, Yifang Wang, Yifan Qian, Zhenyu Pan, Han Liu, Dashun Wang

专题命中 Agent评测 :agent(abstract);AI agent(abstract);分类 cs.AI

AI总结 SciSciGPT通过LLM驱动的研究工具促进人机协作,提升科研效率与可重复性,同时提出能力成熟度模型以指导未来框架发展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.10674 2025-12-01 cs.CL cs.AI cs.DB 62%

Continual Learning of Domain Knowledge from Human Feedback in Text-to-SQL

从人类反馈中持续学习领域知识的文本到SQL

Thomas Cook, Kelly Patel, Sivapriya Vellaichamy, Udari Madhushani Sehwag, Saba Rahimi, Zhen Zeng, Sumitra Ganesh

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL

AI总结 本文提出一种通过人类反馈持续学习领域知识的文本到SQL框架,通过记忆增强的代理提升查询准确性与错误减少。

Comments 34 pages, 6 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21742 2025-12-01 cs.CL cs.AI 62%

EduMod-LLM: A Modular Approach for Designing Flexible and Transparent Educational Assistants

EduMod-LLM: 一种用于设计灵活且透明教育助手的模块化方法

Meenakshi Mittal, Rishi Khare, Mihran Miroyan, Chancharik Mitra, Narges Norouzi

专题命中 Agent评测 :function calling(abstract);分类 cs.AI、cs.CL

AI总结 EduMod-LLM通过模块化方法评估教育问答系统各组件性能,揭示失败模式,提升透明度和教学对齐效果。

Comments Proceedings of the AAAI Conference on Artificial Intelligence

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.10157 2025-12-01 cs.AI cs.CL 62%

One Patient, Many Contexts: Scaling Medical AI with Contextual Intelligence

一个患者,许多情境:通过情境智能扩展医疗AI

Michelle M. Li, Ben Y. Reis, Adam Rodman, Tianxi Cai, Noa Dagan, Ran D. Balicer, Joseph Loscalzo, Isaac S. Kohane, Marinka Zitnik

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL

AI总结 本文提出情境切换技术,通过调整模型推理而非重新训练,使医疗AI能适应不同专科、人群和地理环境,提升其在现实护理中的可靠性和扩展性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22598 2025-12-01 cs.LG 57%

LLM-Cave: A benchmark and light environment for large language models reasoning and decision-making system

LLM-Cave: 一个用于大型语言模型推理和决策系统的基准和轻量环境

Huanyu Li, Zongyuan Li, Wei Huang, Xian Guo

机构 * College of Artificial Intelligence Nankai University(人工智能学院 南开大学)

专题命中 Agent评测 :agent(abstract);分类 cs.LG

AI总结 LLM-Cave提出了一种轻量环境和基准,用于评估大型语言模型的推理和决策能力,展示了不同模型在复杂任务中的表现及改进方法。

Comments 8 pages, 5 figures, ICICN 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19957 2025-12-01 cs.CL 57%

AppSelectBench: Application-Level Tool Selection Benchmark

AppSelectBench: 应用级工具选择基准

Tianyi Chen, Michael Solodko, Sen Wang, Jongwoo Ko, Junheng Hao, Colby Banbury, Sara Abdali, Saeed Amizadeh, Qing Xiao, Yinheng Li, Tianyu Ding, Kamran Ghasedi Dizaji, Suzhen Zheng, Hao Fan, Justin Wagle, Pashmina Cameron, Kazuhito Koishida

机构 * Microsoft(微软)

专题命中 Agent评测 :agent(abstract);分类 cs.CL

AI总结 AppSelectBench通过评估CUAs的应用选择能力,揭示了模型在跨应用推理中的系统性优劣,为智能代理的研究提供了新基准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.23424 2025-12-01 econ.TH math.OC 50%

Contracting with discretionary bonuses

带有酌情奖金的合同

Guillermo Alonso Alvarez, Ibrahim Ekren, Liwei Huang

专题命中 Agent评测 :agent(abstract)

AI总结 本文研究了雇主如何通过提供入职奖金来优化激励结构,探讨了急躁程度和奖金支付次数对合同价值的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.23061 2025-12-01 physics.soc-ph cs.SI 50%

The impact of anticonformity on the diffusion of innovation -- insights from the q-voter model

反从众对创新扩散的影响——来自q-投票模型的洞察

Angelika Abramiuk-Szurlej

专题命中 Agent评测 :agent(abstract)

AI总结 本文通过扩展q-投票模型引入反从众行为,研究其对创新扩散的影响,发现反从众能加速早期采用并促进成功扩散,具有实际应用价值。

Comments 7 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22933 2025-12-01 eess.SP 50%

RAG-Empowered LLM-Driven Dynamic Radio Resource Management in Open 6G RAN

基于RAG的LLM驱动的开放6G RAN动态无线电资源管理

Onur Salan, Burak Çırağ, Onur Sever, İbrahim Hökelek, Ali Görçin, Hakan Ali Çırpan

专题命中 Agent评测 :agent(abstract)

AI总结 本文提出基于RAG的LLM驱动的O-RAN动态资源管理框架,通过双代理机制实现网络切片的自适应控制,提升计算效率和SLA合规性。

Comments Submitted to possible IEEE conferences

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.13278 2025-12-01 math.PR econ.GN math.OC q-fin.EC 50%

Randomisation with moral hazard: a path to existence of optimal contracts

随机性与道德风险:最优合同存在的路径

Daniel Kršek, Dylan Possamaï

专题命中 Agent评测 :agent(abstract)

AI总结 本文提出了一种在连续时间内处理道德风险问题的方法,通过测度值控制和反向随机微分方程,证明了在约束条件下最优合同存在的可能性。

Comments 48 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22683 2025-12-01 cs.IT math.IT 50%

On Information Theoretic Fairness With A Bounded Point-Wise Statistical Parity Constraint: An Information Geometric Approach

在有信息论公平性与有界点对点统计平等等约束下的信息几何方法:一种设计公平表示的问题

Amirreza Zamani, Ayfer Özgür, Mikael Skoglund

专题命中 Agent评测 :agent(abstract)

AI总结 本文提出了一种基于信息几何的方法,通过设计满足有界点对点统计平等等约束的表示Y,以最大化任务的互信息并满足压缩率约束。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22466 2025-12-01 cs.CV 50%

RoadSceneBench: A Lightweight Benchmark for Mid-Level Road Scene Understanding

RoadSceneBench: 一个轻量级的中层道路场景理解基准

Xiyan Liu, Han Wang, Yuhu Wang, Junjie Cai, Zhe Cao, Jianzhong Yang, Zhen Lu

机构 * Baidu Inc(百度公司)

专题命中 Agent评测 :planning(abstract)

AI总结 RoadSceneBench提出一种轻量级基准,通过HRRP-T框架提升道路场景的视觉推理能力,实现结构一致性和时间一致性,推动自动驾驶感知发展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22384 2025-12-01 cs.GT cs.CC 50%

Skating System Unveiled: Exploring Preference Aggregation in Ballroom Tournaments

冰上系统揭示:探索舞会赛事中的偏好聚合

Laryssa Horn, Paul Nüsken, Jörg Rothe, Tessa Seeger

专题命中 Agent评测 :agent(abstract)

AI总结 本文提出了一种新的投票系统SkS,分析其在偏好聚合中的公理性质及对操纵和选举控制的抗性,揭示其优势与局限性。

Comments In Proceedings TARK 2025, arXiv:2511.20540

Journal ref EPTCS 437, 2025, pp. 271-285

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22379 2025-12-01 cs.LO 50%

Group Knowledge of Hypothetical Values

假设值的群体知识

Alexandru Baltag, Sonja Smets

专题命中 Agent评测 :agent(abstract)

AI总结 本文研究了半公开数据交换事件中群体知识的动态逻辑,引入了分布式知识和条件知识的操作符,并给出了完整的公理化和可判定性证明。

Comments In Proceedings TARK 2025, arXiv:2511.20540

Journal ref EPTCS 437, 2025, pp. 140-159

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21782 2025-12-01 physics.soc-ph cs.CY cs.MA 50%

CompARE: A Computational framework for Airborne Respiratory disease Evaluation integrating flow physics and human behavior

CompARE:用于空中呼吸系统疾病评估的计算框架,整合流体动力学和人类行为

Fong Yew Leong, Jaeyoung Kwak, Zhengwei Ge, Chin Chun Ooi, Siew-Wai Fong, Matthew Zirui Tay, Hua Qian, Chang Wei Kang, Wentong Cai, Hongying Li

专题命中 Agent评测 :agent(abstract)

AI总结 CompARE框架整合流体动力学与人类行为,揭示室内空气传播疾病风险的双峰分布,通过CFD、ML和ABM分析,提供通风设计和社交距离政策的量化见解。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.09934 2025-12-01 cs.GT 50%

Robust Resource Allocation via Competitive Subsidies

通过竞争补贴实现鲁棒资源分配

David X. Lin, Giannis Fikioris, Siddhartha Banerjee, Éva Tardos

专题命中 Agent评测 :agent(abstract)

AI总结 通过竞争补贴机制,实现0.625鲁棒性,接近非战略鲁棒性上限,突破0.6第一价格拍卖障碍。

详情

展开后加载摘要…

URL PDF HTML 收藏