arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2025-12-11 至 2025-12-11 共收录 8 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. Agent评测 8 篇

2512.09108 2025-12-11 cs.SE cs.AI 79%

Evolving Excellence: Automated Optimization of LLM-based Agents

精益求精:基于大语言模型的代理的自动化优化

Paul Brookes, Vardan Voskanyan, Rafail Giavrimis, Matthew Truscott, Mina Ilieva, Chrystalla Pavlou, Alexandru Staicu, Manal Adham, Will Evers- Hood, Jingzhi Gong, Kejia Zhang, Matvey Fedoseev, Vishal Sharma, Roman Bauer, Zheng Wang, Hema Nair, Wei Jie, Tianhua Xu, Aurora Constantin, Leslie Kanthan, Michail Basios

机构 * University of Leeds(利兹大学) City, University of London(伦敦城市大学) University of West London(西伦敦大学) University of Edinburgh(爱丁堡大学) University of Surrey(萨里大学) University of Warwick(沃里克大学) King's College London(伦敦国王学院)

专题命中 Agent评测 :agent(abstract);AI agent(abstract);agentic(abstract);分类 cs.AI、cs.SE

AI总结 ARTEMIS通过语义感知的进化算法,自动优化基于大语言模型的代理配置,显著提升多个任务的性能表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09577 2025-12-11 cs.HC cs.AI 77%

Auto-BenchmarkCard: Automated Synthesis of Benchmark Documentation

Auto-BenchmarkCard:自动化生成基准测试文档

Aris Hofmann, Inge Vejsbjerg, Dhaval Salwala, Elizabeth M. Daly

专题命中 Agent评测 :agent(abstract);workflow(abstract);multi-agent(abstract);分类 cs.AI

AI总结 Auto-BenchmarkCard通过多智能体数据提取与大语言模型合成,自动化生成准确的AI基准测试文档,提升基准测试的透明性和可比性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09187 2025-12-11 cs.MA cs.AI 70%

WOLF: Werewolf-based Observations for LLM Deception and Falsehoods

基于狼人游戏的LLM欺骗与虚假信息观测

Mrinal Agarwal, Saad Rana, Theo Sundoro, Hermela Berhe, Spencer Kim, Vasu Sharma, Sean O'Brien, Kevin Zhu

机构 * Algoverse AI Research(Algoverse AI研究院)

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.AI

AI总结 WOLF通过狼人游戏构建多智能体社交推理基准,评估LLM在欺骗生成与检测中的能力,展示动态交互提升欺骗识别性能。

Comments Spotlight Multi-Turn Interactions in Large Language Models (MTI-LLM) Workshop at NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05137 2025-12-11 cs.CL 70%

Demystifying deep search: a holistic evaluation with hint-free multi-hop questions and factorised metrics

解析深度搜索:基于无提示多跳问题和因子化指标的全面评估

Maojia Song, Renhang Liu, Xinyu Wang, Yong Jiang, Pengjun Xie, Fei Huang, Jingren Zhou, Dorien Herremans, Soujanya Poria

机构 * Singapore University of Technology and Design(新加坡科技设计大学) Nanyang Technological University(南洋理工大学) Tongyi Lab, Alibaba Group(阿里云实验室)

专题命中 Agent评测 :workflow(abstract);agentic(abstract);分类 cs.CL

AI总结 本文提出WebDetective基准测试,通过无提示多跳问题和因子化指标,揭示深度搜索中模型在知识利用和拒绝行为上的系统性弱点,并开发EvidenceLoop工作流程以改进自主推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09312 2025-12-11 cs.NI 67%

Tyche: A Hybrid Computation Framework of Illumination Pattern for Satellite Beam Hopping

Tyche:一种用于卫星波束跳跃的混合计算框架

Ziheng Yang, Kun Qiu, Zhe Chen, Wenjun Zhu, Yue Gao

专题命中 Agent评测 :agent(abstract);multi-agent(abstract)

AI总结 Tyche是一种混合计算框架,通过MCTS-BH算法和滑动窗口技术显著提升卫星波束跳跃的计算效率和吞吐量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08952 2025-12-11 cs.LG cs.AI cs.HC cs.RO 62%

Learning When to Ask: Simulation-Trained Humanoids for Mental-Health Diagnosis

学习何时提问:为心理健康诊断训练的仿真 humanoid

Filippo Cenacchi, Deborah Richards, Longbing Cao

机构 * Macquarie University(麦考瑞大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG

AI总结 本文提出了一种基于仿真的方法,通过训练人形机器人以更有效地进行心理健康诊断,利用反事实回放和安全学习循环提升对话节奏和关系建立。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09913 2025-12-11 cs.CV 50%

NordFKB: a fine-grained benchmark dataset for geospatial AI in Norway

NordFKB:挪威地理空间AI的细粒度基准数据集

Sander Riisøen Jyhne, Aditya Gupta, Ben Worsley, Marianne Andersen, Ivar Oveland, Alexander Salveson Nossum

机构 * Kartverket Kristiansand(挪威地图局克里斯蒂安桑分部) University of Agder(阿格德大学) Norkart Kristiansand(挪威地图公司克里斯蒂安桑分部)

专题命中 Agent评测 :planning(abstract)

AI总结 NordFKB为挪威地理空间AI提供细粒度基准数据集,包含高分辨率影像和详细注释,支持语义分割和目标检测的标准化评估。

Comments 8 pages, 2 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09367 2025-12-11 cs.GT 50%

Procurement Auctions with Predictions: Improved Frugality for Facility Location

带有预测的采购拍卖:改进的设施选址frugality

Eric Balkanski, Nicholas DeFilippis, Vasilis Gkatzelis, Xizhi Tan

专题命中 Agent评测 :agent(abstract)

AI总结 本文提出了一种改进的设施选址拍卖机制,通过引入预测增强框架,提高了frugality比率并增强了鲁棒性。

Comments In proceeding at NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏