arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2025-12-12 至 2025-12-12 共收录 12 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. Agent评测 12 篇

2512.09964 2025-12-12 q-bio.GN 85%

Development of an Agentic AI Model for NGS Downstream Analysis Targeting Researchers with Limited Biological Background

面向生物背景有限研究者的NGS下游分析代理AI模型开发

Donghyeon Lee, Dongseok Kim, Seokhwan Ko, Seo-Young Park, Junghwan Cho

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);AI agent(abstract)

AI总结 本文提出了一种面向生物背景有限研究者的代理AI模型,通过自动化NGS下游分析、文献支持的解释和高级分析方法推荐,实现从基础数据处理到假设验证的无缝过渡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.17158 2025-12-12 cs.AI cs.CL 84%

ARE: Scaling Up Agent Environments and Evaluations

ARE:扩展代理环境和评估

Romain Froger, Pierre Andrews, Matteo Bettini, Amar Budhiraja, Ricardo Silveira Cabral, Virginie Do, Emilien Garreau, Jean-Baptiste Gaya, Hugo Laurençon, Maxime Lecanu, Kunal Malkan, Dheeraj Mekala, Pierre Ménard, Gerard Moreno-Torres Bertran, Ulyana Piterbarg, Mikhail Plekhanov, Mathieu Rita, Andrey Rusakov, Vladislav Vorotilov, Mengjue Wang, Ian Yu, Amine Benhalloum, Grégoire Mialon, Thomas Scialom

机构 * Meta Superintelligence Labs(Meta超级智能实验室)

专题命中 Agent评测 :agent(title,abstract);agentic(abstract);分类 cs.AI、cs.CL

AI总结 ARE平台通过Gaia2基准测试代理能力,强调需新架构和适应性计算策略以应对智能光谱的挑战。

Comments Updated authors order and acknowledgement

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20926 2025-12-12 cs.CV 78%

A deep learning model to reduce agent dose for contrast-enhanced MRI of the cerebellopontine angle cistern

一种深度学习模型用于降低对比增强MRI的脑干桥小脑角蛛网膜下隙剂剂量

Yunjie Chen, Rianne A. Weber, Olaf M. Neve, Stephan R. Romeijn, Erik F. Hensen, Jelmer M. Wolterink, Qian Tao, Marius Staring, Berit M. Verbist

专题命中 Agent评测 :agent(title,abstract)

AI总结 本研究提出一种深度学习模型,通过降低对比剂剂量提升脑干桥小脑角蛛网膜下隙MRI图像质量,实现低剂量下的病变检测与诊断。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10195 2025-12-12 cs.CL cs.LG cs.MA 73%

AutoMedic: An Automated Evaluation Framework for Clinical Conversational Agents with Medical Dataset Grounding

AutoMedic: 一种用于具有医学数据集支撑的临床对话代理的自动化评估框架

Gyutaek Oh, Sangjoon Park, Byung-Hoon Kim

机构 * Yonsei University College of Medicine(延世大学医学院) Yonsei Institute for Digital Health(延世大学数字健康研究所) Yonsei University(延世大学) Institute of Behavioral Sciences in Medicine(医学行为科学研究所)

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.CL、cs.LG

AI总结 AutoMedic是一种基于医学数据集的自动化评估框架,用于评估临床对话代理的多方面性能,包括准确性、效率、同理心和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18271 2025-12-12 cs.CV cs.AI 70%

Beyond Words and Pixels: A Benchmark for Implicit World Knowledge Reasoning in Generative Models

超越文字和像素:生成模型中隐式世界知识推理的基准测试

Tianyang Han, Junhao Su, Junjie Hu, Peizhen Yang, Hengyu Shi, Junfeng Luo, Jialin Gao

机构 * MeiGen AI Team, Meituan(美团梅基因AI团队) Fudan University(复旦大学) D^{4} Lab(D⁴实验室) HHMI Janelia Research Campus(HHMI贾能实验室)

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.AI

AI总结 本文提出PicWorld基准测试,用于评估生成模型在隐式世界知识和物理因果推理方面的能力,揭示了现有T2I模型在这些方面的局限性,并提出了证据基础的多代理评估器进行细粒度评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10863 2025-12-12 cs.CV cs.AI 57%

MMSI-Video-Bench: A Holistic Benchmark for Video-Based Spatial Intelligence

MMSI-Video-Bench: 一个面向视频基于空间智能的综合基准

Jingli Lin, Runsen Xu, Shaohao Zhu, Sihan Yang, Peizhou Cao, Yunlong Ran, Miao Hu, Chenming Zhu, Yiman Xie, Yilin Long, Wenbo Hu, Dahua Lin, Tai Wang, Jiangmiao Pang

机构 * Shanghai AI Laboratory(上海人工智能实验室) Shanghai Jiaotong University(上海交通大学) The Chinese University of Hong Kong(香港中文大学) Zhejiang University(浙江大学) Beihang University(北京航空航天大学) Xi’an Jiaotong University(西安交通大学) University of Hong Kong(香港大学) Fudan University(复旦大学) University of California, Los Angeles(加州大学洛杉矶分校)

专题命中 Agent评测 :planning(abstract);分类 cs.AI

AI总结 MMSI-Video-Bench是一个综合评估视频基于空间智能的基准,通过多任务和多数据集评估25个MLLMs,揭示了人机推理差距和模型泛化不足的问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08868 2025-12-12 cs.AI 57%

EcomBench: Towards Holistic Evaluation of Foundation Agents in E-commerce

EcomBench: 向电子商务基础智能体的全面评估迈进

Rui Min, Zile Qiao, Ze Xu, Jiawen Zhai, Wenyu Gao, Xuanzhong Chen, Haozhen Sun, Zhen Zhang, Xinyu Wang, Hong Zhou, Wenbiao Yin, Bo Zhang, Xuan Zhou, Ming Yan, Yong Jiang, Haicheng Liu, Liang Ding, Ling Zou, Yi R. Fung, Yalong Li, Pengjun Xie

机构 * Tongyi Lab(通义实验室) Alibaba Group(阿里巴巴集团)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 EcomBench通过真实电子商务场景评估智能体的核心能力,提供动态测试环境以衡量其在实际决策中的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.19286 2025-12-12 cs.CL 57%

TheMCPCompany: Creating General-purpose Agents with Task-specific Tools

TheMCPCompany:创建通用代理的专用工具

Reza Esfandiarpoor, Vishwas Suryanarayanan, Stephen H. Bach, Vishal Chowdhary, Anthony Aue

专题命中 Agent评测 :agent(abstract);分类 cs.CL

AI总结 TheMCPCompany通过评估工具调用代理在现实世界服务交互中的表现,揭示了当前模型在复杂任务中的挑战。

Comments Code: https://github.com/Reza-esfandiarpoor/the-mcp-company

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10892 2025-12-12 cs.GT 50%

Designing Truthful Mechanisms for Asymptotic Fair Division

为渐近公平分配设计 truthful 机制

Jugal Garg, Vishnu V. Narayan, Yuang Eric Shen

专题命中 Agent评测 :agent(abstract)

AI总结 本文提出了一种在期望下 truthful 的随机机制,用于在渐近设定下实现公平分配。

Comments 34 pages. To appear at AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10458 2025-12-12 quant-ph 50%

Shot and Architecture Adaptive Subspace Variational Quantum Eigensolver for Microwave Simulation

针对射频模拟的自适应子空间变分量子本征值求解器

Zhixiu Han, Fanxu Meng, Weidong Li, Xutao Yu, Zaichen Zhang

专题命中 Agent评测 :agent(abstract)

AI总结 本文提出一种自适应子空间变分量子本征值求解器,通过强化学习优化电路设计和自适应射频分配,提升NISQ设备上微波波导本征模模拟的效率和精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2207.00685 2025-12-12 econ.TH 50%

Engagement Maximization

参与度最大化

Benjamin Hébert, Weijie Zhong

专题命中 Agent评测 :agent(abstract)

AI总结 本文提出通过稀释策略最大化用户参与度,通过稀有但信息丰富的信号诱导用户在关键信号到来时停止,应用于广告媒体和教育场景。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10106 2025-12-12 cs.SI cs.MA 50%

A Simulation Framework for Studying Recommendation-Network Co-evolution in Social Platforms

推荐网络共演的模拟框架

Gaurav Koley, Sanika Digrajkar

专题命中 Agent评测 :agent(abstract)

AI总结 本文提出一个模拟框架,研究推荐系统与社交网络的共进化,通过实验发现激活时间影响网络结构和参与度,延迟激活可提升内容多样性但降低模块性。

详情

展开后加载摘要…

URL PDF HTML 收藏