Agentic Systems in Radiology: Design, Applications, Evaluation, and Challenges
专题命中 Agent评测 :agentic(title,abstract);tool use(abstract);tool-use(abstract);planning(abstract)
AI 大模型
智能体、工具调用、规划、工作流、多智能体和自主任务执行。
专题命中 Agent评测 :agentic(title,abstract);tool use(abstract);tool-use(abstract);planning(abstract)
机构 * ByteDance Seed(字节跳动种子)
专题命中 Agent评测 :agentic(title,abstract);agent(abstract);planning(abstract);multi-agent(abstract)
机构 * Johns Hopkins University(约翰霍普金斯大学)
专题命中 Agent评测 :agentic(title,abstract);agent(abstract);planning(abstract);workflow(abstract)
Comments Accepted to COLM 2025
机构 * Full author list in Contributions(完整作者列表)
专题命中 Agent评测 :agentic(title,abstract);agent(abstract);tool use(abstract);workflow(abstract)
机构 * University of California, Santa Barbara(加州大学圣芭芭拉分校) ; Meta
专题命中 Agent评测 :agent(title,abstract);planning(abstract);workflow(abstract);agentic(abstract)
专题命中 Agent评测 :agentic(title,abstract);agent(abstract);tool use(abstract);workflow(abstract)
Comments Accepted by ICML2025 as Poster
专题命中 Agent评测 :AI agent(title,abstract);agent(abstract);autonomous agent(abstract);agentic(abstract)
TxBench-PP:分析AI代理在小分子临床前药理学中的表现
机构 * LatchBio
专题命中 Agent评测 :agent(title);AI agent(title);workflow(abstract);分类 cs.AI、cs.LG
AI总结 提出TxBench-PP基准,用于评估AI代理从真实实验数据中恢复临床前药理学结论的能力,测试显示最强配置Claude Opus 4.8 / Pi仅通过59.3%的端点尝试。
CAMO:一种用于从微观行为到宏观涌现的LLM代理模拟自动因果发现的框架
机构 * College of Intelligence and Computing, Tianjin University(天津大学智能计算学院) ; Tianjin Key Laboratory of Healthy Habitat and Smart Technology(天津健康人居环境与智能技术重点实验室) ; Laboratory of Computation and Analytics of Complex Management Systems, Tianjin University(复杂管理系统计算与分析实验室)
专题命中 Agent评测 :agent(title,abstract);agentic(title);分类 cs.AI、cs.CL
AI总结 CAMO通过分析LLM代理模拟中的微观行为,自动发现导致宏观结果的因果机制,提供可解释的因果链和干预手段,提升对社会涌现的理解。
你的大语言模型真的掌握了概念吗?一个多智能体基准
机构 * Beijing Normal University(北京师范大学) ; Australian National University(澳大利亚国立大学)
专题命中 Agent评测 :agent(title,abstract);multi-agent(title);分类 cs.AI、cs.CL
AI总结 本文提出CK-Arena,通过多智能体社交推理游戏评估大语言模型的概念理解能力,揭示模型在概念掌握上的差异性。
Comments 8 pages
人工智能代理供应链中行为后门检测的跨LLM泛化
机构 * Arun Chowdary Sanna(独立研究者)
专题命中 Agent评测 :AI agent(title,abstract);agent(title);分类 cs.AI、cs.LG
AI总结 本研究首次系统探讨了跨LLM行为后门检测的泛化问题,发现模型特定特征导致泛化差距,并提出模型感知检测方法提升检测准确率。
Comments 10 pages, 2 figures, 8 tables. Evaluation across 6 production LLMs with 1,198 traces
机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; Grammarly
专题命中 Agent评测 :agent(title,abstract);AI agent(title);分类 cs.AI、cs.CL
机构 * Salesforce AI Research(Salesforce人工智能研究)
专题命中 Agent评测 :agent(title,abstract);AI agent(title);分类 cs.AI、cs.CL
专题命中 Agent评测 :agent(title,abstract);AI agent(title);分类 cs.AI、cs.CL
专题命中 Agent评测 :agent(title,abstract);multi-agent(title);分类 cs.AI、cs.LG
Comments In Proceedings ICLP 2021, arXiv:2109.07914
Journal ref EPTCS 345, 2021, pp. 182-188
Site4Drug: 利用AI智能体预测药物结合靶点
机构 * University of California, San Diego(加州大学圣地亚哥分校)
专题命中 Agent评测 :agent(title,abstract);AI agent(title);分类 cs.LG;agentic(comments)
AI总结 提出Site4Drug,一种模态感知的靶点发现智能体,通过整合拓扑、亲水性、翻译后修饰等证据,输出带约束、风险标记和决策日志的可靶向区域排名列表,并自动推荐结合模态。
Comments Accepted to the ICML 2026 Workshop on Generative and Agentic AI for Biology (GenBio)
AI智能体与可视化(VIS)的未来
专题命中 Agent评测 :AI agent(title,abstract);agent(abstract);autonomous agent(abstract);agentic(abstract)
AI总结 该研讨会聚焦AI智能体与VIS领域的融合,探讨自主智能体对VIS的影响、人机协作等关键问题,邀请相关人员分享思路以推动VIS在人机共存未来的发展。
Comments workshop proposal
DocOps:复杂文档操作中自主智能体的可验证基准
专题命中 Agent评测 :autonomous agent(title,abstract);workflow(abstract);agentic(abstract);分类 cs.AI、cs.CL、cs.LG
AI总结 研究自主智能体处理数字文档的能力,引入DocOps评估框架,解构文档操作,评估多种模型,发现其局限性及关键失败模式,揭示能力边界,为健壮无损智能体设计提供启示。
用于开放即兴分割的视觉引导代理
机构 * University of Michigan(密歇根大学)
专题命中 Agent评测 :agent(title,abstract);AI agent(abstract);workflow(abstract);agentic(abstract)
AI总结 本文提出了一种名为VASA的视觉引导即兴分割代理,该代理通过结合视觉语言模型、分割基础模型和视觉引导工作流,实现了无需训练的即兴分割任务,其在PARS和RefCOCO等基准测试中均表现出色。
Comments 23 pages, 11 figures
RewardHarness: 自我进化代理的后训练
机构 * University of British Columbia(不列颠哥伦比亚大学) ; Vector Institute(向量研究所) ; Kolors Team, Kuaishou Technology(快手团队) ; Carnegie Mellon University(卡内基梅隆大学) ; University of Waterloo(滑铁卢大学) ; Etude AI ; Tsinghua University(清华大学) ; Georgia Institute of Technology(佐治亚理工学院)
专题命中 Agent评测 :agentic(title,abstract);agent(abstract,abstract_cn);分类 cs.AI、cs.CL、cs.LG
AI总结 RewardHarness通过自我进化代理框架,利用少量人类偏好示例迭代优化工具库,实现高效图像编辑评估,准确率达47.4%,超越GPT-5 5.3个百分点。
Comments Project page: https://rewardharness.com
AgentDyn: 您的代理安全防御能在现实世界动态环境中部署吗?
专题命中 Agent评测 :agent(title,abstract);AI agent(abstract);planning(abstract);agentic(abstract)
AI总结 本文揭示现有代理安全基准的三大缺陷,提出AgentDyn基准,包含60个挑战性开放任务和560个注入测试用例,评估十种先进防御,发现现有防御不足或过度防御,亟需更适应动态环境的基准。
Comments 26 Pages, 17 Tables
AgentServe: 为在消费级GPU上高效执行代理AI服务的算法-系统协同设计
专题命中 Agent评测 :agentic(title,abstract);agent(abstract);AI agent(abstract);multi-agent(abstract)
AI总结 AgentServe通过算法-系统协同设计,在消费级GPU上实现高效代理AI服务,提升延迟稳定性并保持吞吐量。
代理批判训练
机构 * University of Maryland College Park(马里兰大学学院公园分校)
专题命中 Agent评测 :agentic(title,abstract);agent(abstract);autonomous agent(abstract);分类 cs.AI、cs.CL、cs.LG
AI总结 代理批判训练(ACT)是一种强化学习方法,通过奖励模型判断替代行为的正确性,使模型自主发展对行为质量的推理,从而提升代理性能和泛化能力。
Comments Project page: https://attention-is-all-i-need.github.io/ACT/
代理自动组合:一种背包方法用于代理组件选择
机构 * AWS Agentic AI(AWS 代理人工智能)
专题命中 Agent评测 :agentic(title,abstract);agent(abstract);multi-agent(abstract);分类 cs.AI、cs.CL、cs.LG
AI总结 本文提出基于背包问题的代理组件自动组合框架,通过动态评估组件性能与成本,提升代理系统在不同场景下的成功率和资源利用效率。
Comments Accepted to NeurIPS 2025 Conference
专题命中 Agent评测 :agent(title,abstract);AI agent(abstract);agentic(abstract);分类 cs.AI、cs.CL、cs.LG
专题命中 Agent评测 :agentic(title,abstract);agent(abstract);autonomous agent(abstract);分类 cs.AI、cs.CL、cs.LG
Comments 38th Conference on Neural Information Processing Systems (NeurIPS 2024), NeurIPS 2024 Workshop on Open-World Agents
专题命中 Agent评测 :agentic(title,abstract);agent(abstract);multi-agent(abstract);分类 cs.AI、cs.CL、cs.LG
Comments Paper was accepted for Undergraduate Consortium at ACM KDD, 2024. Please find the link: https://kdd2024.kdd.org/undergraduate-consortium/
HANDBOOK.md:长上下文代理指令跟随基准测试
机构 * Surge AI
专题命中 Agent评测 :agentic(title,abstract);agent(abstract,comments);tool-use(abstract);分类 cs.AI、cs.CL
AI总结 该研究提出HANDBOOK.md基准测试,模拟企业员工遵循公司手册,含65个代理任务跨越多领域多公司。任务修改基础手册防记忆,评分具确定性。测试发现模型配置通过率低,代理常违背策略,还发布了所有任务、环境及评估工具。
Comments 16 pages, 3 figures, 5 tables. Accepted to the Workshop on Agent Behavior (WAB) at COLM 2026. Benchmark, environments, and evaluation harness: https://github.com/surge-ai/handbook
专题命中 Agent评测 :agentic(title,abstract);agent(abstract);multi-agent(abstract);分类 cs.AI、cs.SE
Comments Petar Radanliev, Carsten Maple, Omar Santos, and Kayvan Atefi. 2026. SBOMs into Agentic AIBOMs: Schema Extensions, Agentic Orchestration, and Reproducibility Evaluation. Digital Threats Just Accepted (March 2026)
多视角编码器在基于大语言模型的代理工作流性能预测中的应用
机构 * KAIST(韩国科学技术院)
专题命中 Agent评测 :agentic(title,abstract);agent(abstract);workflow(abstract);分类 cs.AI、cs.LG
AI总结 本文提出Agentic Predictor,通过多视角编码技术与跨领域预训练,实现高效准确的代理工作流性能预测,提升LLM代理系统设计效率。
Comments ICLR 2026, Project Page: https://deepauto-ai.github.io/agentic-predictor/