arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

共收录 15866 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. Agent评测 15866 篇

2601.08183 2026-01-15 cs.CV cs.AI 57%

GI-Bench: A Panoramic Benchmark Revealing the Knowledge-Experience Dissociation of Multimodal Large Language Models in Gastrointestinal Endoscopy Against Clinical Standards

GI-Bench: 一个全景基准测试,揭示多模态大语言模型在内窥镜检查中与临床标准相比的知识-经验脱节

Yan Zhu, Te Luo, Pei-Yao Fu, Zhen Zhang, Zi-Long Wang, Yi-Fan Qu, Zi-Han Geng, Jia-Qi Xu, Lu Yao, Li-Yun Ma, Wei Su, Wei-Feng Chen, Quan-Lin Li, Shuo Wang, Ping-Hong Zhou

专题命中 Agent评测 :workflow(abstract);分类 cs.AI

AI总结 GI-Bench通过评估多模态大语言模型在胃肠内窥镜中的性能,揭示其在诊断推理和空间定位方面的不足,发现模型在语言流畅度上优于人类,但事实准确性较低。

Comments 45 pages, 17 figures, 6 tables. Leaderboard available at: https://roterdl.github.io/GIBench/ . Includes supplementary material

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08748 2026-01-14 cs.CV cs.AI 57%

UR-Bench: A Benchmark for Multi-Hop Reasoning over Ultra-High-Resolution Images

UR-Bench:面向超高清图像的多跳推理基准

Siqi Li, Xinyu Cai, Jianbiao Mei, Nianchen Deng, Pinlong Cai, Licheng Wen, Yufan Shen, Xuemeng Yang, Botian Shi, Yong Liu

机构 * Zhejiang University(浙江大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 UR-Bench是一个针对超高清图像多跳推理的基准,通过引入代理框架和语义工具,评估大语言模型在极端视觉信息下的推理能力。

Comments 10 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08690 2026-01-14 cs.AI 57%

All Required, In Order: Phase-Level Evaluation for AI-Human Dialogue in Healthcare and Beyond

全部必要,按顺序:面向AI-人类对话在医疗保健及其他领域的相级评估

Shubham Kulkarni, Alexander Lyzhov, Shiva Chaitanya, Preetam Joshi

专题命中 Agent评测 :workflow(abstract);分类 cs.AI

AI总结 OIP-SCE是一种用于评估AI-人类对话在医疗及其他领域中合规性的方法,通过相级证据确保临床义务按顺序满足,提升AI与临床流程的对齐度。

Comments Accepted at the AI for Medicine and Healthcare (AIMedHealth) Bridge Program, AAAI-26, Singapore. Full-length paper; to appear in Proceedings of Machine Learning Research (PMLR)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08406 2026-01-14 cs.AI cs.CR 57%

WebTrap Park: An Automated Platform for Systematic Security Evaluation of Web Agents

WebTrap Park: 一个用于系统评估Web代理安全性的自动化平台

Xinyi Wu, Jiagui Chen, Geng Hong, Jiayi Dong, Xudong Pan, Jiarun Dai, Min Yang

机构 * Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 WebTrap Park通过自动化平台系统评估Web代理的安全性,揭示不同框架间的安全差异,强调架构重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08254 2026-01-14 cs.AI cs.SY eess.SY 57%

Large Artificial Intelligence Model Guided Deep Reinforcement Learning for Resource Allocation in Non Terrestrial Networks

大人工智能模型引导的深度强化学习用于非地面网络资源分配

Abdikarim Mohamed Ibrahim, Rosdiadee Nordin

机构 * Faculty of Engineering, Sunway University, Petaling Jaya, Malaysia(工程学院,Sunway大学,Petaling Jaya,马来西亚) Future Cities Research Institute, Sunway University, Petaling Jaya, Malaysia(未来城市研究 institute,Sunway大学,Petaling Jaya,马来西亚)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 本文提出利用大语言模型引导深度强化学习,以提升非地面网络资源分配的性能,在极端天气下表现优于传统方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07395 2026-01-13 cs.CR cs.AI 57%

MCP-ITP: An Automated Framework for Implicit Tool Poisoning in MCP

MCP-ITP:一种用于MCP中隐式工具中毒的自动化框架

Ruiqi Li, Zhiqiang Wang, Yunhao Yao, Xiang-Yang Li

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 MCP-ITP是一种用于MCP中隐式工具中毒的自动化框架,通过黑箱优化策略提升攻击成功率并规避检测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02598 2026-01-13 cs.DL cs.AI 57%

LongDA: Benchmarking LLM Agents for Long-Document Data Analysis

LongDA:评估基于LLM的代理在长文档数据分析中的基准测试

Yiyang Li, Zheyuan Zhang, Tianyi Ma, Zehong Wang, Keerthiram Murugesan, Chuxu Zhang, Yanfang Ye

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 LongDA通过评估基于LLM的代理在长文档数据分析中的性能,揭示了现有模型在处理复杂任务时的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.06361 2026-01-13 cs.MA cs.AI cs.GT 57%

A Graph-Theoretical Perspective on Law Design for Multiagent Systems

多智能体系统的法律设计图论视角

Qi Shi, Pavel Naumov

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 本文从图论角度研究多智能体系统中法律设计问题,提出两种法律类型并证明其最小化问题的计算复杂性,同时利用超图顶点覆盖的近似算法进行高效近似。

Comments The 40th AAAI Conference on Artificial Intelligence (AAAI-26)

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.02225 2026-01-13 cs.LG 57%

Metric Design != Metric Behavior: Improving Metric Selection for the Unbiased Evaluation of Dimensionality Reduction

度量设计不等于度量行为:改进无偏评估降维的度量选择

Jiyeon Bae, Hyeon Jeon, Jinwook Seo

机构 * Seoul National University(首尔国立大学)

专题命中 Agent评测 :workflow(abstract);分类 cs.LG

AI总结 本文提出了一种基于度量相关性聚类的工作流程,以减少降维评估中的偏差,提高评估的稳定性。

Comments IEEE VIS 2025 (short paper)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06027 2026-01-13 cs.HC cs.AI cs.CE cs.IR cs.PL 57%

AI-Assisted Authoring for Transparent, Data-Driven Documents

辅助作者生成透明、数据驱动的文档

Alfonso Piscitelli, Cristina David, Mattia De Rosa, Ali Mohammed, Federico Nanni, Jacob Pake, Roly Perera, Jessy Sodimu, Chenyiqiu Zheng

机构 * University of Salerno(萨勒诺大学) University of Bristol(布里斯托大学) Manchester Metropolitan University(曼彻斯特 Metropolitan 大学) The Alan Turing Institute(艾伦·图灵研究所) University of Kent(肯特大学) University of Cambridge(剑桥大学) University of Bath(巴斯大学) University College London(伦敦大学学院)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 本文提出了一种基于大语言模型的工具,用于生成透明、数据驱动的文档,通过交互式数据溯源技术增强学术文章的可验证性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.07278 2026-01-13 cs.AI 57%

Lifelong Learning of Large Language Model based Agents: A Roadmap

基于大语言模型代理的终身学习:路线图

Junhao Zheng, Chengming Shi, Xidi Cai, Qiuke Li, Duzhen Zhang, Chenxing Li, Dong Yu, Qianli Ma

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 本文提出了一种基于大语言模型代理的终身学习框架,通过三个模块整合多模态输入、知识存储与动态环境交互,以实现持续适应和长期性能提升。

Comments Accepted to IEEE TPAMI

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.11796 2026-01-12 nlin.AO cond-mat.dis-nn cs.CV cs.LG 57%

Solving Inverse Problems in Stochastic Self-Organizing Systems through Invariant Representations

通过不变表示解决随机自组织系统中的逆问题

Elias Najarro, Nicolas Bessone, Sebastian Risi

机构 * IT University of Copenhagen(丹麦哥本哈根IT大学)

专题命中 Agent评测 :agent(abstract);分类 cs.LG

AI总结 本文提出了一种利用不变表示解决随机自组织系统逆问题的方法,通过视觉嵌入生成鲁棒表示,有效恢复未知因果参数,适用于物理、生物和社会系统。

Comments Preprint. Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01802 2026-01-09 cs.AI 57%

PsychEval: A Multi-Session and Multi-Therapy Benchmark for High-Realism AI Psychological Counselor

PsychEval: 一个多会话和多疗法的基准,用于高真实感的AI心理顾问

Qianjun Pan, Junyi Wang, Jie Zhou, Yutao Yang, Junsong Li, Kaiyin Xu, Yougen Zhou, Yihan Li, Jingyuan Zhao, Qin Chen, Ningning Zhou, Kai Chen, Liang He

机构 * School of Computer Science and Technology, East China Normal University(东华大学计算机科学与技术学院) Shanghai AI Laboratory(上海人工智能实验室) School of Psychology and Cognitive Science, East China Normal University(东华大学心理学与认知科学学院)

专题命中 Agent评测 :planning(abstract);分类 cs.AI

AI总结 PsychEval是一个多会话和多疗法的基准,用于评估高真实感的AI心理顾问,通过多阶段数据集和全面评估框架提升AI在心理咨询服务中的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.03508 2026-01-09 cs.CL 57%

One Battle After Another: Probing LLMs' Limits on Multi-Turn Instruction Following with a Benchmark Evolving Framework

一战接一战:通过一个演进框架探测LLMs在多轮指令遵循中的极限

Qi Jia, Ye Shen, Xiujie Song, Kaiwei Zhang, Shibo Wang, Dun Pei, Xiangyang Zhu, Guangtao Zhai

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Shanghai Jiao Tong University(上海交通大学) Jilin University(吉林大学)

专题命中 Agent评测 :agent(abstract);分类 cs.CL

AI总结 本文提出EvolIF演进框架,通过多轮对话测试LLMs的指令遵循能力,揭示失败恢复和细粒度指令遵循的不足,GPT-5在鲁棒性上表现最佳。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04137 2026-01-08 cs.RO cs.AI cs.CV 57%

Wow, wo, val! A Comprehensive Embodied World Model Evaluation Turing Test

哇,哇,val!一个综合的具身世界模型评估图灵测试

Chun-Kai Fan, Xiaowei Chi, Xiaozhu Ju, Hao Li, Yong Bao, Yu-Kai Wang, Lizhang Chen, Zhiyuan Jiang, Kuangzhi Ge, Ying Li, Weishi Mi, Qingpo Wuwu, Peidong Jia, Yulin Luo, Kevin Zhang, Zhiyuan Qin, Yong Dai, Sirui Han, Yike Guo, Shanghang Zhang, Jian Tang

机构 * State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University(多媒体信息处理国家重点实验室,计算机学院,北京大学) Beijing Innovation Center of Humanoid Robotics(人形机器人创新中心) The Hong Kong University of Science and Technology(香港科技大学)

专题命中 Agent评测 :planning(abstract);分类 cs.AI

AI总结 本文提出Wow-wo-val基准测试,评估视频基础模型在具身人工智能中的生成能力,发现其在长期规划和物理一致性上表现有限,揭示了现实世界与生成视频之间的差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03543 2026-01-08 cs.CL 57%

EvolMem: A Cognitive-Driven Benchmark for Multi-Session Dialogue Memory

EvolMem:一种基于认知的多会话对话记忆基准

Ye Shen, Dun Pei, Yiqiu Guo, Junying Wang, Yijin Guo, Zicheng Zhang, Qi Jia, Jun Zhou, Guangtao Zhai

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Fudan University(复旦大学)

专题命中 Agent评测 :agent(abstract);分类 cs.CL

AI总结 EvolMem提出了一种基于认知的多会话对话记忆基准,用于评估LLMs和智能体系统的多会话记忆能力,揭示了不同模型在多维记忆任务中的表现差异。

Comments 14 pages, 7 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03458 2026-01-08 cs.CY cs.AI 57%

Automated Feedback Generation for Undergraduate Mathematics: Development and Evaluation of an AI Teaching Assistant

大学数学自动反馈生成:一种AI教学助教的开发与评估

Aron Gohr, Marie-Amelie Lawn, Kevin Gao, Inigo Serjeant, Stephen Heslip

机构 * Imperial College London(帝国理工学院伦敦校区)

专题命中 Agent评测 :workflow(abstract);分类 cs.AI

AI总结 本文提出了一种基于AI的教学助手系统,用于生成大学数学作业的自动反馈,通过模块化工作流和大型语言模型实现了对技术正确性和风格的评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12302 2026-01-08 cs.CV cs.CL cs.RO 57%

From Human Intention to Action Prediction: Intention-Driven End-to-End Autonomous Driving

从人类意图到动作预测:意图驱动的端到端自动驾驶

Huan Zheng, Yucheng Zhou, Tianyi Yan, Jiayi Su, Hongjun Chen, Dubing Chen, Xingtai Gui, Wencheng Han, Runzhou Tao, Zhongying Qiu, Jianfei Yang, Jianbing Shen

机构 * SKL-IOTSC, CIS, University of Macau(澳门大学SKL-IOTSC、CIS) Zhejiang ZEEKR Automobile Research & Development Co., Ltd.(浙江浙汽汽车研究院有限公司)

专题命中 Agent评测 :agent(abstract);分类 cs.CL

AI总结 本文提出意图驱动的端到端自动驾驶框架,通过引入新的评估协议和两种解决方案范式,提升自动驾驶对高层次人类意图的理解和实现能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12063 2026-01-07 cs.AI 57%

TextBO: Bayesian Optimization in Language Space for Eval-Efficient Self-Improving AI

TextBO: 在语言空间中基于贝叶斯优化的评估高效自改进AI

Enoch Hyunwook Kang, Hema Yoganarasimhan

机构 * University of Washington(华盛顿大学)

专题命中 Agent评测 :agentic(abstract);分类 cs.AI

AI总结 TextBO是一种在语言空间中基于贝叶斯优化的评估高效自改进AI算法,通过结合文本梯度与最佳N选择策略,实现高效自改进。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02314 2026-01-06 cs.AI 57%

Project Ariadne: A Structural Causal Framework for Auditing Faithfulness in LLM Agents

Project Ariadne: 一种用于审计大语言模型代理忠实性的结构因果框架

Sourena Khanzadeh

机构 * Sourena Khanzadeh(独立研究者)

专题命中 Agent评测 :agentic(abstract);分类 cs.AI

AI总结 Project Ariadne提出一种结构因果框架,通过因果干预评估大语言模型代理推理的忠实性,揭示代理推理与决策之间的因果脱节问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21907 2026-01-06 cs.AI 57%

SpatialBench: Can Agents Analyze Real-World Spatial Biology Data?

SpatialBench: 聊聊智能体能否分析真实世界的空间生物学数据?

Kenny Workman, Zhen Yang, Harihara Muralidharan, Hannah Le

机构 * LatchBio

专题命中 Agent评测 :AI agent(abstract);分类 cs.AI

AI总结 SpatialBench通过146个可验证问题评估智能体分析真实世界空间生物学数据的能力,揭示了模型性能受设计和平台影响显著,需进一步优化工具与流程。

Comments 10 pages, 9 figures, 4 tables; NeurIPS 2024 format

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01530 2026-01-06 cs.CL cs.HC 57%

EmoHarbor: Evaluating Personalized Emotional Support by Simulating the User's Internal World

EmoHarbor:通过模拟用户的内心世界评估个性化情感支持

Jing Ye, Lu Xiang, Yaping Zhang, Chengqing Zong

专题命中 Agent评测 :agent(abstract);分类 cs.CL

AI总结 EmoHarbor通过模拟用户内心世界,评估个性化情感支持的定制能力,揭示大语言模型在情感支持中的不足,推动用户感知情感支持系统的发展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00930 2026-01-06 cs.IR cs.AI 57%

AlignUSER: Human-Aligned LLM Agents via World Models for Recommender System Evaluation

AlignUSER: 通过世界模型对齐LLM代理以评估推荐系统

Nicolas Bougie, Gian Maria Marconi, Tony Yip, Narimasa Watanabe

机构 * Woven by Toyota(丰田织物)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 AlignUSER通过世界模型驱动的代理学习,利用人类交互数据提升推荐系统评估的准确性与真实用户行为的对齐程度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.09737 2026-01-06 cs.AI cs.RO 57%

General Dynamic Goal Recognition using Goal-Conditioned and Meta Reinforcement Learning

使用目标条件化和元强化学习进行通用动态目标识别

Osher Elhadad, Owen Morrissey, Reuth Mirsky

机构 * Department of Computer Science, Bar Ilan University(巴伊兰大学计算机科学系) Department of Computer Science, Tufts University(塔夫茨大学计算机科学系)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 本文提出两种方法,通过目标条件化和元强化学习实现动态环境下的目标识别,提升系统在变化和噪声中的适应能力与识别精度。

Comments Accepted for publication at AAMAS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00607 2026-01-05 cs.LG 57%

Traffic-Aware Optimal Taxi Placement Using Graph Neural Network-Based Reinforcement Learning

基于图神经网络强化学习的交通感知出租车最优布置

Sonia Khetarpaul, P Y Sharan

专题命中 Agent评测 :agent(abstract);分类 cs.LG

AI总结 本文提出基于图神经网络强化学习的交通感知出租车最优布置方法,通过实时整合交通数据优化出租车热点,有效减少乘客等待时间和司机行驶距离。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00596 2026-01-05 cs.CL 57%

Beyond IVR: Benchmarking Customer Support LLM Agents for Business-Adherence

超越IVR:评估符合业务规范的客户支持LLM代理的基准测试

Sumanth Balaji, Piyush Mishra, Aashraya Sachdeva, Suraj Agrawal

专题命中 Agent评测 :agent(abstract);分类 cs.CL

AI总结 本文提出JourneyBench基准测试,用于评估客户支持中遵循业务政策的LLM代理,展示动态提示代理在提升政策遵循度方面的有效性。

Comments 17 pages, 3 figures, preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00213 2026-01-05 cs.CR cs.CL 57%

Overlooked Safety Vulnerability in LLMs: Malicious Intelligent Optimization Algorithm Request and its Jailbreak

LLMs中被忽视的安全漏洞:恶意智能优化算法请求及其突破

Haoran Gu, Handing Wang, Yi Mei, Mengjie Zhang, Yaochu Jin

机构 * Xidian University(西安电子科技大学) Victoria University of Wellington(威灵顿维多利亚大学) Westlake University(西湖大学)

专题命中 Agent评测 :agent(abstract);分类 cs.CL

AI总结 本研究揭示了LLMs在恶意智能优化算法请求中的安全漏洞,提出MOBjailbreak方法并评估了其对主流模型的攻击效果,强调了对齐技术在防范滥用中的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.15206 2026-01-05 cs.CV cs.LG cs.RO 57%

AutoTrust: Benchmarking Trustworthiness in Large Vision Language Models for Autonomous Driving

AutoTrust: 评估自动驾驶大视觉语言模型的可信度

Shuo Xing, Hongyuan Hua, Xiangbo Gao, Shenzhe Zhu, Renjie Li, Kexin Tian, Xiaopeng Li, Heng Huang, Tianbao Yang, Zhangyang Wang, Yang Zhou, Huaxiu Yao, Zhengzhong Tu

专题命中 Agent评测 :agent(abstract);分类 cs.LG

AI总结 AutoTrust研究自动驾驶大视觉语言模型的可信度问题,发现通用模型在可信度上优于专用模型,同时揭示DriveVLMs在隐私、安全和公平性方面的漏洞。

Comments Published at TMLR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24733 2026-01-01 cs.CL 57%

BIOME-Bench: A Benchmark for Biomolecular Interaction Inference and Multi-Omics Pathway Mechanism Elucidation from Scientific Literature

BIOME-Bench: 一个用于生物分子相互作用推断和多组学通路机制阐明的基准

Sibo Wei, Peng Chen, Lifeng Dong, Yin Luo, Lei Wang, Peng Zhang, Wenpeng Lu, Jianbin Guo, Hongjun Yang, Dajun Zeng

机构 * Beijing Wenge Technology Co., Ltd(北京文格科技有限公司) Experimental Research Center, China Academy of Chinese Medical Sciences(中国中医科学院实验研究中心) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) College of Intelligence and Computing, Tianjin University(天津大学智能与计算学院) Qilu University of Technology (Shandong Academy of Sciences)(齐鲁工业大学(山东科学院)) School of New Media and Communication, Tianjin University(天津大学新闻与传播学院) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院)

专题命中 Agent评测 :workflow(abstract);分类 cs.CL

AI总结 BIOME-Bench通过四阶段工作流评估LLMs在多组学分析中的生物分子相互作用推断和通路机制阐明能力,揭示现有模型在细粒度关系区分和通路解释上的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23440 2025-12-30 cs.CL 57%

ClinDEF: A Dynamic Evaluation Framework for Large Language Models in Clinical Reasoning

ClinDEF: 一种用于大语言模型临床推理的动态评估框架

Yuqi Tang, Jing Yu, Zichang Su, Kehua Feng, Zhihui Zhu, Libin Wang, Lei Liang, Qiang Zhang, Keyan Ding, Huajun Chen

机构 * ZJU-Hangzhou Global Scientific and Technological Innovation Center, Zhejiang University(浙江大学杭州全球科技创新中心) ZJU-UIUC Institute, Zhejiang University(浙江大学UIUC研究院) College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院) The Polytechnic Institute, Zhejiang University(浙江大学 polytechnic 院) AntGroup(蚂蚁集团)

专题命中 Agent评测 :agent(abstract);分类 cs.CL

AI总结 ClinDEF通过模拟诊断对话评估大语言模型的临床推理能力,利用疾病知识图谱生成病例并进行多轮交互,提供细粒度效率分析和诊断质量评估,揭示LLM在临床推理中的关键不足。

Comments 23 pages, 4 figures, under review

详情

展开后加载摘要…

URL PDF HTML 收藏