arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-01-26 至 2026-01-26 共收录 51 信号源:cs.CL, cs.AI, cs.LG

1. 数学推理 3 篇

2512.22255 2026-01-26 cs.AI cs.LG 86%

Shape of Thought: When Distribution Matters More than Correctness in Reasoning Tasks

思维的形状:当分布比正确性更重要时在推理任务中的表现

Abhranil Chandra, Ayush Agrawal, Arian Hosseini, Sebastian Fischmeister, Rishabh Agarwal, Navin Goyal, Aaron Courville

机构 * University of Waterloo(滑铁卢大学) University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校) MILA - Quebec AI Institute(魁北克人工智能研究所) Université de Montréal(蒙特利尔大学) Microsoft Research India(微软印度研究院) Google DeepMind(谷歌DeepMind) Periodic Labs(周期实验室)

专题命中 数学推理 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.AI、cs.LG

AI总结 通过训练合成数据集中的链式思考轨迹,即使最终答案错误,也能提升语言模型的推理能力,表明分布比正确性更重要。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16218 2026-01-26 cs.CL cs.AI 81%

M3Kang: Evaluating Multilingual Multimodal Mathematical Reasoning in Vision-Language Models

M3Kang: 评估视觉-语言模型在多语言多模态数学推理中的表现

Aleix Torres-Camps, Nathaniel Mitrani Hadida, Víctor Conchello Vendrell, Àlex Batlle Casellas, Arnau Padrés Masdemont, Jordi Ros-Giralt

机构 * Qualcomm AI Research(高通人工智能研究)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 M3Kang是一个大规模多语言多模态数学推理数据集,用于评估视觉-语言模型在多语言数学推理中的表现,通过基准测试揭示模型在基础数学和图表推理上的不足,并展示多语言技术在多模态设置中的有效性。

Comments 10 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01078 2026-01-26 cs.AI 57%

SimWorld: An Open-ended Realistic Simulator for Autonomous Agents in Physical and Social Worlds

SimWorld:一种用于物理和社会世界中自主代理的开放式真实模拟器

Jiawei Ren, Yan Zhuang, Xiaokang Ye, Lingjun Mao, Xuhong He, Jianzhi Shen, Mrinaal Dogra, Yiming Liang, Ruixuan Zhang, Tianai Yue, Yiqing Yang, Eric Liu, Ryan Wu, Kevin Benavente, Rajiv Mandya Nagaraju, Muhammad Faayez, Xiyan Zhang, Dhruv Vivek Sharma, Xianrui Zhong, Ziqiao Ma, Tianmin Shu, Zhiting Hu, Lianhui Qin

机构 * UCSD(加州大学圣地亚哥分校) UVA(弗吉尼亚大学) UIUC(伊利诺伊大学香槟分校) JHU(约翰·霍普金斯大学) Purdue(Purdue 大学) PolyU USC(美国南加州大学) UMich(密歇根大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI

AI总结 SimWorld是一个基于Unreal Engine 5构建的开放式真实模拟器,旨在开发和评估LLM/VLM代理在复杂物理和社会环境中的能力,通过多代理配送任务验证其推理模式与局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 逻辑推理 1 篇

2509.04744 2026-01-26 cs.SD cs.CL eess.AS 79%

WildScore: Benchmarking MLLMs in-the-Wild Symbolic Music Reasoning

WildScore: 多模态符号音乐推理在现实中的基准测试

Gagan Mundada, Yash Vishe, Amit Namburi, Xin Xu, Zachary Novack, Julian McAuley, Junda Wu

机构 * University of California, San Diego(加州大学圣地亚哥分校)

专题命中 逻辑推理 :reasoning(title,abstract);分类 cs.CL

AI总结 WildScore是首个用于评估多模态大语言模型在现实世界中符号音乐推理能力的基准测试,通过真实音乐作品和用户生成问题,系统性评估模型在音乐学分析中的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 规划推理 11 篇

2601.01011 2026-01-26 cs.CL cs.AI 84%

Intention Collapse: Intention-Level Metrics for Reasoning in Language Models

意图坍缩:语言模型推理中的意图级度量

Patricio Vera

机构 * School of Engineering and Applied Science(工程与应用科学学院) George Washington University(乔治·华盛顿大学)

专题命中 规划推理 :reasoning(title);chain-of-thought(abstract);CoT(abstract);分类 cs.CL、cs.AI

AI总结 研究提出意图级度量用于评估语言模型推理性能,通过意图熵、有效维度和可恢复性分析CoT方法的效果差异。

Comments 41 pages, 8 figures, 6 tables. Code: https://github.com/patriciomvera/intention-collapse-experiments

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16480 2026-01-26 cs.CL 79%

TL-GRPO: Turn-Level RL for Reasoning-Guided Iterative Optimization

TL-GRPO:基于回合的强化学习用于推理引导的迭代优化

Peiji Li, Linyang Li, Handa Sun, Wenjin Mai, Yongkang Chen, Xiaozhe Li, Yue Shen, Yichuan Ma, Yiliu Sun, Jiaxi Cao, Zhishu He, Bo Wang, Xiaoqing Zheng, Zhaori Bi, Xipeng Qiu, Qipeng Guo, Kai Chen, Dahua Lin

机构 * Fudan University(复旦大学) Shanghai AI Laboratory(上海人工智能实验室) The Chinese University of Hong Kong(香港中文大学)

专题命中 规划推理 :reasoning(title,abstract);分类 cs.CL

AI总结 TL-GRPO通过回合级分组采样优化解决迭代优化任务中的轨迹级强化学习问题,实现更精细的优化效果。

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16486 2026-01-26 cs.CL cs.AI 73%

Timely Machine: Awareness of Time Makes Test-Time Scaling Agentic

及时机器:时间意识使测试时间缩放成为代理

Yichuan Ma, Linyang Li, Yongkang chen, Peiji Li, Xiaozhe Li, Qipeng Guo, Dahua Lin, Kai Chen

机构 * Fudan University Shanghai AI Laboratory(复旦大学上海人工智能实验室) Shanghai AI Laboratory(上海人工智能实验室) The Chinese University of Hong Kong(香港中文大学)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.CL、cs.AI

AI总结 Timely Machine通过重新定义测试时间为实时时钟时间,提出Timely-RL方法提升时间预算意识,以应对高频工具调用和时间受限推理的挑战。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16276 2026-01-26 cs.CL cs.AI cs.GT cs.LG cs.MA 67%

GameTalk: Training LLMs for Strategic Conversation

GameTalk: 训练 LLMs 进行战略性对话

Victor Conchello Vendrell, Max Ruiz Luyten, Mihaela van der Schaar

机构 * University of Cambridge(剑桥大学)

专题命中 规划推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 GameTalk 通过多轮互动训练 LLMs 实现战略性决策,优于传统方法,尤其在奖励塑造下表现突出。

Comments 32 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16895 2026-01-26 cs.CV cs.AI 57%

Evaluating Large Vision-language Models for Surgical Tool Detection

评估大型视觉-语言模型用于手术工具检测

Nakul Poudel, Richard Simon, Cristian A. Linte

机构 * Rochester Institute of Technology(罗切斯特理工大学) Center for Imaging Science(成像科学中心) Center for Imaging Science and Biomedical Engineering(成像科学与生物医学工程中心)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 本研究评估了三种大型视觉-语言模型在手术工具检测任务中的性能,发现Qwen2.5在检测和泛化能力上表现最佳。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16649 2026-01-26 cs.AI 57%

LUMINA: Long-horizon Understanding for Multi-turn Interactive Agents

LUMINA:多轮交互智能体的长视图理解

Amin Rakhsha, Thomas Hehn, Pietro Mazzaglia, Fabio Valerio Massoli, Arash Behboodi, Tribhuvanesh Orekondy

机构 * University of Toronto(多伦多大学) Qualcomm AI Research(高通人工智能研究)

专题命中 规划推理 :planning(abstract);分类 cs.AI

AI总结 LUMINA研究通过oracle反事实框架分析多轮交互智能体中各基础能力的重要性,揭示了不同技能在不同环境下的有效性差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16479 2026-01-26 cs.AI 57%

Doc2AHP: Inferring Structured Multi-Criteria Decision Models via Semantic Trees with LLMs

Doc2AHP: 通过语义树利用LLMs推断结构化的多准则决策模型

Hongjia Wu, Shuai Zhou, Hongxin Zhang, Wei Chen

机构 * State Key Laboratory of CAD&CG(计算机辅助设计与图形学国家重点实验室)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 Doc2AHP通过结合AHP原理和LLMs,实现结构化多准则决策模型的高效推断,提升决策模型的逻辑完整性和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16400 2026-01-26 cs.CL 57%

Clarify or Answer: Reinforcement Learning for Agentic VQA with Context Under-specification

澄清或回答:基于上下文不充分的代理视觉问答强化学习

Zongwan Cao, Bingbing Wen, Lucy Lu Wang

机构 * University of Washington(华盛顿大学) Allen Institute for AI(人工智能研究院)

专题命中 规划推理 :reasoning(abstract);分类 cs.CL

AI总结 CoA通过强化学习解决上下文不充分的视觉问答问题,通过生成聚焦问题澄清歧义,提升问答准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12698 2026-01-26 cs.CL 57%

A Two-Stage GPU Kernel Tuner Combining Semantic Refactoring and Search-Based Optimization

一种结合语义重构和基于搜索的优化的双阶段GPU内核调优器

Qiuyi Qu, Yicheng Sui, Yufei Sun, Rui Chen, Xiaofei Zhang, Yuzhi Zhang, Haofeng Wang, Ge Lan

机构 * NanKai University(南开大学) Beijing Institute of Computer Technology and Applications(北京计算机技术与应用研究所)

专题命中 规划推理 :planning(abstract);分类 cs.CL

AI总结 本文提出一种结合语义重构和基于搜索的双阶段GPU内核调优器,通过模板化和参数优化提升内核性能,实现更稳定和高质量的加速效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.01238 2026-01-26 cs.AI 57%

Towards Open-World Retrieval-Augmented Generation on Knowledge Graph: A Multi-Agent Collaboration Framework

面向知识图谱的开放世界检索增强生成:一种多智能体协作框架

Jiasheng Xu, Mingda Li, Yongqiang Tang, Peijie Wang, Wensheng Zhang

机构 * School of Computer Science and Cyber Engineering(计算机科学与网络工程学院) Guangzhou University(广州大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 AnchorRAG通过多智能体协作框架,在无需预定义锚实体的情况下提升开放世界检索增强生成的鲁棒性与准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16356 2026-01-26 cs.HC 50%

The Behavioral Fabric of LLM-Powered GUI Agents: Human Values and Interaction Outcomes

LLM驱动的GUI代理的行为织体:人类价值观与交互结果

Simret Araya Gebreegziabher, Yukun Yang, Charles Chiang, Hojun Yoo, Chaoran Chen, Hyo Jin Do, Zahra Ashktorab, Werner Geyer, Diego Gómez-Zará, Toby Jia-Jun Li

专题命中 规划推理 :reasoning(abstract)

AI总结 本文研究了LLM驱动的GUI代理中人类价值观如何影响其行为和交互结果,提出了一种开源测试平台和实证分析方法。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 视觉空间推理 8 篇

2601.13976 2026-01-26 cs.CV cs.RO 90%

FantasyVLN: Unified Multimodal Chain-of-Thought Reasoning for Vision-Language Navigation

FantasyVLN: 一种统一的多模态链式推理框架用于视觉-语言导航

Jing Zuo, Lingzhou Mu, Fan Jiang, Chengcheng Ma, Mu Xu, Yonggang Qi

机构 * Fantasy AIGC Team(幻想AIGC团队) Beijing University of Posts and Telecommunications(北京邮电大学) Tsinghua University(清华大学)

专题命中 视觉空间推理 :reasoning(title,abstract);chain-of-thought(title,abstract);CoT(abstract);planning(abstract)

AI总结 FantasyVLN通过统一的隐式推理框架实现视觉-语言导航的实时高效推理,结合多模态信息提升导航性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16965 2026-01-26 cs.AI 83%

Spatial-Agent: Agentic Geo-spatial Reasoning with Scientific Core Concepts

空间智能体:基于科学核心概念的地理空间推理

Riyang Bao, Cheng Yang, Dazhou Yu, Zhexiang Tang, Gengchen Mai, Liang Zhao

机构 * Emory University(埃默里大学) Rutgers University(罗格斯大学) University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 视觉空间推理 :reasoning(title,abstract);planning(abstract);分类 cs.AI

AI总结 Spatial-Agent通过基于空间信息科学的理论框架,实现了可解释的地理空间推理,优于现有方法并产生可执行的工作流。

Comments 15pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16520 2026-01-26 cs.CV cs.AI cs.CL 81%

TangramPuzzle: Evaluating Multimodal Large Language Models with Compositional Spatial Reasoning

TangramPuzzle: 通过组合空间推理评估多模态大语言模型

Daixian Liu, Jiayi Kuang, Yinghui Li, Yangning Li, Di Yin, Haoyu Cao, Xing Sun, Ying Shen, Hai-Tao Zheng, Liang Lin, Philip S. Yu

机构 * Tsinghua University(清华大学) Sun-Yat Sen University(孙逸人大学) Tencent Youtu Lab(腾讯优图实验室) University of Illinois Chicago(伊利诺伊大学香槟分校)

专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 TangramPuzzle通过几何基准测试评估多模态大语言模型的组合空间推理能力,发现模型在匹配轮廓时忽视几何约束,导致碎片变形。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16394 2026-01-26 cs.CV cs.AI 79%

ResAgent: Entropy-based Prior Point Discovery and Visual Reasoning for Referring Expression Segmentation

ResAgent:基于熵的先验点发现与视觉推理的指称表达分割

Yihao Wang, Jusheng Zhang, Ziyi Tang, Keze Wang, Meng Yang

机构 * Sun Yat-sen University(中山大学)

专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.AI

AI总结 ResAgent通过熵引导的点发现和视觉推理方法,提升指称表达分割的准确性与效率。

Comments 23 pages, 7gigures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16690 2026-01-26 cs.CL cs.CV 57%

EMemBench: Interactive Benchmarking of Episodic Memory for VLM Agents

EMemBench: 交互式评估VLM代理情景记忆的基准测试

Xinze Li, Ziyue Zhu, Siyuan Liu, Yubo Ma, Yuhang Zang, Yixin Cao, Aixin Sun

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.CL

AI总结 EMemBench通过交互式游戏评估VLM代理的情景记忆,发现归纳和空间推理在视觉设置中仍是瓶颈,且持续记忆对文本游戏有明显提升,但对VLM代理的提升不一致。

Comments 25 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16378 2026-01-26 cs.CV cs.AI q-bio.NC 57%

Cognitively-Inspired Tokens Overcome Egocentric Bias in Multimodal Models

具有认知启发的标记克服了多模态模型中的自我中心偏差

Bridget Leonard, Scott O. Murray

机构 * Department of Psychology University of Washington(心理学系华盛顿大学)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

AI总结 本研究通过引入视角标记,提升多模态模型在空间推理任务中的表现,实现更人样的空间认知能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09588 2026-01-26 cs.LG 57%

Energy-Entropy Regularization: The True Power of Minimal Looped Transformers

能量-熵正则化:最小循环转换器的真实力量

Wai-Lun Lam

机构 * Wai-Lun Lam

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.LG

AI总结 本文提出利用Tsallis熵和哈密顿动力学改进循环转换器训练,成功解决长序列归纳任务,揭示其推理能力的内在机制。

Comments 19 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09954 2026-01-26 cs.CV 50%

The Spatial Blindspot of Vision-Language Models

视觉-语言模型的空间盲区

Nahid Alam, Leema Krishna Murali, Siddhant Bharadwaj, Patrick Liu, Timothy Chung, Drishti Sharma, Akshata A, Kranthi Kiran, Wesley Tam, Bala Krishna S Vegesna

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 本文提出通过改进图像编码器和2D位置编码来提升视觉-语言模型的空间推理能力,以解决其在空间关系捕捉上的不足。

Comments Work done as part of the EleutherAI SOAR Program

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 测试时计算 2 篇

2509.02846 2026-01-26 cs.LG physics.comp-ph 79%

Towards Reasoning for PDE Foundation Models: A Reward-Model-Driven Inference-Time-Scaling Algorithm

面向PDE基础模型的推理:一种基于奖励模型的推理时扩展算法

Siddharth Mansingh, James Amarel, Ragib Arnab, Arvind Mohan, Kamaljeet Singh, Gerd J. Kunde, Nicolas Hengartner, Benjamin Migliori, Emily Casleton, Nathan A. Debardeleben, Ayan Biswas, Diane Oyen, Earl Lawrence

机构 * Los Alamos National Laboratory(洛斯阿拉莫斯国家实验室)

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.LG

AI总结 本文提出了一种基于奖励模型的推理时扩展算法,用于提升PDE基础模型在分布外情况下的预测准确性,减少对训练样本和模型规模的依赖。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.20304 2026-01-26 cs.CL 57%

Exploring Generative Process Reward Modeling for Semi-Structured Data: A Case Study of Table Question Answering

探索生成过程奖励建模在半结构化数据中的应用:表格问答的案例研究

Lei Tang, Wei Zhou, Mohsen Mesgar

机构 * University of Augsburg(奥格斯堡大学) Institut für Maschinelle Sprachverarbeitung, University of Stuttgart(斯图加特大学机械语言处理研究所) Bosch Center for Artificial Intelligence(博世人工智能中心)

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL

AI总结 本文研究了生成过程奖励模型在表格问答任务中的应用,发现结合文本和代码验证的PRMs能辅助解决方案选择,但泛化能力有限。

Comments Accepted at EACL 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 复杂问题求解 2 篇

2601.11021 2026-01-26 cs.LG cs.AI 62%

Combating Spurious Correlations in Graph Interpretability via Self-Reflection

通过自反思对抗图可解释性中的虚假相关性

Kecheng Cai, Chenyang Xu, Chao Peng, Jiafu Huang, Qiyuan Liang, Irene Zheng

机构 * (January 2026)((2026年1月))

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出自反思框架提升图可解释性,通过反馈机制改进模型对虚假相关性的识别能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15876 2026-01-26 cs.AI 57%

EvoCUA: Evolving Computer Use Agents via Learning from Scalable Synthetic Experience

EvoCUA:通过可扩展的合成经验学习来进化计算机使用代理

Taofeng Xue, Chong Peng, Mianqiu Huang, Linsen Guo, Tiancheng Han, Haozhe Wang, Jianing Wang, Xiaocheng Zhang, Xin Yang, Dengchang Zhao, Jinrui Ding, Xiandi Ma, Yuchen Xie, Peng Pei, Xunliang Cai, Xipeng Qiu

机构 * Meituan(美团) Fudan University(复旦大学) Tongji University(同济大学) The Hong Kong University of Science and Technology(香港理工大学)

专题命中 复杂问题求解 :self-correction(abstract);分类 cs.AI

AI总结 EvoCUA通过可扩展的合成经验学习进化计算机使用代理,实现更高性能和通用性。

Comments 26 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

7. 推理评测 12 篇

2601.16964 2026-01-26 cs.AI 83%

AgentDrive: An Open Benchmark Dataset for Agentic AI Reasoning with LLM-Generated Scenarios in Autonomous Systems

AgentDrive: 一个用于自主系统中基于LLM生成场景的代理AI推理开放基准数据集

Mohamed Amine Ferrag, Abderrahmane Lakas, Merouane Debbah

机构 * Department of Computer and Network Engineering, College of Information Technology, United Arab Emirates University(计算机与网络工程系,信息科技学院,阿联酋大学) Khalifa University of Science and Technology(科技大学)

专题命中 推理评测 :reasoning(title,abstract);planning(abstract);分类 cs.AI

AI总结 AgentDrive是一个用于自主系统中基于LLM生成场景的代理AI推理开放基准数据集,包含300,000个驾驶场景和100,000个问题的多项选择基准,用于评估和训练自主代理。

Comments 16 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.13680 2026-01-26 cs.CL cs.LG 81%

VMMU: A Vietnamese Multitask Multimodal Understanding and Reasoning Benchmark

VMMU:一个多任务多模态理解和推理基准

Vy Tuong Dang, An Vo, Emilio Villa-Cueva, Quang Tau, Duc Dm, Thamar Solorio, Daeyoung Kim

机构 * KAIST(韩国科学技术院) MBZUAI(慕布扎伊大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.LG

AI总结 VMMU是一个评估视觉语言模型在非英语环境下多模态理解和推理能力的基准,通过2500个多模态问题测试模型对视觉和文本信息的整合与推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16685 2026-01-26 cs.AI 79%

AgentsEval: Clinically Faithful Evaluation of Medical Imaging Reports via Multi-Agent Reasoning

AgentsEval: 通过多智能体推理实现医学影像报告的临床可信评估

Suzhong Fu, Jingqi Dong, Xuan Ding, Rui Sun, Yiming Yang, Shuguang Cui, Zhen Li

机构 * FNii-Shenzhen, The Chinese University of Hong Kong (Shenzhen) School of Science and Engineering(深圳FNii、香港中文大学(深圳)科学与工程学院)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 AgentsEval通过多智能体推理框架,实现医学影像报告的临床可信评估,提供结构化反馈和稳健的评估结果。

详情

展开后加载摘要…

URL PDF HTML 收藏