arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 10530 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 10530 篇

2602.22402 2026-02-27 cs.SE cs.AI cs.HC cs.OS 57%

Contextual Memory Virtualisation: DAG-Based State Management and Structurally Lossless Trimming for LLM Agents

上下文记忆虚拟化:基于DAG的状态管理和结构无损修剪用于LLM代理

Cosmo Santoni

机构 * Imperial College London(伦敦帝国学院)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 上下文记忆虚拟化通过DAG结构管理和无损修剪技术,提升LLM代理在长期推理任务中的上下文重用效率和经济性。

Comments 11 pages. 6 figures. Introduces a DAG-based state management system for LLM agents. Evaluation on 76 coding sessions shows up to 86% token reduction (mean 20%) while remaining economically viable under prompt caching. Includes reference implementation for Claude Code

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22125 2026-02-26 cs.CL 57%

IndicIFEval: A Benchmark for Verifiable Instruction-Following Evaluation in 14 Indic Languages

IndicIFEval: 一种用于14种印地语系语言可验证指令跟随评估的基准

Thanmay Jayakumar, Mohammed Safi Ur Rahman Khan, Raj Dabre, Ratish Puduppully, Anoop Kunchukuttan

机构 * Nilekani Centre at AI4Bharat(AI4Bharat的Nilekani中心) Indian Institute of Technology Madras(印度理工学院马德拉斯分校) IT University of Copenhagen(丹麦技术大学) Microsoft(微软)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 IndicIFEval是一个评估14种印地语系语言指令跟随能力的基准,通过规则指令和人类验证例子评估大语言模型的生成能力。

Comments 8 pages + Appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21763 2026-02-26 cs.CL 57%

Improving Implicit Discourse Relation Recognition with Natural Language Explanations from LLMs

通过LLMs生成的自然语言解释提升隐含话语关系识别

Heng Wang, Changxing Wu

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 本文通过利用LLMs生成的自然语言解释提升隐含话语关系识别的性能和可解释性。

Comments AAAI26'0ral

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21728 2026-02-26 cs.CL 57%

Explore-on-Graph: Incentivizing Autonomous Exploration of Large Language Models on Knowledge Graphs with Path-refined Reward Modeling

在知识图谱上探索:通过路径细化奖励建模激励大语言模型自主探索

Shiqi Yan, Yubo Chen, Ruiqi Zhou, Zhengxi Yao, Shuai Chen, Tianyi Zhang, Shijie Zhang, Wei Qiang Zhang, Yongfeng Huang, Haixin Duan, Yunqi Zhang

机构 * Zhongguancun Laboratory, Beijing, China(中关村实验室,北京,中国) Department of Electronic Engineering, Tsinghua University, Beijing, China(电子工程系,清华大学,北京,中国) Institute for Network Sciences and Cyberspace, Tsinghua University, Beijing, China(网络科学与网络空间研究院,清华大学,北京,中国) Ant International, Ant Group, Hangzhou, Zhejiang, China(蚂蚁集团,杭州,浙江,中国)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 本文提出Explore-on-Graph框架,通过强化学习和路径细化奖励建模,使大语言模型在知识图谱上自主探索更广泛的推理空间,实现对分布外推理问题的高效泛化。

Comments Published as a conference paper at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21230 2026-02-26 cs.CL 57%

TRACE: Trajectory-Aware Comprehensive Evaluation for Deep Research Agents

TRACE: 基于轨迹的深度研究代理综合评估

Yanyu Chen, Jiyue Jiang, Jiahong Liu, Yifei Zhang, Xiao Guo, Irwin King

机构 * The Chinese University of Hong Kong(香港中文大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 TRACE提出基于轨迹的深度研究代理综合评估框架,通过分层效用函数和阶梯式能力评估协议,解决单一指标评估的不足,揭示代理在准确性、效率和鲁棒性之间的关键权衡。

Comments Accepted by WWW 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07986 2026-02-26 cs.CL cs.CV 57%

VULCA-Bench: A Multicultural Vision-Language Benchmark for Evaluating Cultural Understanding

VULCA-Bench:一个多文化视觉-语言基准,用于评估文化理解

Haorui Yu, Diji Yang, Hang He, Fengrui Zhang, Qiufeng Yi

机构 * DJCAD, University of Dundee, United Kingdom(邓迪大学DJCAD部门) University of California, Santa Cruz, USA(加州大学圣克ruz分校) Analogy AI East China Normal University, China(华东师范大学) Nanjing University, China(南京大学) Department of Mechanical Engineering, School of Engineering, University of Birmingham(伯明翰大学工程学院机械工程系)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 VULCA-Bench通过多文化艺术批评基准评估视觉-语言模型在文化理解上的能力,包含7,410对图像-批评对,涵盖八个文化传统,通过五层框架评估文化理解,揭示更高阶推理更具挑战性。

Comments 8 pages, 4 figures, submitted to ACL 2026 Dataset Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.21112 2026-02-26 cs.RO cs.AI 57%

EO-1: An Open Unified Embodied Foundation Model for General Robot Control

EO-1:一个通用机器人控制的开放统一具身基础模型

Delin Qu, Haoming Song, Qizhi Chen, Zhaoqing Chen, Xianqiang Gao, Dong Wang, Xinyi Ye, Qi Lv, Modi Shi, Guanghui Ren, Cheng Ruan, Maoqing Yao, Haoran Yang, Jiacheng Bao, Bin Zhao, Xuelong Li

机构 * Shanghai AI Laboratory(上海人工智能实验室) Fudan University(复旦大学) AgiBot Northwestern Polytechnical University(西北工业大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 EO-1是一个统一的具身基础模型,通过交错视觉-文本-动作预训练实现了在多模态推理和机器人控制中的卓越性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.14685 2026-02-25 cs.CL 57%

Language Models use Lookbacks to Track Beliefs

语言模型使用回溯来跟踪信念

Nikhil Prakash, Natalie Shapira, Arnab Sen Sharma, Christoph Riedl, Yonatan Belinkov, Tamar Rott Shaham, David Bau, Atticus Geiger

机构 * Northeastern University(东北大学) Technion(技术学院) MIT CSAIL(麻省理工学院计算机科学与人工智能实验室) Goodfire Pr(Ai) 2 R Group(Pr(Ai) 2 R集团)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 本研究揭示语言模型通过回溯机制跟踪角色信念的算法模式,通过构建CausalToM数据集,分析LM在因果中介和抽象中的推理能力,并探讨可见性对信念更新的影响。

Comments 38 pages, 50 figures. Code and data at https://belief.baulab.info/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20424 2026-02-25 cs.AI 57%

Implicit Intelligence -- Evaluating Agents on What Users Don't Say

隐式智能 -- 评估代理在用户未言明之事上的能力

Ved Sirdeshmukh, Marc Wetter

机构 * Applied Machine Learning Research(应用机器学习研究)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 隐式智能框架评估AI代理在未明示约束下的推理能力,通过交互式世界模拟发现代理在复杂情境下的表现有限,揭示了改进空间。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20333 2026-02-25 cs.AI 57%

DMCD: Semantic-Statistical Framework for Causal Discovery

DMCD:基于语义-统计的因果发现框架

Samarth KaPatel, Sofia Nikiforova, Giacinto Paolo Saggese, Paul Smith

机构 * Causify AI

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 DMCD通过结合语义引导的先验和统计验证,实现了在因果发现任务中的高性能表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.03475 2026-02-25 cs.LG 57%

ContextPilot: Fast Long-Context Inference via Context Reuse

ContextPilot: 通过上下文重用实现快速长上下文推断

Yinsicheng Jiang, Yeqi Huang, Liang Cheng, Cheng Deng, Xuan Sun, Luo Mai

专题命中 推理评测 :reasoning(abstract);分类 cs.LG

AI总结 ContextPilot通过引入上下文重用机制,显著提升长上下文推断效率,减少延迟并保持推理质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05598 2026-02-25 cs.IR cs.AI 57%

AgentDR: Dynamic Recommendation with Implicit Item-Item Relations via LLM-based Agents

AgentDR: 通过基于LLM的代理进行动态推荐:利用隐式物品-物品关系

Mingdai Yang, Nurendra Choudhary, Jiangshu Du, Edward W. Huang, Philip S. Yu, Karthik Subbian, Danai Koutra

机构 * Amazon(亚马逊) University of Michigan(密歇根大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 AgentDR通过基于LLM的代理利用隐式物品-物品关系,结合记忆机制和提示策略,提升动态推荐的全排名性能和相关性。

Comments 12 pages, accepted by WWW'26 as long paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00628 2026-02-25 cs.SD cs.CL 57%

Hearing the Order: Investigating Position Bias in Large Audio-Language Models

听序:探究大型音频-语言模型中的位置偏差

Yu-Xiang Lin, Chen-An Li, Sheng-Lun Wei, Po-Chun Chen, Hsin-Hsi Chen, Hung-yi Lee

机构 * National Taiwan University(台湾大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 本文首次系统研究了大型音频-语言模型中位置偏差问题,通过实验发现答案选项顺序影响模型性能,提出基于排列的策略可缓解偏差。

Comments The first two authors contributed equally. Submitted to Interspeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.23434 2026-02-25 cs.LG 57%

Towards Trustworthy GUI Agents: A Survey

迈向可信的GUI代理:综述

Yucheng Shi, Wenhao Yu, Jingyuan Huang, Wenlin Yao, Wenhu Chen, Ninghao Liu

机构 * University of Georgia(佐治亚大学) Tencent AI Seattle Lab(腾讯AI西雅图实验室) Microsoft Research(微软研究院) University of Waterloo(滑铁卢大学) Hong Kong Polytechnic University(香港理工大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.LG

AI总结 本文综述了GUI代理的可信度挑战,提出信任分类法并分析了信任评估与安全可靠部署的开放问题。

Comments 14 pages, work in process

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19843 2026-02-24 cs.SE cs.AI 57%

MAS-FIRE: Fault Injection and Reliability Evaluation for LLM-Based Multi-Agent Systems

MAS-FIRE:基于大语言模型的多智能体系统故障注入与可靠性评估

Jin Jia, Zhiling Deng, Zhuangbin Chen, Yingqi Wang, Zibin Zheng

机构 * Sun Yat-sen University(中山大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 MAS-FIRE通过故障注入和分层分析,揭示多智能体系统在容错和鲁棒性方面的关键因素,为提升系统可靠性提供系统性方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19212 2026-02-24 cs.CL 57%

Retrieval Augmented Enhanced Dual Co-Attention Framework for Target Aware Multimodal Bengali Hateful Meme Detection

基于检索增强的增强双注意力框架的目标感知多模态孟加拉语仇恨表情识别

Raihan Tanvir, Md. Golam Rabiul Alam

机构 * Department of Computer Science and Engineering, BRAC University(计算机科学与工程系,BRAC大学) Department of Computer Science and Engineering, Ahsanullah University of Science and Technology(计算机科学与工程系,Ahsanullah科技大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 本文提出基于检索增强的增强双注意力框架,用于目标感知多模态孟加拉语仇恨表情识别,通过语义对齐提升类别平衡和多样性,实验表明xDORA和RAG-Fused DORA在识别和检测任务中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16449 2026-02-24 cs.CV cs.AI 57%

Emotion-LLaMAv2 and MMEVerse: A New Framework and Benchmark for Multimodal Emotion Understanding

Emotion-LLaMAv2 和 MMEVerse:多模态情感理解的新框架和基准

Xiaojiang Peng, Jingyi Chen, Zebang Cheng, Bao Peng, Fengyi Wu, Yifei Dong, Shuyuan Tu, Qiyu Hu, Huiting Huang, Yuxiang Lin, Jun-Yan He, Kai Wang, Zheng Lian, Zhi-Qi Cheng

机构 * Shenzhen Technology University(深圳技术大学) Shenzhen University of Information Technology(深圳信息科技学院) University of Washington(华盛顿大学) Foundation Model Team, Meituan(美团基础模型团队) National University of Singapore(新加坡国立大学) Tongji University(同济大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 Emotion-LLaMAv2和MMEVerse通过端到端多视图编码器、Conv Attention预融合模块和课程指令调制方案,提升了多模态情绪理解和推理能力,并构建了统一的多模态情绪基准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16175 2026-02-24 cs.CV cs.AI 57%

Mantis: A Versatile Vision-Language-Action Model with Disentangled Visual Foresight

Mantis:一种具有解耦视觉前瞻性能力的多功能视觉-语言-动作模型

Yi Yang, Xueqi Li, Yiyang Chen, Jin Song, Yihan Wang, Zipeng Xiao, Jiadi Su, You Qiaoben, Pengfei Liu, Zhijie Deng

机构 * SJTU(上海交通大学) SII(上海信息所) SUSTech(四川大学) NJUPT(南京工业大学) FDU(福建大学) BOSCH(博世)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 Mantis通过解耦视觉前瞻性模块提升视觉-语言-动作模型的性能,实现高成功率和快速收敛。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.23828 2026-02-24 cs.CL 57%

Beyond Understanding: Evaluating the Pragmatic Gap in LLMs' Cultural Processing of Figurative Language

超越理解:评估LLMs在处理隐喻语言中的文化差距

Mena Attia, Aashiq Muhamed, Mai Alkhamissi, Thamar Solorio, Mona Diab

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 本文评估了LLMs在处理隐喻语言中的文化理解差距,发现其在语用使用方面存在显著挑战,并发布了首个埃及阿拉伯语习语数据集用于进一步研究。

Comments EACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.03867 2026-02-24 cs.CL 57%

EuroGEST: Investigating gender stereotypes in multilingual language models

EuroGEST:研究多语言语言模型中的性别刻板印象

Jacqueline Rowe, Mateusz Klimaszewski, Liane Guillou, Shannon Vallor, Alexandra Birch

机构 * University of Edinburgh(爱丁堡大学) Warsaw University of Technology(华沙技术大学) Aveni

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 EuroGEST研究多语言语言模型中的性别刻板印象,通过跨29种欧洲语言的数据集揭示了性别刻板印象的普遍性及模型对刻板印象的编码强度。

Comments In Proceedings of the 2025 Conference on Empirical Methods in Natural Language Processing, pages 32074-32096, Suzhou, China. Association for Computational Linguistics. 9 pages, 5 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.13904 2026-02-24 cs.CL 57%

Calibrating Large Language Models with Sample Consistency

通过样本一致性校准大型语言模型

Qing Lyu, Kumar Shridhar, Chaitanya Malaviya, Li Zhang, Yanai Elazar, Niket Tandon, Marianna Apidianaki, Mrinmaya Sachan, Chris Callison-Burch

机构 * University of Pennsylvania(宾夕法尼亚大学) ETH Zurich(苏黎世联邦理工学院) University of Washington(华盛顿大学) Allen Institute for AI(人工智能研究院)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 通过样本一致性方法提升大型语言模型的校准效果,改进其预测置信度评估和性能表现。

Comments AAAI 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18940 2026-02-24 cs.AI 57%

DREAM: Deep Research Evaluation with Agentic Metrics

DREAM: 基于代理度量的深度研究评估

Elad Ben Avraham, Changhao Li, Ron Dorfman, Roy Ganz, Oren Nuriel, Amir Dudai, Aviad Aberdam, Noah Flynn, Elman Mansimov, Adi Kalyanpur, Ron Litman

机构 * AWS Agentic AI(AWS敏捷人工智能) Georgia Institute of Technology(佐治亚理工学院)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 DREAM提出一种基于代理度量的深度研究评估框架,通过能力平衡原则解决现有基准在事实和时间衰减检测上的不足,实现可扩展的无参考评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18824 2026-02-24 cs.SI cs.AI 57%

UniRank: A Multi-Agent Calibration Pipeline for Estimating University Rankings from Anonymized Bibliometric Signals

UniRank:一种多智能体校准流程,用于从匿名化的引文计量信号中估算大学排名

Pedram Riyazimehr, Seyyed Ehsan Mahmoudi

机构 * NotionWave

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 UniRank通过多智能体校准流程,利用匿名化引文数据估算大学排名,实现零记忆误差和高准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18731 2026-02-24 cs.AI 57%

Beyond Description: A Multimodal Agent Framework for Insightful Chart Summarization

超越描述:一种多模态代理框架用于深入的图表摘要

Yuhang Bai, Yujuan Ding, Shanru Lin, Wenqi Fan

机构 * The Hong Kong Polytechnic University(香港理工大学) City University of Hong Kong(香港城市大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文提出多模态代理框架Chart Insight Agent Flow,通过结合MLLMs的感知与推理能力,提升图表摘要的深度和多样性,并引入新数据集ChartSummInsights以支持研究。

Comments 5 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18693 2026-02-24 cs.CL 57%

Contradiction to Consensus: Dual Perspective, Multi Source Retrieval Based Claim Verification with Source Level Disagreement using LLM

与共识相悖:基于双视角、多源检索的声明验证系统,利用源级别分歧

Md Badsha Biswas, Ozlem Uzuner

机构 * George Mason University(乔治·梅奥大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 本研究提出基于双视角多源检索和跨源分歧分析的声明验证系统,利用LLM提升验证准确性并揭示来源差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18497 2026-02-24 cs.DB cs.AI 57%

PIPE-RDF: An LLM-Assisted Pipeline for Enterprise RDF Benchmarking

PIPE-RDF: 一个基于LLM的企业RDF基准测试流水线

Suraj Ranganath

机构 * UC San Deigo(加州大学圣地亚哥分校)

专题命中 推理评测 :planning(abstract);分类 cs.AI

AI总结 PIPE-RDF通过反向查询和检索增强提示构建企业RDF基准测试,生成450个问题-SPARQL对,实现100%有效性验证。

Comments Conference submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18460 2026-02-24 cs.CY cs.AI cs.HC 57%

The Doctor Will (Still) See You Now: On the Structural Limits of Agentic AI in Healthcare

医生还会见你:论代理AI在医疗领域的结构性限制

Gabriela Aránguiz Dias, Kiana Jafari, Allie Griffith, Carolina Aránguiz Dias, Grace Ra Kim, Lana Saadeddin, Mykel J. Kochenderfer

机构 * Stanford University(斯坦福大学) University of Florida(佛罗里达大学) Montclair State University(蒙特克莱尔州立大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文探讨了代理AI在医疗领域应用中的结构性限制,指出技术期望、商业激励和临床约束的交汇对患者安全和责任归属产生实质性影响。

Comments 17 pages, 3 pages of appendix, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01678 2026-02-24 cs.LG 57%

HeurekaBench: A Benchmarking Framework for AI Co-scientist

HeurekaBench: 一个用于AI合作者的基准评估框架

Siba Smarak Panigrahi, Jovana Videnović, Maria Brbić

机构 * École Polytechnique Fédérale de Lausanne (EPFL)(瑞士联邦理工学院(EPFL))

专题命中 推理评测 :reasoning(abstract);分类 cs.LG

AI总结 HeurekaBench通过创建基于真实科学流程的基准,为评估AI合作者提供了一种方法,通过半自动流程生成探索性问题,并展示了批评模块对提升代理性能的效果。

Comments 33 pages, 5 figures, 7 tables. Code available at https://github.com/mlbio-epfl/HeurekaBench. Accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.24856 2026-02-24 cs.CL 57%

Do Large Language Models Grasp The Grammar? Evidence from Grammar-Book-Guided Probing in Luxembourgish

大型语言模型是否理解语法规则?来自卢森堡语语法书引导探测的证据

Lujun Li, Yewei Song, Lama Sleem, Yiqun Wang, Yangjie Xu, Cedric Lothritz, Niccolo Gentile, Radu State, Tegawende F. Bissyande, Jacques Klein

机构 * University of Luxembourg(卢森堡大学) Luxembourg Institute of Science and Technology(卢森堡科学与技术研究院)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 本研究通过卢森堡语语法书引导探测,探讨大型语言模型对语法规则的理解,发现翻译性能与语法规则理解弱相关,大模型在语义上表现良好但句法和形态学能力较弱,推理能力有助于提升语法规则理解。

Comments This paper has been accepted for publication in the proceedings of the 15th biennial Language Resources and Evaluation Conference (LREC 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.05690 2026-02-24 cs.CL 57%

When to use Graphs in RAG: A Comprehensive Analysis for Graph Retrieval-Augmented Generation

在何时使用图在RAG中:图检索增强生成的全面分析

Zhishang Xiang, Chuanjie Wu, Qinggang Zhang, Shengyuan Chen, Zijin Hong, Xiao Huang, Jinsong Su

机构 * Xiamen University(厦门大学) The Hong Kong Polytechnic University(香港理工大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 本文提出GraphRAG-Bench基准,系统分析GraphRAG在不同任务中的表现,揭示其在特定场景下的优势与适用条件。

Comments All resources and analyses are collected at https://github.com/GraphRAG-Bench/GraphRAG-Benchmark

详情

展开后加载摘要…

URL PDF HTML 收藏